Intermedio 14 minOllama

Qwen 3.8 27B en local: instalación de Ollama y VRAM

Los pesos de Qwen3.8-27B se publicaron el 14 de agosto de 2026 en Hugging Face, bajo licencia Apache 2.0, y la etiqueta oficial de Ollama llegó ese mismo día. Es el primer modelo de la generación 3.8 que realmente puedes instalar en tu equipo: denso, multimodal (imagen y vídeo), con 262 144 tokens de contexto nativo. Esta guía proporciona el comando exacto, la VRAM realmente necesaria para cada etiqueta, los ajustes del modo «thinking», activado por defecto, y los dos problemas que arruinan la mayoría de las primeras pruebas: el truncamiento del contexto sin aviso y la descarga de parte del modelo en la RAM del sistema.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#El veredicto en 30 segundos

Qwen 3.8 27B se instala con un solo comando: «ollama run qwen3.8:27b». El paquete predeterminado (Q4_K_M) pesa 18 GB y requiere una tarjeta con 24 GB de VRAM —RTX 3090, 4090, 5090— o un Mac Apple Silicon con al menos 32 GB de memoria unificada para trabajar cómodamente. Con menos memoria, el modelo sigue funcionando, pero parte de las capas pasa al procesador y la velocidad de generación cae drásticamente.

Qué es
Un modelo denso de 27 mil millones de parámetros, con soporte nativo de visión y lenguaje (imágenes y videos), 262.144 tokens de contexto, bajo licencia Apache 2.0 — por lo tanto, utilizable comercialmente sin cláusulas restrictivas.
El requisito realista
24 GB de VRAM o 32 GB de memoria unificada para la versión Q4_K_M. 30 GB de archivos y ~40 GB de VRAM para la Q8, 56 GB para la BF16.
El comando
ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
La trampa nº 1
El contexto anunciado es de 256k, pero Ollama aplica por defecto una ventana mucho más pequeña y trunca sin avisar. Es necesario ajustar manualmente num_ctx.
La trampa n.º 2
El modo «thinking» está activo por defecto y consume muchos tokens antes de responder. En local, reduce reasoning_effort o desactiva ese modo para las tareas sencillas.
!
Los números de rendimiento provienen de Alibaba
En la fecha de publicación de esta guía, no se ha reproducido ningún benchmark independiente con Qwen3.8-27B. Todas las puntuaciones citadas a continuación proceden de la ficha oficial del modelo. Son coherentes con la generación anterior, pero deben tratarse como cifras proporcionadas por el desarrollador.

#Lo que es realmente Qwen 3.8 27B

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Frente a la tendencia hacia los modelos Mixture-of-Experts, Qwen3.8-27B es un modelo denso: los 27 mil millones de parámetros se activan en cada token. Esto hace que su consumo de memoria sea predecible —sin sorpresas positivas en la velocidad de generación ni negativas en la VRAM— y también explica que su velocidad de generación en local sea más modesta que la de un MoE de tamaño comparable.

Arquitectura
64 capas organizadas en 16 bloques de «3 × (Gated DeltaNet → FFN), seguidas de 1 × (Gated Attention → FFN)». Una atención híbrida: la mayoría de las capas utiliza atención lineal, que consume poca memoria, intercalada con verdaderas capas de atención para mejorar la precisión.
Modalidades
Visión y lenguaje integrados de forma nativa: imágenes fijas, documentos, diagramas científicos y videos. No es un adaptador añadido a posteriori.
Contexto
Contexto nativo de 262 144 tokens, ampliable a 1 000 000 mediante YaRN, pero únicamente en vLLM, SGLang o TokenSpeed, no mediante Ollama.
Licencia
Apache 2.0. Uso comercial autorizado, sin umbral de usuarios como en Llama, sin cláusula de uso como en Gemma.
Particularidad
El modelo está entrenado con Multi-Token Prediction (MTP), de ahí las etiquetas «mtp» de Ollama, que aceleran la generación en los motores que saben aprovecharlo.
i
No confundir con Qwen 3.8-Max
Qwen 3.8-Max, lanzado el 3 de agosto de 2026, es un modelo de tipo MoE con aproximadamente 2,4 billones de parámetros, disponible únicamente a través de API: no existe forma de ejecutarlo en tu propio equipo. El 27B es la variante de pesos abiertos de la misma generación. La cronología completa se detalla en nuestra guía sobre los pesos abiertos de Qwen 3.8.

#El hardware que se necesita, etiqueta por etiqueta

La biblioteca de Ollama publica doce variantes. El tamaño de la descarga no equivale a la VRAM necesaria: hay que sumarle la caché KV, que crece con la longitud del contexto, y el codificador visual. Calcula un margen de entre el 15 % y el 25 % por encima del tamaño del archivo.

Variantes oficiales de Qwen 3.8 27B en Ollama (registro del 18 de agosto de 2026)
TagTamañoMemoria para funcionar con holguraPara quién
qwen3.8:27b (Q4_K_M, predeterminado)18 GB24 GBElección por defecto: RTX 3090/4090/5090, Mac 32 GB
qwen3.8:27b-q8_030 GB40 GB y másCalidad casi máxima: RTX Pro 6000, configuración de dos GPU de 24 GB
qwen3.8:27b-bf1656 GB80 GBPesos de referencia, máquinas de cálculo (H100, H200)
qwen3.8:27b-mlx18 GB32 GB unificadosApple Silicon: compilación con Metal, la opción predeterminada adecuada en Mac
qwen3.8:27b-mxfp832 GB48 GB unificadosMac Studio / M4 Max 64 GB, calidad superior
qwen3.8:27b-mlx-bf1656 GB96 GB unificadosMac Studio 128 GB, sin pérdida por cuantización
qwen3.8:27b-mtp-q4_K_M18 GB24 GBIgual que la opción predeterminada, con predicción de múltiples tokens explícita
!
16 GB de VRAM: posible, pero incómodo
En una RTX 4060 Ti de 16 GB o una 5070 Ti, la versión Q4_K_M no cabe completamente en memoria: Ollama coloca el resto en el procesador y la generación suele caer por debajo de 5 tokens por segundo. Con 16 GB, un modelo de 12 a 14 mil millones de parámetros sigue siendo una forma mucho mejor de aprovechar la máquina.

En cuanto a la velocidad de generación, nuestras estimaciones para un modelo 27B denso en Q4 rondan los 14 tokens/segundo en una configuración de gama media y los 22 tokens/segundo en una de gama alta reciente. Son órdenes de magnitud calculados, no mediciones: el modo «thinking», activado por defecto, puede además duplicar el tiempo percibido antes de la primera línea de respuesta.

#Instalar Qwen 3.8 27B con Ollama

  1. 01
    Actualiza Ollama
    Las capas híbridas y el parser de visión de Qwen 3.8 requieren una versión reciente de Ollama. Una versión anterior a agosto de 2026 devolverá un error de arquitectura o un «model not found» engañoso. Reinstala desde el sitio oficial o vuelve a ejecutar el script de instalación en Linux.
  2. 02
    Descarga el modelo
    Se transfieren 18 GB: reserva espacio en el disco del sistema, donde Ollama almacena sus blobs. El pull se puede reanudar si se interrumpe la conexión.
  3. 03
    Empieza un primer intercambio
    La primera respuesta es más lenta porque los pesos tienen que cargarse en memoria. Si tarda más de un minuto en empezar, es señal de que parte del procesamiento se está trasladando al procesador.
  4. 04
    Comprueba dónde se ejecuta el modelo
    El comando ollama ps muestra la distribución GPU/CPU. Mientras no veas 100 % GPU, cada token cuesta caro: baja un nivel de cuantización o reduce el contexto.
Instalación y primer test
# 1. Récupérer le modèle (18 Go)
ollama pull qwen3.8:27b

# 2. Discuter avec
ollama run qwen3.8:27b

# 3. Vérifier la répartition GPU / CPU
ollama ps
i
qwen3.8 sin más = el 27B
La etiqueta «qwen3.8:latest» apunta actualmente al mismo blob que «qwen3.8:27b»: es el único formato publicado en la biblioteca oficial. Escribir «ollama run qwen3.8» equivale exactamente a lo mismo, pero fijar el tamaño en tus scripts evita sorpresas desagradables cuando lleguen otras variantes.

#En Mac con Apple Silicon: elige la variante MLX

Ollama publica una compilación MLX, compilada para el motor Metal de Apple. Con el mismo tamaño de archivo (18 GB), aprovecha mejor la memoria unificada y ofrece una velocidad de generación notablemente superior a la del GGUF genérico en los chips M3, M4 y posteriores.

En Mac con Apple Silicon
# Build MLX (Metal) — recommandé sur M1/M2/M3/M4
ollama run qwen3.8:27b-mlx

# Mac 64 Go et plus : qualité supérieure
ollama run qwen3.8:27b-mxfp8
Mac 16 GB
Insuficiente. macOS solo deja aproximadamente el 70 % de la memoria unificada a disposición de la GPU: el modelo recurre a la memoria de intercambio y se vuelve inutilizable.
Mac 24 GB
Funciona por muy poco con un contexto corto, sin ninguna otra aplicación exigente abierta. Aceptable para hacer pruebas, frustrante en el uso cotidiano.
Mac 32 GB
El verdadero punto de entrada: el modelo cabe en la memoria y queda margen para la caché KV y el sistema.
Mac de 64 GB o más
Holgado, y permite pasar a mxfp8 o trabajar con documentos largos.

#La trampa del contexto de 256k

Es el error que cometen casi todos los usuarios primerizos. El modelo anuncia 262.144 tokens, pero Ollama aplica por defecto una ventana mucho más corta: si se supera ese límite, el principio de tu documento simplemente se recorta, sin ningún mensaje de error. El modelo responde con seguridad sobre un texto que no ha visto en su totalidad.

Ajustar el tamaño del contexto
# Dans une session interactive
/set parameter num_ctx 32768

# Ou via un Modelfile réutilisable
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 32768
PARAMETER temperature 1.0
PARAMETER top_p 0.95
PARAMETER top_k 20
EOF
ollama create qwen38-long -f Modelfile
!
256k sobre el papel, de 16k a 64k en tu equipo
La caché KV crece aproximadamente de forma lineal con el contexto y se suma a los 18 GB de los pesos. En una tarjeta de 24 GB, una ventana de 32.000 tokens es una configuración razonable; 64.000 caben a costa de algo de lentitud; 262.144 quedan fuera de alcance. Activar la atención rápida y cuantizar la caché KV en q8_0 (variables OLLAMA_FLASH_ATTENTION y OLLAMA_KV_CACHE_TYPE) libera varios gigabytes.

En cuanto al millón de tokens anunciado: se basa en una extensión YaRN, configurada en el archivo de configuración del modelo, y solo es compatible con vLLM, SGLang o TokenSpeed. Actualmente no existe ninguna forma de acceder a él desde Ollama.

#Modo de pensamiento y parámetros de muestreo

Qwen 3.8 piensa antes de responder: genera un bloque de razonamiento entre etiquetas « think » y luego la respuesta final. Está activado por defecto, y es lo que explica en gran medida la latencia percibida. En los motores que lo soportan, la profundidad se ajusta con reasoning_effort — xhigh por defecto, luego medium y low.

Parámetros de muestreo recomendados por Alibaba
Modotemperaturetop_ptop_kpresence_penalty
Thinking (predeterminado)1.00.95200.0
Instruct (sin reflexión)0.70.80201.5
Tareas cortas en local
Reduce reasoning_effort a low o medium: en una reformulación o una extracción, un razonamiento prolongado no cambia la calidad y triplica el tiempo de espera.
Tareas de agentes
Mantén xhigh. Alibaba señala que un esfuerzo reducido provoca análisis insuficientes, por lo que hay reintentos — el beneficio por turno se anula por los fracasos.
Respuestas que se repiten en bucle
Aumenta presence_penalty (entre 0 y 2). Por encima de 1,5, el modelo comienza a mezclar idiomas.
Salida contaminada por el razonamiento
Si tu aplicación muestra las etiquetas de reflexión, es porque no separa reasoning_content del contenido final. Desactiva la reflexión para este caso de uso en lugar de filtrar el texto posteriormente.

#Analizar una imagen o un documento

La visión es nativa: captura de pantalla, foto de tabla, esquema técnico, página escaneada. En línea de comando, basta con indicar la ruta del archivo en el prompt; a través de la API, las imágenes pasan codificadas en base64 en el campo previsto por Ollama.

Visión desde la línea de comandos
ollama run qwen3.8:27b
>>> Décris ce schéma et liste les valeurs lisibles ./schema.png
!
Prueba la visión antes de ponerla en producción
El procesamiento multimodal recibió una corrección en el analizador poco después del lanzamiento. Si las respuestas que obtienes ignoran la imagen o describen otra cosa, actualiza Ollama antes de seguir investigando y valida el funcionamiento con unos diez documentos propios antes de llevarlo a producción a gran escala.

#Qué valor tienen las puntuaciones anunciadas

El salto que se afirma haber logrado frente a Qwen 3.6-27B, el modelo del mismo tamaño de la generación anterior, es importante, sobre todo en la programación con agentes y el uso del ordenador. Estas son las cifras publicadas por Alibaba, teniendo en cuenta que no se han reproducido de forma independiente.

Qwen3.8-27B vs Qwen3.6-27B — puntuaciones comunicadas por Alibaba (agosto 2026)
PruebaQwen3.8-27BQwen3.6-27B
Terminal Bench 2.1 (programación con agentes)73,063,4
SWE-bench Pro61,753,5
LiveCodeBench v690,383,9
IFBench (seguimiento de instrucciones)79,569,1
GPQA Diamond (ciencias)89,287,8
OSWorld-Verified (uso del ordenador)84,363,9
MathVision (matemáticas visuales)90,085,1
OmniDocBench 1.5 (documentos)91,189,4

Lo que conviene recordar para un uso local: los avances se centran sobre todo en tareas largas que utilizan herramientas: manejar un terminal, corregir un repositorio y encadenar pasos sin desviarse. En una conversación sencilla o un resumen, la diferencia con la generación anterior será mucho menos visible de lo que estas cifras sugieren.

#¿Conviene dejar de usar Qwen 3.6, Gemma 4 o gpt-oss?

Usas Qwen 3.6-27B
Sí, la actualización merece la pena: mismo consumo de memoria, misma licencia permisiva y mejoras claras en programación y en tareas con agentes. Conserva la etiqueta anterior mientras validas tus prompts, ya que cambia el estilo de las respuestas.
Usas Gemma 4 26B
Qwen 3.8 mantiene la ventaja en programación y tareas con agentes; en cuanto a licencias, ambos están ahora bajo Apache 2.0, ya que Gemma pasó a tener una licencia permisiva en abril de 2026. Gemma 4 (MoE 26B-A4B, multimodal) suele seguir siendo más natural en francés conversacional y más rápido de poner en marcha.
Usas gpt-oss-20b
Dos filosofías: gpt-oss es más ligero y más rápido, Qwen 3.8 ve imágenes, mantiene un contexto mucho más largo y se enfoca en tareas largas. Elige según la VRAM disponible.
Buscas sobre todo programar
Un modelo MoE de 30B especializado en código sigue siendo más rápido en autocompletado. Qwen 3.8 27B se justifica cuando el agente debe leer, planificar y modificar varios archivos.
Tienes menos de 24 GB
No fuerces las cosas. Un modelo de 12-14B en Q4 te dará una mejor experiencia que uno de 27B que tenga que ejecutarse parcialmente en la CPU.

#Solución de problemas

« model not found » al hacer pull
Tu versión de Ollama es demasiado antigua para reconocer este repositorio, o la etiqueta está mal escrita: la correcta es «qwen3.8:27b», con un punto, no un guion. Actualiza Ollama y vuelve a intentarlo.
Error de arquitectura al cargar
Misma causa: las capas híbridas de Qwen 3.8 solo están soportadas por versiones recientes del motor.
Generación muy lenta (menos de 5 tokens/s)
Parte del modelo se carga en la RAM del sistema. Compruébalo con ollama ps: si la distribución no es 100 % GPU, reduce num_ctx, cierra las otras aplicaciones que usan la GPU o pasa a un modelo más pequeño.
Respuestas que ignoran el inicio del documento
El contexto se trunca sin avisar. Ajusta num_ctx a la longitud real de tu entrada o divide el documento.
El modelo « piensa » sin fin
reasoning_effort demasiado alto para la tarea. Bájalo a medium o low, o desactiva la reflexión para las tareas sencillas.
La imagen se ignora
La ruta del archivo debe ser accesible desde el proceso Ollama, y el analizador de visión requiere una versión actualizada. Prueba con una imagen local simple antes de culpar al modelo.
Falta de espacio en disco
Entre los blobs y la caché, prevé el doble del tamaño anunciado durante la instalación. Un pull interrumpido por un disco lleno deja fragmentos: ollama rm y después un nuevo pull.
Preguntas frecuentes
¿Cuánta VRAM se necesita para Qwen 3.8 27B?+
24 GB de VRAM para la versión predeterminada Q4_K_M, cuyos archivos ocupan 18 GB, a los que se suma la caché KV. Calcula 40 GB para la versión Q8 y 56 GB para los pesos BF16. En Mac, se necesitan al menos 32 GB de memoria unificada.
¿Cómo instalar Qwen 3.8 27B localmente?+
Instala o actualiza Ollama y luego ejecuta «ollama pull qwen3.8:27b» y «ollama run qwen3.8:27b». La descarga ocupa 18 GB. En un Mac Apple Silicon, utiliza preferentemente la etiqueta qwen3.8:27b-mlx, optimizada para Metal.
¿Qwen 3.8 27B es gratuito y se puede usar en una empresa?+
Sí. Los pesos están publicados bajo licencia Apache 2.0, que permite el uso comercial, la modificación y la redistribución, sin umbral de usuarios ni cláusula restrictiva de uso. Es una de las licencias más permisivas entre los modelos abiertos.
¿Qué diferencia hay entre Qwen 3.8 27B y Qwen 3.8-Max?+
Qwen 3.8-Max es un modelo propietario de tipo Mixture-of-Experts con aproximadamente 2.400 mil millones de parámetros, accesible únicamente por API. Qwen3.8-27B es la variante densa de pesos abiertos de la misma generación: es la única de las dos que puedes ejecutar en tu máquina.
¿Se puede ejecutar Qwen 3.8 27B con 16 GB de VRAM?+
Técnicamente sí, pero una parte del modelo pasa a ejecutarse en la CPU y la velocidad de generación suele caer por debajo de 5 tokens por segundo. Con 16 GB, un modelo de 12 a 14 mil millones de parámetros ofrece una experiencia mucho mejor.
¿Qwen 3.8 27B es mejor que Qwen 3.6 27B?+
Según las cifras publicadas por Alibaba, sí, claramente en la programación con agentes (73,0 frente a 63,4 en Terminal Bench 2.1) y en el uso del ordenador (84,3 frente a 63,9 en OSWorld-Verified). Estas puntuaciones aún no se han reproducido de forma independiente, y la diferencia es menos notable en los usos conversacionales.
¿Se puede desactivar el modo reflexión de Qwen 3.8?+
Sí. El modo thinking está activo por defecto, pero se puede desactivar para cada solicitud, y su profundidad se ajusta con el parámetro reasoning_effort (xhigh, medium o low). En modo directo, los ajustes recomendados son temperature 0,7 y top_p 0,80.
¿Es accesible localmente un contexto de un millón de tokens?+
No a través de Ollama. El contexto nativo es de 262.144 tokens, y la extensión a un millón requiere una configuración YaRN soportada únicamente por vLLM, SGLang y TokenSpeed. En la práctica, en una tarjeta de 24 GB, una ventana de 16.000 a 64.000 tokens es el ajuste realista.

#Para ir más allá

Esta guía presupone una instalación de Ollama que funcione y una elección consciente de la cuantización. Estas páginas complementan el tema:

Instalar Ollama
El requisito si el motor aún no está instalado, en Windows, macOS o Linux — y la actualización, esencial para Qwen 3.8.
Elegir tu cuantización
Para elegir entre Q4, Q8 y BF16 con conocimiento de causa: cuánta memoria consume cada nivel y qué calidad ofrece.
Qwen 3.8: la cronología de los pesos abiertos
De dónde viene la confusión entre el Max disponible mediante API y el 27B abierto, y qué se anunció realmente y cuándo.
¿Qué LLM para 24 GB de VRAM?
El comparativo de modelos que caben en una tarjeta de 24 GB, si aún dudas entre Qwen 3.8 27B y una alternativa más ligera.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.