Qwen 3.8 27B en local: instalación de Ollama y VRAM
Los pesos de Qwen3.8-27B se publicaron el 14 de agosto de 2026 en Hugging Face, bajo licencia Apache 2.0, y la etiqueta oficial de Ollama llegó ese mismo día. Es el primer modelo de la generación 3.8 que realmente puedes instalar en tu equipo: denso, multimodal (imagen y vídeo), con 262 144 tokens de contexto nativo. Esta guía proporciona el comando exacto, la VRAM realmente necesaria para cada etiqueta, los ajustes del modo «thinking», activado por defecto, y los dos problemas que arruinan la mayoría de las primeras pruebas: el truncamiento del contexto sin aviso y la descarga de parte del modelo en la RAM del sistema.
#El veredicto en 30 segundos
Qwen 3.8 27B se instala con un solo comando: «ollama run qwen3.8:27b». El paquete predeterminado (Q4_K_M) pesa 18 GB y requiere una tarjeta con 24 GB de VRAM —RTX 3090, 4090, 5090— o un Mac Apple Silicon con al menos 32 GB de memoria unificada para trabajar cómodamente. Con menos memoria, el modelo sigue funcionando, pero parte de las capas pasa al procesador y la velocidad de generación cae drásticamente.
- Qué es
- Un modelo denso de 27 mil millones de parámetros, con soporte nativo de visión y lenguaje (imágenes y videos), 262.144 tokens de contexto, bajo licencia Apache 2.0 — por lo tanto, utilizable comercialmente sin cláusulas restrictivas.
- El requisito realista
- 24 GB de VRAM o 32 GB de memoria unificada para la versión Q4_K_M. 30 GB de archivos y ~40 GB de VRAM para la Q8, 56 GB para la BF16.
- El comando
- ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
- La trampa nº 1
- El contexto anunciado es de 256k, pero Ollama aplica por defecto una ventana mucho más pequeña y trunca sin avisar. Es necesario ajustar manualmente num_ctx.
- La trampa n.º 2
- El modo «thinking» está activo por defecto y consume muchos tokens antes de responder. En local, reduce reasoning_effort o desactiva ese modo para las tareas sencillas.
#Lo que es realmente Qwen 3.8 27B
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Frente a la tendencia hacia los modelos Mixture-of-Experts, Qwen3.8-27B es un modelo denso: los 27 mil millones de parámetros se activan en cada token. Esto hace que su consumo de memoria sea predecible —sin sorpresas positivas en la velocidad de generación ni negativas en la VRAM— y también explica que su velocidad de generación en local sea más modesta que la de un MoE de tamaño comparable.
- Arquitectura
- 64 capas organizadas en 16 bloques de «3 × (Gated DeltaNet → FFN), seguidas de 1 × (Gated Attention → FFN)». Una atención híbrida: la mayoría de las capas utiliza atención lineal, que consume poca memoria, intercalada con verdaderas capas de atención para mejorar la precisión.
- Modalidades
- Visión y lenguaje integrados de forma nativa: imágenes fijas, documentos, diagramas científicos y videos. No es un adaptador añadido a posteriori.
- Contexto
- Contexto nativo de 262 144 tokens, ampliable a 1 000 000 mediante YaRN, pero únicamente en vLLM, SGLang o TokenSpeed, no mediante Ollama.
- Licencia
- Apache 2.0. Uso comercial autorizado, sin umbral de usuarios como en Llama, sin cláusula de uso como en Gemma.
- Particularidad
- El modelo está entrenado con Multi-Token Prediction (MTP), de ahí las etiquetas «mtp» de Ollama, que aceleran la generación en los motores que saben aprovecharlo.
#El hardware que se necesita, etiqueta por etiqueta
La biblioteca de Ollama publica doce variantes. El tamaño de la descarga no equivale a la VRAM necesaria: hay que sumarle la caché KV, que crece con la longitud del contexto, y el codificador visual. Calcula un margen de entre el 15 % y el 25 % por encima del tamaño del archivo.
| Tag | Tamaño | Memoria para funcionar con holgura | Para quién |
|---|---|---|---|
| qwen3.8:27b (Q4_K_M, predeterminado) | 18 GB | 24 GB | Elección por defecto: RTX 3090/4090/5090, Mac 32 GB |
| qwen3.8:27b-q8_0 | 30 GB | 40 GB y más | Calidad casi máxima: RTX Pro 6000, configuración de dos GPU de 24 GB |
| qwen3.8:27b-bf16 | 56 GB | 80 GB | Pesos de referencia, máquinas de cálculo (H100, H200) |
| qwen3.8:27b-mlx | 18 GB | 32 GB unificados | Apple Silicon: compilación con Metal, la opción predeterminada adecuada en Mac |
| qwen3.8:27b-mxfp8 | 32 GB | 48 GB unificados | Mac Studio / M4 Max 64 GB, calidad superior |
| qwen3.8:27b-mlx-bf16 | 56 GB | 96 GB unificados | Mac Studio 128 GB, sin pérdida por cuantización |
| qwen3.8:27b-mtp-q4_K_M | 18 GB | 24 GB | Igual que la opción predeterminada, con predicción de múltiples tokens explícita |
En cuanto a la velocidad de generación, nuestras estimaciones para un modelo 27B denso en Q4 rondan los 14 tokens/segundo en una configuración de gama media y los 22 tokens/segundo en una de gama alta reciente. Son órdenes de magnitud calculados, no mediciones: el modo «thinking», activado por defecto, puede además duplicar el tiempo percibido antes de la primera línea de respuesta.
#Instalar Qwen 3.8 27B con Ollama
- 01Actualiza OllamaLas capas híbridas y el parser de visión de Qwen 3.8 requieren una versión reciente de Ollama. Una versión anterior a agosto de 2026 devolverá un error de arquitectura o un «model not found» engañoso. Reinstala desde el sitio oficial o vuelve a ejecutar el script de instalación en Linux.
- 02Descarga el modeloSe transfieren 18 GB: reserva espacio en el disco del sistema, donde Ollama almacena sus blobs. El pull se puede reanudar si se interrumpe la conexión.
- 03Empieza un primer intercambioLa primera respuesta es más lenta porque los pesos tienen que cargarse en memoria. Si tarda más de un minuto en empezar, es señal de que parte del procesamiento se está trasladando al procesador.
- 04Comprueba dónde se ejecuta el modeloEl comando ollama ps muestra la distribución GPU/CPU. Mientras no veas 100 % GPU, cada token cuesta caro: baja un nivel de cuantización o reduce el contexto.
#En Mac con Apple Silicon: elige la variante MLX
Ollama publica una compilación MLX, compilada para el motor Metal de Apple. Con el mismo tamaño de archivo (18 GB), aprovecha mejor la memoria unificada y ofrece una velocidad de generación notablemente superior a la del GGUF genérico en los chips M3, M4 y posteriores.
- Mac 16 GB
- Insuficiente. macOS solo deja aproximadamente el 70 % de la memoria unificada a disposición de la GPU: el modelo recurre a la memoria de intercambio y se vuelve inutilizable.
- Mac 24 GB
- Funciona por muy poco con un contexto corto, sin ninguna otra aplicación exigente abierta. Aceptable para hacer pruebas, frustrante en el uso cotidiano.
- Mac 32 GB
- El verdadero punto de entrada: el modelo cabe en la memoria y queda margen para la caché KV y el sistema.
- Mac de 64 GB o más
- Holgado, y permite pasar a mxfp8 o trabajar con documentos largos.
#La trampa del contexto de 256k
Es el error que cometen casi todos los usuarios primerizos. El modelo anuncia 262.144 tokens, pero Ollama aplica por defecto una ventana mucho más corta: si se supera ese límite, el principio de tu documento simplemente se recorta, sin ningún mensaje de error. El modelo responde con seguridad sobre un texto que no ha visto en su totalidad.
En cuanto al millón de tokens anunciado: se basa en una extensión YaRN, configurada en el archivo de configuración del modelo, y solo es compatible con vLLM, SGLang o TokenSpeed. Actualmente no existe ninguna forma de acceder a él desde Ollama.
#Modo de pensamiento y parámetros de muestreo
Qwen 3.8 piensa antes de responder: genera un bloque de razonamiento entre etiquetas « think » y luego la respuesta final. Está activado por defecto, y es lo que explica en gran medida la latencia percibida. En los motores que lo soportan, la profundidad se ajusta con reasoning_effort — xhigh por defecto, luego medium y low.
| Modo | temperature | top_p | top_k | presence_penalty |
|---|---|---|---|---|
| Thinking (predeterminado) | 1.0 | 0.95 | 20 | 0.0 |
| Instruct (sin reflexión) | 0.7 | 0.80 | 20 | 1.5 |
- Tareas cortas en local
- Reduce reasoning_effort a low o medium: en una reformulación o una extracción, un razonamiento prolongado no cambia la calidad y triplica el tiempo de espera.
- Tareas de agentes
- Mantén xhigh. Alibaba señala que un esfuerzo reducido provoca análisis insuficientes, por lo que hay reintentos — el beneficio por turno se anula por los fracasos.
- Respuestas que se repiten en bucle
- Aumenta presence_penalty (entre 0 y 2). Por encima de 1,5, el modelo comienza a mezclar idiomas.
- Salida contaminada por el razonamiento
- Si tu aplicación muestra las etiquetas de reflexión, es porque no separa reasoning_content del contenido final. Desactiva la reflexión para este caso de uso en lugar de filtrar el texto posteriormente.
#Analizar una imagen o un documento
La visión es nativa: captura de pantalla, foto de tabla, esquema técnico, página escaneada. En línea de comando, basta con indicar la ruta del archivo en el prompt; a través de la API, las imágenes pasan codificadas en base64 en el campo previsto por Ollama.
#Qué valor tienen las puntuaciones anunciadas
El salto que se afirma haber logrado frente a Qwen 3.6-27B, el modelo del mismo tamaño de la generación anterior, es importante, sobre todo en la programación con agentes y el uso del ordenador. Estas son las cifras publicadas por Alibaba, teniendo en cuenta que no se han reproducido de forma independiente.
| Prueba | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| Terminal Bench 2.1 (programación con agentes) | 73,0 | 63,4 |
| SWE-bench Pro | 61,7 | 53,5 |
| LiveCodeBench v6 | 90,3 | 83,9 |
| IFBench (seguimiento de instrucciones) | 79,5 | 69,1 |
| GPQA Diamond (ciencias) | 89,2 | 87,8 |
| OSWorld-Verified (uso del ordenador) | 84,3 | 63,9 |
| MathVision (matemáticas visuales) | 90,0 | 85,1 |
| OmniDocBench 1.5 (documentos) | 91,1 | 89,4 |
Lo que conviene recordar para un uso local: los avances se centran sobre todo en tareas largas que utilizan herramientas: manejar un terminal, corregir un repositorio y encadenar pasos sin desviarse. En una conversación sencilla o un resumen, la diferencia con la generación anterior será mucho menos visible de lo que estas cifras sugieren.
#¿Conviene dejar de usar Qwen 3.6, Gemma 4 o gpt-oss?
- Usas Qwen 3.6-27B
- Sí, la actualización merece la pena: mismo consumo de memoria, misma licencia permisiva y mejoras claras en programación y en tareas con agentes. Conserva la etiqueta anterior mientras validas tus prompts, ya que cambia el estilo de las respuestas.
- Usas Gemma 4 26B
- Qwen 3.8 mantiene la ventaja en programación y tareas con agentes; en cuanto a licencias, ambos están ahora bajo Apache 2.0, ya que Gemma pasó a tener una licencia permisiva en abril de 2026. Gemma 4 (MoE 26B-A4B, multimodal) suele seguir siendo más natural en francés conversacional y más rápido de poner en marcha.
- Usas gpt-oss-20b
- Dos filosofías: gpt-oss es más ligero y más rápido, Qwen 3.8 ve imágenes, mantiene un contexto mucho más largo y se enfoca en tareas largas. Elige según la VRAM disponible.
- Buscas sobre todo programar
- Un modelo MoE de 30B especializado en código sigue siendo más rápido en autocompletado. Qwen 3.8 27B se justifica cuando el agente debe leer, planificar y modificar varios archivos.
- Tienes menos de 24 GB
- No fuerces las cosas. Un modelo de 12-14B en Q4 te dará una mejor experiencia que uno de 27B que tenga que ejecutarse parcialmente en la CPU.
#Solución de problemas
- « model not found » al hacer pull
- Tu versión de Ollama es demasiado antigua para reconocer este repositorio, o la etiqueta está mal escrita: la correcta es «qwen3.8:27b», con un punto, no un guion. Actualiza Ollama y vuelve a intentarlo.
- Error de arquitectura al cargar
- Misma causa: las capas híbridas de Qwen 3.8 solo están soportadas por versiones recientes del motor.
- Generación muy lenta (menos de 5 tokens/s)
- Parte del modelo se carga en la RAM del sistema. Compruébalo con ollama ps: si la distribución no es 100 % GPU, reduce num_ctx, cierra las otras aplicaciones que usan la GPU o pasa a un modelo más pequeño.
- Respuestas que ignoran el inicio del documento
- El contexto se trunca sin avisar. Ajusta num_ctx a la longitud real de tu entrada o divide el documento.
- El modelo « piensa » sin fin
- reasoning_effort demasiado alto para la tarea. Bájalo a medium o low, o desactiva la reflexión para las tareas sencillas.
- La imagen se ignora
- La ruta del archivo debe ser accesible desde el proceso Ollama, y el analizador de visión requiere una versión actualizada. Prueba con una imagen local simple antes de culpar al modelo.
- Falta de espacio en disco
- Entre los blobs y la caché, prevé el doble del tamaño anunciado durante la instalación. Un pull interrumpido por un disco lleno deja fragmentos: ollama rm y después un nuevo pull.
¿Cuánta VRAM se necesita para Qwen 3.8 27B?+
¿Cómo instalar Qwen 3.8 27B localmente?+
¿Qwen 3.8 27B es gratuito y se puede usar en una empresa?+
¿Qué diferencia hay entre Qwen 3.8 27B y Qwen 3.8-Max?+
¿Se puede ejecutar Qwen 3.8 27B con 16 GB de VRAM?+
¿Qwen 3.8 27B es mejor que Qwen 3.6 27B?+
¿Se puede desactivar el modo reflexión de Qwen 3.8?+
¿Es accesible localmente un contexto de un millón de tokens?+
#Para ir más allá
Esta guía presupone una instalación de Ollama que funcione y una elección consciente de la cuantización. Estas páginas complementan el tema:
- Instalar Ollama
- El requisito si el motor aún no está instalado, en Windows, macOS o Linux — y la actualización, esencial para Qwen 3.8.
- Elegir tu cuantización
- Para elegir entre Q4, Q8 y BF16 con conocimiento de causa: cuánta memoria consume cada nivel y qué calidad ofrece.
- Qwen 3.8: la cronología de los pesos abiertos
- De dónde viene la confusión entre el Max disponible mediante API y el 27B abierto, y qué se anunció realmente y cuándo.
- ¿Qué LLM para 24 GB de VRAM?
- El comparativo de modelos que caben en una tarjeta de 24 GB, si aún dudas entre Qwen 3.8 27B y una alternativa más ligera.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.