Qwythos 9B: el pequeño modelo de razonamiento entrenado con Claude, probado en local
Qwythos-9B es un modelo comunitario publicado por Empero AI en junio de 2026: una base Qwen3.5-9B bajo licencia Apache 2.0, con un contexto de 1M, sometida a un ajuste fino con trazas de razonamiento generadas por Claude; de ahí el nombre «Qwythos», que combina Qwen y Mythos. No hay detrás una página de marketing cuidada: solo pesos GGUF en Hugging Face y etiquetas de Ollama publicadas por la comunidad. Esta guía aclara su origen, muestra cómo instalarlo correctamente y lo compara en una prueba real con su base Qwen3.5-9B en una RTX 5070 Ti.
#Qwythos, ¿de qué se trata realmente?
Qwythos-9B no es un modelo «desde cero». Es un fine-tune: alguien tomó una base abierta sólida —Qwen3.5-9B de Alibaba— y la reentrenó con un corpus específico de trazas de razonamiento. Estas trazas (cadenas de pensamiento detalladas, pregunta → reflexión paso a paso → respuesta) procederían de salidas de Claude, la familia de modelos de Anthropic, sobre un conjunto de problemas de lógica, matemáticas y código. El nombre «Qwythos» condensa la idea: la letra inicial de Qwen y «Mythos», nombre informal dado al estilo de razonamiento de Claude por la comunidad que compiló el conjunto de datos.
El interés del proyecto se resume en una frase: destilar un estilo de razonamiento verboso y estructurado en un modelo lo bastante pequeño como para ejecutarse en una GPU de consumo. Un 9B cabe en 6 GB de VRAM en Q4, mientras que los grandes modelos de razonamiento requieren decenas de GB. Si la transferencia de esa «manera de pensar» funciona, obtenemos un razonador de bolsillo. Eso es exactamente lo que vamos a comprobar.
#Origen de Qwythos: las dos fuentes que debes conocer
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Antes de instalar cualquier cosa, es necesario entender de dónde provienen realmente los pesos. Para un modelo comunitario, la procedencia no es un detalle: condiciona la confianza que puedes depositar en el archivo que descargas. Qwythos se encuentra en dos lugares, y no merecen la misma confianza.
- Fuente 1 — Hugging Face (repositorio original)
- Empero AI publica los pesos en Hugging Face, tanto en formato transformers (safetensors) como en GGUF cuantizado. Esta es la fuente de referencia: ficha del modelo, licencia Apache 2.0 indicada, mención de la base Qwen3.5-9B y del conjunto de datos de trazas de razonamiento. Parte siempre de ahí para verificar el hash y leer la ficha.
- Fuente 2 — Etiquetas comunitarias de Ollama
- En el registro Ollama, Qwythos aparece en espacios de nombres de usuarios (tipo nombre-usuario/qwythos), no en la biblioteca oficial. Estos tags son prácticos — una sola orden para instalar — pero son reempaquetados por terceros a partir de GGUF de Hugging Face. Revisa quién publica el tag antes de confiar en él.
- Base
- Qwen3.5-9B (Alibaba), licencia Apache 2.0
- Tipo
- Fine-tune de razonamiento, cadena de pensamiento explícita
- Editor
- Empero AI (comunitario), publicación en junio de 2026
- Licencia
- Apache 2.0 — uso comercial autorizado, licencia heredada del modelo base
- Contexto
- Se anuncia un contexto de 1M de tokens (heredado de Qwen3.5), una cifra que debe tomarse con cautela según la VRAM real
- Formatos
- safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) en Hugging Face
#Requisitos de hardware
Un modelo de 9 mil millones de parámetros se puede ejecutar cómodamente en hardware reciente. Con la cuantización Q4_K_M —el equilibrio recomendado entre calidad y memoria—, Qwythos-9B ocupa aproximadamente 6 GB de VRAM una vez cargado, a los que se añade la caché de contexto (KV cache), que crece con la longitud de los prompts. Nuestro banco de pruebas funciona con una RTX 5070 Ti (16 GB), muy por encima del mínimo.
- Q4_K_M (recomendado)
- ≈ 6 GB de VRAM. Cabe en una RTX 3060 de 12 GB, una 4070, una 5070 Ti, e incluso parcialmente en una tarjeta de 8 GB con un contexto modesto.
- Q5_K_M
- ≈ 7 GB. Ligero aumento de calidad, preferible si tienes 12 GB o más.
- Q8_0
- ≈ 10 GB. Casi sin pérdida frente al FP16, adecuado a partir de 16 GB.
- Contexto largo
- El 1M anunciado es teórico. Una caché KV para 128k tokens ya añade varios GB; busca 16 GB o más de VRAM para superar cómodamente 32k.
#Instalar Qwythos con Ollama
Dos opciones. La rápida: descargar un tag comunitario. La segura: descargar el GGUF oficial desde Hugging Face e importarlo mediante un Modelfile. Detallo ambas; para una estación de trabajo destinada a un uso serio, la segunda es preferible porque sabes exactamente qué archivo estás ejecutando.
- 01Verificar que Ollama esté en ejecuciónOllama expone su daemon en http://localhost:11434. Una simple llamada confirma que responde antes de seguir. Si aún no lo has instalado, consulta la guía de instalación de Ollama.
- 02Ruta rápida — etiqueta comunitariaBusca la etiqueta en ollama.com (espacio de nombres de usuario), luego ejecuta ollama run. Anota el nombre exacto del publicador: es tu única garantía de origen.
- 03Vía segura — GGUF desde Hugging FaceDescarga el archivo .gguf en Q4_K_M desde el repositorio Empero AI, verifica su huella SHA256 contra la mostrada en la tarjeta del modelo, luego crea un Modelfile que apunte a él.
- 04Crear el modelo localEl comando ollama create crea un modelo con nombre a partir de tu Modelfile. Obtienes una etiqueta local que controlas de principio a fin.
- 05Ejecutar y conversarollama run inicia la sesión interactiva. La primera carga coloca el modelo en la VRAM; los siguientes inicios son instantáneos mientras permanezca en ella.
#Primer test de razonamiento
Empezamos por un problema trampa clásico, del tipo que hace fallar a los modelos pequeños no entrenados para razonar. El objetivo no es simplemente obtener la respuesta correcta, sino ver si el modelo desarrolla un razonamiento coherente en lugar de adivinar.
Respuesta esperada: 0,05 €. La trampa intuitiva lleva a 0,10 €. En nuestro banco de pruebas, Qwythos-9B plantea la ecuación (balle = x, batte = x + 1, total 2x + 1 = 1,10), despeja x = 0,05 y comprueba que 0,05 + 1,05 = 1,10 antes de concluir. El razonamiento es verboso —unas diez líneas de reflexión para una respuesta de una sola cifra—, pero es correcto y trazable. Es precisamente el comportamiento que se espera de un fine-tune de razonamiento.
#Qwythos vs Qwen3.5-9B base: lo que cambia el fine-tune
La verdadera pregunta: ¿el modelo ajustado aporta algo en comparación con el modelo base del que procede? Para medirlo, instalamos el modelo base Qwen3.5-9B en paralelo y presentamos a ambos modelos la misma serie de problemas de lógica y matemáticas, con la misma temperatura. Estos son los resultados en nuestro banco de pruebas con una RTX 5070 Ti.
- Longitud de reflexión
- Qwythos desarrolla sistemáticamente una cadena de pensamiento explícita; el modelo base Qwen3.5 suele dar respuestas más breves, a veces directamente, sin mostrar los pasos intermedios.
- Problemas con trampa
- En los acertijos contraintuitivos (bate/pelota, secuencias lógicas), Qwythos se equivoca menos porque verifica su respuesta. El modelo base cae más fácilmente en la trampa de la intuición.
- Velocidad
- Ventaja para el modelo base: genera menos tokens para una respuesta equivalente. Qwythos es más lento en la práctica porque «piensa» antes de responder: el precio del razonamiento.
- Conocimientos factuales
- Empate. El fine-tuning de razonamiento no añade conocimientos factuales; en las preguntas de cultura general, ambos modelos rinden igual (y comparten las mismas lagunas).
- Francés
- Equivalente. La calidad del francés proviene de la base Qwen3.5; Qwythos no mejora ni empeora la fluidez, solo cambia la estructura de la respuesta, no el idioma.
Veredicto de la comparación: Qwythos gana claramente en tareas donde un razonamiento es clave (matemáticas, lógica, depuración, planificación), y pierde en velocidad y respuestas cortas. Si buscas un asistente rápido para reformulaciones o resúmenes, la base Qwen3.5-9B basta. Si quieres un pequeño razonador que muestre su trabajo, Qwythos justifica su existencia.
#El hermano mayor: Qwythos 27B
Empero AI también publica una variante de 27B, construida sobre una base Qwen3.5 más grande siguiendo el mismo principio: ajuste fino con trazas de razonamiento. Está dirigida a quienes disponen de suficiente VRAM para mejorar la calidad del proceso de razonamiento, a costa de un presupuesto de memoria considerablemente mayor.
- VRAM (Q4_K_M)
- ≈ 19 GB. Se necesita una RTX 4090 de 24 GB, una tarjeta profesional, o un Mac con memoria unificada (M4 Pro/Max) para alojarlo cómodamente.
- Lo que se gana
- Cadenas de razonamiento más largas y más robustas en problemas de múltiples etapas; menos errores aritméticos en cascada. La diferencia aumenta especialmente en tareas realmente difíciles.
- Lo que se paga
- Tres veces más VRAM y una generación más lenta. En hardware de 12-16 GB, el 27B simplemente no cabe en Q4 sin offload a CPU, lo que reduce drásticamente la velocidad.
- ¿Cuándo elegirlo?
- Si el 9B falla regularmente en tus problemas reales Y tienes 24 GB de VRAM. De lo contrario, el 9B sigue siendo el mejor equilibrio calidad/recursos.
#Solución de problemas
- El tag Ollama no existe / ha desaparecido
- Las etiquetas comunitarias van y vienen. Pasa a la opción segura: descarga el GGUF desde Hugging Face e impórtalo mediante un Modelfile. Ya no dependes de la disponibilidad de un tercero.
- El modelo no razona, responde de forma directa
- Agrega una instrucción de sistema explícita (« descompón paso a paso ») y verifica que num_ctx sea lo suficientemente grande como para dejar espacio para la reflexión. Una temperatura demasiado baja también inhibe la cadena de pensamiento.
- Respuestas truncadas
- La reflexión consume el presupuesto de salida. Aumenta num_predict (o el parámetro equivalente de tu cliente) para que el modelo termine su razonamiento Y dé su respuesta.
- Salida muy lenta
- Comprueba que el modelo quepa bien en la VRAM (ollama ps). Si parte del modelo pasa a la RAM del sistema, la velocidad cae en picado: baja un nivel de cuantización o reduce num_ctx.
- Duda sobre la integridad del archivo
- Compara el SHA256 del GGUF descargado con el publicado en la ficha del modelo en Hugging Face. Una huella diferente significa que el archivo se ha reempaquetado o está corrupto: no lo ejecutes.
#Para ir más allá
Para instalar los componentes que acompañan a Qwythos y entender las decisiones de compromiso mencionadas aquí:
- Instalar Ollama (Windows, macOS, Linux)
- El requisito previo de esta guía: configurar el demonio de Ollama en el puerto 11434 antes de descargar cualquier modelo.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para elegir entre Q4_K_M, Q5_K_M y Q8_0 según tu VRAM y tus requisitos de calidad, tanto para Qwythos como para sus modelos hermanos.
- Instalar DeepSeek R1 con Ollama
- Otro modelo de razonamiento de código abierto con cadena de pensamiento, útil para comparar el enfoque de Qwythos con una referencia bien establecida.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.