Intermedio 10 minComunidad

Qwythos 9B: el pequeño modelo de razonamiento entrenado con Claude, probado en local

Qwythos-9B es un modelo comunitario publicado por Empero AI en junio de 2026: una base Qwen3.5-9B bajo licencia Apache 2.0, con un contexto de 1M, sometida a un ajuste fino con trazas de razonamiento generadas por Claude; de ahí el nombre «Qwythos», que combina Qwen y Mythos. No hay detrás una página de marketing cuidada: solo pesos GGUF en Hugging Face y etiquetas de Ollama publicadas por la comunidad. Esta guía aclara su origen, muestra cómo instalarlo correctamente y lo compara en una prueba real con su base Qwen3.5-9B en una RTX 5070 Ti.

Por Mohamed Meguedmi·Actualización 2026-08-21·Probado en Windows, macOS y Linux

#Qwythos, ¿de qué se trata realmente?

Qwythos-9B no es un modelo «desde cero». Es un fine-tune: alguien tomó una base abierta sólida —Qwen3.5-9B de Alibaba— y la reentrenó con un corpus específico de trazas de razonamiento. Estas trazas (cadenas de pensamiento detalladas, pregunta → reflexión paso a paso → respuesta) procederían de salidas de Claude, la familia de modelos de Anthropic, sobre un conjunto de problemas de lógica, matemáticas y código. El nombre «Qwythos» condensa la idea: la letra inicial de Qwen y «Mythos», nombre informal dado al estilo de razonamiento de Claude por la comunidad que compiló el conjunto de datos.

El interés del proyecto se resume en una frase: destilar un estilo de razonamiento verboso y estructurado en un modelo lo bastante pequeño como para ejecutarse en una GPU de consumo. Un 9B cabe en 6 GB de VRAM en Q4, mientras que los grandes modelos de razonamiento requieren decenas de GB. Si la transferencia de esa «manera de pensar» funciona, obtenemos un razonador de bolsillo. Eso es exactamente lo que vamos a comprobar.

i
Modelo comunitario, no producto oficial
Qwythos no es un modelo de Alibaba ni un modelo de Anthropic. Es un fine-tune comunitario distribuido por Empero AI. Ninguna de las dos empresas de origen lo mantiene ni lo respalda. Trátalo como un proyecto open source: los pesos están allí, la calidad debe verificarse, el soporte depende de la buena voluntad de sus autores.

#Origen de Qwythos: las dos fuentes que debes conocer

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Antes de instalar cualquier cosa, es necesario entender de dónde provienen realmente los pesos. Para un modelo comunitario, la procedencia no es un detalle: condiciona la confianza que puedes depositar en el archivo que descargas. Qwythos se encuentra en dos lugares, y no merecen la misma confianza.

Fuente 1 — Hugging Face (repositorio original)
Empero AI publica los pesos en Hugging Face, tanto en formato transformers (safetensors) como en GGUF cuantizado. Esta es la fuente de referencia: ficha del modelo, licencia Apache 2.0 indicada, mención de la base Qwen3.5-9B y del conjunto de datos de trazas de razonamiento. Parte siempre de ahí para verificar el hash y leer la ficha.
Fuente 2 — Etiquetas comunitarias de Ollama
En el registro Ollama, Qwythos aparece en espacios de nombres de usuarios (tipo nombre-usuario/qwythos), no en la biblioteca oficial. Estos tags son prácticos — una sola orden para instalar — pero son reempaquetados por terceros a partir de GGUF de Hugging Face. Revisa quién publica el tag antes de confiar en él.
!
Una etiqueta Ollama no está firmada
Cualquiera puede subir un modelo al registro de Ollama bajo su propio nombre. Una etiqueta «qwythos» no garantiza que el GGUF asociado corresponda a los pesos oficiales de Empero AI. Para un uso serio, es preferible que descargues el GGUF desde Hugging Face y lo importes tú mismo mediante un Modelfile (véase más abajo), en lugar de descargar a ciegas un modelo con una etiqueta comunitaria.
Base
Qwen3.5-9B (Alibaba), licencia Apache 2.0
Tipo
Fine-tune de razonamiento, cadena de pensamiento explícita
Editor
Empero AI (comunitario), publicación en junio de 2026
Licencia
Apache 2.0 — uso comercial autorizado, licencia heredada del modelo base
Contexto
Se anuncia un contexto de 1M de tokens (heredado de Qwen3.5), una cifra que debe tomarse con cautela según la VRAM real
Formatos
safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) en Hugging Face

#Requisitos de hardware

Un modelo de 9 mil millones de parámetros se puede ejecutar cómodamente en hardware reciente. Con la cuantización Q4_K_M —el equilibrio recomendado entre calidad y memoria—, Qwythos-9B ocupa aproximadamente 6 GB de VRAM una vez cargado, a los que se añade la caché de contexto (KV cache), que crece con la longitud de los prompts. Nuestro banco de pruebas funciona con una RTX 5070 Ti (16 GB), muy por encima del mínimo.

Q4_K_M (recomendado)
≈ 6 GB de VRAM. Cabe en una RTX 3060 de 12 GB, una 4070, una 5070 Ti, e incluso parcialmente en una tarjeta de 8 GB con un contexto modesto.
Q5_K_M
≈ 7 GB. Ligero aumento de calidad, preferible si tienes 12 GB o más.
Q8_0
≈ 10 GB. Casi sin pérdida frente al FP16, adecuado a partir de 16 GB.
Contexto largo
El 1M anunciado es teórico. Una caché KV para 128k tokens ya añade varios GB; busca 16 GB o más de VRAM para superar cómodamente 32k.
→
Un modelo de razonamiento genera mucho
Los modelos de razonamiento «piensan» en voz alta antes de responder: a veces generan cientos de tokens de reflexión para una respuesta de una línea. Debes incluir un margen en el contexto de salida (num_predict) y esperar respuestas más lentas que un modelo clásico de igual tamaño.

#Instalar Qwythos con Ollama

Dos opciones. La rápida: descargar un tag comunitario. La segura: descargar el GGUF oficial desde Hugging Face e importarlo mediante un Modelfile. Detallo ambas; para una estación de trabajo destinada a un uso serio, la segunda es preferible porque sabes exactamente qué archivo estás ejecutando.

  1. 01
    Verificar que Ollama esté en ejecución
    Ollama expone su daemon en http://localhost:11434. Una simple llamada confirma que responde antes de seguir. Si aún no lo has instalado, consulta la guía de instalación de Ollama.
  2. 02
    Ruta rápida — etiqueta comunitaria
    Busca la etiqueta en ollama.com (espacio de nombres de usuario), luego ejecuta ollama run. Anota el nombre exacto del publicador: es tu única garantía de origen.
  3. 03
    Vía segura — GGUF desde Hugging Face
    Descarga el archivo .gguf en Q4_K_M desde el repositorio Empero AI, verifica su huella SHA256 contra la mostrada en la tarjeta del modelo, luego crea un Modelfile que apunte a él.
  4. 04
    Crear el modelo local
    El comando ollama create crea un modelo con nombre a partir de tu Modelfile. Obtienes una etiqueta local que controlas de principio a fin.
  5. 05
    Ejecutar y conversar
    ollama run inicia la sesión interactiva. La primera carga coloca el modelo en la VRAM; los siguientes inicios son instantáneos mientras permanezca en ella.
Terminal — verificar Ollama
curl http://localhost:11434/api/version
# {"version":"0.x.x"}
Terminal — acceso rápido (etiqueta comunitaria)
# Remplacez <publieur> par le nom réel du dépôt Ollama
ollama run <publieur>/qwythos:9b-q4_k_m
Terminal — vía segura (GGUF Hugging Face)
# 1. Télécharger le GGUF officiel depuis le dépôt Empero AI
huggingface-cli download EmperoAI/Qwythos-9B-GGUF \
  qwythos-9b-Q4_K_M.gguf --local-dir ./qwythos

# 2. Vérifier l'empreinte contre celle de la carte du modèle
sha256sum ./qwythos/qwythos-9b-Q4_K_M.gguf
Modelfile — qwythos.Modelfile
FROM ./qwythos/qwythos-9b-Q4_K_M.gguf

PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER num_ctx 32768

# Encourage la chaîne de pensée explicite
SYSTEM """Tu es un assistant de raisonnement. Décompose chaque problème étape par étape avant de conclure."""
Terminal — importar y ejecutar
ollama create qwythos-9b -f qwythos.Modelfile
ollama run qwythos-9b
i
Temperatura más baja para el razonamiento
En los modelos de razonamiento, una temperatura en torno a 0.6 produce cadenas de pensamiento más estables que el valor habitual de 0.8. Si es demasiado alta, el modelo divaga; si es demasiado baja (0.1-0.2), se repite. La combinación 0.6 / top_p 0.95 es un buen punto de partida; ajústala según tus tareas.

#Primer test de razonamiento

Empezamos por un problema trampa clásico, del tipo que hace fallar a los modelos pequeños no entrenados para razonar. El objetivo no es simplemente obtener la respuesta correcta, sino ver si el modelo desarrolla un razonamiento coherente en lugar de adivinar.

Prompt de prueba
ollama run qwythos-9b "Un batte et une balle coûtent 1,10 € au total. La batte coûte 1 € de plus que la balle. Combien coûte la balle ? Raisonne étape par étape."

Respuesta esperada: 0,05 €. La trampa intuitiva lleva a 0,10 €. En nuestro banco de pruebas, Qwythos-9B plantea la ecuación (balle = x, batte = x + 1, total 2x + 1 = 1,10), despeja x = 0,05 y comprueba que 0,05 + 1,05 = 1,10 antes de concluir. El razonamiento es verboso —unas diez líneas de reflexión para una respuesta de una sola cifra—, pero es correcto y trazable. Es precisamente el comportamiento que se espera de un fine-tune de razonamiento.

→
Ponlo a prueba con TUS problemas
Un modelo puede haber visto este tipo de enigma clásico durante el entrenamiento. Para evaluar con honestidad, construye dos o tres problemas tomados de tu ámbito real (una restricción logística, un fragmento de código que depurar, un cálculo profesional) y compara el proceso, no solo el resultado final.

#Qwythos vs Qwen3.5-9B base: lo que cambia el fine-tune

La verdadera pregunta: ¿el modelo ajustado aporta algo en comparación con el modelo base del que procede? Para medirlo, instalamos el modelo base Qwen3.5-9B en paralelo y presentamos a ambos modelos la misma serie de problemas de lógica y matemáticas, con la misma temperatura. Estos son los resultados en nuestro banco de pruebas con una RTX 5070 Ti.

Terminal — instalar la base para comparar
ollama pull qwen3.5:9b
ollama run qwen3.5:9b "Un batte et une balle coûtent 1,10 €..."
Longitud de reflexión
Qwythos desarrolla sistemáticamente una cadena de pensamiento explícita; el modelo base Qwen3.5 suele dar respuestas más breves, a veces directamente, sin mostrar los pasos intermedios.
Problemas con trampa
En los acertijos contraintuitivos (bate/pelota, secuencias lógicas), Qwythos se equivoca menos porque verifica su respuesta. El modelo base cae más fácilmente en la trampa de la intuición.
Velocidad
Ventaja para el modelo base: genera menos tokens para una respuesta equivalente. Qwythos es más lento en la práctica porque «piensa» antes de responder: el precio del razonamiento.
Conocimientos factuales
Empate. El fine-tuning de razonamiento no añade conocimientos factuales; en las preguntas de cultura general, ambos modelos rinden igual (y comparten las mismas lagunas).
Francés
Equivalente. La calidad del francés proviene de la base Qwen3.5; Qwythos no mejora ni empeora la fluidez, solo cambia la estructura de la respuesta, no el idioma.

Veredicto de la comparación: Qwythos gana claramente en tareas donde un razonamiento es clave (matemáticas, lógica, depuración, planificación), y pierde en velocidad y respuestas cortas. Si buscas un asistente rápido para reformulaciones o resúmenes, la base Qwen3.5-9B basta. Si quieres un pequeño razonador que muestre su trabajo, Qwythos justifica su existencia.

!
El razonamiento no es gratuito
Cadena de pensamiento = más tokens generados = más latencia y mayor consumo de VRAM para el contexto. En tareas simples, forzar a un modelo a razonar lo ralentiza sin aportar nada. Reserva Qwythos para los problemas que realmente se beneficien de una descomposición y conserva un modelo más directo para el resto.

#El hermano mayor: Qwythos 27B

Empero AI también publica una variante de 27B, construida sobre una base Qwen3.5 más grande siguiendo el mismo principio: ajuste fino con trazas de razonamiento. Está dirigida a quienes disponen de suficiente VRAM para mejorar la calidad del proceso de razonamiento, a costa de un presupuesto de memoria considerablemente mayor.

VRAM (Q4_K_M)
≈ 19 GB. Se necesita una RTX 4090 de 24 GB, una tarjeta profesional, o un Mac con memoria unificada (M4 Pro/Max) para alojarlo cómodamente.
Lo que se gana
Cadenas de razonamiento más largas y más robustas en problemas de múltiples etapas; menos errores aritméticos en cascada. La diferencia aumenta especialmente en tareas realmente difíciles.
Lo que se paga
Tres veces más VRAM y una generación más lenta. En hardware de 12-16 GB, el 27B simplemente no cabe en Q4 sin offload a CPU, lo que reduce drásticamente la velocidad.
¿Cuándo elegirlo?
Si el 9B falla regularmente en tus problemas reales Y tienes 24 GB de VRAM. De lo contrario, el 9B sigue siendo el mejor equilibrio calidad/recursos.
i
Empieza por el 9B
No elijas el 27B por inercia. Prueba primero el 9B con tus tareas reales: en muchos casos, basta. Pasa al 27B solo si identificas un límite de calidad concreto en problemas que realmente necesitas resolver, no por principio.

#Solución de problemas

El tag Ollama no existe / ha desaparecido
Las etiquetas comunitarias van y vienen. Pasa a la opción segura: descarga el GGUF desde Hugging Face e impórtalo mediante un Modelfile. Ya no dependes de la disponibilidad de un tercero.
El modelo no razona, responde de forma directa
Agrega una instrucción de sistema explícita (« descompón paso a paso ») y verifica que num_ctx sea lo suficientemente grande como para dejar espacio para la reflexión. Una temperatura demasiado baja también inhibe la cadena de pensamiento.
Respuestas truncadas
La reflexión consume el presupuesto de salida. Aumenta num_predict (o el parámetro equivalente de tu cliente) para que el modelo termine su razonamiento Y dé su respuesta.
Salida muy lenta
Comprueba que el modelo quepa bien en la VRAM (ollama ps). Si parte del modelo pasa a la RAM del sistema, la velocidad cae en picado: baja un nivel de cuantización o reduce num_ctx.
Duda sobre la integridad del archivo
Compara el SHA256 del GGUF descargado con el publicado en la ficha del modelo en Hugging Face. Una huella diferente significa que el archivo se ha reempaquetado o está corrupto: no lo ejecutes.

#Para ir más allá

Para instalar los componentes que acompañan a Qwythos y entender las decisiones de compromiso mencionadas aquí:

Instalar Ollama (Windows, macOS, Linux)
El requisito previo de esta guía: configurar el demonio de Ollama en el puerto 11434 antes de descargar cualquier modelo.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para elegir entre Q4_K_M, Q5_K_M y Q8_0 según tu VRAM y tus requisitos de calidad, tanto para Qwythos como para sus modelos hermanos.
Instalar DeepSeek R1 con Ollama
Otro modelo de razonamiento de código abierto con cadena de pensamiento, útil para comparar el enfoque de Qwythos con una referencia bien establecida.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.