🇨🇳 DeepSeek R1 Distill 32B
El mejor modelo de razonamiento accesible con pesos abiertos.
ollama run deepseek-r1:32b
Ranking actualizado el 22/09/2026
Clasificación de LLM especializados en razonamiento: aquellos que producen una cadena de pensamiento (chain-of-thought) explícita antes de la respuesta. Excelentes en matemáticas, lógica formal, depuración y preguntas científicas que requieren varias etapas.
El mejor modelo de razonamiento accesible con pesos abiertos.
ollama run deepseek-r1:32b
Razonador RL Apache 2.0. AIME24 79.5, MATH-500 90.6. Competidor directo de DeepSeek R1.
ollama run qwq:32b
Modelo de razonamiento de 14B con licencia MIT. Supera a R1-Distill-Llama-70B en las evaluaciones AIME24/25 de Microsoft con una quinta parte de los parámetros.
ollama run phi4-reasoning:14b
R1 destilado con Qwen 14B como modelo base. AIME24 69.7, MATH-500 93.9. Supera a o1-mini en muchos benchmarks.
ollama run deepseek-r1:14b
Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.
ollama run qwen3.8:27b
| Puesto | Modelo | Params | VRAM Q4 | Contexto | Licencia |
|---|---|---|---|---|---|
| #1 | DeepSeek R1 Distill 32B | 32B | 19 GB | 32 768 | MIT |
| #2 | QwQ 32B | 32B | 19 GB | 131 072 | Apache 2.0 |
| #3 | Phi-4 Reasoning 14B | 14B | 9 GB | 32 768 | MIT |
| #4 | DeepSeek R1 Distill Qwen 14B | 14B | 9 GB | 131 072 | MIT |
| #5 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #6 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
Filtramos por la etiqueta « reasoning » — modelos entrenados explícitamente para desplegar una cadena de pensamiento (tokens
Criterios considerados:
La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.
¿Qué es un LLM de razonamiento?
Un modelo que genera primero una cadena de pensamiento (secuencia de pasos internos) antes de producir la respuesta final. Es más lento y más prolijo, pero mucho más preciso en problemas de múltiples pasos (matemáticas, lógica, depuración compleja).
DeepSeek R1 o QwQ-32B: ¿cuál es el mejor?
Ver el comparativo. Los dos son muy similares: DeepSeek R1 tiene una ligera ventaja en MATH, QwQ en GPQA. Elección según la licencia (ambos tienen licencias MIT/Apache) y la VRAM (mismo tamaño, ~32B).
¿Se pueden usar estos modelos en tiempo real (chat)?
Posible pero no recomendado: generan 2 a 5 veces más tokens que un modelo normal (la cadena de pensamiento es visible). Mejor: reservarlos para preguntas que lo justifiquen, y usar un modelo rápido (Mistral 7B, Llama 3.1 8B) para el chat básico.
¿Cuánta VRAM necesita DeepSeek R1 32B?
19 GB en Q4_K_M, 23 GB en Q5, 35 GB en Q8. El modelo cabe cómodamente en una RTX 4090 (24 GB) en Q5. Una RTX 3060 de 12 GB se queda corta para este tamaño.
Profundiza con nuestras comparativas detalladas entre los finalistas: