Instalar DeepSeek R1 con Ollama
DeepSeek R1 es un modelo de razonamiento con cadena de pensamiento publicado bajo licencia MIT por DeepSeek. El modelo completo tiene 671 mil millones de parámetros y queda fuera del alcance de un equipo personal, pero las versiones destiladas (1.5B a 70B) caben holgadamente en hardware de consumo. Este tutorial muestra cómo instalar DeepSeek R1 con Ollama, elegir el tamaño adecuado y aprovechar el modo de razonamiento.
#¿Por qué DeepSeek R1?
R1 no es un LLM "clásico": antes de responder, genera una cadena de razonamiento visible, delimitada por las etiquetas <think>...</think>. Esta fase le permite resolver problemas de matemáticas, lógica o código que los modelos de generación directa a menudo no logran resolver. En AIME 2024 y MATH-500, los modelos destilados de 14B y 32B superan ampliamente a Llama 3.1 70B Instruct, que, sin embargo, pesa entre 2 y 5 veces más.
Otra ventaja: la licencia MIT, sin restricciones de uso comercial ni geográficas. Puedes integrar R1 en un producto, un agente o una herramienta interna sin pedir permiso a nadie. Es poco habitual para un modelo de razonamiento de este nivel.
#Las versiones destiladas disponibles
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Ollama distribuye siete tamaños bajo el mismo nombre deepseek-r1. La etiqueta por defecto apunta a la versión destilada de 7B (basada en Qwen 7B).
- deepseek-r1:1.5b
- Basado en Qwen 2.5 Math 1.5B. Ligero, perfecto para probar en un portátil sin GPU. Calidad limitada en problemas complejos.
- deepseek-r1:7b
- Base Qwen 2.5 Math 7B. Etiqueta por defecto. Buen equilibrio para 8 GB de VRAM. Excelente punto de partida.
- deepseek-r1:8b
- Base Llama 3.1 8B. Ligeramente más habladora que la 7B, mejor en francés.
- deepseek-r1:14b
- Base Qwen 2.5 14B. Salto notable en calidad en matemáticas. Punto óptimo para 12 GB de VRAM.
- deepseek-r1:32b
- Basado en Qwen 2.5 32B. Al nivel de o1-mini en la mayoría de los benchmarks de razonamiento. Requiere 24 GB de VRAM en Q4.
- deepseek-r1:70b
- Basado en Llama 3.3 70B. El más capaz de los modelos destilados. RTX 5090 de 32 GB o Mac Studio de 64 GB o más.
- deepseek-r1:671b
- El modelo completo (MoE 671B, 37B activos). Fuera del alcance de un equipo personal, pero posible en un Mac Studio Ultra de 512 GB.
#Requisitos y VRAM por tamaño
Antes de instalar DeepSeek R1 con Ollama, verifica que tengas Ollama instalado (el daemon escucha por defecto en http://localhost:11434) y que tu GPU tenga suficiente memoria para el tamaño deseado. A continuación, los requisitos de VRAM para la cuantización Q4_K_M, que es la que Ollama descarga por defecto.
- 1.5B Q4
- ~1,1 GB de VRAM. Funciona en cualquier GPU o incluso solo con CPU (15-25 tok/s).
- 7B Q4
- ~4,7 GB de VRAM. RTX 3050 8 GB, 4060 8 GB, Mac M1/M2 16 GB.
- 8B Q4
- ~5,2 GB de VRAM. Mismo objetivo que el modelo de 7B, margen más ajustado con 6 GB.
- 14B Q4
- ~9 GB de VRAM. RTX 3060 de 12 GB, 4070 de 12 GB, M2 Pro de 16 GB.
- 32B Q4
- ~19 GB de VRAM. RTX 3090/4090 24 GB, M3 Max 36 GB.
- 70B Q4
- ~40 GB de VRAM. RTX 5090 de 32 GB con offload, Mac Studio Ultra de 64 GB+.
#1. Instalar el modelo
Una sola orden basta. Ollama descarga los pesos desde su registro oficial y carga el modelo en memoria al primer uso.
Para un tamaño específico, añade la etiqueta:
La primera ejecución descarga el modelo (de 1 GB para la versión 1.5B a 40 GB para la versión 70B). Las ejecuciones siguientes son instantáneas siempre que el modelo permanezca en la caché de Ollama.
#2. Elegir el tamaño
La elección de tamaño depende de tres variables: la VRAM, el tipo de tareas y tu tolerancia a la espera. R1 produce en promedio entre 500 y 2000 tokens de razonamiento antes de dar la respuesta final — es decir, 3 a 10 veces más tokens que un modelo de chat clásico con generación directa. La velocidad importa mucho.
- Probar R1 sin GPU de alto rendimiento
- 1,5B o 7B. Latencia aceptable para el chat incluso en CPU.
- Matemáticas de nivel de bachillerato / Python básico
- 7B o 8B. Suficiente el 80 % del tiempo, decepciona en álgebra avanzada.
- Matemáticas exigentes, lógica, razonamiento prolongado
- Mínimo 14B. Mejora clara entre 8B y 14B en AIME y MATH-500.
- Nivel o1-mini, depuración compleja, demostraciones
- 32B. Es la opción ideal si tienes 24 GB de VRAM.
- El máximo local posible
- 70B Q4 en RTX 5090 con offload o en Mac Studio 64 GB+.
#3. Primer prompt de razonamiento
R1 destaca en problemas que requieren varios pasos. Probémoslo con un clásico de AIME, abordable para la versión de 14B:
Fíjate bien en la estructura: todo lo que está entre <think> y </think> es la cadena de pensamiento del modelo. Puedes mostrarla al usuario final, ocultarla o registrarla para depurar. Es un excelente recurso para mejorar la explicabilidad en una aplicación.
#4. Q4 vs Q8: elegir la cuantización
Por defecto, Ollama descarga la Q4_K_M (compromiso calidad/memoria recomendado). Para modelos de razonamiento, algunos prefieren subir a Q8_0 — la degradación de calidad en la cadena de pensamiento se siente más que en chat clásico.
- Q4_K_M
- Opción equilibrada por defecto. Entre un 2 y un 4 % menos de calidad que FP16 en los benchmarks de matemáticas. Es la opción que conviene elegir primero.
- Q5_K_M
- +1 % de calidad vs Q4, +25 % de memoria. Interesante si tienes margen de VRAM sin poder pasar al tamaño superior.
- Q8_0
- Calidad casi equivalente a FP16 (-0,5 %). El doble de memoria que Q4. Recomendado si quieres la máxima calidad con el modelo 14B o 32B y tienes suficiente VRAM.
- FP16
- Referencia de precisión completa. No ofrece ventaja práctica frente a Q8 en distillados, y es 4 veces más pesado que Q4.
#DeepSeek R1 vs Qwen 3.8 27B
Qwen 3.8 27B, lanzado el 14 de agosto de 2026 por el equipo Qwen, es el modelo generalista de pesos abiertos de referencia de 2026: 262k tokens de contexto, visión, licencia Apache 2.0 y, sobre todo, un modo de razonamiento integrado. Es la alternativa natural a R1 cuando se quiere un solo modelo capaz de razonar Y de hacer todo lo demás. ¿Cuál elegir?
- DeepSeek R1 32B
- Especialista en razonamiento puro. Mejor en benchmarks de matemáticas (AIME, MATH-500). El razonamiento siempre es visible y fácil de analizar mediante <think>...</think>. Solo hace eso, pero lo hace muy bien.
- Qwen 3.8 27B
- Generalista 2026 con razonamiento integrado. Contexto 262k, visión, Apache 2.0, ~18 GB en Q4. Por defecto razona excesivamente: incluso en una pregunta sencilla, desarrolla una larga cadena de pensamiento innecesaria. Reduce su nivel de razonamiento a low para obtener respuestas directas.
- Veredicto práctico
- R1 32B sigue por delante en matemáticas y lógica puras, y en cuanto a un formato de razonamiento estable que se puede registrar. Qwen 3.8 27B gana en cuanto quieres un modelo versátil (código, chat, visión, contexto largo) que razone a demanda. Para el francés, ambos son sólidos.
- Recursos
- Comparables. R1 32B cabe en Q4 con 24 GB (RTX 3090/4090). Qwen 3.8 27B es un poco más ligero (~18 GB en Q4) y deja más margen de contexto en la misma tarjeta.
#Solución de problemas
- Modelo que no muestra el <think>
- Quizás estés usando un cliente que oculta las etiquetas XML. Prueba con ollama run en CLI para verificar que el modelo las genere correctamente. Si la API JSON las corta, es un problema del cliente.
- Respuestas truncadas
- El contexto predeterminado de Ollama es de 4096 tokens. R1 consume muchos para su razonamiento. Amplíalo: /set parameter num_ctx 16384 en la sesión, o mediante el parámetro options.num_ctx en la API.
- Muy lento a pesar de tener una buena GPU
- Verifica con ollama ps que el modelo esté bien 100 % en GPU. Si la columna PROCESSOR muestra CPU, estás sobrecargando la RAM. Disminuye el tamaño o cambia a una cuantización más agresiva.
- El modelo entra en un bucle en su cadena de pensamiento
- Es típico de los pequeños modelos destilados (1.5B, 7B) ante problemas demasiado difíciles. Usa un modelo más grande, plantea un problema más sencillo o añade a tu prompt «responde en menos de 500 tokens de razonamiento».
- Error "insufficient memory"
- Modelo demasiado grande para tu VRAM. ollama rm deepseek-r1:32b y luego ollama pull deepseek-r1:14b. También puedes forzar un offload parcial con OLLAMA_GPU_LAYERS.
#Para ir más allá
Algunas opciones para seguir después de esta instalación:
- Comprender las cuantizaciones
- La guía Q4/Q5/Q8 del sitio detalla los compromisos precisos, útil antes de aumentar el tamaño.
- Elegir tu GPU para R1
- Si te planteas seriamente usar la versión de 32B, la guía de compra de GPU indica los umbrales de 24/32 GB a los que debes apuntar en 2026.
- Conectar R1 a una interfaz
- Open WebUI o LM Studio gestionan de forma nativa las etiquetas <think> y permiten contraer y expandir el razonamiento.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.