Principiante 8 minOllama

Instalar DeepSeek R1 con Ollama

DeepSeek R1 es un modelo de razonamiento con cadena de pensamiento publicado bajo licencia MIT por DeepSeek. El modelo completo tiene 671 mil millones de parámetros y queda fuera del alcance de un equipo personal, pero las versiones destiladas (1.5B a 70B) caben holgadamente en hardware de consumo. Este tutorial muestra cómo instalar DeepSeek R1 con Ollama, elegir el tamaño adecuado y aprovechar el modo de razonamiento.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué DeepSeek R1?

R1 no es un LLM "clásico": antes de responder, genera una cadena de razonamiento visible, delimitada por las etiquetas <think>...</think>. Esta fase le permite resolver problemas de matemáticas, lógica o código que los modelos de generación directa a menudo no logran resolver. En AIME 2024 y MATH-500, los modelos destilados de 14B y 32B superan ampliamente a Llama 3.1 70B Instruct, que, sin embargo, pesa entre 2 y 5 veces más.

Otra ventaja: la licencia MIT, sin restricciones de uso comercial ni geográficas. Puedes integrar R1 en un producto, un agente o una herramienta interna sin pedir permiso a nadie. Es poco habitual para un modelo de razonamiento de este nivel.

i
Destilación, en dos palabras
El modelo completo R1 (671B MoE) generó millones de ejemplos de razonamiento, que luego se usaron para realizar el ajuste fino de modelos más pequeños (Qwen 7B/14B/32B y Llama 8B/70B). Los modelos destilados no son, por tanto, R1 en sí, sino modelos Qwen/Llama que aprendieron a razonar como R1.

#Las versiones destiladas disponibles

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Ollama distribuye siete tamaños bajo el mismo nombre deepseek-r1. La etiqueta por defecto apunta a la versión destilada de 7B (basada en Qwen 7B).

deepseek-r1:1.5b
Basado en Qwen 2.5 Math 1.5B. Ligero, perfecto para probar en un portátil sin GPU. Calidad limitada en problemas complejos.
deepseek-r1:7b
Base Qwen 2.5 Math 7B. Etiqueta por defecto. Buen equilibrio para 8 GB de VRAM. Excelente punto de partida.
deepseek-r1:8b
Base Llama 3.1 8B. Ligeramente más habladora que la 7B, mejor en francés.
deepseek-r1:14b
Base Qwen 2.5 14B. Salto notable en calidad en matemáticas. Punto óptimo para 12 GB de VRAM.
deepseek-r1:32b
Basado en Qwen 2.5 32B. Al nivel de o1-mini en la mayoría de los benchmarks de razonamiento. Requiere 24 GB de VRAM en Q4.
deepseek-r1:70b
Basado en Llama 3.3 70B. El más capaz de los modelos destilados. RTX 5090 de 32 GB o Mac Studio de 64 GB o más.
deepseek-r1:671b
El modelo completo (MoE 671B, 37B activos). Fuera del alcance de un equipo personal, pero posible en un Mac Studio Ultra de 512 GB.

#Requisitos y VRAM por tamaño

Antes de instalar DeepSeek R1 con Ollama, verifica que tengas Ollama instalado (el daemon escucha por defecto en http://localhost:11434) y que tu GPU tenga suficiente memoria para el tamaño deseado. A continuación, los requisitos de VRAM para la cuantización Q4_K_M, que es la que Ollama descarga por defecto.

1.5B Q4
~1,1 GB de VRAM. Funciona en cualquier GPU o incluso solo con CPU (15-25 tok/s).
7B Q4
~4,7 GB de VRAM. RTX 3050 8 GB, 4060 8 GB, Mac M1/M2 16 GB.
8B Q4
~5,2 GB de VRAM. Mismo objetivo que el modelo de 7B, margen más ajustado con 6 GB.
14B Q4
~9 GB de VRAM. RTX 3060 de 12 GB, 4070 de 12 GB, M2 Pro de 16 GB.
32B Q4
~19 GB de VRAM. RTX 3090/4090 24 GB, M3 Max 36 GB.
70B Q4
~40 GB de VRAM. RTX 5090 de 32 GB con offload, Mac Studio Ultra de 64 GB+.
→
¿No estás seguro de tu VRAM?
En Windows, abre el Administrador de tareas, pestaña Rendimiento > GPU. En Linux: nvidia-smi para NVIDIA, rocm-smi para AMD. En Mac: la memoria es unificada; calcula aproximadamente el 75 % de la RAM total como VRAM utilizable para el LLM.

#1. Instalar el modelo

Una sola orden basta. Ollama descarga los pesos desde su registro oficial y carga el modelo en memoria al primer uso.

Instalar la versión 7B predeterminada
ollama run deepseek-r1

Para un tamaño específico, añade la etiqueta:

Elegir explícitamente un tamaño
# Version la plus légère (1.5B)
ollama run deepseek-r1:1.5b

# Sweet spot 12 Go VRAM
ollama run deepseek-r1:14b

# Pour RTX 3090/4090
ollama run deepseek-r1:32b

La primera ejecución descarga el modelo (de 1 GB para la versión 1.5B a 40 GB para la versión 70B). Las ejecuciones siguientes son instantáneas siempre que el modelo permanezca en la caché de Ollama.

!
Nunca uses :cloud
Si ves deepseek-r1:cloud en algún lugar, ignóralo: es una etiqueta que dirige las solicitudes a los servidores de Ollama Cloud y cobra por uso. Para mantener un autoalojamiento estricto, utiliza únicamente las etiquetas numeradas (1.5b, 7b, 14b, 32b, 70b).

#2. Elegir el tamaño

La elección de tamaño depende de tres variables: la VRAM, el tipo de tareas y tu tolerancia a la espera. R1 produce en promedio entre 500 y 2000 tokens de razonamiento antes de dar la respuesta final — es decir, 3 a 10 veces más tokens que un modelo de chat clásico con generación directa. La velocidad importa mucho.

Probar R1 sin GPU de alto rendimiento
1,5B o 7B. Latencia aceptable para el chat incluso en CPU.
Matemáticas de nivel de bachillerato / Python básico
7B o 8B. Suficiente el 80 % del tiempo, decepciona en álgebra avanzada.
Matemáticas exigentes, lógica, razonamiento prolongado
Mínimo 14B. Mejora clara entre 8B y 14B en AIME y MATH-500.
Nivel o1-mini, depuración compleja, demostraciones
32B. Es la opción ideal si tienes 24 GB de VRAM.
El máximo local posible
70B Q4 en RTX 5090 con offload o en Mac Studio 64 GB+.
→
Regla simple
Comienza con la 14B si tienes 12 GB de VRAM. Es el umbral en el que R1 se vuelve realmente interesante. La 7B sirve principalmente para practicar.

#3. Primer prompt de razonamiento

R1 destaca en problemas que requieren varios pasos. Probémoslo con un clásico de AIME, abordable para la versión de 14B:

Ejemplo de matemáticas
>>> Un train part de Lyon à 8h à 90 km/h vers Paris.
... Un autre part de Paris à 9h à 110 km/h vers Lyon.
... La distance Lyon-Paris est 460 km. À quelle heure se croisent-ils ?

<think>
À 9h, le premier train a parcouru 90 km. Il reste 460 - 90 = 370 km
entre les deux trains. Ils se rapprochent à 90 + 110 = 200 km/h.
Temps avant croisement : 370 / 200 = 1,85 h = 1h51min.
Donc croisement à 9h + 1h51 = 10h51.
</think>

Les deux trains se croisent à 10h51.

Fíjate bien en la estructura: todo lo que está entre <think> y </think> es la cadena de pensamiento del modelo. Puedes mostrarla al usuario final, ocultarla o registrarla para depurar. Es un excelente recurso para mejorar la explicabilidad en una aplicación.

i
No elimines el <think>
Una tentación habitual: añadir un prompt de sistema que diga "no generes una cadena de pensamiento". Mala idea: la calidad se desploma. El razonamiento ES el modelo. Oculta el bloque en la interfaz en lugar de eliminarlo durante la generación.

#4. Q4 vs Q8: elegir la cuantización

Por defecto, Ollama descarga la Q4_K_M (compromiso calidad/memoria recomendado). Para modelos de razonamiento, algunos prefieren subir a Q8_0 — la degradación de calidad en la cadena de pensamiento se siente más que en chat clásico.

Tags de cuantización de Ollama
# Q4_K_M (défaut) — recommandé pour 80 % des cas
ollama pull deepseek-r1:14b

# Q8_0 — qualité maximale, mémoire doublée
ollama pull deepseek-r1:14b-q8_0

# Liste complète des tags disponibles
ollama show deepseek-r1:14b --modelfile
Q4_K_M
Opción equilibrada por defecto. Entre un 2 y un 4 % menos de calidad que FP16 en los benchmarks de matemáticas. Es la opción que conviene elegir primero.
Q5_K_M
+1 % de calidad vs Q4, +25 % de memoria. Interesante si tienes margen de VRAM sin poder pasar al tamaño superior.
Q8_0
Calidad casi equivalente a FP16 (-0,5 %). El doble de memoria que Q4. Recomendado si quieres la máxima calidad con el modelo 14B o 32B y tienes suficiente VRAM.
FP16
Referencia de precisión completa. No ofrece ventaja práctica frente a Q8 en distillados, y es 4 veces más pesado que Q4.
→
Q4 14B > Q8 7B
Cuando dudes entre aumentar la precisión de la cuantización o aumentar el tamaño, aumenta siempre el tamaño. Un modelo 14B Q4 supera sistemáticamente a un modelo 7B Q8 en razonamiento, con aproximadamente la misma cantidad de VRAM.

#DeepSeek R1 vs Qwen 3.8 27B

Qwen 3.8 27B, lanzado el 14 de agosto de 2026 por el equipo Qwen, es el modelo generalista de pesos abiertos de referencia de 2026: 262k tokens de contexto, visión, licencia Apache 2.0 y, sobre todo, un modo de razonamiento integrado. Es la alternativa natural a R1 cuando se quiere un solo modelo capaz de razonar Y de hacer todo lo demás. ¿Cuál elegir?

DeepSeek R1 32B
Especialista en razonamiento puro. Mejor en benchmarks de matemáticas (AIME, MATH-500). El razonamiento siempre es visible y fácil de analizar mediante <think>...</think>. Solo hace eso, pero lo hace muy bien.
Qwen 3.8 27B
Generalista 2026 con razonamiento integrado. Contexto 262k, visión, Apache 2.0, ~18 GB en Q4. Por defecto razona excesivamente: incluso en una pregunta sencilla, desarrolla una larga cadena de pensamiento innecesaria. Reduce su nivel de razonamiento a low para obtener respuestas directas.
Veredicto práctico
R1 32B sigue por delante en matemáticas y lógica puras, y en cuanto a un formato de razonamiento estable que se puede registrar. Qwen 3.8 27B gana en cuanto quieres un modelo versátil (código, chat, visión, contexto largo) que razone a demanda. Para el francés, ambos son sólidos.
Recursos
Comparables. R1 32B cabe en Q4 con 24 GB (RTX 3090/4090). Qwen 3.8 27B es un poco más ligero (~18 GB en Q4) y deja más margen de contexto en la misma tarjeta.
i
Probar ambos es rápido
ollama pull qwen3.8:27b à côté de deepseek-r1:32b, puis comparez sur vos vrais prompts. Pensez à baisser le niveau de raisonnement de Qwen 3.8 en low si vous le trouvez trop bavard. C'est l'arbitrage le plus fiable — vos cas d'usage valent mieux que n'importe quel benchmark public.

#Solución de problemas

Modelo que no muestra el <think>
Quizás estés usando un cliente que oculta las etiquetas XML. Prueba con ollama run en CLI para verificar que el modelo las genere correctamente. Si la API JSON las corta, es un problema del cliente.
Respuestas truncadas
El contexto predeterminado de Ollama es de 4096 tokens. R1 consume muchos para su razonamiento. Amplíalo: /set parameter num_ctx 16384 en la sesión, o mediante el parámetro options.num_ctx en la API.
Muy lento a pesar de tener una buena GPU
Verifica con ollama ps que el modelo esté bien 100 % en GPU. Si la columna PROCESSOR muestra CPU, estás sobrecargando la RAM. Disminuye el tamaño o cambia a una cuantización más agresiva.
El modelo entra en un bucle en su cadena de pensamiento
Es típico de los pequeños modelos destilados (1.5B, 7B) ante problemas demasiado difíciles. Usa un modelo más grande, plantea un problema más sencillo o añade a tu prompt «responde en menos de 500 tokens de razonamiento».
Error "insufficient memory"
Modelo demasiado grande para tu VRAM. ollama rm deepseek-r1:32b y luego ollama pull deepseek-r1:14b. También puedes forzar un offload parcial con OLLAMA_GPU_LAYERS.

#Para ir más allá

Algunas opciones para seguir después de esta instalación:

Comprender las cuantizaciones
La guía Q4/Q5/Q8 del sitio detalla los compromisos precisos, útil antes de aumentar el tamaño.
Elegir tu GPU para R1
Si te planteas seriamente usar la versión de 32B, la guía de compra de GPU indica los umbrales de 24/32 GB a los que debes apuntar en 2026.
Conectar R1 a una interfaz
Open WebUI o LM Studio gestionan de forma nativa las etiquetas <think> y permiten contraer y expandir el razonamiento.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.