Intermedio 15 minHerramientas

Configurar DeepSeek con Ollama: Guía de despliegue complet

DeepSeek cubre dos necesidades muy diferentes: generar código (Coder) y razonar paso a paso (R1). Esta guía muestra cómo configurar DeepSeek correctamente con Ollama: elegir la variante adecuada, ajustar la temperatura y la ventana de contexto, mantenerse dentro de la capacidad de tu VRAM y atender varias solicitudes en paralelo. El objetivo: una inferencia estable y rápida, sin ajustar los parámetros a base de ensayo y error.

Por Mohamed Meguedmi·Actualización 2026-08-28·Probado en Windows, macOS y Linux

#Por qué configurar DeepSeek con Ollama

Ollama se encarga por ti de la descarga de los pesos, la distribución entre GPU/CPU y la API local. Obtienes un servidor que escucha en http://localhost:11434 y un único comando para lanzar cualquier variante de DeepSeek. El resto —temperatura, tamaño de contexto, memoria— se controla mediante unos pocos parámetros que conviene comprender en lugar de sufrir sus efectos.

Una buena configuración lo cambia todo: un DeepSeek R1 ejecutado con la temperatura incorrecta entra en bucle o trunca su razonamiento; un DeepSeek Coder con un contexto demasiado corto olvida la mitad de tu archivo. El objetivo de esta guía es fijar estos ajustes de una vez por todas.

#DeepSeek Coder vs Chat vs R1: ¿cuál instalar?

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Tres familias coexisten bajo el nombre DeepSeek en la biblioteca Ollama. No se configuran de la misma forma porque no sirven al mismo propósito.

deepseek-coder
Especializado en código: completado de código, generación de funciones, refactorización. Disponible en tamaños pequeños (1.3B, 6.7B, 33B). Ideal conectado a un editor para el autocompletado local.
deepseek-v3 / deepseek-llm (Chat)
Modelo conversacional generalista. Respuestas directas, sin cadena de pensamiento expuesta. Para un asistente polivalente tanto en francés como en inglés.
deepseek-r1
Modelo de razonamiento: desarrolla una cadena de pensamiento (etiquetas <think>) antes de responder. Excelente en matemáticas, lógica y problemas de múltiples etapas. Versiones destiladas de 1.5B / 7B / 8B / 14B / 32B / 70B para que quepan en local.
i
R1: son destilaciones
Las versiones de deepseek-r1 de 7B a 70B en Ollama son destilaciones basadas en Qwen y Llama, no el modelo completo de 671B. Eso permite ejecutarlas en una tarjeta gráfica de consumo, conservando parte de la capacidad de razonamiento de su hermano mayor.

Regla simple: código mientras escribes → Coder; un asistente que conversa → Chat/V3; un problema que requiere reflexionar → R1. Nada impide instalar los tres; Ollama los almacena uno junto a otro.

#Requisitos y VRAM por tamaño

Ollama debe estar instalado y su servicio activo. La cuantización predeterminada de los modelos DeepSeek en Ollama es Q4_K_M, el mejor equilibrio entre calidad y memoria para la mayoría de las tarjetas. Esta es la VRAM que debes prever en Q4, contando solo los pesos: añade entre 1 y 2 GB más para el contexto.

1.5B – 3B (R1 destilado)
≈ 2 GB · funciona incluso sin GPU dedicada, o en una RTX 3060 de 12 GB sin ningún esfuerzo.
7B – 8B
≈ 5 GB · RTX 3060 12 GB, RTX 4070 12 GB. Punto de equilibrio para uso diario.
14B
≈ 9 GB · Poco margen en una RTX 4070 de 12 GB, margen cómodo en una RTX 4080 de 16 GB.
32B / 33B (Coder)
≈ 19 GB · RTX 4090 24 GB, o Mac con memoria unificada 24-48 GB.
70B
≈ 40 GB · dos GPU de 24 GB o un Mac M4 Pro con 48 GB o más.
→
Verificar antes de descargar
Ejecuta `ollama ps` después de una primera prueba: la columna PROCESSOR indica 100% GPU si el modelo cabe por completo en la VRAM, o un reparto GPU/CPU si supera su capacidad. Ese reparto implica una ralentización considerable; opta entonces por un tamaño de modelo o un nivel de cuantización inferior.

#Instalar y arrancar DeepSeek

  1. 01
    Verificar que Ollama esté en ejecución
    El servicio debe estar iniciado. `ollama --version` confirma la instalación; el servidor escucha en el puerto 11434.
  2. 02
    Descargar el modelo
    Elige la variante y el tamaño con `ollama pull`. La etiqueta después de los dos puntos fija el tamaño (por ejemplo, :7b, :14b, :32b). Sin etiqueta, Ollama toma el tamaño por defecto.
  3. 03
    Iniciar una sesión
    `ollama run` descarga el modelo si es necesario y abre una consola interactiva. Escribe /bye para salir.
  4. 04
    Probar la API
    El mismo modelo está inmediatamente disponible en la API REST local, lista para conectarse a Open WebUI, un editor o tus scripts.
Terminal — descargar e iniciar
# Modèle de raisonnement, distillation 7B
ollama pull deepseek-r1:7b

# Modèle de code, 6.7B
ollama pull deepseek-coder:6.7b

# Lancer une session interactive
ollama run deepseek-r1:7b

# Voir ce qui est chargé et où (GPU/CPU)
ollama ps
Terminal — llamada a API REST
curl http://localhost:11434/api/generate -d '{
  "model": "deepseek-r1:7b",
  "prompt": "Explique la récursivité en une phrase.",
  "stream": false
}'

#Ajustar la temperatura y la ventana de contexto

Los dos parámetros que más influyen en la calidad son la temperatura (creatividad vs determinismo) y num_ctx (tamaño de la ventana de contexto). Los valores predeterminados de Ollama no siempre son ideales, especialmente para R1.

temperature (R1)
0.5 a 0.7. DeepSeek recomienda ~0.6 para R1: demasiado bajo, el razonamiento se congela; demasiado alto, se desvía. Evita 0 en un modelo de razonamiento.
temperature (Coder)
0.1 a 0.3. Para código, queremos determinismo y reproducibilidad, no creatividad.
num_ctx
Tamaño del contexto en tokens. El valor por defecto suele ser 4096. Auméntalo a 8192 o 16384 para archivos largos o cadenas de razonamiento largas, a costa de un mayor consumo de VRAM.
top_p
Aproximadamente 0.95. Dejarlo así en la mayoría de los casos; ajusta primero la temperatura.
repeat_penalty
1.1 por defecto. Útil si R1 se repite en bucle en su cadena de pensamiento.
Sesión interactiva — ajustar en tiempo real
ollama run deepseek-r1:7b
>>> /set parameter temperature 0.6
>>> /set parameter num_ctx 8192
>>> Résous : un train part à 60 km/h...
>>> /bye
API — parámetros por solicitud
{
  "model": "deepseek-coder:6.7b",
  "prompt": "Écris une fonction Python de tri fusion.",
  "options": {
    "temperature": 0.2,
    "num_ctx": 8192,
    "top_p": 0.95
  },
  "stream": false
}
!
num_ctx consume memoria
Duplicar la ventana de contexto aumenta considerablemente la VRAM ocupada por la caché KV. En una tarjeta con una capacidad apenas suficiente, pasar de 4096 a 16384 puede hacer que parte del modelo pase a la CPU. Aumenta el contexto solo si realmente lo necesitas.

#Fijar la configuración con un Modelfile

Ajustar los parámetros en cada sesión es laborioso. Un Modelfile crea una variante con nombre que incluye tus ajustes y un prompt de sistema. Obtienes un modelo listo para usar, que puedes invocar como cualquier otro.

Modelfile — deepseek-coder-fr
FROM deepseek-coder:6.7b

PARAMETER temperature 0.2
PARAMETER num_ctx 8192
PARAMETER top_p 0.95

SYSTEM """Tu es un assistant de programmation.
Réponds en français, commente le code, et privilégie la clarté."""
Terminal — crear y usar la variante
# Créer le modèle à partir du fichier
ollama create deepseek-coder-fr -f ./Modelfile

# L'utiliser comme n'importe quel modèle
ollama run deepseek-coder-fr

El mismo enfoque se aplica a R1: un Modelfile con temperature 0.6 y num_ctx 16384 te da un modelo de razonamiento calibrado, sin tener que pensar en ello cada vez que lo ejecutas.

#Optimizar la VRAM y la memoria

Si un modelo no cabe en la VRAM, Ollama coloca las capas que no caben en la CPU y la tasa de tokens/segundo se desploma. Tres formas de mantener la ejecución íntegramente en la GPU.

Bajar la cuantización
Q4_K_M por defecto. Mantén ese nivel: ya ofrece un buen equilibrio. Sube a Q5_K_M o Q8_0 solo si la VRAM lo permite y buscas un poco más de calidad.
Elegir el tamaño adecuado
Un modelo de 14B ejecutado íntegramente en la GPU supera a uno de 32B que necesita descargar parte del modelo a la CPU, tanto en velocidad como en comodidad de uso. Busca el modelo más grande que quepa completamente en la VRAM.
Dominar num_ctx
La caché KV crece con el contexto. Un contexto razonable (8192) libera espacio para los pesos del modelo.
Descargar de la memoria después del uso
OLLAMA_KEEP_ALIVE establece cuánto tiempo permanece un modelo en memoria después de la última solicitud. Reduce su valor para liberar la GPU más rápido entre dos modelos.
Terminal — liberar el GPU rápidamente
# Garder les modèles chargés 2 minutes seulement (défaut : 5 min)
export OLLAMA_KEEP_ALIVE=2m

# Décharger immédiatement un modèle précis
ollama stop deepseek-r1:7b

#Ejecución en paralelo y concurrencia

Ollama puede atender varias consultas simultáneamente y mantener varios modelos cargados a la vez. Útil para un asistente compartido, o para ejecutar Coder y R1 al mismo tiempo. Dos variables de entorno controlan este comportamiento.

OLLAMA_NUM_PARALLEL
Número de solicitudes procesadas en paralelo por un mismo modelo. Cada solicitud consume su propia parte del contexto y, por tanto, de la VRAM. Aumenta el valor con precaución (2, 4) según la tarjeta.
OLLAMA_MAX_LOADED_MODELS
Número de modelos distintos mantenidos simultáneamente en memoria. Ajusta el valor a 2 para mantener Coder y R1 cargados y listos al mismo tiempo, si la VRAM lo permite.
Terminal — iniciar con concurrencia
# Servir 4 requêtes en parallèle, 2 modèles chargés
export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=2

# Redémarrer le service pour prendre en compte les variables
ollama serve
!
El paralelismo se paga en VRAM
Cada solicitud paralela y cada modelo cargado ocupa su propia memoria. En una tarjeta con apenas la memoria necesaria, aumentar estos valores hace que se recurra rápidamente a la CPU. Mide con `ollama ps` después de aumentar los valores y redúcelos si la columna PROCESSOR deja de mostrar 100% GPU.

#Solución de problemas habituales

R1 se queda en bucle dentro de <think>
Temperatura demasiado baja o repeat_penalty ausente. Sube temperature a 0.6 y añade repeat_penalty 1.1.
Generación muy lenta
El modelo se ejecuta parcialmente en la CPU. Comprueba `ollama ps`: si PROCESSOR no indica 100% GPU, reduce el tamaño, la cuantización o num_ctx.
Respuesta truncada
num_predict (número máximo de tokens generados) demasiado bajo, o contexto saturado. Aumenta num_ctx y deja num_predict libre (-1).
El código sale con las etiquetas de razonamiento
Estás usando R1 para código. Cambia a deepseek-coder, que no genera una cadena de pensamiento.

#Para ir más allá

Una vez configurado y calibrado DeepSeek, estos son los siguientes pasos naturales: profundizar en R1, afinar tus variantes y elegir la cuantización según tu tarjeta.

Instalar DeepSeek R1 con Ollama
Guía dedicada al modelo de razonamiento, las versiones destiladas y la cadena de pensamiento, para ir más allá de la configuración.
Personalizar un modelo con Ollama Modelfile
Sistema de plantillas, prompts de sistema y parámetros — para industrializar las variantes vistas aquí.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Comprender el equilibrio entre calidad y VRAM para que el modelo DeepSeek más grande posible quepa en tu GPU.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.