Configurar DeepSeek con Ollama: Guía de despliegue complet
DeepSeek cubre dos necesidades muy diferentes: generar código (Coder) y razonar paso a paso (R1). Esta guía muestra cómo configurar DeepSeek correctamente con Ollama: elegir la variante adecuada, ajustar la temperatura y la ventana de contexto, mantenerse dentro de la capacidad de tu VRAM y atender varias solicitudes en paralelo. El objetivo: una inferencia estable y rápida, sin ajustar los parámetros a base de ensayo y error.
#Por qué configurar DeepSeek con Ollama
Ollama se encarga por ti de la descarga de los pesos, la distribución entre GPU/CPU y la API local. Obtienes un servidor que escucha en http://localhost:11434 y un único comando para lanzar cualquier variante de DeepSeek. El resto —temperatura, tamaño de contexto, memoria— se controla mediante unos pocos parámetros que conviene comprender en lugar de sufrir sus efectos.
Una buena configuración lo cambia todo: un DeepSeek R1 ejecutado con la temperatura incorrecta entra en bucle o trunca su razonamiento; un DeepSeek Coder con un contexto demasiado corto olvida la mitad de tu archivo. El objetivo de esta guía es fijar estos ajustes de una vez por todas.
#DeepSeek Coder vs Chat vs R1: ¿cuál instalar?
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Tres familias coexisten bajo el nombre DeepSeek en la biblioteca Ollama. No se configuran de la misma forma porque no sirven al mismo propósito.
- deepseek-coder
- Especializado en código: completado de código, generación de funciones, refactorización. Disponible en tamaños pequeños (1.3B, 6.7B, 33B). Ideal conectado a un editor para el autocompletado local.
- deepseek-v3 / deepseek-llm (Chat)
- Modelo conversacional generalista. Respuestas directas, sin cadena de pensamiento expuesta. Para un asistente polivalente tanto en francés como en inglés.
- deepseek-r1
- Modelo de razonamiento: desarrolla una cadena de pensamiento (etiquetas <think>) antes de responder. Excelente en matemáticas, lógica y problemas de múltiples etapas. Versiones destiladas de 1.5B / 7B / 8B / 14B / 32B / 70B para que quepan en local.
Regla simple: código mientras escribes → Coder; un asistente que conversa → Chat/V3; un problema que requiere reflexionar → R1. Nada impide instalar los tres; Ollama los almacena uno junto a otro.
#Requisitos y VRAM por tamaño
Ollama debe estar instalado y su servicio activo. La cuantización predeterminada de los modelos DeepSeek en Ollama es Q4_K_M, el mejor equilibrio entre calidad y memoria para la mayoría de las tarjetas. Esta es la VRAM que debes prever en Q4, contando solo los pesos: añade entre 1 y 2 GB más para el contexto.
- 1.5B – 3B (R1 destilado)
- ≈ 2 GB · funciona incluso sin GPU dedicada, o en una RTX 3060 de 12 GB sin ningún esfuerzo.
- 7B – 8B
- ≈ 5 GB · RTX 3060 12 GB, RTX 4070 12 GB. Punto de equilibrio para uso diario.
- 14B
- ≈ 9 GB · Poco margen en una RTX 4070 de 12 GB, margen cómodo en una RTX 4080 de 16 GB.
- 32B / 33B (Coder)
- ≈ 19 GB · RTX 4090 24 GB, o Mac con memoria unificada 24-48 GB.
- 70B
- ≈ 40 GB · dos GPU de 24 GB o un Mac M4 Pro con 48 GB o más.
#Instalar y arrancar DeepSeek
- 01Verificar que Ollama esté en ejecuciónEl servicio debe estar iniciado. `ollama --version` confirma la instalación; el servidor escucha en el puerto 11434.
- 02Descargar el modeloElige la variante y el tamaño con `ollama pull`. La etiqueta después de los dos puntos fija el tamaño (por ejemplo, :7b, :14b, :32b). Sin etiqueta, Ollama toma el tamaño por defecto.
- 03Iniciar una sesión`ollama run` descarga el modelo si es necesario y abre una consola interactiva. Escribe /bye para salir.
- 04Probar la APIEl mismo modelo está inmediatamente disponible en la API REST local, lista para conectarse a Open WebUI, un editor o tus scripts.
#Ajustar la temperatura y la ventana de contexto
Los dos parámetros que más influyen en la calidad son la temperatura (creatividad vs determinismo) y num_ctx (tamaño de la ventana de contexto). Los valores predeterminados de Ollama no siempre son ideales, especialmente para R1.
- temperature (R1)
- 0.5 a 0.7. DeepSeek recomienda ~0.6 para R1: demasiado bajo, el razonamiento se congela; demasiado alto, se desvía. Evita 0 en un modelo de razonamiento.
- temperature (Coder)
- 0.1 a 0.3. Para código, queremos determinismo y reproducibilidad, no creatividad.
- num_ctx
- Tamaño del contexto en tokens. El valor por defecto suele ser 4096. Auméntalo a 8192 o 16384 para archivos largos o cadenas de razonamiento largas, a costa de un mayor consumo de VRAM.
- top_p
- Aproximadamente 0.95. Dejarlo así en la mayoría de los casos; ajusta primero la temperatura.
- repeat_penalty
- 1.1 por defecto. Útil si R1 se repite en bucle en su cadena de pensamiento.
#Fijar la configuración con un Modelfile
Ajustar los parámetros en cada sesión es laborioso. Un Modelfile crea una variante con nombre que incluye tus ajustes y un prompt de sistema. Obtienes un modelo listo para usar, que puedes invocar como cualquier otro.
El mismo enfoque se aplica a R1: un Modelfile con temperature 0.6 y num_ctx 16384 te da un modelo de razonamiento calibrado, sin tener que pensar en ello cada vez que lo ejecutas.
#Optimizar la VRAM y la memoria
Si un modelo no cabe en la VRAM, Ollama coloca las capas que no caben en la CPU y la tasa de tokens/segundo se desploma. Tres formas de mantener la ejecución íntegramente en la GPU.
- Bajar la cuantización
- Q4_K_M por defecto. Mantén ese nivel: ya ofrece un buen equilibrio. Sube a Q5_K_M o Q8_0 solo si la VRAM lo permite y buscas un poco más de calidad.
- Elegir el tamaño adecuado
- Un modelo de 14B ejecutado íntegramente en la GPU supera a uno de 32B que necesita descargar parte del modelo a la CPU, tanto en velocidad como en comodidad de uso. Busca el modelo más grande que quepa completamente en la VRAM.
- Dominar num_ctx
- La caché KV crece con el contexto. Un contexto razonable (8192) libera espacio para los pesos del modelo.
- Descargar de la memoria después del uso
- OLLAMA_KEEP_ALIVE establece cuánto tiempo permanece un modelo en memoria después de la última solicitud. Reduce su valor para liberar la GPU más rápido entre dos modelos.
#Ejecución en paralelo y concurrencia
Ollama puede atender varias consultas simultáneamente y mantener varios modelos cargados a la vez. Útil para un asistente compartido, o para ejecutar Coder y R1 al mismo tiempo. Dos variables de entorno controlan este comportamiento.
- OLLAMA_NUM_PARALLEL
- Número de solicitudes procesadas en paralelo por un mismo modelo. Cada solicitud consume su propia parte del contexto y, por tanto, de la VRAM. Aumenta el valor con precaución (2, 4) según la tarjeta.
- OLLAMA_MAX_LOADED_MODELS
- Número de modelos distintos mantenidos simultáneamente en memoria. Ajusta el valor a 2 para mantener Coder y R1 cargados y listos al mismo tiempo, si la VRAM lo permite.
#Solución de problemas habituales
- R1 se queda en bucle dentro de <think>
- Temperatura demasiado baja o repeat_penalty ausente. Sube temperature a 0.6 y añade repeat_penalty 1.1.
- Generación muy lenta
- El modelo se ejecuta parcialmente en la CPU. Comprueba `ollama ps`: si PROCESSOR no indica 100% GPU, reduce el tamaño, la cuantización o num_ctx.
- Respuesta truncada
- num_predict (número máximo de tokens generados) demasiado bajo, o contexto saturado. Aumenta num_ctx y deja num_predict libre (-1).
- El código sale con las etiquetas de razonamiento
- Estás usando R1 para código. Cambia a deepseek-coder, que no genera una cadena de pensamiento.
#Para ir más allá
Una vez configurado y calibrado DeepSeek, estos son los siguientes pasos naturales: profundizar en R1, afinar tus variantes y elegir la cuantización según tu tarjeta.
- Instalar DeepSeek R1 con Ollama
- Guía dedicada al modelo de razonamiento, las versiones destiladas y la cadena de pensamiento, para ir más allá de la configuración.
- Personalizar un modelo con Ollama Modelfile
- Sistema de plantillas, prompts de sistema y parámetros — para industrializar las variantes vistas aquí.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Comprender el equilibrio entre calidad y VRAM para que el modelo DeepSeek más grande posible quepa en tu GPU.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.