Cline + Ollama : agente de código 100 % local en VS Código
Cline convierte VS Code en un agente de programación autónomo: lee tus archivos, propone diffs, ejecuta comandos e itera hasta que la tarea esté terminada. Conectado a Ollama, todo este trabajo permanece en tu máquina: ningún token se envía a un servidor de terceros. Esta guía explica cómo montar una configuración completa y funcional de Cline + Ollama: qué modelo elegir según tu VRAM, la configuración de Ollama que evita sorpresas desagradables con el contexto y los ajustes que marcan la diferencia entre un agente que se puede usar y uno que no deja de dar vueltas.
#Por qué un agente Cline en local
Cline (anteriormente Claude Dev) es una extensión de VS Code que controla un LLM en un bucle de agente: planifica, edita varios archivos, ejecuta comandos en el terminal, lee la salida y corrige. A diferencia de un simple autocompletado en línea, es un ejecutor que se encarga de tareas completas: escribir una función, migrar un módulo o depurar una traza de pila.
Asociarlo a Ollama en lugar de a una API en la nube tiene tres ventajas concretas: tu código propietario nunca sale del equipo, no hay coste por token (Cline consume muchísimo contexto, lo que encarece rápidamente el uso en la nube) y el agente funciona sin conexión. El precio que hay que pagar: un buen modelo local para programación exige VRAM, y los ajustes predeterminados de Ollama no son adecuados para usarlo con un agente.
#Prerrequisitos
Esta guía te lleva al modelo. El kit te lleva al copiloto que programa en tu editor.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
- VS Code
- Versión reciente (1.90+). Cline también funciona en los forks compatibles con Open VSX (VSCodium, Cursor), pero esta guía se centra en la versión estándar de VS Code.
- Ollama instalado
- El demonio debe estar en ejecución y escuchar en http://localhost:11434. Si aún no está configurado así, ver nuestra guía de instalación de Ollama.
- Un GPU con suficiente VRAM
- 16 GB como mínimo para usar un agente con comodidad, 24 GB para las opciones de gama alta. Usar solo la CPU sigue siendo posible, pero resulta demasiado lento para el bucle del agente.
- Un proyecto abierto en VS Code
- Cline actúa en el directorio del workspace actual: abre un repositorio real, no un archivo aislado.
#Elegir el modelo por VRAM
La elección del modelo es lo más importante: un agente Cline encadena llamadas a herramientas, lectura de archivos y diffs, por lo que necesita un modelo que siga instrucciones y respete el formato de las herramientas. Tres perfiles cubren la mayoría de las tarjetas en 2026.
- 24 GB (RTX 4090, 3090, RX 7900 XTX) — Qwen3-Coder 32B
- El mejor agente local hoy en día. En Q4_K_M ocupa ~19 GB, dejando margen para un contexto de 32k. Es el modelo que debes buscar si tu tarjeta lo soporta.
- 16 GB (RTX 4080, 5070 Ti, 4060 Ti 16GB) — Devstral Small 2
- Modelo Mistral especializado en agentes de código, optimizado para funcionar con 16 GB en Q4_K_M y un contexto útil. El mejor equilibrio en este rango de tarjetas.
- Generalista sólido — Qwen 3.6 27B
- Si quieres un solo modelo para el código y el resto, la variante 27B cabe en 24 GB en Q4 y funciona muy bien como agente. Un paso por debajo de Qwen3-Coder en código puro, pero más versátil.
Evita los modelos de menos de 14B para usarlos como agentes: rompen el formato de las llamadas a herramientas, entran en bucles o proponen diffs que no se pueden aplicar. Un modelo pequeño y rápido es excelente para el autocompletado en línea (a través de Tabby o Continue), pero no para controlar Cline.
#1. Preparar Ollama
Verifica primero que Ollama esté funcionando y luego descarga el modelo elegido. Aquí usamos Qwen3-Coder 32B como ejemplo: sustituye la etiqueta por la que corresponda a tu VRAM.
#2. Configurar el contexto de Ollama
Es el paso que todo el mundo hace mal. Por defecto, Ollama sirve los modelos con una ventana de contexto de 4096 tokens. Sin embargo, Cline envía el contenido de varios archivos, el historial de la tarea y las definiciones de herramientas: con 4k, el agente olvida el inicio de su propia tarea en cada turno y se vuelve inutilizable.
Es necesario aumentar num_ctx. La forma correcta es crear un modelo derivado mediante un Modelfile, para que el ajuste sea permanente e independiente de Cline.
#3. Instalar Cline
- 01Abrir el MarketplaceEn VS Code, abre el panel de Extensiones (Ctrl+Mayús+X).
- 02Buscar ClineEscribe «Cline» en la barra de búsqueda. La extensión oficial está publicada por «Cline Bot Inc.» — comprueba quién la publica para evitar los clones.
- 03Instalar y anclarHaz clic en Instalar. Aparece un icono de Cline en la barra lateral de actividades; fíjalo para acceder rápidamente.
#4. Conectar Cline a Ollama
Cline admite Ollama de forma nativa: no necesitas configurar manualmente una URL de API compatible con OpenAI. Abre el panel de Cline, haz clic en el icono de ajustes y luego configura el proveedor.
- 01API Provider → OllamaEn la lista desplegable «API Provider», selecciona «Ollama».
- 02Base URLDeja http://localhost:11434 (valor predeterminado). Cámbialo solo si Ollama se ejecuta en otra máquina o en un contenedor.
- 03ModelSelecciona qwen3-coder-agent (el modelo derivado creado en el paso 2), no el modelo bruto de 4k de contexto.
- 04Verificar la ventana de contextoCline muestra un campo «Context Window». Ajústalo al valor de num_ctx del Modelfile (32768). Una discrepancia aquí hace que Cline trunque los prompts antes de que lleguen siquiera a Ollama.
#5. Primer lanzamiento en modo agente
Abre un proyecto real y luego dale a Cline una tarea concreta y acotada. Las mejores pruebas iniciales son las que afectan a pocos archivos: añadir un test, corregir un bug identificado o escribir una pequeña función utilitaria.
Cline va a leer la carpeta, proponer un diff y pedirte que valides cada modificación y cada comando. Aprueba paso a paso la primera vez para entender su comportamiento. Cuando ya tengas confianza, puedes activar la aprobación automática de ciertas acciones (lectura de archivos, comandos no destructivos) en los ajustes.
#Errores comunes
- El agente olvida su tarea
- Casi siempre es un problema de contexto: num_ctx demasiado bajo en Ollama o Context Window mal configurada en Cline. Vuelve a alinear ambos valores.
- Los diffs no se aplican
- El modelo es demasiado pequeño o demasiado cuantizado para respetar el formato de edición. Sube un nivel (14B → 27B/32B) o pasa de Q3 a Q4_K_M.
- La inferencia pasa a ejecutarse en la CPU
- El modelo y el contexto superan la capacidad de la VRAM. Revisa `ollama ps`; reduce num_ctx o elige un modelo más pequeño. Un agente que se ejecuta parcialmente en la CPU se vuelve inutilizable.
- Bucles infinitos de herramientas
- Algunos modelos vuelven a ejecutar el mismo comando. Cambia primero a Plan Mode y divide la tarea en subtareas más pequeñas.
- Conexión rechazada
- Ollama no está escuchando, o no lo hace en la URL esperada. Prueba `curl http://localhost:11434/api/version`. En un contenedor, expón el puerto y configura Cline para que use la dirección correcta.
#Para ir más allá
Tienes un agente Cline 100 % local que edita tu código sin exponer nada. Dos extensiones naturales: afinar la selección del modelo y completar con la autocompletación en línea que Cline no proporciona.
- Mejor LLM local para programar en 2026
- La comparativa de Devstral / Qwen3-Coder y otras alternativas, con datos de VRAM y calidad del código, para afinar la elección del modelo conectado a Cline.
- Continue.dev comprado por Cursor: migrar a Cline
- Si vienes de Continue.dev, la guía dedicada a la exportación y la migración de tu configuración a este mismo entorno.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Entender el equilibrio entre calidad y consumo de VRAM para que el modelo más grande posible quepa en tu tarjeta.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.