Intermedio 14 minAgentes

Cline + Ollama : agente de código 100 % local en VS Código

Cline convierte VS Code en un agente de programación autónomo: lee tus archivos, propone diffs, ejecuta comandos e itera hasta que la tarea esté terminada. Conectado a Ollama, todo este trabajo permanece en tu máquina: ningún token se envía a un servidor de terceros. Esta guía explica cómo montar una configuración completa y funcional de Cline + Ollama: qué modelo elegir según tu VRAM, la configuración de Ollama que evita sorpresas desagradables con el contexto y los ajustes que marcan la diferencia entre un agente que se puede usar y uno que no deja de dar vueltas.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#Por qué un agente Cline en local

Cline (anteriormente Claude Dev) es una extensión de VS Code que controla un LLM en un bucle de agente: planifica, edita varios archivos, ejecuta comandos en el terminal, lee la salida y corrige. A diferencia de un simple autocompletado en línea, es un ejecutor que se encarga de tareas completas: escribir una función, migrar un módulo o depurar una traza de pila.

Asociarlo a Ollama en lugar de a una API en la nube tiene tres ventajas concretas: tu código propietario nunca sale del equipo, no hay coste por token (Cline consume muchísimo contexto, lo que encarece rápidamente el uso en la nube) y el agente funciona sin conexión. El precio que hay que pagar: un buen modelo local para programación exige VRAM, y los ajustes predeterminados de Ollama no son adecuados para usarlo con un agente.

i
Esta guía no es una guía de migración
Si vienes de Continue.dev y buscas recuperar tu configuración, sigue mejor nuestra guía específica «Continue.dev adquirido por Cursor: migrar a Cline»: cubre la exportación de datos y la correspondencia entre ajustes. Aquí empezamos desde cero para crear una configuración de Cline + Ollama bien organizada.

#Prerrequisitos

El kit Copiloto Local

Esta guía te lleva al modelo. El kit te lleva al copiloto que programa en tu editor.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida
VS Code
Versión reciente (1.90+). Cline también funciona en los forks compatibles con Open VSX (VSCodium, Cursor), pero esta guía se centra en la versión estándar de VS Code.
Ollama instalado
El demonio debe estar en ejecución y escuchar en http://localhost:11434. Si aún no está configurado así, ver nuestra guía de instalación de Ollama.
Un GPU con suficiente VRAM
16 GB como mínimo para usar un agente con comodidad, 24 GB para las opciones de gama alta. Usar solo la CPU sigue siendo posible, pero resulta demasiado lento para el bucle del agente.
Un proyecto abierto en VS Code
Cline actúa en el directorio del workspace actual: abre un repositorio real, no un archivo aislado.

#Elegir el modelo por VRAM

La elección del modelo es lo más importante: un agente Cline encadena llamadas a herramientas, lectura de archivos y diffs, por lo que necesita un modelo que siga instrucciones y respete el formato de las herramientas. Tres perfiles cubren la mayoría de las tarjetas en 2026.

24 GB (RTX 4090, 3090, RX 7900 XTX) — Qwen3-Coder 32B
El mejor agente local hoy en día. En Q4_K_M ocupa ~19 GB, dejando margen para un contexto de 32k. Es el modelo que debes buscar si tu tarjeta lo soporta.
16 GB (RTX 4080, 5070 Ti, 4060 Ti 16GB) — Devstral Small 2
Modelo Mistral especializado en agentes de código, optimizado para funcionar con 16 GB en Q4_K_M y un contexto útil. El mejor equilibrio en este rango de tarjetas.
Generalista sólido — Qwen 3.6 27B
Si quieres un solo modelo para el código y el resto, la variante 27B cabe en 24 GB en Q4 y funciona muy bien como agente. Un paso por debajo de Qwen3-Coder en código puro, pero más versátil.
→
Indicador de VRAM en Q4
Con cuantización Q4_K_M (la opción predeterminada recomendada): un 14B ≈ 9 GB, un 27B ≈ 16-17 GB, un 32B ≈ 19 GB. Añade la VRAM del contexto: cuanto mayor sea la ventana, más crecerá la caché KV. Mantén siempre un margen de 2-3 GB.

Evita los modelos de menos de 14B para usarlos como agentes: rompen el formato de las llamadas a herramientas, entran en bucles o proponen diffs que no se pueden aplicar. Un modelo pequeño y rápido es excelente para el autocompletado en línea (a través de Tabby o Continue), pero no para controlar Cline.

#1. Preparar Ollama

Verifica primero que Ollama esté funcionando y luego descarga el modelo elegido. Aquí usamos Qwen3-Coder 32B como ejemplo: sustituye la etiqueta por la que corresponda a tu VRAM.

Terminal
# Vérifier que le daemon répond
curl http://localhost:11434/api/version

# Tirer le modèle de code (adapter au tag exact affiché sur ollama.com)
ollama pull qwen3-coder:32b

# Alternatives selon la VRAM
ollama pull devstral-small-2   # 16 Go
ollama pull qwen3.6:27b        # généraliste 24 Go

# Lister ce qui est installé
ollama list
!
Verifica el tag exacto
Los nombres de los tags Ollama evolucionan (sufijos de cuantización, versiones). Copia el tag desde la página oficial del modelo en ollama.com en lugar de adivinarlo: un tag inexistente produce un error de pull silencioso.

#2. Configurar el contexto de Ollama

Es el paso que todo el mundo hace mal. Por defecto, Ollama sirve los modelos con una ventana de contexto de 4096 tokens. Sin embargo, Cline envía el contenido de varios archivos, el historial de la tarea y las definiciones de herramientas: con 4k, el agente olvida el inicio de su propia tarea en cada turno y se vuelve inutilizable.

Es necesario aumentar num_ctx. La forma correcta es crear un modelo derivado mediante un Modelfile, para que el ajuste sea permanente e independiente de Cline.

Modelfile
# Fichier : Modelfile
FROM qwen3-coder:32b

# Contexte élargi pour l'usage agent (32k)
PARAMETER num_ctx 32768

# Un peu de déterminisme pour le code
PARAMETER temperature 0.2
Terminal
# Créer le modèle dérivé
ollama create qwen3-coder-agent -f Modelfile

# Il apparaît désormais dans la liste
ollama list
!
num_ctx consume VRAM
Pasar de 4k a 32k aumenta la caché KV en varios GB. Con 16 GB, mantente en 16k (num_ctx 16384) en lugar de 32k; de lo contrario, Ollama desplaza parte del modelo a la RAM del sistema y el agente se vuelve lento. Vigila `ollama ps`: si la columna PROCESSOR muestra CPU, reduce el contexto o la cuantización.

#3. Instalar Cline

  1. 01
    Abrir el Marketplace
    En VS Code, abre el panel de Extensiones (Ctrl+Mayús+X).
  2. 02
    Buscar Cline
    Escribe «Cline» en la barra de búsqueda. La extensión oficial está publicada por «Cline Bot Inc.» — comprueba quién la publica para evitar los clones.
  3. 03
    Instalar y anclar
    Haz clic en Instalar. Aparece un icono de Cline en la barra lateral de actividades; fíjalo para acceder rápidamente.

#4. Conectar Cline a Ollama

Cline admite Ollama de forma nativa: no necesitas configurar manualmente una URL de API compatible con OpenAI. Abre el panel de Cline, haz clic en el icono de ajustes y luego configura el proveedor.

  1. 01
    API Provider → Ollama
    En la lista desplegable «API Provider», selecciona «Ollama».
  2. 02
    Base URL
    Deja http://localhost:11434 (valor predeterminado). Cámbialo solo si Ollama se ejecuta en otra máquina o en un contenedor.
  3. 03
    Model
    Selecciona qwen3-coder-agent (el modelo derivado creado en el paso 2), no el modelo bruto de 4k de contexto.
  4. 04
    Verificar la ventana de contexto
    Cline muestra un campo «Context Window». Ajústalo al valor de num_ctx del Modelfile (32768). Una discrepancia aquí hace que Cline trunque los prompts antes de que lleguen siquiera a Ollama.
i
Plan Mode y Act Mode
Cline distingue el modo Plan (piensa y propone una estrategia sin tocar los archivos) y el modo Act (ejecuta). Con un modelo local, empieza en Plan para validar el enfoque: así se evita que un modelo un poco débil empiece editando diez archivos en la dirección equivocada.

#5. Primer lanzamiento en modo agente

Abre un proyecto real y luego dale a Cline una tarea concreta y acotada. Las mejores pruebas iniciales son las que afectan a pocos archivos: añadir un test, corregir un bug identificado o escribir una pequeña función utilitaria.

Prompt Cline
Ajoute une fonction `slugify(texte)` dans src/utils/strings.js qui met en minuscules, remplace les accents et les espaces par des tirets. Écris aussi un test unitaire dans le fichier de tests existant à côté.

Cline va a leer la carpeta, proponer un diff y pedirte que valides cada modificación y cada comando. Aprueba paso a paso la primera vez para entender su comportamiento. Cuando ya tengas confianza, puedes activar la aprobación automática de ciertas acciones (lectura de archivos, comandos no destructivos) en los ajustes.

→
Un archivo de reglas de proyecto
Añade un archivo `.clinerules` a la raíz del repositorio para establecer las reglas del agente: convenciones de nomenclatura, comando de prueba que debe ejecutar, carpetas que nunca debe tocar. Un modelo local sigue mejor las instrucciones cuando las reglas son explícitas y breves.

#Errores comunes

El agente olvida su tarea
Casi siempre es un problema de contexto: num_ctx demasiado bajo en Ollama o Context Window mal configurada en Cline. Vuelve a alinear ambos valores.
Los diffs no se aplican
El modelo es demasiado pequeño o demasiado cuantizado para respetar el formato de edición. Sube un nivel (14B → 27B/32B) o pasa de Q3 a Q4_K_M.
La inferencia pasa a ejecutarse en la CPU
El modelo y el contexto superan la capacidad de la VRAM. Revisa `ollama ps`; reduce num_ctx o elige un modelo más pequeño. Un agente que se ejecuta parcialmente en la CPU se vuelve inutilizable.
Bucles infinitos de herramientas
Algunos modelos vuelven a ejecutar el mismo comando. Cambia primero a Plan Mode y divide la tarea en subtareas más pequeñas.
Conexión rechazada
Ollama no está escuchando, o no lo hace en la URL esperada. Prueba `curl http://localhost:11434/api/version`. En un contenedor, expón el puerto y configura Cline para que use la dirección correcta.

#Para ir más allá

Tienes un agente Cline 100 % local que edita tu código sin exponer nada. Dos extensiones naturales: afinar la selección del modelo y completar con la autocompletación en línea que Cline no proporciona.

→
Kit Copiloto Local
La combinación completa para sustituir GitHub Copilot en local: Cline (chat + agente) para las tareas, Tabby para las sugerencias de autocompletado en gris mientras escribes y un modelo de código adaptado a tu GPU. Cada componente permanece en tu máquina.
Mejor LLM local para programar en 2026
La comparativa de Devstral / Qwen3-Coder y otras alternativas, con datos de VRAM y calidad del código, para afinar la elección del modelo conectado a Cline.
Continue.dev comprado por Cursor: migrar a Cline
Si vienes de Continue.dev, la guía dedicada a la exportación y la migración de tu configuración a este mismo entorno.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Entender el equilibrio entre calidad y consumo de VRAM para que el modelo más grande posible quepa en tu tarjeta.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.