Intermedio 20 minDev

Copilot local con Cline: agente IA en VS Code (Ollama)

GitHub Copilot envía tu código a Microsoft. Para un desarrollador freelance que firma acuerdos de confidencialidad (NDA) o un equipo en un sector regulado, eso es inaceptable. Cline es la extensión de VS Code/JetBrains que sustituye a Copilot por un modelo local (a través de Ollama), con un chat y un modo agente capaz de leer y modificar varios archivos. Esta guía explica cómo instalarla, configurar un modelo de código reciente (Qwen 3.5, Devstral) y recuperar lo esencial de la experiencia de usuario de Copilot, manteniendo tu código en casa.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
i
Continue ya no se mantiene (junio de 2026)
Continue fue adquirido por Cursor (Anysphere) el 18 de junio de 2026: el repositorio está archivado (v2.0.0 es la última versión) y la extensión ya no recibe mantenimiento — sigue pudiendo instalarse a través de forks comunitarios y esta guía sigue funcionando tal como está. Para una nueva configuración, recomendamos Cline como alternativa (de código abierto, MIT, compatible con Ollama): consulta nuestra guía «Migrar de Continue a Cline».

#¿Por qué un Copilot local?

Confidencialidad
Ningún fragmento de código abandona tu equipo. NDA, secreto industrial, código de cliente: todo permanece local.
Offline
En el avión, al fondo de un laboratorio sin internet, de vacaciones. El modelo está en tu disco.
Coste
Gratuito tras comprar una GPU. Un desarrollador que usa Copilot durante dos años cubre el costo de una tarjeta gráfica de gama media.
Elección del modelo
Puedes sustituir Qwen 3.5 por Devstral, Qwen3-Coder o GLM 4.7 Flash según el lenguaje de programación y tu VRAM.

#Por qué esta guía ha pasado a Cline

Esta guía se basaba inicialmente en Continue.dev. Continue fue adquirido por Cursor en junio de 2026, su repositorio ahora está archivado y el producto independiente ya no recibe mantenimiento: por eso hemos actualizado la guía para Cline, un asistente de código abierto equivalente, activo y también 100 % local mediante Ollama.

El kit Copiloto Local

Esta guía te lleva al modelo. El kit te lleva al copiloto que programa en tu editor.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
i
¿Venías de Continue?
La transición es sencilla: tu backend Ollama no cambia, solo sustituyes la extensión. Sigue siendo legal ejecutar tus forks de Continue fijados a una versión concreta (código Apache 2.0), pero ten en cuenta que el plazo para exportar los datos alojados terminó el 15 de julio de 2026. Una guía específica detalla la migración paso a paso si la necesitas.

#Modelos a utilizar

⭐ Qwen 3.5 9B
LA opción para 8 GB en 2026. Multilingüe (FR incluido), 256k de contexto, visión, Apache 2.0. Bueno tanto en chat como en tareas de agente para Python, TypeScript y Rust. ~6,6 GB en Q4.
Devstral 24B (Mistral AI)
Especialista en agentes de programación, Apache 2.0. LA opción para 16 GB cuando Cline modifica varios archivos. ~14 GB en Q4.
Qwen3-Coder 30B-A3B
MoE para código (3B activos, por lo tanto rápido), 256k de contexto. Para 24 GB: chat + agente de gama alta que rivaliza con Copilot. ~19 GB en Q4.
Qwen 3.8 27B
El modelo de 2026 «similar a Copilot» (lanzado el 14/08/2026), 262k de contexto, visión, Apache 2.0. Para 24 GB: configura el razonamiento en «low» para que no piense demasiado.
Modelo recomendado según la VRAM disponible
VRAMModelo Cline (chat + agente)Cuantización
6 GBgranite4.2:8bQ4_K_M (~5,3 GB)
8 GBqwen3.5:9bQ4_K_M (~6,6 GB)
16 GBdevstral:24b / gpt-oss:20bQ4 / MXFP4 (~14 GB)
24 GB+qwen3-coder:30b / qwen3.8:27bQ4 (~18-19 GB)
→
Cline prefiere un modelo que siga las instrucciones
A diferencia de la autocompletación básica, el modo agente envía instrucciones de varios pasos. Prioriza la variante instruct/chat del modelo (no la variante -base) y pasa a un modelo más grande (Devstral 24B, Qwen3-Coder 30B) si tu VRAM lo permite, para obtener una mayor fiabilidad.

#1. Instalar Cline

  1. 01
    Instalar Ollama
    Si aún no lo has hecho, ver la guía Instalar Ollama en Windows/macOS/Linux. Es el motor que ejecuta el modelo en segundo plano.
  2. 02
    Descargar el modelo
    Descarga un modelo especializado en código adecuado para tu VRAM con el comando que aparece a continuación.
  3. 03
    Instalar la extensión Cline
    En VS Code: Extensiones (Ctrl+Shift+X) → buscar Cline → Install. En JetBrains, accede al marketplace de plugins.
  4. 04
    Abrir el panel
    Aparece un icono Cline en la barra lateral izquierda. Haz clic en él para abrir el panel de chat y agente.
Modelo para descargar
# Modèle principal (chat + agent)
ollama pull qwen3.5:9b

# Plus de VRAM ? Devstral, le spécialiste du mode agent (16 Go)
ollama pull devstral:24b

#2. Configurar el proveedor Ollama

Cline debe saber dónde encontrar el modelo. Abre su configuración (icono de engranaje en el panel), selecciona el proveedor Ollama, introduce la dirección local del demonio y elige el modelo en la lista detectada.

Ajustes del proveedor
Provider     : Ollama
Base URL     : http://localhost:11434
Modèle       : qwen3.5:9b
!
Asegúrate de seguir usando el proveedor local
Cline también puede comunicarse con API en la nube. Para un uso 100 % local, comprueba que el proveedor activo sea Ollama y no un proveedor remoto: ese es el único ajuste que separa un uso privado del envío de código a un servidor de terceros.

#3. Modo chat

El modo chat es el equivalente directo de un panel de Copilot Chat, ejecutado en local. Haz una pregunta, pega código, pide una explicación o una corrección.

Abrir el chat
Haz clic en el icono Cline en la barra lateral. La conversación se muestra en el panel.
Incluir código
Selecciona un bloque en el editor, luego envíalo al contexto del chat para que el modelo lo analice.
Mencionar archivos
Cline puede referenciar archivos de tu proyecto para responder con el contexto adecuado, sin que tengas que copiar y pegar todo.
Mantener el historial en local
Tus conversaciones permanecen en tu máquina. Nada se sincroniza en el cloud.

#4. Modo agente

Allí es donde Cline va más allá de un simple chat. En modo agente, puede leer el árbol de directorios, abrir archivos, proponer modificaciones en múltiples archivos y ejecutar comandos —cada acción está sujeta a tu validación.

Plan y luego ejecución
Describe una tarea en francés («ajoute un endpoint /health et son test»). Cline propone un plan y luego aplica los cambios paso a paso.
Diff validado
Cada modificación se presenta en forma de diff que puedes aceptar o rechazar. Tienes el control en todo momento.
Ejecución de comandos bajo control
El agente puede sugerir ejecutar una orden (pruebas, compilación). Nada se ejecuta sin tu aprobación explícita.
Ejemplos de instrucciones para el agente
- Ajoute du logging pour tracer les entrées/sorties
- Convertis cette fonction en async/await
- Extrais ce bloc dans un fichier util.ts et mets à jour les imports
- Écris des tests unitaires pour les cas limites
→
Da contexto al agente
Cuanto más precisa es la instrucción (archivo objetivo, comportamiento esperado, restricción de estilo), mejor es el resultado. Un modelo de 24B (Devstral) sigue mejor las instrucciones multietapa que uno de 9B.

#5. Autocompletado: Tabby o Twinny

Punto importante: Cline es un asistente de chat y un agente; no ofrece autocompletado en línea con «texto gris» mientras escribes. Para recuperar esa comodidad al estilo de Copilot, añade una extensión dedicada, también conectada a Ollama.

Tabby
Extensión de autocompletado autoalojada, ideal si varios desarrolladores comparten una misma GPU. El autocompletado línea por línea aparece en gris; pulsa Tab para aceptar.
Twinny
Extensión ligera de VS Code con autocompletado + chat, que se conecta directamente a Ollama. Buen complemento de Cline para escribir grandes cantidades de código cuando trabajas por tu cuenta.
El dúo que funciona
Cline para el chat y el agente, Tabby o Twinny para el autocompletado en línea. Ambos se conectan al mismo Ollama, y tu código permanece en local en ambos casos.
→
Modelo dedicado al autocompletado
Para el autocompletado (Fill-In-the-Middle), qwen2.5-coder:7b-base sigue siendo la referencia en 2026 (~4,7 GB) y responde muy rápido: es uno de los pocos casos en los que un modelo de 2024 sigue a la cabeza. Reserva tu modelo de chat/agente (Qwen 3.5 9B, Devstral 24B) para Cline.

#Rendimiento y ajustes avanzados

Num_ctx alto
En Ollama, establece num_ctx en 16384 para que el agente pueda enviar mucho contexto (archivos, diffs). Mediante un Modelfile.
Flash Attention
En RTX 30/40/50, activa FA en Ollama (variable OLLAMA_FLASH_ATTENTION=1). Aproximadamente +20 % de velocidad.
Caché KV cuantizada
OLLAMA_KV_CACHE_TYPE=q8_0 reduce por la mitad la VRAM del contexto. Crucial cuando el agente trabaja con archivos grandes.
Un modelo por rol
Un modelo FIM dedicado (qwen2.5-coder:7b-base, ~4,7 GB) para la autocompletación (Tabby/Twinny), un 24B/30B (Devstral, Qwen3-Coder) para el chat y el agente de Cline. Ollama carga el que se solicita.
Aumentar la ventana de contexto
# Modelfile : devstral-16k
FROM devstral:24b
PARAMETER num_ctx 16384
Crear el modelo de contexto ampliado
ollama create devstral-16k -f Modelfile
# puis sélectionnez devstral-16k comme modèle dans Cline

#Preguntas frecuentes

FAQ
¿Cline reemplaza realmente a GitHub Copilot?+
Para el chat y el modo agente (leer/modificar varios archivos, ejecutar comandos), sí. Para el autocompletado en línea con «texto gris» mientras escribes, no: Cline no lo proporciona. Añade Tabby o Twinny, conectados al mismo Ollama, para recuperar esa comodidad.
¿Por qué no quedarse en Continue.dev?+
Continue fue adquirido por Cursor en junio de 2026; el desarrollo continúa en Cursor (v2.0.0 = última versión estable), pero el futuro del producto independiente es incierto. La extensión todavía se puede instalar y sigue siendo legal ejecutar el código bajo licencia Apache 2.0, pero sin actualizaciones ni parches. Cline, de código abierto bajo licencia MIT y en desarrollo activo, es la opción de consolidación recomendada.
¿Qué modelo elegir si solo tengo 8 GB de VRAM?+
Qwen 3.5 9B en Q4_K_M (~6,6 GB) cabe cómodamente en 8 GB y sigue siendo la mejor opción de la gama en 2026 (256k de contexto, multilingüe, visión). Si la VRAM es realmente escasa, Granite 4.2 8B (~5,3 GB) consume aún menos memoria. Ambos son suficientes para el chat; para un modo de agente de varios pasos más fiable, pasa a Devstral 24B en cuanto tu VRAM (16 GB) lo permita.
¿Mi código se sube a Internet con Cline?+
No, mientras el proveedor activo sea Ollama (http://localhost:11434). Cline también puede comunicarse con API en la nube: comprueba en sus ajustes que estás usando el proveedor local Ollama; este es el único ajuste que separa un uso 100 % privado del envío a un servidor de terceros.
¿Funciona Cline en JetBrains, no solo en VS Code?+
Sí. Cline existe para VS Code y para los IDE JetBrains (a través del marketplace de plugins). La configuración del proveedor Ollama y la selección del modelo son idénticas en ambos casos.

#Conclusión

En unos veinte minutos, tienes un copiloto de código 100 % local: Cline para el chat y el modo agente, un modelo de código reciente (Qwen 3.5 9B, o Devstral 24B para el agente) mediante Ollama como motor, y Tabby o Twinny (con qwen2.5-coder:7b-base) para el autocompletado en línea. Tu código nunca sale de tu máquina, trabajas sin conexión y conservas la libertad de cambiar de modelo según tus lenguajes. Si quieres ahorrarte las horas de ajustes y partir de una base probada, la guía de pago «Copiloto de código local» ofrece un paquete completo de configuraciones Ollama + Cline + Aider listo para usar.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.