Copilot local con Cline: agente IA en VS Code (Ollama)
GitHub Copilot envía tu código a Microsoft. Para un desarrollador freelance que firma acuerdos de confidencialidad (NDA) o un equipo en un sector regulado, eso es inaceptable. Cline es la extensión de VS Code/JetBrains que sustituye a Copilot por un modelo local (a través de Ollama), con un chat y un modo agente capaz de leer y modificar varios archivos. Esta guía explica cómo instalarla, configurar un modelo de código reciente (Qwen 3.5, Devstral) y recuperar lo esencial de la experiencia de usuario de Copilot, manteniendo tu código en casa.
#¿Por qué un Copilot local?
- Confidencialidad
- Ningún fragmento de código abandona tu equipo. NDA, secreto industrial, código de cliente: todo permanece local.
- Offline
- En el avión, al fondo de un laboratorio sin internet, de vacaciones. El modelo está en tu disco.
- Coste
- Gratuito tras comprar una GPU. Un desarrollador que usa Copilot durante dos años cubre el costo de una tarjeta gráfica de gama media.
- Elección del modelo
- Puedes sustituir Qwen 3.5 por Devstral, Qwen3-Coder o GLM 4.7 Flash según el lenguaje de programación y tu VRAM.
#Por qué esta guía ha pasado a Cline
Esta guía se basaba inicialmente en Continue.dev. Continue fue adquirido por Cursor en junio de 2026, su repositorio ahora está archivado y el producto independiente ya no recibe mantenimiento: por eso hemos actualizado la guía para Cline, un asistente de código abierto equivalente, activo y también 100 % local mediante Ollama.
Esta guía te lleva al modelo. El kit te lleva al copiloto que programa en tu editor.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
#Modelos a utilizar
- ⭐ Qwen 3.5 9B
- LA opción para 8 GB en 2026. Multilingüe (FR incluido), 256k de contexto, visión, Apache 2.0. Bueno tanto en chat como en tareas de agente para Python, TypeScript y Rust. ~6,6 GB en Q4.
- Devstral 24B (Mistral AI)
- Especialista en agentes de programación, Apache 2.0. LA opción para 16 GB cuando Cline modifica varios archivos. ~14 GB en Q4.
- Qwen3-Coder 30B-A3B
- MoE para código (3B activos, por lo tanto rápido), 256k de contexto. Para 24 GB: chat + agente de gama alta que rivaliza con Copilot. ~19 GB en Q4.
- Qwen 3.8 27B
- El modelo de 2026 «similar a Copilot» (lanzado el 14/08/2026), 262k de contexto, visión, Apache 2.0. Para 24 GB: configura el razonamiento en «low» para que no piense demasiado.
| VRAM | Modelo Cline (chat + agente) | Cuantización |
|---|---|---|
| 6 GB | granite4.2:8b | Q4_K_M (~5,3 GB) |
| 8 GB | qwen3.5:9b | Q4_K_M (~6,6 GB) |
| 16 GB | devstral:24b / gpt-oss:20b | Q4 / MXFP4 (~14 GB) |
| 24 GB+ | qwen3-coder:30b / qwen3.8:27b | Q4 (~18-19 GB) |
#1. Instalar Cline
- 01Instalar OllamaSi aún no lo has hecho, ver la guía Instalar Ollama en Windows/macOS/Linux. Es el motor que ejecuta el modelo en segundo plano.
- 02Descargar el modeloDescarga un modelo especializado en código adecuado para tu VRAM con el comando que aparece a continuación.
- 03Instalar la extensión ClineEn VS Code: Extensiones (Ctrl+Shift+X) → buscar Cline → Install. En JetBrains, accede al marketplace de plugins.
- 04Abrir el panelAparece un icono Cline en la barra lateral izquierda. Haz clic en él para abrir el panel de chat y agente.
#2. Configurar el proveedor Ollama
Cline debe saber dónde encontrar el modelo. Abre su configuración (icono de engranaje en el panel), selecciona el proveedor Ollama, introduce la dirección local del demonio y elige el modelo en la lista detectada.
#3. Modo chat
El modo chat es el equivalente directo de un panel de Copilot Chat, ejecutado en local. Haz una pregunta, pega código, pide una explicación o una corrección.
- Abrir el chat
- Haz clic en el icono Cline en la barra lateral. La conversación se muestra en el panel.
- Incluir código
- Selecciona un bloque en el editor, luego envíalo al contexto del chat para que el modelo lo analice.
- Mencionar archivos
- Cline puede referenciar archivos de tu proyecto para responder con el contexto adecuado, sin que tengas que copiar y pegar todo.
- Mantener el historial en local
- Tus conversaciones permanecen en tu máquina. Nada se sincroniza en el cloud.
#4. Modo agente
Allí es donde Cline va más allá de un simple chat. En modo agente, puede leer el árbol de directorios, abrir archivos, proponer modificaciones en múltiples archivos y ejecutar comandos —cada acción está sujeta a tu validación.
- Plan y luego ejecución
- Describe una tarea en francés («ajoute un endpoint /health et son test»). Cline propone un plan y luego aplica los cambios paso a paso.
- Diff validado
- Cada modificación se presenta en forma de diff que puedes aceptar o rechazar. Tienes el control en todo momento.
- Ejecución de comandos bajo control
- El agente puede sugerir ejecutar una orden (pruebas, compilación). Nada se ejecuta sin tu aprobación explícita.
#5. Autocompletado: Tabby o Twinny
Punto importante: Cline es un asistente de chat y un agente; no ofrece autocompletado en línea con «texto gris» mientras escribes. Para recuperar esa comodidad al estilo de Copilot, añade una extensión dedicada, también conectada a Ollama.
- Tabby
- Extensión de autocompletado autoalojada, ideal si varios desarrolladores comparten una misma GPU. El autocompletado línea por línea aparece en gris; pulsa Tab para aceptar.
- Twinny
- Extensión ligera de VS Code con autocompletado + chat, que se conecta directamente a Ollama. Buen complemento de Cline para escribir grandes cantidades de código cuando trabajas por tu cuenta.
- El dúo que funciona
- Cline para el chat y el agente, Tabby o Twinny para el autocompletado en línea. Ambos se conectan al mismo Ollama, y tu código permanece en local en ambos casos.
#Rendimiento y ajustes avanzados
- Num_ctx alto
- En Ollama, establece num_ctx en 16384 para que el agente pueda enviar mucho contexto (archivos, diffs). Mediante un Modelfile.
- Flash Attention
- En RTX 30/40/50, activa FA en Ollama (variable OLLAMA_FLASH_ATTENTION=1). Aproximadamente +20 % de velocidad.
- Caché KV cuantizada
- OLLAMA_KV_CACHE_TYPE=q8_0 reduce por la mitad la VRAM del contexto. Crucial cuando el agente trabaja con archivos grandes.
- Un modelo por rol
- Un modelo FIM dedicado (qwen2.5-coder:7b-base, ~4,7 GB) para la autocompletación (Tabby/Twinny), un 24B/30B (Devstral, Qwen3-Coder) para el chat y el agente de Cline. Ollama carga el que se solicita.
#Preguntas frecuentes
¿Cline reemplaza realmente a GitHub Copilot?+
¿Por qué no quedarse en Continue.dev?+
¿Qué modelo elegir si solo tengo 8 GB de VRAM?+
¿Mi código se sube a Internet con Cline?+
¿Funciona Cline en JetBrains, no solo en VS Code?+
#Conclusión
En unos veinte minutos, tienes un copiloto de código 100 % local: Cline para el chat y el modo agente, un modelo de código reciente (Qwen 3.5 9B, o Devstral 24B para el agente) mediante Ollama como motor, y Tabby o Twinny (con qwen2.5-coder:7b-base) para el autocompletado en línea. Tu código nunca sale de tu máquina, trabajas sin conexión y conservas la libertad de cambiar de modelo según tus lenguajes. Si quieres ahorrarte las horas de ajustes y partir de una base probada, la guía de pago «Copiloto de código local» ofrece un paquete completo de configuraciones Ollama + Cline + Aider listo para usar.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.