Intermedio 15 minIDE

Copilot gratuito local: Cline, Tabby & CodeGeeX en VS Code (2026)

GitHub Copilot cuesta 10 €/mes y envía cada carácter que escribes a un servidor de Microsoft. Tres extensiones gratuitas para VS Code resuelven los dos problemas al conectar el chat y la autocompletación con un LLM local: Cline, Tabby y CodeGeeX. Esta guía instala las tres, muestra qué modelos usar y compara lo que realmente hacen para ayudarte a elegir un copiloto gratuito local para VS Code.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
i
Continue ya no se mantiene (junio de 2026)
Continue fue adquirido por Cursor (Anysphere) el 18 de junio de 2026: el repositorio está archivado (v2.0.0 es la última versión) y la extensión ya no recibe mantenimiento — sigue pudiendo instalarse a través de forks comunitarios y esta guía sigue funcionando tal como está. Para una nueva configuración, recomendamos Cline como alternativa (de código abierto, MIT, compatible con Ollama): consulta nuestra guía «Migrar de Continue a Cline».

#¿Por qué un Copilot gratuito en local para VS Code?

Copilot y Cursor envían tu código a OpenAI o Anthropic. En un proyecto de un cliente sujeto a un NDA, con código propietario o simplemente por principio, eso no siempre es aceptable. Un copiloto local resuelve tres cosas de golpe: cero fugas (nada sale del portátil), cero suscripciones, cero latencia de red.

Hay que reconocer la contrapartida: la calidad de un Qwen 3.5 9B en local no iguala la del modelo más reciente de Copilot Pro. Pero para usos cotidianos —completar un bucle, escribir un test, refactorizar una función de 30 líneas— un modelo de 9 a 24B en Q4 hace el trabajo. Y para las tareas que el modelo local no puede realizar, mantienes Copilot en paralelo.

i
Lo que hacen estas 3 herramientas
Cline = chat + agente que trabaja con varios archivos (sin autocompletado en la propia línea de código). Tabby = solo autocompletado, centrado en el autoalojamiento para equipos. CodeGeeX = completado + chat, con un modelo propio integrado. Todos funcionan en VS Code y JetBrains.
→
¿Y Continue.dev?
Continue.dev aparecía en las recopilaciones hasta 2026, pero fue adquirido por Cursor (la adquisición se anunció el 18 de junio de 2026). La v2.0.0 es la última versión estable publicada y el futuro de la extensión independiente es incierto. Lo hemos sustituido por Cline, su equivalente de código abierto que sigue activo. Si todavía lo utilizabas, ten en cuenta que el plazo para exportar los datos alojados terminó el 15 de julio de 2026.

#Prerrequisitos

El kit Copiloto Local

Esta guía te lleva al modelo. El kit te lleva al copiloto que programa en tu editor.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
VS Code reciente
Versión 1.85+ para la API de completado en línea. Las extensiones de JetBrains también están disponibles para las tres herramientas.
Ollama instalado
Sirve de backend de inferencia para Cline. Escucha por defecto en http://localhost:11434. Para Tabby, el runtime está incluido; CodeGeeX puede apuntar a Ollama.
GPU con un mínimo de 8 GB de VRAM
RTX 3060 de 12 GB, 4060 Ti de 16 GB, Mac M2/M3 con 16 GB de memoria unificada. Con una configuración inferior, usa modelos de 1.5B (qwen2.5-coder:1.5b) para el autocompletado, que siguen respondiendo con rapidez.
20 GB de espacio en disco
Un modelo de programación de 7B en Q4 = 4-5 GB. Prevé espacio de sobra si pruebas varios modelos o varias herramientas.
→
VRAM real según el tamaño del modelo de código
Qwen 3.5 9B Q4 ≈ 6,6 GB · Gemma 4 12B ≈ 7,6 GB · Devstral 24B Q4 ≈ 14 GB · Qwen 3.6 35B-A3B ≈ 23 GB. Para el autocompletado en línea (FIM), la latencia es más importante que la calidad: basta con un modelo FIM pequeño como Qwen2.5-Coder. Mantén un Qwen 3.5 9B para el chat y un Devstral 24B para el agente si tienes suficiente VRAM.

#1. Cline (chat + agente)

Cline es la opción más completa en cuanto a asistencia: chat lateral y modo agente capaz de leer y modificar varios archivos, al estilo de Cursor, todo en local mediante Ollama. Es de código abierto, con licencia MIT y modalidad BYO-LLM, y es el sustituto natural de Continue.dev. Roo Code, un fork de Cline, también cierra: Cline se convierte así en el punto de consolidación de este ecosistema. Su limitación: no ofrece autocompletado inline; lo cubrimos con Tabby más abajo.

  1. 01
    Instalar la extensión
    En VS Code, abre la paleta de extensiones (Ctrl+Shift+X), busca Cline, instálalo. Aparece un icono de Cline en la barra lateral izquierda.
  2. 02
    Descargar un modelo
    Qwen 3.5 9B se desenvuelve razonablemente bien en chat y como agente con 8 GB de VRAM. Pasa a Devstral 24B o Qwen 3.6 35B-A3B si tienes margen; Devstral está especialmente diseñado para tareas con agentes.
  3. 03
    Configurar el proveedor Ollama
    Abre los ajustes de Cline, elige el proveedor Ollama, introduce la URL local y selecciona el modelo.
  4. 04
    Probar el chat
    Haz una pregunta, pega código, pide una corrección. La respuesta llega al panel, sin enviar nada a la nube.
  5. 05
    Probar el agente
    Describe una tarea que implique varios archivos. Cline propone un plan y luego aplica los cambios en forma de diffs que validas uno por uno.
Descargar el modelo
ollama pull qwen3.5:9b
# Plus de VRAM ? Devstral, spécialiste agent de code, suit mieux le mode agent
ollama pull devstral:24b
Ajustes del proveedor en Cline
Provider : Ollama
Base URL : http://localhost:11434
Modèle   : qwen3.5:9b
→
Variante instruct para el agente
Para el chat y el agente de Cline, utiliza la variante instruct/chat del modelo (no la variante -base, reservada para el autocompletado). Sigue mejor las instrucciones de varios pasos.

#2. Tabby (autocompletado autoalojado)

Tabby (TabbyML) cubre exactamente lo que Cline no hace: la autocompletación en línea. Está diseñado para equipos — un servidor único aloja el modelo, y todos los desarrolladores se conectan desde su IDE. El servidor incluye su propio runtime, no necesitas Ollama para él.

  1. 01
    Iniciar el servidor Tabby
    El método Docker es el más sencillo. El servidor expone un endpoint HTTP en :8080 y una interfaz de administración web.
  2. 02
    Crear una cuenta admin
    Abre http://localhost:8080 en el navegador. Primer inicio de sesión: crea la cuenta de propietario. Ve a Settings → Information para obtener un token de autenticación.
  3. 03
    Instalar la extensión de VS Code
    En el panel de extensiones, busca Tabby (editor: TabbyML). Instálalo.
  4. 04
    Conectar la extensión
    Abre los ajustes (Ctrl+,) y busca tabby. Configura Endpoint = http://localhost:8080 y pega el token. La barra de estado de VS Code muestra Tabby: ready; las sugerencias de autocompletado aparecen en gris mientras escribes.
Inicio de Tabby (GPU NVIDIA)
docker run -d --name tabby \
  --gpus all -p 8080:8080 \
  -v $HOME/.tabby:/data \
  registry.tabbyml.com/tabbyml/tabby \
  serve --model StarCoder-1B --device cuda
i
Cline + Tabby: el dúo completo
Cline gestiona el chat y el agente, y Tabby gestiona el autocompletado inline. Juntos, recrean la experiencia completa de Copilot en local y de forma gratuita. Es la combinación recomendada tanto para un equipo de uso individual como para un equipo de trabajo. Twinny es una alternativa a Tabby si prefieres seguir usando Ollama también para el autocompletado.

#3. CodeGeeX

CodeGeeX (Tsinghua KEG / Zhipu AI) es la opción «todo en uno»: la extensión ya incluye autocompletado y chat con un modelo propietario gratuito alojado en sus servidores. Pero también puede conectarse a un modelo local, que es lo que nos interesa aquí.

  1. 01
    Instalar la extensión
    En VS Code, busca CodeGeeX (editor: aminer). Instálalo. Aparece un icono de CodeGeeX en la barra lateral.
  2. 02
    Cambiar al modo local
    Abre los ajustes de CodeGeeX (engranaje en el panel lateral). Busca la sección Local mode y actívala.
  3. 03
    Apuntar a Ollama
    Introduce la URL del modelo local. CodeGeeX se comunica con un endpoint compatible con OpenAI; el de Ollama en http://localhost:11434/v1 sirve.
  4. 04
    Elegir el modelo
    codegeex4 (9B) es el modelo propio disponible en Ollama. Como alternativa, cualquier modelo reciente de programación sirve (qwen3-coder, devstral).
Modelo CodeGeeX en Ollama
ollama pull codegeex4
!
Modo cloud por defecto
Por defecto, CodeGeeX utiliza los servidores Zhipu en China. Mientras no hayas cambiado explícitamente al modo local en los ajustes, tu código se enviará a ellos. Revisa la etiqueta en la barra de estado de VS Code: debe aparecer Local, no Cloud.

#Tabla comparativa

Las 3 alternativas gratuitas locales a Copilot en VS Code
HerramientaLo que haceBackend localLicenciaIdeal para
ClineChat + agente multiarchivosOllama (1 por puesto)MIT, de código abiertoSolo, usuario avanzado
TabbyAutocompletado en líneaRuntime incluido (servidor)Self-hostedEquipo, complemento de Cline
CodeGeeXAutocompletado + chatPunto de acceso compatible con OpenAIGratuito (nube por defecto)Configuración ligera todo en uno
Cobertura de usos
Cline: chat + agente (sin autocompletado). Tabby: autocompletado (sin chat avanzado). CodeGeeX: autocompletado + chat básico. La combinación Cline + Tabby lo cubre todo.
Esfuerzo de configuración
CodeGeeX (5 min) < Cline + Ollama (10 min) < Tabby autoalojado (15-20 min).
Multi-utilisateurs
Solo Tabby está diseñado para ello de forma nativa. Cline/CodeGeeX = un puesto = un Ollama.
Confidencialidad
Cline y Tabby funcionan en local por defecto. CodeGeeX envía los datos a la nube mientras no se haya activado el modo local: conviene vigilarlo.
→
Recomendación práctica
Para empezar por tu cuenta: Cline + Qwen 3.5 9B en Ollama para el chat y el agente, más Tabby para el autocompletado. Para un equipo de 3 o más desarrolladores que comparten una GPU: Tabby para el autocompletado compartido y Cline en el equipo de cada desarrollador. CodeGeeX sigue siendo una alternativa ligera todo en uno.

#Solución de problemas

Cline no responde
Verifica ollama ps: el modelo debe aparecer cuando realices una consulta. Si Ollama no responde, prueba curl http://localhost:11434/api/tags desde el terminal. Asegúrate también de que el proveedor seleccionado en Cline sea realmente Ollama.
No aparece el autocompletado en gris
Cline no realiza autocompletado en línea: es normal. Instala Tabby (o Twinny) para autocompletado línea por línea, y verifica editor.inlineSuggest.enabled en VS Code.
Tabby muestra "Connection refused"
El contenedor no está funcionando o el puerto no está expuesto. docker ps debe listar tabby. docker logs tabby muestra la causa (a menudo, el modelo no se ha descargado en el primer arranque; espera 5-10 min).
CodeGeeX devuelve respuestas en chino
Especifica el idioma en el prompt de sistema (Settings CodeGeeX → Custom system prompt → "Responder siempre en francés"), o utiliza Qwen 3.5 9B, que responde en francés cuando se le habla en francés.
VRAM saturada cuando todo está en ejecución
Tal vez tengas dos modelos cargados (autocompletación Tabby + chat Cline). En 8 GB, mantén un modelo FIM ligero para la autocompletación y un Qwen 3.5 9B para el chat. ollama ps muestra el consumo.

#FAQ

¿Cuál es la mejor alternativa gratuita a Copilot en local?+
No hay una sola respuesta, porque las herramientas no cubren la misma necesidad. Para el chat y el agente que trabaja con varios archivos, Cline es el más completo. Para el autocompletado directamente en el código, Tabby (o Twinny). En la práctica, el dúo Cline + Tabby reproduce la experiencia completa de Copilot, gratis y en local. CodeGeeX es la opción todo en uno más rápida de instalar.
¿Por qué esta guía ya no habla de Continue.dev?+
Continue.dev fue adquirido por Cursor (adquisición para incorporar al equipo, o acqui-hire, anunciada el 18 de junio de 2026). La v2.0.0 es la última versión estable publicada y el futuro de la extensión independiente es incierto. El código sigue bajo la licencia Apache 2.0, por lo que las compilaciones fijadas a una versión concreta continúan funcionando, pero para contar con una base que siga desarrollándose es mejor migrar a Cline. La fecha límite para exportar los datos alojados era el 15 de julio de 2026 (ya ha pasado).
¿Cline realiza autocompletado como Copilot?+
No. Cline se centra en el chat y el modo agente (leer y modificar varios archivos). No ofrece autocompletado en gris línea por línea. Para esta función, añade Tabby o Twinny en paralelo: las dos extensiones coexisten sin conflictos en VS Code.
¿Qué modelo local elegir para programar?+
Para la autocompletación inline (FIM), Qwen2.5-Coder sigue siendo una apuesta fiable gracias a su baja latencia. Para el chat y el agente: Qwen 3.5 9B con 8 GB, Devstral 24B o gpt-oss 20B con 16 GB, Qwen 3.6 35B-A3B si tienes margen. Devstral, especializado en agentes de código, es una excelente alternativa. Regla sencilla: un modelo ligero para la autocompletación, un modelo más grande para el razonamiento.
¿Se necesita una GPU potente para usarlo?+
No. 8 GB de VRAM bastan para un Qwen 3.5 9B en Q4 (chat) más un pequeño modelo FIM para el autocompletado. Con menos memoria, usa modelos FIM ligeros que respondan con rapidez. Un Mac M2/M3 con 16 GB de memoria unificada también cumple muy bien esta función.

#Para ir más allá

Ya tienes un copiloto local funcionando. Tres caminos lógicos según tu perfil:

Profundizar en Cline
La guía específica sobre Copilot local con Cline profundiza en la configuración: proveedor Ollama, modo agente, autocompletado mediante Tabby/Twinny y ajustes finos para el funcionamiento de los agentes.
Venías de Continue.dev
La guía de migración Continue → Cline explica en detalle la transición (ajustes equivalentes, modelos, datos locales).
Elegir tu hardware
Antes de pasar a un modelo de 14B o 32B, la guía Elige tu GPU para IA local te ayuda a evitar comprar una GPU con una VRAM demasiado justa.

Si quieres ahorrar tiempo en la configuración, la guía de pago «Copiloto de código local» ofrece un paquete completo de configuraciones de Ollama + Cline + Aider listas para usar y pegar, tanto para un puesto individual como para un equipo.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.