Copilot gratuito local: Cline, Tabby & CodeGeeX en VS Code (2026)
GitHub Copilot cuesta 10 €/mes y envía cada carácter que escribes a un servidor de Microsoft. Tres extensiones gratuitas para VS Code resuelven los dos problemas al conectar el chat y la autocompletación con un LLM local: Cline, Tabby y CodeGeeX. Esta guía instala las tres, muestra qué modelos usar y compara lo que realmente hacen para ayudarte a elegir un copiloto gratuito local para VS Code.
#¿Por qué un Copilot gratuito en local para VS Code?
Copilot y Cursor envían tu código a OpenAI o Anthropic. En un proyecto de un cliente sujeto a un NDA, con código propietario o simplemente por principio, eso no siempre es aceptable. Un copiloto local resuelve tres cosas de golpe: cero fugas (nada sale del portátil), cero suscripciones, cero latencia de red.
Hay que reconocer la contrapartida: la calidad de un Qwen 3.5 9B en local no iguala la del modelo más reciente de Copilot Pro. Pero para usos cotidianos —completar un bucle, escribir un test, refactorizar una función de 30 líneas— un modelo de 9 a 24B en Q4 hace el trabajo. Y para las tareas que el modelo local no puede realizar, mantienes Copilot en paralelo.
#Prerrequisitos
Esta guía te lleva al modelo. El kit te lleva al copiloto que programa en tu editor.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
- VS Code reciente
- Versión 1.85+ para la API de completado en línea. Las extensiones de JetBrains también están disponibles para las tres herramientas.
- Ollama instalado
- Sirve de backend de inferencia para Cline. Escucha por defecto en http://localhost:11434. Para Tabby, el runtime está incluido; CodeGeeX puede apuntar a Ollama.
- GPU con un mínimo de 8 GB de VRAM
- RTX 3060 de 12 GB, 4060 Ti de 16 GB, Mac M2/M3 con 16 GB de memoria unificada. Con una configuración inferior, usa modelos de 1.5B (qwen2.5-coder:1.5b) para el autocompletado, que siguen respondiendo con rapidez.
- 20 GB de espacio en disco
- Un modelo de programación de 7B en Q4 = 4-5 GB. Prevé espacio de sobra si pruebas varios modelos o varias herramientas.
#1. Cline (chat + agente)
Cline es la opción más completa en cuanto a asistencia: chat lateral y modo agente capaz de leer y modificar varios archivos, al estilo de Cursor, todo en local mediante Ollama. Es de código abierto, con licencia MIT y modalidad BYO-LLM, y es el sustituto natural de Continue.dev. Roo Code, un fork de Cline, también cierra: Cline se convierte así en el punto de consolidación de este ecosistema. Su limitación: no ofrece autocompletado inline; lo cubrimos con Tabby más abajo.
- 01Instalar la extensiónEn VS Code, abre la paleta de extensiones (Ctrl+Shift+X), busca Cline, instálalo. Aparece un icono de Cline en la barra lateral izquierda.
- 02Descargar un modeloQwen 3.5 9B se desenvuelve razonablemente bien en chat y como agente con 8 GB de VRAM. Pasa a Devstral 24B o Qwen 3.6 35B-A3B si tienes margen; Devstral está especialmente diseñado para tareas con agentes.
- 03Configurar el proveedor OllamaAbre los ajustes de Cline, elige el proveedor Ollama, introduce la URL local y selecciona el modelo.
- 04Probar el chatHaz una pregunta, pega código, pide una corrección. La respuesta llega al panel, sin enviar nada a la nube.
- 05Probar el agenteDescribe una tarea que implique varios archivos. Cline propone un plan y luego aplica los cambios en forma de diffs que validas uno por uno.
#2. Tabby (autocompletado autoalojado)
Tabby (TabbyML) cubre exactamente lo que Cline no hace: la autocompletación en línea. Está diseñado para equipos — un servidor único aloja el modelo, y todos los desarrolladores se conectan desde su IDE. El servidor incluye su propio runtime, no necesitas Ollama para él.
- 01Iniciar el servidor TabbyEl método Docker es el más sencillo. El servidor expone un endpoint HTTP en :8080 y una interfaz de administración web.
- 02Crear una cuenta adminAbre http://localhost:8080 en el navegador. Primer inicio de sesión: crea la cuenta de propietario. Ve a Settings → Information para obtener un token de autenticación.
- 03Instalar la extensión de VS CodeEn el panel de extensiones, busca Tabby (editor: TabbyML). Instálalo.
- 04Conectar la extensiónAbre los ajustes (Ctrl+,) y busca tabby. Configura Endpoint = http://localhost:8080 y pega el token. La barra de estado de VS Code muestra Tabby: ready; las sugerencias de autocompletado aparecen en gris mientras escribes.
#3. CodeGeeX
CodeGeeX (Tsinghua KEG / Zhipu AI) es la opción «todo en uno»: la extensión ya incluye autocompletado y chat con un modelo propietario gratuito alojado en sus servidores. Pero también puede conectarse a un modelo local, que es lo que nos interesa aquí.
- 01Instalar la extensiónEn VS Code, busca CodeGeeX (editor: aminer). Instálalo. Aparece un icono de CodeGeeX en la barra lateral.
- 02Cambiar al modo localAbre los ajustes de CodeGeeX (engranaje en el panel lateral). Busca la sección Local mode y actívala.
- 03Apuntar a OllamaIntroduce la URL del modelo local. CodeGeeX se comunica con un endpoint compatible con OpenAI; el de Ollama en http://localhost:11434/v1 sirve.
- 04Elegir el modelocodegeex4 (9B) es el modelo propio disponible en Ollama. Como alternativa, cualquier modelo reciente de programación sirve (qwen3-coder, devstral).
#Tabla comparativa
| Herramienta | Lo que hace | Backend local | Licencia | Ideal para |
|---|---|---|---|---|
| Cline | Chat + agente multiarchivos | Ollama (1 por puesto) | MIT, de código abierto | Solo, usuario avanzado |
| Tabby | Autocompletado en línea | Runtime incluido (servidor) | Self-hosted | Equipo, complemento de Cline |
| CodeGeeX | Autocompletado + chat | Punto de acceso compatible con OpenAI | Gratuito (nube por defecto) | Configuración ligera todo en uno |
- Cobertura de usos
- Cline: chat + agente (sin autocompletado). Tabby: autocompletado (sin chat avanzado). CodeGeeX: autocompletado + chat básico. La combinación Cline + Tabby lo cubre todo.
- Esfuerzo de configuración
- CodeGeeX (5 min) < Cline + Ollama (10 min) < Tabby autoalojado (15-20 min).
- Multi-utilisateurs
- Solo Tabby está diseñado para ello de forma nativa. Cline/CodeGeeX = un puesto = un Ollama.
- Confidencialidad
- Cline y Tabby funcionan en local por defecto. CodeGeeX envía los datos a la nube mientras no se haya activado el modo local: conviene vigilarlo.
#Solución de problemas
- Cline no responde
- Verifica ollama ps: el modelo debe aparecer cuando realices una consulta. Si Ollama no responde, prueba curl http://localhost:11434/api/tags desde el terminal. Asegúrate también de que el proveedor seleccionado en Cline sea realmente Ollama.
- No aparece el autocompletado en gris
- Cline no realiza autocompletado en línea: es normal. Instala Tabby (o Twinny) para autocompletado línea por línea, y verifica editor.inlineSuggest.enabled en VS Code.
- Tabby muestra "Connection refused"
- El contenedor no está funcionando o el puerto no está expuesto. docker ps debe listar tabby. docker logs tabby muestra la causa (a menudo, el modelo no se ha descargado en el primer arranque; espera 5-10 min).
- CodeGeeX devuelve respuestas en chino
- Especifica el idioma en el prompt de sistema (Settings CodeGeeX → Custom system prompt → "Responder siempre en francés"), o utiliza Qwen 3.5 9B, que responde en francés cuando se le habla en francés.
- VRAM saturada cuando todo está en ejecución
- Tal vez tengas dos modelos cargados (autocompletación Tabby + chat Cline). En 8 GB, mantén un modelo FIM ligero para la autocompletación y un Qwen 3.5 9B para el chat. ollama ps muestra el consumo.
#FAQ
¿Cuál es la mejor alternativa gratuita a Copilot en local?+
¿Por qué esta guía ya no habla de Continue.dev?+
¿Cline realiza autocompletado como Copilot?+
¿Qué modelo local elegir para programar?+
¿Se necesita una GPU potente para usarlo?+
#Para ir más allá
Ya tienes un copiloto local funcionando. Tres caminos lógicos según tu perfil:
- Profundizar en Cline
- La guía específica sobre Copilot local con Cline profundiza en la configuración: proveedor Ollama, modo agente, autocompletado mediante Tabby/Twinny y ajustes finos para el funcionamiento de los agentes.
- Venías de Continue.dev
- La guía de migración Continue → Cline explica en detalle la transición (ajustes equivalentes, modelos, datos locales).
- Elegir tu hardware
- Antes de pasar a un modelo de 14B o 32B, la guía Elige tu GPU para IA local te ayuda a evitar comprar una GPU con una VRAM demasiado justa.
Si quieres ahorrar tiempo en la configuración, la guía de pago «Copiloto de código local» ofrece un paquete completo de configuraciones de Ollama + Cline + Aider listas para usar y pegar, tanto para un puesto individual como para un equipo.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.