El desarrollador — « Copilot local, 100 % sin conexión, 0 latencia de la nube. »
Qwen2.5 Coder 32B conectado a VSCode a través de Continue.dev. Autocompletado, chat y refactorización de un archivo entero, sin que ni una línea de tu código se filtre a Microsoft, OpenAI o Anthropic. ¿Tu PR contiene una clave API? Se queda ahí.
Al final de este proceso, tendrás un servidor llama.cpp que corre en segundo plano con Qwen2.5 Coder 32B en cuantización Q4. Continue.dev se conectará a VSCode con autocompletado (FIM) y chat en la barra lateral. La latencia será inferior a 100 ms, y la calidad del autocompletado será comparable a Copilot, a veces mejor en código reciente.
Para quién está pensado este recorrido
Preferimos decírtelo pronto a dejar que pierdas 30 minutos para nada.
- ✓Programas todos los días y estás harto de copiar tus fragmentos de código en una interfaz web.
- ✓Tu empleador prohíbe GitHub Copilot, ChatGPT, Cursor —por buenas razones.
- ✓Trabajas con código propietario, bajo NDA o con secretos de API en texto plano.
- ✓Tienes una RTX 4070 Ti+, RTX 4090, RTX 5090, o un MacBook Pro M2/M3/M4 con 32 GB+
- ✓El ping de 200 ms hacia las API de la nube te rompe el ritmo.
- ·Tienes 8 GB de VRAM: es viable, pero con un modelo de 7B, con una calidad muy inferior a la de Copilot.
- ·Programas 1 hora por semana: una cuenta gratuita con un proveedor de servicios en la nube te dará menos quebraderos de cabeza.
- ·¿Quieres un asistente de chat de uso general? Consulta la ruta para curiosos, que es más sencilla.
El recorrido en 4 pasos
Cada paso remite a una guía detallada que puedes leer en paralelo. El orden está optimizado: no te saltes ningún paso la primera vez.
- 1Paso 01·12 min·Avanzado
Compilar llama.cpp con aceleración GPU
Compilar desde el código fuente para obtener el máximo de tokens/segundo. En NVIDIA: CUDA. En Apple Silicon: Metal. En AMD: ROCm. Es entre un 15 y un 30 % más rápido que Ollama.
Binario llama-server listo, capaz de ofrecer una API compatible con OpenAI.Leer la guía → - 2Paso 02·6 min·Intermedio
Descargar Qwen2.5 Coder 32B (Q4)
El mejor modelo de código con pesos abiertos de su categoría. Q4_K_M cabe en ~19 GB de VRAM y conserva el 95 % de la calidad de FP16. Descarga desde Hugging Face.
El modelo se sirve en localhost:8080 en formato chat completions.Leer la guía → - 3Paso 03·8 min·Intermedio
Conectar Continue.dev a VSCode
Instalar la extensión Continue desde el marketplace, editar ~/.continue/config.json para que apunte a tu endpoint local y configurar el modelo FIM para el autocompletado.
Tab para aceptar una sugerencia, Cmd+L para abrir el chat sobre la selección.Leer la guía → - +Paso bonus·4 min·Avanzado
Bonus — Aider en la línea de comandos
Para tareas más amplias (refactor de un módulo, generación de pruebas), Aider permite editar archivos en lenguaje natural desde el terminal, con commit automático de git.
Una CLI con capacidades de agente conectada al mismo backend, complementaria a Continue.Leer la guía →
Modelos recomendados
Tres opciones probadas para este itinerario, desde el modelo más ligero hasta el más capaz. Haz clic para ver la ficha detallada (VRAM, contexto, benchmarks).
El polivalente. 14B = 9 GB en Q4, calidad de código excelente, cabe en 12 GB de VRAM.
Buen equilibrio si tienes 16 GB de VRAM, más generalista.
Ver el detalle →La mejor opción si tienes un Mac de 64 GB o una GPU de 48 GB. Mayor latencia, pero calidad superior.
Preguntas frecuentes
Las preguntas reales que nos hacen por correo y en Mastodon. Si falta la tuya, abre un ticket.
El profesional con documentos confidenciales — « Mis documentos no salen de mi equipo. »
Jurista, médico, RR. HH., consultor, experto contable, notario — tus documentos están protegidos por el secreto profesional o un NDA. Un LLM local conectado a un RAG te permite consultarlos, resumirlos,…
Reemplaza GitHub Copilot y Cursor con un copiloto de código 100 % local — la guía de referencia, con configuraciones incluidas.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
¿Una pregunta, una errata, un bug?
Este itinerario evoluciona con cada lanzamiento de un modelo. Tus comentarios son la materia prima.