Recorrido 02 · Para programar

El desarrollador — « Copilot local, 100 % sin conexión, 0 latencia de la nube. »

Qwen2.5 Coder 32B conectado a VSCode a través de Continue.dev. Autocompletado, chat y refactorización de un archivo entero, sin que ni una línea de tu código se filtre a Microsoft, OpenAI o Anthropic. ¿Tu PR contiene una clave API? Se queda ahí.

Duración total
~30 min
Nivel requerido
Cómodo con un terminal
Coste
0 €
Máquina típica
GPU con 16 GB de VRAM o Mac de la serie M con 32 GB o más
↑
Nuestra promesa

Al final de este proceso, tendrás un servidor llama.cpp que corre en segundo plano con Qwen2.5 Coder 32B en cuantización Q4. Continue.dev se conectará a VSCode con autocompletado (FIM) y chat en la barra lateral. La latencia será inferior a 100 ms, y la calidad del autocompletado será comparable a Copilot, a veces mejor en código reciente.

Para quién está pensado este recorrido

Preferimos decírtelo pronto a dejar que pierdas 30 minutos para nada.

✓ Es para ti si
  • ✓Programas todos los días y estás harto de copiar tus fragmentos de código en una interfaz web.
  • ✓Tu empleador prohíbe GitHub Copilot, ChatGPT, Cursor —por buenas razones.
  • ✓Trabajas con código propietario, bajo NDA o con secretos de API en texto plano.
  • ✓Tienes una RTX 4070 Ti+, RTX 4090, RTX 5090, o un MacBook Pro M2/M3/M4 con 32 GB+
  • ✓El ping de 200 ms hacia las API de la nube te rompe el ritmo.
✕ Busca otras opciones si
  • ·Tienes 8 GB de VRAM: es viable, pero con un modelo de 7B, con una calidad muy inferior a la de Copilot.
  • ·Programas 1 hora por semana: una cuenta gratuita con un proveedor de servicios en la nube te dará menos quebraderos de cabeza.
  • ·¿Quieres un asistente de chat de uso general? Consulta la ruta para curiosos, que es más sencilla.

El recorrido en 4 pasos

Cada paso remite a una guía detallada que puedes leer en paralelo. El orden está optimizado: no te saltes ningún paso la primera vez.

Acumulado · ~30 min
  1. 1
    Paso 01·12 min·Avanzado

    Compilar llama.cpp con aceleración GPU

    Compilar desde el código fuente para obtener el máximo de tokens/segundo. En NVIDIA: CUDA. En Apple Silicon: Metal. En AMD: ROCm. Es entre un 15 y un 30 % más rápido que Ollama.

    Binario llama-server listo, capaz de ofrecer una API compatible con OpenAI.
    Leer la guía →
  2. 2
    Paso 02·6 min·Intermedio

    Descargar Qwen2.5 Coder 32B (Q4)

    El mejor modelo de código con pesos abiertos de su categoría. Q4_K_M cabe en ~19 GB de VRAM y conserva el 95 % de la calidad de FP16. Descarga desde Hugging Face.

    El modelo se sirve en localhost:8080 en formato chat completions.
    Leer la guía →
  3. 3
    Paso 03·8 min·Intermedio

    Conectar Continue.dev a VSCode

    Instalar la extensión Continue desde el marketplace, editar ~/.continue/config.json para que apunte a tu endpoint local y configurar el modelo FIM para el autocompletado.

    Tab para aceptar una sugerencia, Cmd+L para abrir el chat sobre la selección.
    Leer la guía →
  4. +
    Paso bonus·4 min·Avanzado

    Bonus — Aider en la línea de comandos

    Para tareas más amplias (refactor de un módulo, generación de pruebas), Aider permite editar archivos en lenguaje natural desde el terminal, con commit automático de git.

    Una CLI con capacidades de agente conectada al mismo backend, complementaria a Continue.
    Leer la guía →

Modelos recomendados

Tres opciones probadas para este itinerario, desde el modelo más ligero hasta el más capaz. Haz clic para ver la ficha detallada (VRAM, contexto, benchmarks).

Modelo referenciado
qwen2.5-14b

El polivalente. 14B = 9 GB en Q4, calidad de código excelente, cabe en 12 GB de VRAM.

El polivalente
Mistral Small 3
Mistral AI · 24B · 14 GB en Q4

Buen equilibrio si tienes 16 GB de VRAM, más generalista.

Ver el detalle →
Modelo referenciado
llama-3.3-70b

La mejor opción si tienes un Mac de 64 GB o una GPU de 48 GB. Mayor latencia, pero calidad superior.

Preguntas frecuentes

Las preguntas reales que nos hacen por correo y en Mastodon. Si falta la tuya, abre un ticket.

En el autocompletado línea a línea, Qwen2.5 Coder 32B ofrece resultados muy similares, a veces mejores con código reciente (posterior a 2024). En el chat, Copilot Chat (con GPT-4o detrás) sigue un paso por delante. Pero tú mantienes el control de tus datos.
Una vez completado este recorrido
Siguiente itinerario

El profesional con documentos confidenciales — « Mis documentos no salen de mi equipo. »

Jurista, médico, RR. HH., consultor, experto contable, notario — tus documentos están protegidos por el secreto profesional o un NDA. Un LLM local conectado a un RAG te permite consultarlos, resumirlos,…

→
El kit Copiloto Local

Reemplaza GitHub Copilot y Cursor con un copiloto de código 100 % local — la guía de referencia, con configuraciones incluidas.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

¿Una pregunta, una errata, un bug?

Este itinerario evoluciona con cada lanzamiento de un modelo. Tus comentarios son la materia prima.