Mejor LLM local para programar: Devstral, Qwen3-Coder
El mejor LLM local para programar en 2026 ya no es una cuestión retórica: Devstral, Qwen3-Coder y la nueva generación Qwen 3.5 / 3.8 compiten ahora seriamente con los asistentes en la nube, incluso en tareas agénticas. Esta guía compara los modelos de programación con pesos abiertos disponibles, sus necesidades de VRAM, su calidad real de generación y da una recomendación clara según tu GPU. Sin clasificaciones abstractas: recomendaciones concretas en función de la máquina que tengas a mano.
#¿Por qué un LLM local para programar en 2026?
Programar con un asistente de IA se ha convertido en un hábito. Pero enviar código propietario, secretos, rutas internas o simplemente propiedad intelectual a un servicio en la nube sigue siendo un problema: para profesionales autónomos sujetos a un acuerdo de confidencialidad, para empresas sujetas al RGPD y para desarrolladores que trabajan solos y solo quieren mantener el control.
La buena noticia: desde 2025, los modelos de código con pesos abiertos han reducido buena parte de la brecha. Devstral alcanza puntuaciones en SWE-bench dignas de los mejores modelos en la nube, Qwen3-Coder compite de tú a tú con Claude en refactorización, e incluso un Qwen 3.5 9B en una RTX 3060 hace trabajo útil a diario. El costo de entrada en hardware ha bajado y la calidad ha subido.
#Los criterios adecuados para elegir
Devstral o Qwen3-Coder: tu elección está hecha. El kit Copilote Local lo pone en funcionamiento en treinta minutos (cap. 2), verifica que sea el adecuado para tu memoria de vídeo (cap. 5) y te hace medir el rendimiento de tu máquina en lugar de confiar en la ficha técnica (cap. 18).
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Una prueba de rendimiento de una clasificación no lo dice todo. Para un uso real, esto es lo que importa.
- Calidad del código generado
- Capacidad para escribir un parche que compile y pase las pruebas, no solo código que 'parezca' correcto. HumanEval/MBPP dan una idea, SWE-bench Verified es más representativo de tareas reales.
- Soporte de Fill-in-the-Middle (FIM)
- Indispensable para la autocompletación en el IDE. No todos los modelos lo tienen — Devstral es débil en este aspecto, y para el FIM puro qwen2.5-coder:7b-base sigue siendo la referencia en 2026.
- Ventana de contexto
- Para comprender un archivo de 2000 líneas o un proyecto completo, necesitas al menos 32k tokens. Qwen3-Coder llega a 256k, Devstral hasta 128k.
- Velocidad de inferencia
- Un modelo denso de 30B produce entre 15 y 25 tokens/s en una RTX 4090. Un modelo MoE como Qwen3-Coder 30B-A3B produce entre 60 y 80 tokens/s con una calidad equivalente: la diferencia te cambia la vida al trabajar con el teclado.
- Licencia
- Apache 2.0 y MIT te permiten el uso comercial sin complicaciones. Cuidado con Codestral (no comercial) o los antiguos Code Llama (licencia restrictiva de Meta).
- Lenguajes compatibles
- La mayoría de los buenos modelos cubren correctamente Python, JS/TS, Go, Rust, Java, C/C++. Para PHP, Ruby o Swift, revisa los benchmarks por lenguaje.
#Devstral, especialista en agentes (Mistral AI)
Devstral es el modelo de código de Mistral, entrenado específicamente para trabajar con agentes: es decir, con un agente como Aider, OpenHands o SWE-agent que itera sobre el código, ejecuta las pruebas, lee la salida y corrige. En SWE-bench Verified, Devstral Small se sitúa entre los mejores modelos de pesos abiertos, en una posición que habría sido inalcanzable hace un año.
- Variante recomendada
- Devstral Small (~24B, denso). Apache 2.0. Disponible en Hugging Face y Ollama.
- VRAM en Q4_K_M
- Aproximadamente 14 GB. Cabe holgadamente en una RTX 4080 de 16 GB o en un Mac de la serie M con 24 GB. Es posible con 12 GB, pero con poco margen y un contexto reducido.
- Ventana de contexto
- 128k tokens. Ampliamente suficiente para cargar un repositorio de tamaño medio.
- Fortaleza
- Excelente para flujos de trabajo agénticos de varios pasos: leer un informe de error, navegar por el código, escribir un parche, conseguir que las pruebas pasen.
- Debilidad
- No está diseñado para FIM (autocompletado línea por línea). Si quieres usarlo en Continue.dev para el autocompletado, cambia a qwen2.5-coder:7b-base para esa parte.
#Qwen3-Coder, la navaja suiza (Alibaba)
Qwen3-Coder es la generación de 2025 de la familia Coder de Alibaba, con arquitectura Mixture-of-Experts (MoE). Es el modelo que muchos consideran el estado del arte entre los modelos de pesos abiertos para la generación de código en 2026, en todos los formatos. Disponible bajo licencia Apache 2.0.
- Versión para el público general
- Qwen3-Coder 30B-A3B: 30 mil millones de parámetros en total, pero solo 3 mil millones activados por token. En concreto, eso da la calidad de un modelo denso de 14-22B con la velocidad de uno de 3B.
- VRAM en Q4_K_M
- Aproximadamente 18 GB para la 30B-A3B. Cabe justo en una RTX 4090 de 24 GB o en un Mac M-Pro/M-Max de 24-32 GB.
- Variante de vanguardia
- Qwen3-Coder 480B-A35B. Nivel Claude/GPT-5 en código, pero reservado para Mac Studio Ultra 256-512 GB o para configuraciones multi-GPU H100.
- Contexto
- 256k tokens de forma nativa, ampliable. Puedes literalmente pegar un repositorio entero dentro.
- Fortalezas
- Excelente en refactorización de varios archivos, maneja bien los lenguajes "de nicho" (Elixir, Zig, OCaml), muy bueno en tareas con agentes, y el MoE lo hace excepcionalmente rápido.
- Debilidad
- El 30B-A3B sigue siendo un MoE: si vas justo de VRAM, se nota el consumo adicional de memoria frente a un modelo denso de 9B. Con 12 GB, quédate con un Qwen 3.5 9B (en Q8 si hace falta).
#Qwen 3.5, la apuesta segura para equipos modestos
La familia Qwen 3.5 (2B, 4B, 9B) es en 2026 la opción más versátil para configuraciones modestas. Apache 2.0, gran contexto (hasta 256k), multimodal en tamaños medios, y adaptada para funcionar con entre 4 y 12 GB de VRAM. Exclusivamente para la autocompletación inline (FIM), se mantiene aparte qwen2.5-coder:7b-base, que sigue siendo la referencia en este caso concreto.
- Qwen 3.5 4B
- VRAM Q4 ≈ 3,4 GB (ollama run qwen3.5:4b). Ideal para RTX 3060 de 8 GB, RTX 4060 y MacBook Air de la serie M con 16 GB. El nuevo modelo pequeño por defecto, competente para conversar sobre código.
- Qwen 3.5 9B
- VRAM Q4 ≈ 6,6 GB (ollama run qwen3.5:9b). LA opción para 8 GB en 2026: 256k de contexto, visión, calidad notablemente superior a la del 4B. El modelo de uso diario para tarjetas de 8-12 GB.
- Qwen 3.5 9B en Q8
- VRAM ≈ 11 GB (ollama run qwen3.5:9b-q8_0). La máxima calidad de este segmento, justo para 12 GB de VRAM (RTX 3060 12 GB, RTX 4070).
- Autocompletado (FIM)
- Qwen2.5-Coder 7B base sigue siendo LA referencia FIM en 2026: ollama run qwen2.5-coder:7b-base (≈ 4,7 GB). Conservarlo para el tabAutocomplete de VS Code (Continue.dev, Tabby).
#Alternativas notables
- gpt-oss 20B (OpenAI)
- Modelo de OpenAI con pesos abiertos, cuantizado en MXFP4, muy rápido, con 131k de contexto. VRAM ≈ 14 GB (ollama run gpt-oss:20b). Buen equilibrio con 16 GB si buscas un modelo generalista orientado al código que responda con rapidez.
- GLM 4.7 Flash (Zhipu AI)
- MoE 30B-A3B, licencia MIT, ≈ 19 GB en Q4 (ollama run glm-4.7-flash). Muy sólido en chat técnico, en depuración y en agentes. Pertinente si mezclas francés y código — las explicaciones salen naturalmente en francés.
- Mistral Small 24B
- Generalista denso, ≈ 14 GB en Q4 (ollama run mistral-small). Bueno en francés, útil como complemento para la documentación y las explicaciones en un equipo con 16 GB.
- Codestral 22B (Mistral)
- Técnicamente correcto, pero con licencia Mistral non-production: prohibido en un entorno de trabajo. Descartarlo salvo para un uso estrictamente personal o de investigación.
- DeepSeek-Coder V2, Code Llama, StarCoder 2
- Estos modelos base de 2023-2024 han sido superados en calidad por todos los anteriores. Omitirlos: un Qwen 3.5 9B o un Granite 4.2 8B da mejores resultados con menos VRAM.
#¿Cuál elegir según tu GPU?
Recomendación práctica según la VRAM disponible. Los modelos mencionados están en cuantización Q4_K_M, el mejor equilibrio calidad/memoria para código.
- 8 GB (RTX 3060 8 GB, 4060, 5050, 5060)
- Qwen 3.5 9B (256k ctx, visión). Ya es muy útil para autocompletado y chat técnico. Para FIM puro, añade qwen2.5-coder:7b-base. Contexto 16-32k.
- 12 GB (RTX 3060 12 GB, 4070, 5070)
- Qwen 3.5 9B en Q8 (11 GB) en uso diario, o Gemma 4 12B (7,6 GB, multimodal). Devstral en Q4 funciona con contexto reducido.
- 16 GB (RTX 4080, 4070 Ti Super, 5070 Ti, 5080)
- Devstral 24B para tareas con agentes, gpt-oss 20B o Mistral Small 24B como modelos generalistas, y qwen2.5-coder:7b-base para el FIM. Es la primera configuración en la que realmente tienes opciones.
- 24 GB (RTX 3090, 4090, RX 7900 XTX)
- Qwen3-Coder 30B-A3B (código) o Qwen 3.8 27B (generalista, el más parecido a un Copilot) como modelo de uso diario. Devstral como alternativa de respaldo para tareas con agentes, GLM 4.7 Flash para los agentes. Es la configuración con la que los modelos locales rivalizan con los de la nube en el día a día.
- 32 GB (RTX 5090) o Mac M-series 36-48 GB
- Qwen3-Coder 30B-A3B en Q8 (32 GB), o Qwen 3.6 35B-A3B (23 GB, MoE rápido, la opción fiable de este segmento). Gran comodidad de uso, contexto 128k+. Se busca lo mejor sin concesiones.
- Mac Studio Ultra 128 GB+
- Qwen3-Coder 30B-A3B en Q8 con plena calidad y el contexto completo de 256k, o las variantes de vanguardia de Qwen3-Coder (480B-A35B) si buscas el nivel de una API. Es la única forma accesible (fuera de un centro de datos) de ejecutar en local un modelo de código de vanguardia.
#Conectar todo esto en VS Code
La opción más sencilla: Ollama escucha en http://localhost:11434, y Continue.dev (extensión de VS Code) sabe comunicarse con este endpoint de forma nativa. Aquí tienes una configuración mínima que combina qwen2.5-coder:7b-base para el autocompletado (rápido, FIM) y Qwen3-Coder para el chat (potente).
Para los flujos de trabajo con agentes (refactorización de múltiples archivos, resolución de errores), Aider en CLI destaca especialmente con Devstral:
#Consejos y errores comunes que conviene evitar
- Contexto demasiado corto por defecto en Ollama
- Ollama limita el contexto a 2048 tokens por defecto. Para programar, eso es ridículo. Configura num_ctx mediante un Modelfile o los parámetros de Continue.dev y aumenta el contexto a 16k o 32k como mínimo.
- FIM vs chat — no los mezcles
- Devstral y Qwen3-Coder no están optimizados para el FIM. Si los usas en autocompletado, obtendrás resultados extraños (respuestas de chat en medio de una función). Usa siempre un modelo adecuado para el FIM (qwen2.5-coder:7b-base) para el tabAutocomplete.
- Cuantización demasiado agresiva
- Para código, Q3 y los niveles inferiores empeoran visiblemente la calidad (sintaxis incorrecta, identificadores inventados). Usa como mínimo Q4_K_M. Q5_K_M si tienes suficiente VRAM.
- Rendimiento que colapsa después de unos minutos
- Ollama libera de la memoria los modelos inactivos al cabo de 5 minutos. Si programas de forma intermitente, ejecuta Ollama con OLLAMA_KEEP_ALIVE=1h para mantener el modelo cargado.
- Modelo que siempre responde en inglés
- Añade un prompt de sistema en Continue.dev o en el Modelfile: «Responde siempre en francés, con el código y los comentarios en inglés». Qwen 3.5 / 3.8 y Devstral siguen esta instrucción sin problemas.
- Qwen 3.8 27B que reflexiona más de lo necesario
- Con su configuración predeterminada de razonamiento, Qwen 3.8 27B tiende a razonar demasiado en tareas simples y a aumentar la latencia. Para programar a diario, configura su esfuerzo de razonamiento en low (o desactiva el thinking): ganas capacidad de respuesta sin una pérdida notable en las tareas habituales.
#Para ir más allá
Has elegido tu modelo de código y está funcionando. Algunas ideas para ir más allá:
- Copilot local con Continue.dev
- La guía detallada para configurar Continue.dev en VS Code con Ollama, modelos separados para autocompletado y chat, y atajos.
- Usar Ollama en Claude Code y Cursor
- Para conectar Devstral o Qwen3-Coder a Cursor o Claude Code a través del endpoint compatible con OpenAI de Ollama y usar estos IDE de gama alta sin recurrir a la nube.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para entender exactamente qué pierdes o ganas al pasar de Q4_K_M a Q5_K_M en un modelo de código y cuándo tiene sentido usar una cuantización de mayor precisión.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.