Inicio › Catálogo › Mejor LLM local para programar en 2026

Mejor LLM local para programar en 2026

Ranking actualizado el 22/09/2026

Clasificación de LLM de pesos abiertos especializados o de alto rendimiento para la generación, refactorización y autocompletado de código. Se prefieren modelos evaluados en HumanEval/MBPP, con un contexto ≥ 32k tokens para cubrir archivos completos y una licencia permisiva.

⚡ La configuración completa que funcionaCline + Aider + Modelfiles configurados, todo listo en 30 min — el kit Copilote Local →

Clasificación

1

🇺🇸 Laguna XS.2

Poolside · 33 mil millones de parámetros · Apache 2.0 · 131 072 tokens ctx

MoE 33B/3B activos, Apache 2.0, especialista en programación con agentes. 68.2% SWE-Bench Verified, 128k ctx. Funciona en un Mac con 36 GB. Lanzamiento el 28 de abril de 2026.

Por qué esta posición Modelo especializado en código, contexto de 131 072 tokens. Licencia libre que permite el uso comercial.
ollama run laguna-xs.2
VRAM Q4
19 GB
35 GB en Q8
2

🇫🇷 Devstral Small 2 24B

Mistral AI · 24B parámetros · Apache 2.0 · 256 000 tokens ctx

Especialista en programación 24B Apache 2.0. 72.2% SWE-Bench. 256k ctx, laboratorio francés.

Por qué esta posición Modelo especializado en código, contexto de 256 000 tokens. Licencia libre que permite el uso comercial.
ollama run devstral-small2:24b
VRAM Q4
14 GB
26 GB en Q8
3

🇺🇸 Laguna XS 2.1

Poolside · 33 mil millones de parámetros · OpenMDW 1.1 · 256 000 tokens ctx

MoE 33B / 3B activos (Poolside), programación multilingüe mediante agentes. Contexto de 256k, licencia abierta OpenMDW. Funciona en un Mac con 43 GB. Lanzamiento en junio de 2026.

Por qué esta posición Modelo especializado en código, contexto de 256 000 tokens. Licencia pendiente de verificación para producción.
ollama run laguna-xs-2.1
VRAM Q4
19 GB
35 GB en Q8
4

🇨🇳 Qwen3-Coder 30B-A3B

Alibaba · 30B de parámetros · Apache 2.0 · 262 144 tokens ctx

MoE de 30B (3,3B activos), especializado en programación agéntica. Muy rápido en local, contexto nativo de 256k, la referencia para 16-24 GB con Ollama.

Por qué esta posición Modelo especializado en código, contexto de 262 144 tokens. Licencia libre para uso comercial.
ollama run qwen3-coder:30b
VRAM Q4
19 GB
35 GB en Q8
5

🇨🇳 Qwen 2.5 Coder 32B

Alibaba · 32 mil millones de parámetros · Apache 2.0 · 131 072 tokens ctx

Referente entre los modelos de pesos abiertos para programación a finales de 2024, hoy superado por la generación Qwen3-Coder / Devstral.

Por qué esta posición Modelo especializado en código, contexto de 131 072 tokens. Licencia libre que permite el uso comercial.
ollama run qwen2.5-coder:32b
VRAM Q4
19 GB
35 GB en Q8
6

🇨🇳 Qwen 2.5 Coder 14B Instruct

Alibaba · 14B parámetros · Apache 2.0 · 131 072 tokens ctx

Coder 14B. HumanEval 89.6, LiveCodeBench 37.1. Equilibrio ideal de VRAM para programar con modelos autoalojados.

Por qué esta posición Modelo especializado en código, contexto de 131 072 tokens. Licencia libre que permite el uso comercial.
ollama run qwen2.5-coder:14b
VRAM Q4
9 GB
16 GB en Q8
7

🇨🇳 Qwen 3.6 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Por qué esta posición Modelo especializado en código, contexto de 262 144 tokens. Licencia libre para uso comercial.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB en Q8

Tabla comparativa

Puesto Modelo Params VRAM Q4 Contexto Licencia
#1 Laguna XS.2 33B 19 GB 131 072 Apache 2.0
#2 Devstral Small 2 24B 24B 14 GB 256 000 Apache 2.0
#3 Laguna XS 2.1 33B 19 GB 256 000 OpenMDW 1.1
#4 Qwen3-Coder 30B-A3B 30B 19 GB 262 144 Apache 2.0
#5 Qwen 2.5 Coder 32B 32B 19 GB 131 072 Apache 2.0
#6 Qwen 2.5 Coder 14B Instruct 14B 9 GB 131 072 Apache 2.0
#7 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0

Dos opciones según la memoria necesaria y tu software: Radeon RX 9070 XT 16 GB · GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — comparar el hardware para IA →

El kit Copiloto Local

Tienes tu modelo. Queda ponerlo a trabajar en tu editor: el kit Copilote Local lo integra en VS Code con Cline (cap. 7), en el terminal con Aider (cap. 8) y como autocompletado mientras escribes (cap. 9), con el Modelfile ajustado para ese modelo concreto (cap. 11).

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Memo gratuito

¿Qué modelo para programar ejecutar en TU máquina?

Recibe el resumen VRAM → mejor modelo de código → comando Ollama (una sola pantalla, copiar y pegar). Y pasa al kit Copiloto Local para convertirlo en una configuración que realmente funcione.

El kit Copiloto Local — las configuraciones de Ollama + Cline + Aider listas para pegar, Modelfiles ajustados, solución de problemas, espacio en línea de por vida →

Sin spam. Darte de baja en 1 clic. Tus datos se quedan con nosotros (nunca se venden).

Metodología del ranking

Filtramos los modelos cuyas etiquetas incluyen «code» y cuyo tamaño no supera los 100B (por encima de ese límite ya no es «local»). La clasificación combina: especialización en código (el nombre contiene «coder», «codestral», «devstral», «laguna»), contexto largo, licencia permisiva y tamaño óptimo de 7-32B.

Criterios considerados:

  • HumanEval / MBPP
  • Contexto ≥ 32k tokens
  • Licencia permisiva
  • Soporte IDE (Cline, Aider)

La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.

Preguntas frecuentes

¿Cuál es el mejor LLM open-source para programar en 2026?

Nuestro #1 es Laguna XS.2 (33B, Apache 2.0). Combina una precisión alta en HumanEval, un contexto de 131.072 tokens y una licencia permisiva.

¿Qué cantidad de VRAM se necesita para un buen LLM de código?

Para un modelo 7B Coder en Q4_K_M, 6-8 GB de VRAM son suficientes. Para un 32B Coder en Q4, prevé 20-24 GB (RTX 4090, 3090, 7900 XTX). En Q5 o Q8, la memoria necesaria aumenta rápidamente — consulta el configurador.

¿Puedo usarlo en producción comercial?

Sí si la licencia es Apache 2.0 o MIT. Codestral está bajo Mistral Non-Production License — únicamente para uso personal o de investigación. Qwen y DeepSeek son libres.

¿Cómo integrar un LLM local en VS Code?

A través de la extensión Cline, que se conecta a tu servidor Ollama o LM Studio local. Aider funciona en línea de comandos para refactorización de múltiples archivos.

Para ir más allá

Los kits de QuelLLM La guía de referencia según el uso
Todos los kits de por vida — 49 €