🇺🇸 Laguna XS.2
MoE 33B/3B activos, Apache 2.0, especialista en programación con agentes. 68.2% SWE-Bench Verified, 128k ctx. Funciona en un Mac con 36 GB. Lanzamiento el 28 de abril de 2026.
ollama run laguna-xs.2
Ranking actualizado el 22/09/2026
Clasificación de LLM de pesos abiertos especializados o de alto rendimiento para la generación, refactorización y autocompletado de código. Se prefieren modelos evaluados en HumanEval/MBPP, con un contexto ≥ 32k tokens para cubrir archivos completos y una licencia permisiva.
⚡ La configuración completa que funcionaCline + Aider + Modelfiles configurados, todo listo en 30 min — el kit Copilote Local →MoE 33B/3B activos, Apache 2.0, especialista en programación con agentes. 68.2% SWE-Bench Verified, 128k ctx. Funciona en un Mac con 36 GB. Lanzamiento el 28 de abril de 2026.
ollama run laguna-xs.2
Especialista en programación 24B Apache 2.0. 72.2% SWE-Bench. 256k ctx, laboratorio francés.
ollama run devstral-small2:24b
MoE 33B / 3B activos (Poolside), programación multilingüe mediante agentes. Contexto de 256k, licencia abierta OpenMDW. Funciona en un Mac con 43 GB. Lanzamiento en junio de 2026.
ollama run laguna-xs-2.1
MoE de 30B (3,3B activos), especializado en programación agéntica. Muy rápido en local, contexto nativo de 256k, la referencia para 16-24 GB con Ollama.
ollama run qwen3-coder:30b
Referente entre los modelos de pesos abiertos para programación a finales de 2024, hoy superado por la generación Qwen3-Coder / Devstral.
ollama run qwen2.5-coder:32b
Coder 14B. HumanEval 89.6, LiveCodeBench 37.1. Equilibrio ideal de VRAM para programar con modelos autoalojados.
ollama run qwen2.5-coder:14b
Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
| Puesto | Modelo | Params | VRAM Q4 | Contexto | Licencia |
|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 |
| #2 | Devstral Small 2 24B | 24B | 14 GB | 256 000 | Apache 2.0 |
| #3 | Laguna XS 2.1 | 33B | 19 GB | 256 000 | OpenMDW 1.1 |
| #4 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 2.5 Coder 32B | 32B | 19 GB | 131 072 | Apache 2.0 |
| #6 | Qwen 2.5 Coder 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 |
| #7 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
Dos opciones según la memoria necesaria y tu software: Radeon RX 9070 XT 16 GB · GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — comparar el hardware para IA →
Tienes tu modelo. Queda ponerlo a trabajar en tu editor: el kit Copilote Local lo integra en VS Code con Cline (cap. 7), en el terminal con Aider (cap. 8) y como autocompletado mientras escribes (cap. 9), con el Modelfile ajustado para ese modelo concreto (cap. 11).
Memo gratuito
Recibe el resumen VRAM → mejor modelo de código → comando Ollama (una sola pantalla, copiar y pegar). Y pasa al kit Copiloto Local para convertirlo en una configuración que realmente funcione.
El kit Copiloto Local — las configuraciones de Ollama + Cline + Aider listas para pegar, Modelfiles ajustados, solución de problemas, espacio en línea de por vida →Sin spam. Darte de baja en 1 clic. Tus datos se quedan con nosotros (nunca se venden).
Tu tarjeta → el mejor modelo para programar que puedes ejecutar en local, y el comando exacto de Ollama:
| Tu VRAM | GPU / Mac típicos | Modelo recomendado para programar | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — especialista en agentes de programación | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — el « casi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE rápido | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — sigue siendo la referencia en este caso concreto. ⚠️ Qwen 3.8: su nivel de razonamiento está configurado muy alto por defecto y «piensa demasiado» ante solicitudes simples — bájalo a low (o desactívalo) en el primer arranque. ⚠️ La trampa de la licencia: Codestral 22B = Mistral Non-Production License → prohibido para programar en el trabajo. Qwen 3.5/3.8, Gemma 4 y Devstral tienen licencia Apache 2.0. 💡 ¿Se cuelga por falta de memoria? Deja ~1,5 GB de VRAM libre para el contexto, o baja un nivel de cuantización.🔌 Para integrarlo en VS Code: Cline (agente que trabaja con varios archivos), Aider (CLI) o Tabby/Twinny (autocompletado FIM) — todos se conectan a Ollama en local. El kit Copiloto Local — configuraciones listas para pegar + configuración probada — está disponible: /copilote-local.
Filtramos los modelos cuyas etiquetas incluyen «code» y cuyo tamaño no supera los 100B (por encima de ese límite ya no es «local»). La clasificación combina: especialización en código (el nombre contiene «coder», «codestral», «devstral», «laguna»), contexto largo, licencia permisiva y tamaño óptimo de 7-32B.
Criterios considerados:
La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.
¿Cuál es el mejor LLM open-source para programar en 2026?
Nuestro #1 es Laguna XS.2 (33B, Apache 2.0). Combina una precisión alta en HumanEval, un contexto de 131.072 tokens y una licencia permisiva.
¿Qué cantidad de VRAM se necesita para un buen LLM de código?
Para un modelo 7B Coder en Q4_K_M, 6-8 GB de VRAM son suficientes. Para un 32B Coder en Q4, prevé 20-24 GB (RTX 4090, 3090, 7900 XTX). En Q5 o Q8, la memoria necesaria aumenta rápidamente — consulta el configurador.
¿Puedo usarlo en producción comercial?
Sí si la licencia es Apache 2.0 o MIT. Codestral está bajo Mistral Non-Production License — únicamente para uso personal o de investigación. Qwen y DeepSeek son libres.
¿Cómo integrar un LLM local en VS Code?
A través de la extensión Cline, que se conecta a tu servidor Ollama o LM Studio local. Aider funciona en línea de comandos para refactorización de múltiples archivos.