🇨🇳 Qwen 3.6 27B
Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Ranking actualizado el 22/09/2026
Clasificación de los LLM más confiables para construir agentes autónomos en local: precisión en llamadas a funciones, robustez en múltiples turnos, comprensión de esquemas JSON, contexto suficiente para mantener un plan de acción.
Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.
ollama run qwen3.8:27b
GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.
ollama run glm-4.7-flash
MoE 30B/3B activos: modo thinking + instruct. Medalla de oro en IMO 2025 e IOI 2025. Inferencia rápida gracias a los 3B activos, capacidades de razonamiento de nivel 30B. Lanzamiento en abril de 2026.
ollama run nemotron-cascade-2
Modelo de Cohere de 30,5B orientado a la programación agéntica y al razonamiento. Contexto de 488k, Apache 2.0, ~18 GB de VRAM en Q4.
ollama run north-mini-code-1.0
MoE de 35B/3B activos para programación con agentes. 73.4% en SWE-Bench. Lanzamiento el 16 de abril de 2026.
ollama run qwen3.6:35b-a3b
MoE 30B/3B activos, razonamiento híbrido. MMLU 81.4, AIME24 80.4. Más de 100 idiomas.
ollama run qwen3:30b-a3b
| Puesto | Modelo | Params | VRAM Q4 | Contexto | Licencia |
|---|---|---|---|---|---|
| #1 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #2 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #3 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #4 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License |
| #5 | North Mini Code 1.0 | 30.5B | 18 GB | 488 000 | Apache 2.0 |
| #6 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 |
| #7 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 |
Agentes que actúan en tu máquina: Cline agéntico, MCP, n8n + Ollama, automatizaciones locales.
Se prefieren modelos ≥ 7B con contexto ≥ 32k (para mantener un historial de acciones) y una etiqueta chat o reasoning. La puntuación favorece los modelos recientes y los tamaños medianos a grandes (donde la llamada a funciones se vuelve fiable).
Criterios considerados:
La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.
¿Qué LLM para un agente autónomo que se ejecute localmente?
Qwen 3.6 27B es nuestro #1. Mistral Small 3.1 es especialmente conocido por su fiabilidad en el uso de herramientas y su baja latencia — un factor crítico para un agente que realiza 20+ llamadas por tarea.
¿Ollama admite las llamadas a funciones?
Sí desde la 0.3.0 mediante el parámetro tools. LM Studio y vLLM también. Asegúrate de que el modelo haya sido entrenado para ello (los modelos recientes de Mistral, Qwen y Llama lo están).
¿Qué framework para construir un agente local?
LangGraph, CrewAI, AutoGen, Smolagents — todos pueden conectarse a una instancia local de Ollama mediante el endpoint compatible con OpenAI (http://localhost:11434/v1).
¿Qué diferencia hay entre razonamiento y agentes?
Un modelo de razonamiento (DeepSeek R1, QwQ) desarrolla una cadena de pensamiento antes de responder. Un modelo de agente (Mistral Small, Qwen) elige y llama a herramientas externas. Los dos pueden combinarse: razonamiento para planificar, agente para ejecutar.