Inicio › Catálogo › Mejor LLM local para agentes / tool-use en 2026

Mejor LLM local para agentes / tool-use en 2026

◆ Agentes locales — Agentes que actúan en tu máquina, sin nube · 24 € · o todos los kits 49 € →

Ranking actualizado el 22/09/2026

Clasificación de los LLM más confiables para construir agentes autónomos en local: precisión en llamadas a funciones, robustez en múltiples turnos, comprensión de esquemas JSON, contexto suficiente para mantener un plan de acción.

Clasificación

1

🇨🇳 Qwen 3.6 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Por qué esta posición Llamada a funciones fiable, 262 144 tokens de contexto para mantener el historial de acciones. Capacidad de razonamiento como complemento.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB en Q8
2

🇨🇳 Qwen 3.8 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.

Por qué esta posición Llamada a funciones fiable, 262 144 tokens de contexto para mantener el historial de acciones. Capacidad de razonamiento como complemento.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB en Q8
3

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31 mil millones de parámetros · MIT · 128 000 tokens ctx

GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.

Por qué esta posición Llamada a funciones fiable, 128 000 tokens de contexto para conservar el historial de acciones. Capacidad de razonamiento como ventaja adicional.
ollama run glm-4.7-flash
VRAM Q4
19 GB
35 GB en Q8
4

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B de parámetros · NVIDIA Open Model License · 128 000 tokens ctx

MoE 30B/3B activos: modo thinking + instruct. Medalla de oro en IMO 2025 e IOI 2025. Inferencia rápida gracias a los 3B activos, capacidades de razonamiento de nivel 30B. Lanzamiento en abril de 2026.

Por qué esta posición Llamada a funciones fiable, 128 000 tokens de contexto para conservar el historial de acciones. Capacidad de razonamiento como ventaja adicional.
ollama run nemotron-cascade-2
VRAM Q4
17 GB
32 GB en Q8
5

🇺🇸 North Mini Code 1.0

Cohere · 30.5B parámetros · Apache 2.0 · 488 000 tokens ctx

Modelo de Cohere de 30,5B orientado a la programación agéntica y al razonamiento. Contexto de 488k, Apache 2.0, ~18 GB de VRAM en Q4.

Por qué esta posición Llamada a funciones fiable, 488 000 tokens de contexto para mantener el historial de acciones. Capacidad de razonamiento como ventaja adicional.
ollama run north-mini-code-1.0
VRAM Q4
18 GB
33 GB en Q8
6

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B de parámetros · Apache 2.0 · 262 000 tokens ctx

MoE de 35B/3B activos para programación con agentes. 73.4% en SWE-Bench. Lanzamiento el 16 de abril de 2026.

Por qué esta posición Llamada a funciones fiable, 262 000 tokens de contexto para mantener el historial de acciones. Capacidad de razonamiento como ventaja adicional.
ollama run qwen3.6:35b-a3b
VRAM Q4
21 GB
38 GB en Q8
7

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B de parámetros · Apache 2.0 · 131 072 tokens ctx

MoE 30B/3B activos, razonamiento híbrido. MMLU 81.4, AIME24 80.4. Más de 100 idiomas.

Por qué esta posición Llamada a funciones fiable, 131 072 tokens de contexto para mantener el historial de acciones. Capacidad de razonamiento como ventaja adicional.
ollama run qwen3:30b-a3b
VRAM Q4
19 GB
35 GB en Q8

Tabla comparativa

Puesto Modelo Params VRAM Q4 Contexto Licencia
#1 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#2 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#3 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#4 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License
#5 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#6 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
#7 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0
El kit de Agentes Locales

Agentes que actúan en tu máquina: Cline agéntico, MCP, n8n + Ollama, automatizaciones locales.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Metodología del ranking

Se prefieren modelos ≥ 7B con contexto ≥ 32k (para mantener un historial de acciones) y una etiqueta chat o reasoning. La puntuación favorece los modelos recientes y los tamaños medianos a grandes (donde la llamada a funciones se vuelve fiable).

Criterios considerados:

  • Llamadas precisas a funciones
  • Contexto ≥ 32k tokens
  • Fiabilidad en múltiples turnos
  • Formato JSON respetado

La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.

Preguntas frecuentes

¿Qué LLM para un agente autónomo que se ejecute localmente?

Qwen 3.6 27B es nuestro #1. Mistral Small 3.1 es especialmente conocido por su fiabilidad en el uso de herramientas y su baja latencia — un factor crítico para un agente que realiza 20+ llamadas por tarea.

¿Ollama admite las llamadas a funciones?

Sí desde la 0.3.0 mediante el parámetro tools. LM Studio y vLLM también. Asegúrate de que el modelo haya sido entrenado para ello (los modelos recientes de Mistral, Qwen y Llama lo están).

¿Qué framework para construir un agente local?

LangGraph, CrewAI, AutoGen, Smolagents — todos pueden conectarse a una instancia local de Ollama mediante el endpoint compatible con OpenAI (http://localhost:11434/v1).

¿Qué diferencia hay entre razonamiento y agentes?

Un modelo de razonamiento (DeepSeek R1, QwQ) desarrolla una cadena de pensamiento antes de responder. Un modelo de agente (Mistral Small, Qwen) elige y llama a herramientas externas. Los dos pueden combinarse: razonamiento para planificar, agente para ejecutar.

Para ir más allá

Los kits de QuelLLM La guía de referencia según el uso
Todos los kits de por vida — 49 €