Inicio › Catálogo › Mejor LLM local para RAG en 2026

Mejor LLM local para RAG en 2026

◆ RAG Local — Tus documentos consultados por una IA local, sin nube · 24 € · o todos los kits 49 € →

Ranking actualizado el 22/09/2026

Clasificación de los LLM más adecuados para RAG: ventana de contexto larga (≥ 32k tokens para procesar varios documentos), calidad de la síntesis basada en las fuentes proporcionadas, robustez frente a los distractores (información irrelevante en el prompt).

Clasificación

1

🇨🇳 Qwen 3.6 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Por qué esta posición Contexto de 262.144 tokens — excelente para grandes corpus. 27B parámetros para una síntesis de calidad.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB en Q8
2

🇨🇳 Qwen 3.8 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.

Por qué esta posición Contexto de 262.144 tokens — excelente para grandes corpus. 27B parámetros para una síntesis de calidad.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB en Q8
3

🇺🇸 North Mini Code 1.0

Cohere · 30.5B parámetros · Apache 2.0 · 488 000 tokens ctx

Modelo de Cohere de 30,5B orientado a la programación agéntica y al razonamiento. Contexto de 488k, Apache 2.0, ~18 GB de VRAM en Q4.

Por qué esta posición Contexto de 488 000 tokens — excelente para grandes corpus. 30.5B parámetros para una síntesis de calidad.
ollama run north-mini-code-1.0
VRAM Q4
18 GB
33 GB en Q8
4

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B de parámetros · Apache 2.0 · 128 000 tokens ctx

Variante MoE de Gemma 4. 26B/4B activos. Multimodal completo (texto+imagen+audio).

Por qué esta posición Contexto de 128 000 tokens — excelente para grandes corpus. 26B parámetros para una síntesis de calidad.
ollama run gemma4:26b
VRAM Q4
16 GB
28 GB en Q8
5

🇺🇸 Gemma 4 31B

Google · 31 mil millones de parámetros · Apache 2.0 · 256 000 tokens ctx

Modelo denso multimodal de 31B (texto+imagen+audio). Más de 140 idiomas, contexto de 256k. N.º 3 en Chatbot Arena open.

Por qué esta posición Contexto de 256 000 tokens — excelente para grandes corpus. 31B de parámetros para una síntesis de calidad.
ollama run gemma4:31b
VRAM Q4
18 GB
33 GB en Q8
6

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31 mil millones de parámetros · MIT · 128 000 tokens ctx

GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.

Por qué esta posición Contexto de 128 000 tokens — excelente para grandes corpus. 31B de parámetros para una síntesis de calidad.
ollama run glm-4.7-flash
VRAM Q4
19 GB
35 GB en Q8
7

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B de parámetros · Apache 2.0 · 262 000 tokens ctx

MoE de 35B/3B activos para programación con agentes. 73.4% en SWE-Bench. Lanzamiento el 16 de abril de 2026.

Por qué esta posición Contexto de 262 000 tokens: excelente para corpus extensos. 35 000 millones de parámetros para una síntesis de calidad.
ollama run qwen3.6:35b-a3b
VRAM Q4
21 GB
38 GB en Q8

Tabla comparativa

Puesto Modelo Params VRAM Q4 Contexto Licencia
#1 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#2 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#3 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#4 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0
#5 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0
#6 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#7 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
El kit RAG Local

Tus documentos, tu IA: un RAG local fiable sobre tus PDF, notas y correos — sin enviar nada a la nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Metodología del ranking

Se conservan los modelos de chat o de uso general con un contexto de al menos 32k tokens (necesario para una división en fragmentos útil). La puntuación favorece a los modelos recientes, con una ventana de contexto amplia y una licencia permisiva (despliegue en empresas).

Criterios considerados:

  • Contexto ≥ 32k tokens
  • Calidad de síntesis
  • Robustez frente a distractores
  • Licencia libre

La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.

Preguntas frecuentes

¿Qué tamaño de contexto para un buen RAG?

Mínimo 32k tokens para gestionar 5-10 bloques de ~2k tokens + prompt. Ideal: 128k tokens (Qwen 3.6 27B tiene 262 144), para manejar documentos enteros sin una fragmentación agresiva.

¿Qué modelo para RAG con 24 GB de VRAM (RTX 4090)?

Mistral Small 3.1 24B en Q4_K_M o Qwen 2.5 32B En Q4 caben en 24 GB. Para Llama 3.3 70B hay que bajar a Q2/Q3 o añadir una segunda tarjeta.

¿Qué embedding combinar con estos LLM?

Para el francés: BGE-M3, multilingual-e5-large, o los embeddings Mistral. Consulta la guía de embeddings FR.

¿Qué stack RAG local se recomienda?

Ollama (servidor LLM) + ChromaDB o Qdrant (vector store) + LlamaIndex o LangChain (orquestación). Ver el guía completa.

Para ir más allá

Los kits de QuelLLM La guía de referencia según el uso
Todos los kits de por vida — 49 €