🇨🇳 Qwen 3.6 27B
Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Ranking actualizado el 22/09/2026
Clasificación de los LLM más adecuados para RAG: ventana de contexto larga (≥ 32k tokens para procesar varios documentos), calidad de la síntesis basada en las fuentes proporcionadas, robustez frente a los distractores (información irrelevante en el prompt).
Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.
ollama run qwen3.8:27b
Modelo de Cohere de 30,5B orientado a la programación agéntica y al razonamiento. Contexto de 488k, Apache 2.0, ~18 GB de VRAM en Q4.
ollama run north-mini-code-1.0
Variante MoE de Gemma 4. 26B/4B activos. Multimodal completo (texto+imagen+audio).
ollama run gemma4:26b
Modelo denso multimodal de 31B (texto+imagen+audio). Más de 140 idiomas, contexto de 256k. N.º 3 en Chatbot Arena open.
ollama run gemma4:31b
GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.
ollama run glm-4.7-flash
MoE de 35B/3B activos para programación con agentes. 73.4% en SWE-Bench. Lanzamiento el 16 de abril de 2026.
ollama run qwen3.6:35b-a3b
| Puesto | Modelo | Params | VRAM Q4 | Contexto | Licencia |
|---|---|---|---|---|---|
| #1 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #2 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #3 | North Mini Code 1.0 | 30.5B | 18 GB | 488 000 | Apache 2.0 |
| #4 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 |
| #5 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 |
| #6 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #7 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 |
Tus documentos, tu IA: un RAG local fiable sobre tus PDF, notas y correos — sin enviar nada a la nube.
Se conservan los modelos de chat o de uso general con un contexto de al menos 32k tokens (necesario para una división en fragmentos útil). La puntuación favorece a los modelos recientes, con una ventana de contexto amplia y una licencia permisiva (despliegue en empresas).
Criterios considerados:
La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.
¿Qué tamaño de contexto para un buen RAG?
Mínimo 32k tokens para gestionar 5-10 bloques de ~2k tokens + prompt. Ideal: 128k tokens (Qwen 3.6 27B tiene 262 144), para manejar documentos enteros sin una fragmentación agresiva.
¿Qué modelo para RAG con 24 GB de VRAM (RTX 4090)?
Mistral Small 3.1 24B en Q4_K_M o Qwen 2.5 32B En Q4 caben en 24 GB. Para Llama 3.3 70B hay que bajar a Q2/Q3 o añadir una segunda tarjeta.
¿Qué embedding combinar con estos LLM?
Para el francés: BGE-M3, multilingual-e5-large, o los embeddings Mistral. Consulta la guía de embeddings FR.
¿Qué stack RAG local se recomienda?
Ollama (servidor LLM) + ChromaDB o Qdrant (vector store) + LlamaIndex o LangChain (orquestación). Ver el guía completa.