Todos los modelos · 100 % local, 100 % privado

Qué LLM funciona en
tu equipo

Cuéntanos qué hardware tienes. Te indicamos qué modelos funcionan, qué velocidad puedes esperar y cómo instalarlos paso a paso en español.

¿Aún no tienes el equipo? ¿Qué PC para IA local se ajusta a tu presupuesto? →
Mini-PC de 128 GB · NVIDIA DGX Spark · Todo el hardware para IA

~/configurateur —— ● listo
El cálculo se realiza en tu navegador. El sitio también utiliza un sistema de medición de audiencia.
Gratis
Sin inscripción
En tu idioma
Guías pedagógicas
Código abierto
Datos públicos
Cálculo local
Medición de audiencia
◆ Los kits QuelLLM — guía de referencia por uso · 24 € por kit · 49 € por todos los kits, de por vida →

El mercado en resumen

Todas las novedades →
1 de octubreNVIDIA Kumo Tabular: un modelo de predicción tabular más preciso y eficiente30 de septiembreGLM-5.3 supera un umbral en explotación de binarios, según el equipo de red teaming de Anthropic30 de septiembreClaude Sonnet 5.5: más rápido y menos costoso de usar, al mismo precio que Sonnet 5
Catálogo · 250 modelos

El catálogo de los LLM de pesos abiertos
que funcionan localmente.

Todos los modelos relevantes, con VRAM requerida por cuantización, velocidad estimada y casos de uso. Los modelos franceses se destacan.

🇫🇷
Enfoque en soberanía

Los 26 modelos fabricados en Francia

Mistral, Lucie (OpenLLM-France), CroissantLLM — entrenados con corpus FR, licencias permisivas, excelentes en francés formal.

★Lo mejor de la selección editorialVer todas las clasificaciones →
250 modelos
Modelo↕
Params↕
VRAM Q4↕
Contexto↕
Funciona en
tok/s↕
Fecha de lanzamiento↕
Pleias-RAG 1B★ FRchatfr
🇫🇷 PleIAs · Especializado en RAG 1.2B. Citación y grounding integrados. Supera a la mayoría de los SLM ≤4B en HotPotQA.
1.2B
0.8 GB
2k
8121624
150
abril de 2025
CroissantLLM 1.3B★ FRchatfr
🇫🇷 CroissantLLM · Pequeño modelo bilingüe FR/EN. Funciona en cualquier parte, incluso en CPU.
1.3B
1 GB
2k
8121624
120
enero de 2024
SmolLM2 1.7B Instruct★ FRchatgeneral
🇫🇷 HuggingFace · 1.7B Apache 2.0 con muchas descargas. Supera a Qwen2.5-1.5B en ~6 pts en MMLU-Pro. BFCL function calling 27%.
1.7B
1.2 GB
8k
8121624
120
noviembre de 2024
Helium 1 2B★ FRchatgeneral
🇫🇷 Kyutai · Modelo base multilingüe en 24 idiomas de la UE (Kyutai FR). Destilado de Gemma 2 → también se aplican los Gemma Terms.
2B
1.5 GB
4k
8121624
100
abril de 2025
SmolVLM2 2.2B Instruct★ FRvisionchat
🇫🇷 HuggingFace · VLM 2.2B: imagen+video+texto. 5.2 GB de VRAM para la inferencia de video. Base SmolLM2-1.7B.
2.2B
1.6 GB
8k
8121624
90
febrero de 2025
Pleias 3B Preview★ FRchatmultilingual
🇫🇷 PleIAs · Francés. Entrenado al 100% con Common Corpus (datos abiertos). Cumple el Reglamento de IA de la UE desde el diseño.
3B
2 GB
2k
8121624
70
diciembre de 2024
SmolLM3 3B★ FRchatgeneral
🇫🇷 HuggingFace · 3B con dos modos (think/no-think). 6 idiomas. MMLU 59.7, GSM8K 70.9. Totalmente abierto (datos y receta).
3B
2 GB
125k
8121624
70
julio de 2025
Shieldstral 3B★ FRgeneralsmall
🇫🇷 Mistral AI · Modelo de protección Mistral 3B (moderación de contenido), 32k de contexto, ~1,7 GB de VRAM en Q4. Autoalojado, licencia Apache 2.0.
3B
1.7 GB
32k
8121624
85
—
Voxtral-4B-TTS★ FRaudiomultilingual
🇫🇷 Mistral AI · TTS abierto de vanguardia, 9 idiomas incluido el francés. Rivaliza con ElevenLabs. ⚠ No comercial.
4B
3 GB
4k
8121624
65
marzo de 2026
Mistral 7B Instruct★ FRchatgeneral
🇫🇷 Mistral AI · El clásico francés. Rápido, versátil, excelente base para empezar.
7B
5 GB
32k
8121624
35
septiembre de 2023
Lucie 7B★ FRchatfr
🇫🇷 OpenLLM-France · LLM soberano francófono, entrenado con un corpus en francés.
7B
5 GB
4k
8121624
35
enero de 2025
Codestral Mamba 7B★ FRcódigofr
🇫🇷 Mistral AI · Mamba SSM puro para el código. Inferencia lineal, ctx 256k. Sin Ollama (soporte parcial de llama.cpp).
7B
5 GB
250k
8121624
40
julio de 2024
Claire 7B 0.1★ FRchatfr
🇫🇷 LINAGORA · Ajuste fino de Falcon-7B con LoRA sobre diálogos espontáneos en francés. ⚠ Licencia NC-SA. Variante Apache separada.
7B
5 GB
2k
8121624
35
noviembre de 2023
Moshi 7B★ FRaudiofr
🇫🇷 Kyutai · Primer modelo abierto de habla full-duplex. Latencia ~200 ms. Voces Moshiko/Moshika. Kyutai (laboratorio francés).
7.6B
5 GB
4k
8121624
25
septiembre de 2024
Mistral Nemo 12B Instruct★ FRchatgeneral
🇫🇷 Mistral AI · Desarrollado conjuntamente con NVIDIA. Contexto de 128k, tokenizador Tekken, buen rendimiento en varios idiomas europeos.
12B
7 GB
125k
8121624
25
julio de 2024
Codestral 22B v0.1★ FRcódigofr
🇫🇷 Mistral AI · Code 22B Mistral, 80+ lenguajes. ⚠ Licencia MNPL para uso fuera de producción — uso personal/investigación.
22B
13 GB
31.25k
8121624
16
mayo de 2024
Mistral Small 3★ FRchatgeneral
🇫🇷 Mistral AI · Excelente relación calidad-tamaño en su lanzamiento (principios de 2025). Rivaliza con los modelos de 70B.
24B
14 GB
32k
8121624
15
enero de 2025
Mistral Small 3.1 24B★ FRchatgeneral
🇫🇷 Mistral AI · Small 3 con visión. 128k ctx, Apache 2.0. Sustituido por Small 3.2 desde junio de 2025.
24B
14 GB
125k
8121624
15
marzo de 2025
Devstral Small 2 24B★ FRcódigofr
🇫🇷 Mistral AI · Especialista en programación 24B Apache 2.0. 72.2% SWE-Bench. 256k ctx, laboratorio francés.
24B
14 GB
250k
8121624
15
diciembre de 2025
Mistral Small 3.2 24B★ FRchatgeneral
🇫🇷 Mistral AI · Actualización de junio de 2025 de Small 3.1. La mitad de generaciones infinitas, llamadas a funciones mejoradas.
24B
14 GB
125k
8121624
15
junio de 2025
Magistral Small 24B★ FRreasoningfr
🇫🇷 Mistral AI · Primer modelo de razonamiento abierto de Mistral. AIME24 70.7%. Base Small 3.1 + entrenamiento CoT.
24B
14 GB
125k
8121624
15
junio de 2025
Mixtral 8x7B★ FRchatgeneral
🇫🇷 Mistral AI · MoE con 8 expertos. Alta calidad, pero necesita mucha VRAM.
47B
26 GB
32k
8121624
12
diciembre de 2023
Mistral Small 4★ FRchatgeneral
🇫🇷 Mistral AI · MoE 119B/6.5B activos unifica chat+razonamiento+visión+código. El buque insignia francés de 2026.
119B
72 GB
250k
8121624
12
marzo de 2026
Mistral Medium 3.5 128B★ FRchatgeneral
🇫🇷 Mistral AI · Modelo denso de 128B + visión, contexto de 256k, razonamiento configurable. SWE-Bench 77.6%. Reemplaza a Medium 3.1 y Magistral. Lanzamiento: 29 de abril de 2026.
128B
74 GB
250k
8121624
4
abril de 2026
Mixtral 8x22B Instruct★ FRchatgeneral
🇫🇷 Mistral AI · MoE Apache 2.0 141B/39B activos. MMLU 77.8, HumanEval 45.1. 80 GB en Q4.
141B
82 GB
62.5k
8121624
8
abril de 2024
Mistral Large 3 675B★ FRchatgeneral
🇫🇷 Mistral AI · MoE 675B/41B activos + codificador de visión de 2,5B, Apache 2.0. N.º 2 entre los modelos OSS sin razonamiento en LMArena. Entrenado con 3000 H200.
675B
405 GB
250k
8121624
5
diciembre de 2025
Granite Time Series PatchTST R2generalsmall
🇺🇸 IBM · Modelo fundacional de IBM para series temporales (~385M, PatchTST), predicción multivariada, ~0,2 GB de VRAM en Q4. Ultraligero, funciona en CPU. Licencia Apache 2.0.
0.4B
0.2 GB
8k
8121624
170
agosto de 2026
Activity Generation 0.5B (Qwen)chatgeneral
🇨🇳 mjpsm · Qwen 0.5B ajustado para generar actividades, contexto de 32k, ~0,3 GB de VRAM en Q4. Ultraligero; funciona incluso en CPU. Licencia Apache 2.0.
0.5B
0.3 GB
32k
8121624
170
septiembre de 2026
S1-miniaudiosmall
🇺🇸 superwhisper · S1-mini (superwhisper): reconocimiento de voz de 0,6B basado en Qwen3-0.6B, contexto de 40k, ~0,3 GB de VRAM en Q4. Transcripción local ultraligera.
0.6B
0.3 GB
40k
8121624
170
agosto de 2026
Qwen 3.5 0.8Bchatgeneral
🇨🇳 Alibaba · Modelo denso de 0,8B con licencia Apache 2.0, contexto de 256k. Consumo de memoria insignificante, ideal para edge, móviles y Raspberry Pi. Lanzamiento: 13 de abril de 2026.
0.8B
0.5 GB
250k
8121624
170
abril de 2026
Centro de aprendizaje

La documentación QuelLLM.

335+ Guías en español para Windows, macOS y Linux. Las pruebas realizadas se indican en cada guía. Desde la primera instalación hasta técnicas avanzadas de RAG y fine-tuning.

⌘ K

Destacados

— nuestras guías esenciales
★ Destacado
Empresa · Despliegue

IA de código en la empresa: proteger el código propietario, los NDA y el secreto industrial

Desplegar una IA de código 100% local (Ollama + Cline + Aider + Tabby) para un equipo de desarrollo sujeto a un NDA y al secreto industrial: por qué Copilot y Cursor exponen tu código propietario, qué exigen el RGPD y el Reglamento de IA, la arquitectura en un puesto de trabajo frente a un servidor GPU Tabby y la auditoría de ausencia de exfiltración.

Avanzado·16 min·Mohamed Meguedmi
★ Destacado
Primeros pasos · Gratis

Mejor IA local gratuita: top 2026, incluso sin GPU

IA local: definición y las mejores opciones gratuitas en 2026, para instalar en PC o Mac, incluso sin GPU dedicada. Comparativa de herramientas y guía paso a paso.

Principiante·14 min·Mohamed Meguedmi
★ Destacado
Instalación · Ollama

Instalar Ollama en Windows 11: guía completa (2026)

Descargar Ollama para Windows 11, instalarlo, activar la GPU (CUDA) y ejecutar un primer modelo: la guía paso a paso de 2026, con los errores comunes.

Principiante·3 min·Mohamed Meguedmi
335 resultados
Principiante 3 min

Instalar Ollama en Windows 11: guía completa (2026)

Descargar Ollama para Windows 11, instalarlo, activar la GPU (CUDA) y ejecutar un primer modelo: la guía paso a paso de 2026, con los errores comunes.

OllamaLeer →
Intermedio 12 min

¿Qué LLM usar con una RTX 4090 (24 GB)?

RTX 4090 de 24 GB, la referencia para la IA local de consumo en 2026. Qwen 3.8 27B, Devstral 24B, gpt-oss 20B, GLM 4.7 Flash, benchmarks en tokens/s, optimizaciones CUDA Ada.

RTX 40Leer →
Intermedio 11 min

¿Qué LLM usar con una RTX 5090 (32 GB)?

RTX 5090 de 2025: 32 GB de VRAM GDDR7, ancho de banda de 1792 GB/s. Ejecutar localmente los grandes MoE de 2026 (Qwen 3.6 35B-A3B, Nemotron 3.5 Lightning) y Qwen 3.8 27B con contexto largo, benchmarks, configuraciones ideales.

RTX 50Leer →
Avanzado 16 min

DeepSeek V4 Pro en local: VRAM, hardware, instalación

¿Qué máquina para DeepSeek V4 Pro (1.6T MoE, 49B activos, MIT)? VRAM/RAM requeridas, instalación local, benchmarks frente a GPT-5 y limitaciones reales.

DeepSeekLeer →
Principiante 5 min

LM Studio para principiantes: primer chat local en 10 minutos

Tu primer LLM local con LM Studio: instalar, descargar un modelo y chatear en 10 minutos. Sin usar la línea de comandos, ideal para principiantes.

LM StudioLeer →
Principiante 14 min

¿Qué LLM para RTX 3060 12 GB?

RTX 3060 12 GB: la GPU económica icónica para LLM. 12 GB por 250 € de segunda mano, Gemma 4 12B, Qwen 3.5 9B, Granite 4.2 8B, benchmarks detallados.

RTX 30Leer →
Intermedio 14 min

DeepSeek V4 Flash 284B: el primer modelo frontier que cabe en Mac Studio

DeepSeek V4 Flash 284B MoE (13B activos, MIT, 1M ctx): el primer modelo de frontera ejecutable en una estación de trabajo. Instalación en Mac Studio Ultra, benchmarks, comparativa con Pro.

DeepSeekLeer →
Principiante 3 min

Instalar Ollama en macOS (Apple Silicon): guía 2026

Aprovechar Metal y la memoria unificada de los M1/M2/M3/M4.

OllamaLeer →
Principiante 14 min

¿Qué LLM usar en un Mac mini M4 / M4 Pro (16–64 GB)?

Mac mini M4: la mejor relación rendimiento/precio para IA local en 2026. Benchmarks, configuración recomendada, uso como servidor doméstico.

Mac miniLeer →
Intermedio 13 min

¿Qué LLM usar con una RTX 3090 / 3090 Ti (24 GB)?

RTX 3090 y 3090 Ti de 24 GB de segunda mano: siguen siendo excelentes para LLM en 2026. Qwen 3.8 27B, Qwen3-Coder 30B, benchmarks, valoración de la relación rendimiento/precio, refrigeración.

RTX 30Leer →
Principiante 11 min

¿Qué LLM para 12 GB de VRAM?

12 GB de VRAM (RTX 3060 12GB, 4070, 5070): el equilibrio ideal en 2026. Qwen 3.5 9B en Q8, Gemma 4 12B, RAG multietapa. La guía definitiva.

Por VRAMLeer →
Intermedio 14 min

Qwen 3.8 27B en local: instalación con Ollama y VRAM

Ejecutar Qwen3.8-27B localmente: comando exacto de Ollama, VRAM por cuantización, variante MLX en Mac, trampa del contexto de 256k, modo thinking y benchmarks oficiales.

OllamaLeer →
Principiante 10 min

Tu primera conversación local

Iniciar Ollama, cargar Mistral, dialogar. Tutorial del día 1.

PromptingLeer →
Intermedio 11 min

¿Qué LLM usar con una RTX 5070 Ti (16 GB)?

RTX 5070 Ti 16 GB: el punto de equilibrio ideal de 2025 para la IA local. Benchmarks de Ollama, modelos 14B/24B que funcionan con holgura, comparativa con la 4070 Ti Super.

RTX 50Leer →
Intermedio 11 min

¿Qué LLM usar en un MacBook Pro M4 Pro / Max (24–128 GB)?

MacBook Pro M4 Pro / Max 2025: ancho de banda de 546 GB/s, qué modelos aprovechan realmente el chip y cuáles son sus límites prácticos.

MacBook ProLeer →
Intermedio 14 min

¿Qué LLM usar con una RTX 4070 / 4070 Super / 4070 Ti (12 GB)?

RTX 4070, 4070 Super y 4070 Ti 12 GB: comparativa de LLM, modelos 13B que se ejecutan con holgura, límites de los 12 GB, benchmarks medidos.

RTX 40Leer →
Principiante 11 min

Ollama vs LM Studio vs Jan vs GPT4All

Tabla resumen para elegir la herramienta adecuada para tu perfil.

HerramientasLeer →
Principiante 11 min

¿Qué LLM para 8 GB de VRAM?

La guía completa para 8 GB de VRAM (RTX 3050/3060 8GB, 4060, 5050, 5060): Qwen 3.5 9B, Granite 4.2 8B, trucos para estirar la VRAM.

Por VRAMLeer →
Avanzado 16 min

IA de código en la empresa: proteger el código propietario, los NDA y el secreto industrial

Desplegar una IA de código 100% local (Ollama + Cline + Aider + Tabby) para un equipo de desarrollo sujeto a un NDA y al secreto industrial: por qué Copilot y Cursor exponen tu código propietario, qué exigen el RGPD y el Reglamento de IA, la arquitectura en un puesto de trabajo frente a un servidor GPU Tabby y la auditoría de ausencia de exfiltración.

DespliegueLeer →
Principiante 11 min

Instalar Ollama en 5 minutos (Windows, macOS, Linux)

Cómo instalar Ollama en 5 minutos en Windows, macOS y Linux: requisitos de RAM/GPU, comandos esenciales y primer modelo local para ejecutar justo después.

OllamaLeer →
Principiante 11 min

Fundamentos del prompting

Estructurar tus consultas para obtener respuestas útiles.

PromptingLeer →
Intermedio 12 min

¿Qué LLM usar en un MacBook Pro M3 Pro / Max (18–128 GB)?

MacBook Pro M3 Pro / Max: el mejor portátil para IA local en 2026. Qwen 3.6 35B-A3B, contexto 128k, Flash Attention.

MacBook ProLeer →
Intermedio 11 min

¿Qué LLM usar con una RTX 5080 (16 GB)?

RTX 5080 Blackwell: 16 GB GDDR7 a 960 GB/s. Benchmarks de Qwen 3.5, Granite 4.2, Gemma 4, gpt-oss, Devstral en Q4. Configuración óptima de Ollama.

RTX 50Leer →
Intermedio 11 min

¿Qué LLM para 16 GB de VRAM?

16 GB de VRAM (RTX 4070 Ti Super, 5070 Ti, 5080, 4060 Ti 16GB): Mistral Small 24B, Devstral 24B, gpt-oss 20B, el nivel profesional de 2026.

Por VRAMLeer →
Principiante 12 min

¿Qué GPU para un LLM local? De la RTX 4070 a la 5090, Mac (2026)

RTX 4070 vs 4090 vs Mac M-Max: guía de compra 2026.

GPULeer →
Principiante 11 min

RAG local: introducción

Entender el Retrieval-Augmented Generation para hablar con tus documentos.

ConceptosLeer →
Avanzado 13 min

¿Qué LLM en Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB)?

Mac Studio Ultra: hasta 512 GB de memoria unificada. Ejecutar Llama 4 Maverick 402B, Qwen3-235B, DeepSeek 671B en local. La guía para usuarios avanzados.

Mac StudioLeer →
Intermedio 11 min

¿Qué LLM en RTX 4080 / 4080 Super (16 GB)?

RTX 4080 y 4080 Super 16 GB para LLM local: todos los modelos que caben, benchmarks, comparativa 4080 vs 4080 Super, veredicto de compra.

RTX 40Leer →
Intermedio 11 min

¿Qué LLM en Radeon RX 7900 XTX (24 GB)?

Radeon RX 7900 XTX 24 GB: alternativa de AMD a la RTX 4090 para LLM. ROCm 6.x, Qwen 3.8 27B, benchmarks en tokens/s, veredicto de 2026.

Radeon RX 7000Leer →
Intermedio 11 min

¿Qué LLM para 24 GB de VRAM?

24 GB de VRAM (RTX 3090, 4090, RX 7900 XTX): Qwen 3.8 27B íntegramente en VRAM, gran MoE 35B-A3B, fine-tuning LoRA. El nivel para ir en serio.

Por VRAMLeer →
…
1–30 sobre 335 guías
Recorridos guiados

Tres caminos,
según quién seas.

Cada recorrido es una secuencia de guías pensada para un perfil concreto. Desde la primera descarga hasta una configuración operativa.

01
Rutas curieux

« Solo quiero probar, sin complicaciones. »

Has oído hablar de los LLM locales y quieres ver cómo funcionan en tu máquina. Sin código, sin configuración del sistema — en 10 minutos chateas con tu primer modelo.

Duración total
~15 min
Prerrequisitos
Ninguna
Lo que tendrás al final
Ollama instalado
Mistral 7B lanzado
Primer prompt exitoso
Empezar la ruta→