Todos los modelos · 100 % local, 100 % privado

Qué LLM funciona en
tu equipo

Dinos qué tienes bajo el capó. Te diremos qué funciona, a qué velocidad y cómo instalarlo, paso a paso.

¿Aún no tienes el equipo? ¿Qué PC para IA local se ajusta a tu presupuesto? →
Mini-PC de 128 GB · NVIDIA DGX Spark · Todo el hardware para IA

~/configurateur —— ● listo
El cálculo se realiza en tu navegador. El sitio también utiliza un sistema de medición de audiencia.
Gratis
Sin inscripción
En tu idioma
Guías pedagógicas
Código abierto
Datos públicos
Cálculo local
Medición de audiencia
◆ Los kits QuelLLM — guía de referencia por uso · 24 € por kit · 49 € por todos los kits, de por vida →

El mercado en resumen

Todas las novedades →
9 oct.TII lanza Falcon ASR, un modelo de reconocimiento de voz con pesos abiertos9 oct.Nemotron, ajustado por Nvidia, consigue dos resultados de nivel oro en la IOI y la IMO9 oct.Liquid AI publica open d1, modelos abiertos de toma de decisiones multimodales para el edge
Catálogo · 253 modelos

El catálogo de los LLM de pesos abiertos
que funcionan localmente.

Todos los modelos relevantes, con VRAM requerida por cuantización, velocidad estimada y casos de uso. Los modelos franceses se destacan.

🇫🇷
Enfoque en soberanía

Los 27 modelos fabricados en Francia

Mistral, Lucie (OpenLLM-France), CroissantLLM — entrenados con corpus FR, licencias permisivas, excelentes en francés formal.

★Lo mejor de la selección editorialVer todas las clasificaciones →
253 modelos
Modelo↕
Params↕
VRAM Q4↕
Contexto↕
Funciona en
tok/s↕
Fecha de lanzamiento↕
Pleias-RAG 1B★ FRchatfr
🇫🇷 PleIAs · Especializado en RAG 1.2B. Citación y grounding integrados. Supera a la mayoría de los SLM ≤4B en HotPotQA.
1.2B
0.8 GB
2k
8121624
150
abril de 2025
CroissantLLM 1.3B★ FRchatfr
🇫🇷 CroissantLLM · Pequeño modelo bilingüe FR/EN. Funciona en cualquier parte, incluso en CPU.
1.3B
1 GB
2k
8121624
120
enero de 2024
SmolLM2 1.7B Instruct★ FRchatgeneral
🇫🇷 HuggingFace · 1.7B Apache 2.0 con muchas descargas. Supera a Qwen2.5-1.5B en ~6 pts en MMLU-Pro. BFCL function calling 27%.
1.7B
1.2 GB
8k
8121624
120
noviembre de 2024
Helium 1 2B★ FRchatgeneral
🇫🇷 Kyutai · Modelo base multilingüe en 24 idiomas de la UE (Kyutai FR). Destilado de Gemma 2 → también se aplican los Gemma Terms.
2B
1.5 GB
4k
8121624
100
abril de 2025
SmolVLM2 2.2B Instruct★ FRvisionchat
🇫🇷 HuggingFace · VLM 2.2B: imagen+video+texto. 5.2 GB de VRAM para la inferencia de video. Base SmolLM2-1.7B.
2.2B
1.6 GB
8k
8121624
90
febrero de 2025
Pleias 3B Preview★ FRchatmultilingual
🇫🇷 PleIAs · Francés. Entrenado al 100% con Common Corpus (datos abiertos). Cumple el Reglamento de IA de la UE desde el diseño.
3B
2 GB
2k
8121624
70
diciembre de 2024
SmolLM3 3B★ FRchatgeneral
🇫🇷 HuggingFace · 3B con dos modos (think/no-think). 6 idiomas. MMLU 59.7, GSM8K 70.9. Totalmente abierto (datos y receta).
3B
2 GB
125k
8121624
70
julio de 2025
Shieldstral 3B★ FRgeneralsmall
🇫🇷 Mistral AI · Modelo de protección Mistral 3B (moderación de contenido), 32k de contexto, ~1,7 GB de VRAM en Q4. Autoalojado, licencia Apache 2.0.
3B
1.7 GB
32k
8121624
85
—
Voxtral-4B-TTS★ FRaudiomultilingual
🇫🇷 Mistral AI · TTS abierto de vanguardia, 9 idiomas incluido el francés. Rivaliza con ElevenLabs. ⚠ No comercial.
4B
3 GB
4k
8121624
65
marzo de 2026
Mistral 7B Instruct★ FRchatgeneral
🇫🇷 Mistral AI · El clásico francés. Rápido, versátil, excelente base para empezar.
7B
5 GB
32k
8121624
35
septiembre de 2023
Lucie 7B★ FRchatfr
🇫🇷 OpenLLM-France · LLM soberano francófono, entrenado con un corpus en francés.
7B
5 GB
4k
8121624
35
enero de 2025
Codestral Mamba 7B★ FRcódigofr
🇫🇷 Mistral AI · Mamba SSM puro para el código. Inferencia lineal, ctx 256k. Sin Ollama (soporte parcial de llama.cpp).
7B
5 GB
250k
8121624
40
julio de 2024
Claire 7B 0.1★ FRchatfr
🇫🇷 LINAGORA · Ajuste fino de Falcon-7B con LoRA sobre diálogos espontáneos en francés. ⚠ Licencia NC-SA. Variante Apache separada.
7B
5 GB
2k
8121624
35
noviembre de 2023
Moshi 7B★ FRaudiofr
🇫🇷 Kyutai · Primer modelo abierto de habla full-duplex. Latencia ~200 ms. Voces Moshiko/Moshika. Kyutai (laboratorio francés).
7.6B
5 GB
4k
8121624
25
septiembre de 2024
Mistral Nemo 12B Instruct★ FRchatgeneral
🇫🇷 Mistral AI · Desarrollado conjuntamente con NVIDIA. Contexto de 128k, tokenizador Tekken, buen rendimiento en varios idiomas europeos.
12B
7 GB
125k
8121624
25
julio de 2024
Codestral 22B v0.1★ FRcódigofr
🇫🇷 Mistral AI · Code 22B Mistral, 80+ lenguajes. ⚠ Licencia MNPL para uso fuera de producción — uso personal/investigación.
22B
13 GB
31.25k
8121624
16
mayo de 2024
Mistral Small 3★ FRchatgeneral
🇫🇷 Mistral AI · Excelente relación calidad-tamaño en su lanzamiento (principios de 2025). Rivaliza con los modelos de 70B.
24B
14 GB
32k
8121624
15
enero de 2025
Mistral Small 3.1 24B★ FRchatgeneral
🇫🇷 Mistral AI · Small 3 con visión. 128k ctx, Apache 2.0. Sustituido por Small 3.2 desde junio de 2025.
24B
14 GB
125k
8121624
15
marzo de 2025
Devstral Small 2 24B★ FRcódigofr
🇫🇷 Mistral AI · Especialista en programación 24B Apache 2.0. 72.2% SWE-Bench. 256k ctx, laboratorio francés.
24B
14 GB
250k
8121624
15
diciembre de 2025
Mistral Small 3.2 24B★ FRchatgeneral
🇫🇷 Mistral AI · Actualización de junio de 2025 de Small 3.1. La mitad de generaciones infinitas, llamadas a funciones mejoradas.
24B
14 GB
125k
8121624
15
junio de 2025
Magistral Small 24B★ FRreasoningfr
🇫🇷 Mistral AI · Primer modelo de razonamiento abierto de Mistral. AIME24 70.7%. Base Small 3.1 + entrenamiento CoT.
24B
14 GB
125k
8121624
15
junio de 2025
Mixtral 8x7B★ FRchatgeneral
🇫🇷 Mistral AI · MoE con 8 expertos. Alta calidad, pero necesita mucha VRAM.
47B
26 GB
32k
8121624
12
diciembre de 2023
Mistral Small 4★ FRchatgeneral
🇫🇷 Mistral AI · MoE 119B/6.5B activos unifica chat+razonamiento+visión+código. El buque insignia francés de 2026.
119B
72 GB
250k
8121624
12
marzo de 2026
Mistral Medium 3.5 128B★ FRchatgeneral
🇫🇷 Mistral AI · Modelo denso de 128B + visión, contexto de 256k, razonamiento configurable. SWE-Bench 77.6%. Reemplaza a Medium 3.1 y Magistral. Lanzamiento: 29 de abril de 2026.
128B
74 GB
250k
8121624
4
abril de 2026
Mixtral 8x22B Instruct★ FRchatgeneral
🇫🇷 Mistral AI · MoE Apache 2.0 141B/39B activos. MMLU 77.8, HumanEval 45.1. 80 GB en Q4.
141B
82 GB
62.5k
8121624
8
abril de 2024
Mistral Large 3 675B★ FRchatgeneral
🇫🇷 Mistral AI · MoE 675B/41B activos + codificador de visión de 2,5B, Apache 2.0. N.º 2 entre los modelos OSS sin razonamiento en LMArena. Entrenado con 3000 H200.
675B
405 GB
250k
8121624
5
diciembre de 2025
Mistral Large 4★ FRchatgeneral
🇫🇷 Mistral AI · MoE 1T / 49B activos de Mistral AI, contexto de 32k, ~580 GB de VRAM en Q4: modelo insignia de frontera reservado para servidores con varias GPU.
1000B
580 GB
32k
8121624
10
oct. 2026
Granite Time Series PatchTST R2generalsmall
🇺🇸 IBM · Modelo fundacional de IBM para series temporales (~385M, PatchTST), predicción multivariada, ~0,2 GB de VRAM en Q4. Ultraligero, funciona en CPU. Licencia Apache 2.0.
0.4B
0.2 GB
8k
8121624
170
agosto de 2026
Activity Generation 0.5B (Qwen)chatgeneral
🇨🇳 mjpsm · Qwen 0.5B ajustado para generar actividades, contexto de 32k, ~0,3 GB de VRAM en Q4. Ultraligero; funciona incluso en CPU. Licencia Apache 2.0.
0.5B
0.3 GB
32k
8121624
170
septiembre de 2026
S1-miniaudiosmall
🇺🇸 superwhisper · S1-mini (superwhisper): reconocimiento de voz de 0,6B basado en Qwen3-0.6B, contexto de 40k, ~0,3 GB de VRAM en Q4. Transcripción local ultraligera.
0.6B
0.3 GB
40k
8121624
170
agosto de 2026
Centro de aprendizaje

La documentación QuelLLM.

341+ tutoriales para Windows, macOS y Linux. Las pruebas ejecutadas se especifican en cada guía. Desde la primera instalación hasta las técnicas avanzadas de RAG y fine-tuning.

⌘ K

Destacados

— nuestras guías esenciales
★ Destacado
Empresa · Despliegue

IA de código en la empresa: proteger el código propietario, los NDA y el secreto industrial

Desplegar una IA de código 100% local (Ollama + Cline + Aider + Tabby) para un equipo de desarrollo sujeto a un NDA y al secreto industrial: por qué Copilot y Cursor exponen tu código propietario, qué exigen el RGPD y el Reglamento de IA, la arquitectura en un puesto de trabajo frente a un servidor GPU Tabby y la auditoría de ausencia de exfiltración.

Avanzado·16 min·Mohamed Meguedmi
★ Destacado
Primeros pasos · Gratis

Mejor IA local gratuita: top 2026, incluso sin GPU

IA local: definición y las mejores opciones gratuitas en 2026, para instalar en PC o Mac, incluso sin GPU dedicada. Comparativa de herramientas y guía paso a paso.

Principiante·14 min·Mohamed Meguedmi
★ Destacado
Instalación · Ollama

Instalar Ollama en Windows 11: guía completa (2026)

Descargar Ollama para Windows 11, instalarlo, activar la GPU (CUDA) y ejecutar un primer modelo: la guía paso a paso de 2026, con los errores comunes.

Principiante·3 min·Mohamed Meguedmi
341 resultados
Principiante 3 min

Instalar Ollama en Windows 11: guía completa (2026)

Descargar Ollama para Windows 11, instalarlo, activar la GPU (CUDA) y ejecutar un primer modelo: la guía paso a paso de 2026, con los errores comunes.

OllamaLeer →
Intermedio 12 min

¿Qué LLM usar con una RTX 4090 (24 GB)?

RTX 4090 de 24 GB, la referencia para la IA local de consumo en 2026. Qwen 3.8 27B, Devstral 24B, gpt-oss 20B, GLM 4.7 Flash, benchmarks en tokens/s, optimizaciones CUDA Ada.

RTX 40Leer →
Intermedio 11 min

¿Qué LLM usar con una RTX 5090 (32 GB)?

RTX 5090 de 2025: 32 GB de VRAM GDDR7, ancho de banda de 1792 GB/s. Ejecutar localmente los grandes MoE de 2026 (Qwen 3.6 35B-A3B, Nemotron 3.5 Lightning) y Qwen 3.8 27B con contexto largo, benchmarks, configuraciones ideales.

RTX 50Leer →
Avanzado 16 min

DeepSeek V4 Pro en local: VRAM, hardware, instalación

¿Qué máquina para DeepSeek V4 Pro (1.6T MoE, 49B activos, MIT)? VRAM/RAM requeridas, instalación local, benchmarks frente a GPT-5 y limitaciones reales.

DeepSeekLeer →
Principiante 5 min

LM Studio para principiantes: primer chat local en 10 minutos

Tu primer LLM local con LM Studio: instalar, descargar un modelo y chatear en 10 minutos. Sin usar la línea de comandos, ideal para principiantes.

LM StudioLeer →
Principiante 14 min

¿Qué LLM para RTX 3060 12 GB?

RTX 3060 12 GB: la GPU económica icónica para LLM. 12 GB por 250 € de segunda mano, Gemma 4 12B, Qwen 3.5 9B, Granite 4.2 8B, benchmarks detallados.

RTX 30Leer →
Intermedio 14 min

DeepSeek V4 Flash 284B: el primer modelo frontier que cabe en Mac Studio

DeepSeek V4 Flash 284B MoE (13B activos, MIT, 1M ctx): el primer modelo de frontera ejecutable en una estación de trabajo. Instalación en Mac Studio Ultra, benchmarks, comparativa con Pro.

DeepSeekLeer →
Principiante 3 min

Instalar Ollama en macOS (Apple Silicon): guía 2026

Aprovechar Metal y la memoria unificada de los M1/M2/M3/M4.

OllamaLeer →
Principiante 14 min

¿Qué LLM usar en un Mac mini M4 / M4 Pro (16–64 GB)?

Mac mini M4: la mejor relación rendimiento/precio para IA local en 2026. Benchmarks, configuración recomendada, uso como servidor doméstico.

Mac miniLeer →
Intermedio 13 min

¿Qué LLM usar con una RTX 3090 / 3090 Ti (24 GB)?

RTX 3090 y 3090 Ti de 24 GB de segunda mano: siguen siendo excelentes para LLM en 2026. Qwen 3.8 27B, Qwen3-Coder 30B, benchmarks, valoración de la relación rendimiento/precio, refrigeración.

RTX 30Leer →
Principiante 11 min

¿Qué LLM para 12 GB de VRAM?

12 GB de VRAM (RTX 3060 12GB, 4070, 5070): el equilibrio ideal en 2026. Qwen 3.5 9B en Q8, Gemma 4 12B, RAG multietapa. La guía definitiva.

Por VRAMLeer →
Intermedio 14 min

Qwen 3.8 27B en local: instalación con Ollama y VRAM

Ejecutar Qwen3.8-27B localmente: comando exacto de Ollama, VRAM por cuantización, variante MLX en Mac, trampa del contexto de 256k, modo thinking y benchmarks oficiales.

OllamaLeer →
Principiante 10 min

Tu primera conversación local

Iniciar Ollama, cargar Mistral, dialogar. Tutorial del día 1.

PromptingLeer →
Intermedio 11 min

¿Qué LLM usar con una RTX 5070 Ti (16 GB)?

RTX 5070 Ti 16 GB: el punto de equilibrio ideal de 2025 para la IA local. Benchmarks de Ollama, modelos 14B/24B que funcionan con holgura, comparativa con la 4070 Ti Super.

RTX 50Leer →
Intermedio 11 min

¿Qué LLM usar en un MacBook Pro M4 Pro / Max (24–128 GB)?

MacBook Pro M4 Pro / Max 2025: ancho de banda de 546 GB/s, qué modelos aprovechan realmente el chip y cuáles son sus límites prácticos.

MacBook ProLeer →
Intermedio 14 min

¿Qué LLM usar con una RTX 4070 / 4070 Super / 4070 Ti (12 GB)?

RTX 4070, 4070 Super y 4070 Ti 12 GB: comparativa de LLM, modelos 13B que se ejecutan con holgura, límites de los 12 GB, benchmarks medidos.

RTX 40Leer →
Principiante 11 min

Ollama vs LM Studio vs Jan vs GPT4All

Tabla resumen para elegir la herramienta adecuada para tu perfil.

HerramientasLeer →
Principiante 11 min

¿Qué LLM para 8 GB de VRAM?

La guía completa para 8 GB de VRAM (RTX 3050/3060 8GB, 4060, 5050, 5060): Qwen 3.5 9B, Granite 4.2 8B, trucos para estirar la VRAM.

Por VRAMLeer →
Avanzado 16 min

IA de código en la empresa: proteger el código propietario, los NDA y el secreto industrial

Desplegar una IA de código 100% local (Ollama + Cline + Aider + Tabby) para un equipo de desarrollo sujeto a un NDA y al secreto industrial: por qué Copilot y Cursor exponen tu código propietario, qué exigen el RGPD y el Reglamento de IA, la arquitectura en un puesto de trabajo frente a un servidor GPU Tabby y la auditoría de ausencia de exfiltración.

DespliegueLeer →
Principiante 11 min

Instalar Ollama en 5 minutos (Windows, macOS, Linux)

Cómo instalar Ollama en 5 minutos en Windows, macOS y Linux: requisitos de RAM/GPU, comandos esenciales y primer modelo local para ejecutar justo después.

OllamaLeer →
Principiante 11 min

Fundamentos del prompting

Estructurar tus consultas para obtener respuestas útiles.

PromptingLeer →
Intermedio 12 min

¿Qué LLM usar en un MacBook Pro M3 Pro / Max (18–128 GB)?

MacBook Pro M3 Pro / Max: el mejor portátil para IA local en 2026. Qwen 3.6 35B-A3B, contexto 128k, Flash Attention.

MacBook ProLeer →
Intermedio 11 min

¿Qué LLM usar con una RTX 5080 (16 GB)?

RTX 5080 Blackwell: 16 GB GDDR7 a 960 GB/s. Benchmarks de Qwen 3.5, Granite 4.2, Gemma 4, gpt-oss, Devstral en Q4. Configuración óptima de Ollama.

RTX 50Leer →
Intermedio 11 min

¿Qué LLM para 16 GB de VRAM?

16 GB de VRAM (RTX 4070 Ti Super, 5070 Ti, 5080, 4060 Ti 16GB): Mistral Small 24B, Devstral 24B, gpt-oss 20B, el nivel profesional de 2026.

Por VRAMLeer →
Principiante 12 min

¿Qué GPU para un LLM local? De la RTX 4070 a la 5090, Mac (2026)

RTX 4070 vs 4090 vs Mac M-Max: guía de compra 2026.

GPULeer →
Principiante 11 min

RAG local: introducción

Entender el Retrieval-Augmented Generation para hablar con tus documentos.

ConceptosLeer →
Avanzado 13 min

¿Qué LLM en Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB)?

Mac Studio Ultra: hasta 512 GB de memoria unificada. Ejecutar Llama 4 Maverick 402B, Qwen3-235B, DeepSeek 671B en local. La guía para usuarios avanzados.

Mac StudioLeer →
Intermedio 11 min

¿Qué LLM en RTX 4080 / 4080 Super (16 GB)?

RTX 4080 y 4080 Super 16 GB para LLM local: todos los modelos que caben, benchmarks, comparativa 4080 vs 4080 Super, veredicto de compra.

RTX 40Leer →
Intermedio 11 min

¿Qué LLM en Radeon RX 7900 XTX (24 GB)?

Radeon RX 7900 XTX 24 GB: alternativa de AMD a la RTX 4090 para LLM. ROCm 6.x, Qwen 3.8 27B, benchmarks en tokens/s, veredicto de 2026.

Radeon RX 7000Leer →
Intermedio 11 min

¿Qué LLM para 24 GB de VRAM?

24 GB de VRAM (RTX 3090, 4090, RX 7900 XTX): Qwen 3.8 27B íntegramente en VRAM, gran MoE 35B-A3B, fine-tuning LoRA. El nivel para ir en serio.

Por VRAMLeer →
…
1–30 sobre 341 guías
Banco de pruebas

Opiniones y pruebas.

Cuando la ejecución local no es suficiente, ¿qué servicios en línea merecen tu dinero? 14 marcas analizadas, 7 descartadas. Cada ficha menciona primero la alternativa local gratuita.

Hardware7 guías · una nueva cada jueves
GIGABYTE AI TOP ATOM: nuestro banco de pruebas

Chip NVIDIA GB10 y 128 GB de memoria unificada: lo que esta máquina realmente puede ejecutar, medido en nuestra unidad, con datos públicos como respaldo. Máquina proporcionada gratuitamente por GIGABYTE; las mediciones y las opiniones siguen siendo nuestras.

La ficha completa del AI TOP ATOM →
  1. 8 oct.1. Qué LLM funcionan realmente con 128 GBLeer →
  2. 15 oct.2. AI TOP ATOM y DGX SparkPróximamente
  3. 22 oct.3. GB10, Ryzen AI Max+ 395 o MacPróximamente
  4. 29 oct.4. Un LLM 70B en localPróximamente
  5. 5 nov.5. Ajuste fino en localPróximamente
  6. 12 nov.6. Asistente de IA privado para pymesPróximamente
  7. 19 nov.7. Consumo de una IA localPróximamente
API & código4/5
GLM Coding Plan
La API de los modelos GLM open-weights, probada en nuestro hardware.
Transcripción4.5/5
HappyScribe
Transcripción en la nube frente a Whisper local: nuestra comparativa con cifras.
Agentes de IA3.5/5
Creao AI
Agentes conectados a tus herramientas, sin programar. Todavía en sus primeras etapas.
Formación3.5/5
Code Labs Academy
Bootcamp acreditado de datos/IA, orientado a un cambio de carrera profesional.
Ver la metodología y todas las reseñas →
Recorridos guiados

Tres caminos,
según quién seas.

Cada recorrido es una secuencia de guías pensada para un perfil concreto. Desde la primera descarga hasta una configuración operativa.

01
Rutas curieux

« Solo quiero probar, sin complicaciones. »

Has oído hablar de los LLM locales y quieres ver cómo funcionan en tu máquina. Sin código, sin configuración del sistema — en 10 minutos chateas con tu primer modelo.

Duración total
~15 min
Prerrequisitos
Ninguna
Lo que tendrás al final
Ollama instalado
Mistral 7B lanzado
Primer prompt exitoso
Empezar la ruta→