El mercado en resumen
Todas las novedades →Los kits QuelLLM — la guía de referencia por uso.
Un kit para cada uso: la guía completa, configuraciones listas para copiar y pegar y acceso de por vida al espacio en línea.
El catálogo de los LLM de pesos abiertos
que funcionan localmente.
Todos los modelos relevantes, con VRAM requerida por cuantización, velocidad estimada y casos de uso. Los modelos franceses se destacan.
Encuentra tu LLM según tu necesidad
¿No te apetece usar el configurador? Nuestros rankings temáticos seleccionan los mejores modelos que puedes alojar tú mismo según el caso de uso y el hardware.
La documentación QuelLLM.
335+ Guías en español para Windows, macOS y Linux. Las pruebas realizadas se indican en cada guía. Desde la primera instalación hasta técnicas avanzadas de RAG y fine-tuning.
Destacados
— nuestras guías esencialesInstalar Ollama en Windows 11: guía completa (2026)
Descargar Ollama para Windows 11, instalarlo, activar la GPU (CUDA) y ejecutar un primer modelo: la guía paso a paso de 2026, con los errores comunes.
¿Qué LLM usar con una RTX 4090 (24 GB)?
RTX 4090 de 24 GB, la referencia para la IA local de consumo en 2026. Qwen 3.8 27B, Devstral 24B, gpt-oss 20B, GLM 4.7 Flash, benchmarks en tokens/s, optimizaciones CUDA Ada.
¿Qué LLM usar con una RTX 5090 (32 GB)?
RTX 5090 de 2025: 32 GB de VRAM GDDR7, ancho de banda de 1792 GB/s. Ejecutar localmente los grandes MoE de 2026 (Qwen 3.6 35B-A3B, Nemotron 3.5 Lightning) y Qwen 3.8 27B con contexto largo, benchmarks, configuraciones ideales.
DeepSeek V4 Pro en local: VRAM, hardware, instalación
¿Qué máquina para DeepSeek V4 Pro (1.6T MoE, 49B activos, MIT)? VRAM/RAM requeridas, instalación local, benchmarks frente a GPT-5 y limitaciones reales.
LM Studio para principiantes: primer chat local en 10 minutos
Tu primer LLM local con LM Studio: instalar, descargar un modelo y chatear en 10 minutos. Sin usar la línea de comandos, ideal para principiantes.
¿Qué LLM para RTX 3060 12 GB?
RTX 3060 12 GB: la GPU económica icónica para LLM. 12 GB por 250 € de segunda mano, Gemma 4 12B, Qwen 3.5 9B, Granite 4.2 8B, benchmarks detallados.
DeepSeek V4 Flash 284B: el primer modelo frontier que cabe en Mac Studio
DeepSeek V4 Flash 284B MoE (13B activos, MIT, 1M ctx): el primer modelo de frontera ejecutable en una estación de trabajo. Instalación en Mac Studio Ultra, benchmarks, comparativa con Pro.
Instalar Ollama en macOS (Apple Silicon): guía 2026
Aprovechar Metal y la memoria unificada de los M1/M2/M3/M4.
¿Qué LLM usar en un Mac mini M4 / M4 Pro (16–64 GB)?
Mac mini M4: la mejor relación rendimiento/precio para IA local en 2026. Benchmarks, configuración recomendada, uso como servidor doméstico.
¿Qué LLM usar con una RTX 3090 / 3090 Ti (24 GB)?
RTX 3090 y 3090 Ti de 24 GB de segunda mano: siguen siendo excelentes para LLM en 2026. Qwen 3.8 27B, Qwen3-Coder 30B, benchmarks, valoración de la relación rendimiento/precio, refrigeración.
¿Qué LLM para 12 GB de VRAM?
12 GB de VRAM (RTX 3060 12GB, 4070, 5070): el equilibrio ideal en 2026. Qwen 3.5 9B en Q8, Gemma 4 12B, RAG multietapa. La guía definitiva.
Qwen 3.8 27B en local: instalación con Ollama y VRAM
Ejecutar Qwen3.8-27B localmente: comando exacto de Ollama, VRAM por cuantización, variante MLX en Mac, trampa del contexto de 256k, modo thinking y benchmarks oficiales.
Tu primera conversación local
Iniciar Ollama, cargar Mistral, dialogar. Tutorial del día 1.
¿Qué LLM usar con una RTX 5070 Ti (16 GB)?
RTX 5070 Ti 16 GB: el punto de equilibrio ideal de 2025 para la IA local. Benchmarks de Ollama, modelos 14B/24B que funcionan con holgura, comparativa con la 4070 Ti Super.
¿Qué LLM usar en un MacBook Pro M4 Pro / Max (24–128 GB)?
MacBook Pro M4 Pro / Max 2025: ancho de banda de 546 GB/s, qué modelos aprovechan realmente el chip y cuáles son sus límites prácticos.
¿Qué LLM usar con una RTX 4070 / 4070 Super / 4070 Ti (12 GB)?
RTX 4070, 4070 Super y 4070 Ti 12 GB: comparativa de LLM, modelos 13B que se ejecutan con holgura, límites de los 12 GB, benchmarks medidos.
Ollama vs LM Studio vs Jan vs GPT4All
Tabla resumen para elegir la herramienta adecuada para tu perfil.
¿Qué LLM para 8 GB de VRAM?
La guía completa para 8 GB de VRAM (RTX 3050/3060 8GB, 4060, 5050, 5060): Qwen 3.5 9B, Granite 4.2 8B, trucos para estirar la VRAM.
IA de código en la empresa: proteger el código propietario, los NDA y el secreto industrial
Desplegar una IA de código 100% local (Ollama + Cline + Aider + Tabby) para un equipo de desarrollo sujeto a un NDA y al secreto industrial: por qué Copilot y Cursor exponen tu código propietario, qué exigen el RGPD y el Reglamento de IA, la arquitectura en un puesto de trabajo frente a un servidor GPU Tabby y la auditoría de ausencia de exfiltración.
Instalar Ollama en 5 minutos (Windows, macOS, Linux)
Cómo instalar Ollama en 5 minutos en Windows, macOS y Linux: requisitos de RAM/GPU, comandos esenciales y primer modelo local para ejecutar justo después.
Fundamentos del prompting
Estructurar tus consultas para obtener respuestas útiles.
¿Qué LLM usar en un MacBook Pro M3 Pro / Max (18–128 GB)?
MacBook Pro M3 Pro / Max: el mejor portátil para IA local en 2026. Qwen 3.6 35B-A3B, contexto 128k, Flash Attention.
¿Qué LLM usar con una RTX 5080 (16 GB)?
RTX 5080 Blackwell: 16 GB GDDR7 a 960 GB/s. Benchmarks de Qwen 3.5, Granite 4.2, Gemma 4, gpt-oss, Devstral en Q4. Configuración óptima de Ollama.
¿Qué LLM para 16 GB de VRAM?
16 GB de VRAM (RTX 4070 Ti Super, 5070 Ti, 5080, 4060 Ti 16GB): Mistral Small 24B, Devstral 24B, gpt-oss 20B, el nivel profesional de 2026.
¿Qué GPU para un LLM local? De la RTX 4070 a la 5090, Mac (2026)
RTX 4070 vs 4090 vs Mac M-Max: guía de compra 2026.
RAG local: introducción
Entender el Retrieval-Augmented Generation para hablar con tus documentos.
¿Qué LLM en Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB)?
Mac Studio Ultra: hasta 512 GB de memoria unificada. Ejecutar Llama 4 Maverick 402B, Qwen3-235B, DeepSeek 671B en local. La guía para usuarios avanzados.
¿Qué LLM en RTX 4080 / 4080 Super (16 GB)?
RTX 4080 y 4080 Super 16 GB para LLM local: todos los modelos que caben, benchmarks, comparativa 4080 vs 4080 Super, veredicto de compra.
¿Qué LLM en Radeon RX 7900 XTX (24 GB)?
Radeon RX 7900 XTX 24 GB: alternativa de AMD a la RTX 4090 para LLM. ROCm 6.x, Qwen 3.8 27B, benchmarks en tokens/s, veredicto de 2026.
¿Qué LLM para 24 GB de VRAM?
24 GB de VRAM (RTX 3090, 4090, RX 7900 XTX): Qwen 3.8 27B íntegramente en VRAM, gran MoE 35B-A3B, fine-tuning LoRA. El nivel para ir en serio.
Reseñas y pruebas de herramientas de IA.
Cuando la ejecución local no es suficiente, ¿qué servicios en línea merecen tu dinero? 14 marcas analizadas, 7 descartadas. Cada ficha menciona primero la alternativa local gratuita.
Tres caminos,
según quién seas.
Cada recorrido es una secuencia de guías pensada para un perfil concreto. Desde la primera descarga hasta una configuración operativa.
« Solo quiero probar, sin complicaciones. »
Has oído hablar de los LLM locales y quieres ver cómo funcionan en tu máquina. Sin código, sin configuración del sistema — en 10 minutos chateas con tu primer modelo.