Instalar un LLM local: guía paso a paso (2026)
Instalar un LLM localmente requiere tres cosas: una máquina con suficiente RAM o VRAM para el tamaño del modelo deseado, una herramienta para ejecutarlo —LM Studio sin terminal, Ollama en línea de comandos o llama.cpp para los expertos— y un primer modelo cuantizado adecuado para este hardware. Calcula entre 10 y 15 minutos para tener un primer chat local funcional en una máquina reciente; una vez descargado el modelo, ya no necesitarás conexión a internet.
¿Quieres ejecutar una IA directamente en tu PC o Mac, pero todos los nombres de herramientas y modelos te parecen iguales y no sabes por dónde empezar? Esta guía ofrece la visión general que falta antes de elegir: comprobar si tu máquina puede ejecutarla, comparar los tres métodos de instalación, identificar tu primer modelo y evitar los errores que arruinan la primera prueba. Cada paso lleva a una guía específica más detallada si quieres profundizar en algún punto.
#Comprobar la máquina: RAM, VRAM y tamaño del modelo
Antes de elegir una herramienta, la pregunta que realmente importa es: ¿cuánta memoria puede dedicar tu máquina a un modelo? La denominación «7B» o «32B» de un modelo indica su número de parámetros, pero es su versión cuantizada —comprimida para caber en memoria, a costa de una pequeña pérdida de precisión— la que determina el espacio realmente necesario. La cuantización Q4 (a menudo indicada como Q4_K_M) es el equilibrio estándar para empezar: reduce considerablemente la memoria necesaria en comparación con los pesos originales del modelo, con una pérdida de calidad generalmente poco perceptible durante el uso.
- 8 GB de RAM, sin GPU dedicado
- modelos ligeros de unos 3-4B en Q4: uso básico, respuestas más lentas pero funcionales.
- 16 GB de RAM (CPU) o 8 GB de VRAM (GPU)
- El punto de entrada más cómodo, con modelos de 7 a 8B en Q4 — el formato más común para un primer uso real.
- 12 GB de VRAM
- margen para llegar hasta un modelo de 14B sin mayores problemas.
- 24 GB de VRAM (o 32-48 GB de memoria unificada en Mac)
- Un modelo de 32B con cuantización Q4 funciona cómodamente.
- 64 GB o más de RAM o memoria unificada
- los modelos de alrededor de 70B pasan a ser viables, con una distribución parcial de la carga entre CPU y GPU y una velocidad de generación considerablemente menor.
#Elegir el método: LM Studio, Ollama o llama.cpp
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Hay tres grandes vías para ejecutar un LLM localmente. No se excluyen entre sí, sino que parten de filosofías diferentes. La elección depende sobre todo de tu comodidad con el terminal y de lo que piensas hacer con el modelo una vez instalado.
- LM Studio — sin usar el terminal
- aplicación de escritorio con interfaz gráfica completa, búsqueda integrada de modelos, ajustes visuales de GPU. La opción más directa para un primer contacto, disponible en Windows, macOS (Apple Silicon) y Linux.
- Ollama — terminal y API
- Instalación con un solo comando, biblioteca de modelos gestionada desde la línea de comandos, servidor API local compatible con OpenAI activo por defecto. La opción natural si piensas escribir scripts, automatizar o conectar una herramienta de terceros.
- llama.cpp — para los expertos
- el motor de inferencia que muchas otras herramientas utilizan en segundo plano, entre ellas LM Studio. Compilación a partir del código fuente, control detallado de cada parámetro, ninguna interfaz — reservado para quienes quieran entender u optimizar cada detalle.
En resumen: no quieres abrir ningún terminal → LM Studio. Quieres llamar a tu modelo desde un script, automatización o aplicación → Ollama. Quieres entender o ajustar cada parámetro de compilación, o ejecutar el modelo en un hardware inusual → llama.cpp.
#Instalación rápida, paso a paso
Aquí tienes una instalación resumida para cada una de las tres vías. La idea es ofrecer una visión general para empezar en unos minutos; hay una guía específica para cada herramienta con todos los detalles, incluidas las capturas de pantalla.
Con LM Studio (sin usar el terminal):
- 011. Descargar el instaladorDesde el sitio oficial de LM Studio, obtén la versión correspondiente a tu sistema.
- 022. Abrir la búsqueda de modelosLa primera vez que lo inicies, abre la pestaña de búsqueda (atajo Ctrl/Cmd+Mayús+M) para explorar el catálogo.
- 033. Elegir un modelo adecuadoLa aplicación muestra una estimación de compatibilidad con VRAM antes de la descarga: elige un modelo marcado como compatible con tu máquina.
- 044. Cargar el modelo y conversarAbre la pestaña Chat, carga el modelo descargado en el menú superior y plantea tu primera pregunta.
Con Ollama (terminal y API) :
- 011. Instalar OllamaScript oficial bajo Linux, instalador .exe o .dmg bajo Windows y macOS. La aplicación de escritorio se inicia automáticamente después de la instalación.
- 022. Arrancar un primer modeloEn un terminal, el comando ollama run suivie con el nombre de un modelo lo descarga y arranca un chat directamente en el terminal.
- 033. Conversar o conectar una herramienta de tercerosContinúa en el terminal o configura una aplicación compatible con OpenAI para que se conecte al servidor API local (puerto 11434 por defecto).
- 044. Gestionar tus modelos instaladosPuedes listar, cambiar o eliminar tus modelos en cualquier momento con los comandos de gestión dedicados.
Con llama.cpp (expertos):
- 011. Compilar el binarioClona el repositorio y compila para tu hardware (CPU, CUDA, Metal o ROCm según tu configuración).
- 022. Descargar un modelo GGUFDescarga un archivo en formato GGUF desde Hugging Face, eligiendo la cuantización adecuada para la memoria que tienes disponible.
- 033. Iniciar el binario de chatIndica la ruta del archivo GGUF descargado, con los parámetros de contexto y de transferencia de procesamiento a la GPU que prefieras.
- 044. Ajustar el offload GPU/CPUAjusta capa por capa la distribución entre GPU y CPU para encontrar el mejor equilibrio entre velocidad y memoria en tu configuración.
#Descargar tu primer modelo
La elección del primer modelo adecuado depende sobre todo de lo que tu máquina pueda alojar cómodamente en memoria, no de la reputación del modelo. Aquí tienes orientaciones fiables según tu configuración.
- Máquina modesta (8-16 GB de RAM, sin GPU dedicado)
- un pequeño modelo generalista de alrededor de 3-4B en Q4: rápido incluso usando solo la CPU, más que suficiente para conversar, resumir o traducir un texto corto.
- 8-12 GB de VRAM
- un modelo de 7 a 8B en Q4_K_M, como Qwen3 8B o Mistral: el equilibrio calidad/velocidad más común para uso diario.
- 16-24 GB de VRAM
- un modelo de 14B, o de 32B en Q4 si estás en la parte superior de este rango, como Gemma en su versión más grande: más margen para razonamiento o para código.
- Aún no sabes qué quieres hacer con él
- Empieza con un modelo pequeño. Comprobar que un modelo ligero responde correctamente lleva unos minutos; pasarás a modelos más grandes una vez que la primera prueba haya dado buen resultado.
#Errores comunes que debes evitar
La mayoría de las malas primeras impresiones sobre la IA local se deben a una configuración incorrecta más que a un problema real con la herramienta o el modelo. Estos son los errores más frecuentes entre quienes instalan su primer LLM en local y cómo detectarlos rápidamente.
- Modelo demasiado grande para la VRAM
- el modelo pasa a usar la RAM del sistema e incluso puede fallar al cargar. Las respuestas se vuelven muy lentas o aparece un error de memoria. Baja a un modelo de menor tamaño o a un nivel de cuantización inferior.
- Cuantización elegida al azar
- Descargar la versión más pesada disponible «para tener lo mejor» suele acabar en que no cabe en memoria. Empieza con Q4_K_M y solo sube si el margen de memoria realmente lo permite.
- Ventilador que se acelera y respuesta que tarda
- normal al ejecutar por primera vez un modelo grande: la inferencia exige mucho a la GPU o a la CPU. Si te resulta demasiado lento, es señal de que el modelo es demasiado grande para tu máquina, no de un fallo que haya que corregir.
- Descargar todo antes de probarlo
- es mejor comprobar que un modelo pequeño funciona y responde correctamente antes de empezar a descargar un modelo de varias decenas de GB.
#¿Y después? RAG, asistente de código, API
Una vez instalado y funcionando un primer modelo, se abren varias opciones naturales según el uso que quieras darle: conversar con tus propios documentos, conectar un copiloto de código a tu editor o exponer el servidor API local a tus propios scripts y aplicaciones.
- Hablar con tus documentos (RAG)
- LM Studio ofrece un RAG integrado listo para usar. Con Ollama, es necesario combinarlo con una herramienta de terceros como Open WebUI o un pipeline dedicado para obtener un resultado equivalente.
- Usar un copiloto en tu editor de código
- El servidor API compatible con OpenAI de Ollama o de LM Studio puede conectarse a extensiones como Cline para programar con asistencia 100 % local.
- Automatizar mediante la API
- las dos herramientas exponen un servidor local compatible con OpenAI, reutilizable en cualquier script o aplicación ya pensada para esta API, sin necesidad de cambios en el lado del cliente.
#Preguntas frecuentes
Instalar un LLM localmente, ¿es legal y gratuito?+
¿Qué configuración mínima para comenzar?+
¿Es posible instalar un LLM localmente sin tarjeta gráfica?+
¿Cuánto espacio en disco se debe reservar?+
¿Qué modelo elegir para comenzar?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.