Principiante 12 minInstalación

Instalar un LLM local: guía paso a paso (2026)

Respuesta directa

Instalar un LLM localmente requiere tres cosas: una máquina con suficiente RAM o VRAM para el tamaño del modelo deseado, una herramienta para ejecutarlo —LM Studio sin terminal, Ollama en línea de comandos o llama.cpp para los expertos— y un primer modelo cuantizado adecuado para este hardware. Calcula entre 10 y 15 minutos para tener un primer chat local funcional en una máquina reciente; una vez descargado el modelo, ya no necesitarás conexión a internet.

¿Quieres ejecutar una IA directamente en tu PC o Mac, pero todos los nombres de herramientas y modelos te parecen iguales y no sabes por dónde empezar? Esta guía ofrece la visión general que falta antes de elegir: comprobar si tu máquina puede ejecutarla, comparar los tres métodos de instalación, identificar tu primer modelo y evitar los errores que arruinan la primera prueba. Cada paso lleva a una guía específica más detallada si quieres profundizar en algún punto.

Por Mohamed Meguedmi·Actualización 2026-08-24·Probado en Windows, macOS y Linux

#Comprobar la máquina: RAM, VRAM y tamaño del modelo

Antes de elegir una herramienta, la pregunta que realmente importa es: ¿cuánta memoria puede dedicar tu máquina a un modelo? La denominación «7B» o «32B» de un modelo indica su número de parámetros, pero es su versión cuantizada —comprimida para caber en memoria, a costa de una pequeña pérdida de precisión— la que determina el espacio realmente necesario. La cuantización Q4 (a menudo indicada como Q4_K_M) es el equilibrio estándar para empezar: reduce considerablemente la memoria necesaria en comparación con los pesos originales del modelo, con una pérdida de calidad generalmente poco perceptible durante el uso.

8 GB de RAM, sin GPU dedicado
modelos ligeros de unos 3-4B en Q4: uso básico, respuestas más lentas pero funcionales.
16 GB de RAM (CPU) o 8 GB de VRAM (GPU)
El punto de entrada más cómodo, con modelos de 7 a 8B en Q4 — el formato más común para un primer uso real.
12 GB de VRAM
margen para llegar hasta un modelo de 14B sin mayores problemas.
24 GB de VRAM (o 32-48 GB de memoria unificada en Mac)
Un modelo de 32B con cuantización Q4 funciona cómodamente.
64 GB o más de RAM o memoria unificada
los modelos de alrededor de 70B pasan a ser viables, con una distribución parcial de la carga entre CPU y GPU y una velocidad de generación considerablemente menor.
i
Estos son puntos de referencia, no garantías
La longitud de contexto utilizada, el sistema operativo y las demás aplicaciones abiertas hacen variar el margen real disponible. Mantén siempre un margen de alrededor del 20 al 30 % por encima del tamaño del modelo en sí antes de considerar cómoda una configuración.

#Elegir el método: LM Studio, Ollama o llama.cpp

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Hay tres grandes vías para ejecutar un LLM localmente. No se excluyen entre sí, sino que parten de filosofías diferentes. La elección depende sobre todo de tu comodidad con el terminal y de lo que piensas hacer con el modelo una vez instalado.

LM Studio — sin usar el terminal
aplicación de escritorio con interfaz gráfica completa, búsqueda integrada de modelos, ajustes visuales de GPU. La opción más directa para un primer contacto, disponible en Windows, macOS (Apple Silicon) y Linux.
Ollama — terminal y API
Instalación con un solo comando, biblioteca de modelos gestionada desde la línea de comandos, servidor API local compatible con OpenAI activo por defecto. La opción natural si piensas escribir scripts, automatizar o conectar una herramienta de terceros.
llama.cpp — para los expertos
el motor de inferencia que muchas otras herramientas utilizan en segundo plano, entre ellas LM Studio. Compilación a partir del código fuente, control detallado de cada parámetro, ninguna interfaz — reservado para quienes quieran entender u optimizar cada detalle.

En resumen: no quieres abrir ningún terminal → LM Studio. Quieres llamar a tu modelo desde un script, automatización o aplicación → Ollama. Quieres entender o ajustar cada parámetro de compilación, o ejecutar el modelo en un hardware inusual → llama.cpp.


#Instalación rápida, paso a paso

Aquí tienes una instalación resumida para cada una de las tres vías. La idea es ofrecer una visión general para empezar en unos minutos; hay una guía específica para cada herramienta con todos los detalles, incluidas las capturas de pantalla.

Con LM Studio (sin usar el terminal):

  1. 01
    1. Descargar el instalador
    Desde el sitio oficial de LM Studio, obtén la versión correspondiente a tu sistema.
  2. 02
    2. Abrir la búsqueda de modelos
    La primera vez que lo inicies, abre la pestaña de búsqueda (atajo Ctrl/Cmd+Mayús+M) para explorar el catálogo.
  3. 03
    3. Elegir un modelo adecuado
    La aplicación muestra una estimación de compatibilidad con VRAM antes de la descarga: elige un modelo marcado como compatible con tu máquina.
  4. 04
    4. Cargar el modelo y conversar
    Abre la pestaña Chat, carga el modelo descargado en el menú superior y plantea tu primera pregunta.

Con Ollama (terminal y API) :

  1. 01
    1. Instalar Ollama
    Script oficial bajo Linux, instalador .exe o .dmg bajo Windows y macOS. La aplicación de escritorio se inicia automáticamente después de la instalación.
  2. 02
    2. Arrancar un primer modelo
    En un terminal, el comando ollama run suivie con el nombre de un modelo lo descarga y arranca un chat directamente en el terminal.
  3. 03
    3. Conversar o conectar una herramienta de terceros
    Continúa en el terminal o configura una aplicación compatible con OpenAI para que se conecte al servidor API local (puerto 11434 por defecto).
  4. 04
    4. Gestionar tus modelos instalados
    Puedes listar, cambiar o eliminar tus modelos en cualquier momento con los comandos de gestión dedicados.

Con llama.cpp (expertos):

  1. 01
    1. Compilar el binario
    Clona el repositorio y compila para tu hardware (CPU, CUDA, Metal o ROCm según tu configuración).
  2. 02
    2. Descargar un modelo GGUF
    Descarga un archivo en formato GGUF desde Hugging Face, eligiendo la cuantización adecuada para la memoria que tienes disponible.
  3. 03
    3. Iniciar el binario de chat
    Indica la ruta del archivo GGUF descargado, con los parámetros de contexto y de transferencia de procesamiento a la GPU que prefieras.
  4. 04
    4. Ajustar el offload GPU/CPU
    Ajusta capa por capa la distribución entre GPU y CPU para encontrar el mejor equilibrio entre velocidad y memoria en tu configuración.
i
Para conocer todos los detalles
Cada una de estas tres vías merece su propia guía paso a paso, con capturas de pantalla y opciones avanzadas. Esta versión condensada basta para tener un primer modelo que responda; vuelve a la guía específica cuando quieras profundizar en un punto concreto, como la compatibilidad con GPU AMD o la configuración de red de un servidor.

#Descargar tu primer modelo

La elección del primer modelo adecuado depende sobre todo de lo que tu máquina pueda alojar cómodamente en memoria, no de la reputación del modelo. Aquí tienes orientaciones fiables según tu configuración.

Máquina modesta (8-16 GB de RAM, sin GPU dedicado)
un pequeño modelo generalista de alrededor de 3-4B en Q4: rápido incluso usando solo la CPU, más que suficiente para conversar, resumir o traducir un texto corto.
8-12 GB de VRAM
un modelo de 7 a 8B en Q4_K_M, como Qwen3 8B o Mistral: el equilibrio calidad/velocidad más común para uso diario.
16-24 GB de VRAM
un modelo de 14B, o de 32B en Q4 si estás en la parte superior de este rango, como Gemma en su versión más grande: más margen para razonamiento o para código.
Aún no sabes qué quieres hacer con él
Empieza con un modelo pequeño. Comprobar que un modelo ligero responde correctamente lleva unos minutos; pasarás a modelos más grandes una vez que la primera prueba haya dado buen resultado.
→
El nombre de la cuantización no es un mero detalle estético
Una etiqueta como Q4_K_M, Q5_K_M o Q8_0 indica el nivel de compresión del modelo. Cuanto más bajo es el número, más ligero y rápido es el modelo, pero menos preciso. Q4_K_M sigue siendo el mejor punto de partida para una primera prueba.

#Errores comunes que debes evitar

La mayoría de las malas primeras impresiones sobre la IA local se deben a una configuración incorrecta más que a un problema real con la herramienta o el modelo. Estos son los errores más frecuentes entre quienes instalan su primer LLM en local y cómo detectarlos rápidamente.

Modelo demasiado grande para la VRAM
el modelo pasa a usar la RAM del sistema e incluso puede fallar al cargar. Las respuestas se vuelven muy lentas o aparece un error de memoria. Baja a un modelo de menor tamaño o a un nivel de cuantización inferior.
Cuantización elegida al azar
Descargar la versión más pesada disponible «para tener lo mejor» suele acabar en que no cabe en memoria. Empieza con Q4_K_M y solo sube si el margen de memoria realmente lo permite.
Ventilador que se acelera y respuesta que tarda
normal al ejecutar por primera vez un modelo grande: la inferencia exige mucho a la GPU o a la CPU. Si te resulta demasiado lento, es señal de que el modelo es demasiado grande para tu máquina, no de un fallo que haya que corregir.
Descargar todo antes de probarlo
es mejor comprobar que un modelo pequeño funciona y responde correctamente antes de empezar a descargar un modelo de varias decenas de GB.

#¿Y después? RAG, asistente de código, API

Una vez instalado y funcionando un primer modelo, se abren varias opciones naturales según el uso que quieras darle: conversar con tus propios documentos, conectar un copiloto de código a tu editor o exponer el servidor API local a tus propios scripts y aplicaciones.

Hablar con tus documentos (RAG)
LM Studio ofrece un RAG integrado listo para usar. Con Ollama, es necesario combinarlo con una herramienta de terceros como Open WebUI o un pipeline dedicado para obtener un resultado equivalente.
Usar un copiloto en tu editor de código
El servidor API compatible con OpenAI de Ollama o de LM Studio puede conectarse a extensiones como Cline para programar con asistencia 100 % local.
Automatizar mediante la API
las dos herramientas exponen un servidor local compatible con OpenAI, reutilizable en cualquier script o aplicación ya pensada para esta API, sin necesidad de cambios en el lado del cliente.
→
Un paso a la vez
No es necesario aspirar al RAG, al copiloto de código y a la automatización desde el primer día. Valida primero un chat local que responda correctamente a tus preguntas; los usos más avanzados se construyen de forma natural una vez que tengas esta base sólida.

#Preguntas frecuentes

Instalar un LLM localmente, ¿es legal y gratuito?+
Sí: las herramientas como Ollama, LM Studio o llama.cpp son gratuitas, y los modelos de pesos abiertos (Llama, Qwen, Mistral, Gemma...) están publicados bajo licencias que permiten el uso personal. Algunas licencias tienen condiciones específicas para un uso comercial a gran escala, que deben verificarse caso por caso en la ficha del modelo.
¿Qué configuración mínima para comenzar?+
En la práctica, 16 GB de RAM y un procesador reciente bastan para un primer modelo de unos pocos miles de millones de parámetros. Una GPU con al menos 8 GB de VRAM, o un chip Apple Silicon con suficiente memoria unificada, hace que la experiencia sea mucho más cómoda en cuanto pasas a modelos más grandes.
¿Es posible instalar un LLM localmente sin tarjeta gráfica?+
Sí, los tres métodos presentados aquí funcionan solo con la CPU. Los modelos de 3 a 8B siguen siendo utilizables sin GPU, pero las respuestas son más lentas que con una tarjeta dedicada.
¿Cuánto espacio en disco se debe reservar?+
El tamaño de los modelos cuantizados va de unos cientos de MB para los más pequeños a varias decenas de GB para los más grandes. Asegúrate de tener un margen cómodo en un SSD si planeas probar varios modelos antes de decidirte.
¿Qué modelo elegir para comenzar?+
Un modelo generalista de 7 a 8B, como Qwen3 8B o Mistral, con cuantización Q4_K_M, es un punto de partida sólido en la mayoría de las máquinas recientes. Ajusta luego el tamaño según tu RAM o VRAM real y tus primeras pruebas.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.