Principiante 9 minInterfaces

LM Studio en Linux: Ubuntu, Debian, Arch, Fedora (2026)

LM Studio en Linux es una AppImage de ~600 MB que incluye una interfaz gráfica, una tienda de modelos conectada a Hugging Face, un motor de inferencia llama.cpp y un servidor compatible con OpenAI. No requiere instalación en el sistema, ni un demonio, ni añadir un repositorio: un archivo ejecutable y listo. Esta guía cubre la instalación, la descarga de un GGUF, el inicio del servidor local y los problemas específicos de Linux (permisos, FUSE, GPU).

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Ubuntu 24.04
i
En resumen
LM Studio en Linux es una AppImage de unos 600 MB: sin instalación en el sistema, sin daemon, un único archivo ejecutable. · Bastan tres pasos: descargar el archivo, hacerlo ejecutable (chmod +x) y luego ejecutarlo. · Requisitos: una distribución reciente con glibc 2.35+ y el paquete libfuse2 en Ubuntu 22.04 y versiones posteriores. · La AppImage detecta automáticamente la GPU (CUDA, ROCm o Vulkan según tu tarjeta) para acelerar la inferencia.

#¿Por qué LM Studio en Linux?

En Linux, la solución habitual para un LLM local es Ollama: demonio systemd, interfaz de línea de comandos clara, escucha por defecto en localhost:11434. Es excelente para el servidor. LM Studio aborda otro enfoque: el de la estación de trabajo con interfaz gráfica.

Una interfaz completa sin terminal
Chat, navegador de modelos Hugging Face, gestor de descargas, ajustes de sampling: todo en interfaz gráfica. Útil si quieres probar rápidamente varios modelos antes de pasar a producción.
Un servidor compatible con OpenAI en un clic
La pestaña Developer ofrece un endpoint en http://localhost:1234/v1 que utiliza el protocolo OpenAI. Cualquier SDK (openai-python, LangChain, Continue.dev) puede conectarse a él sin cambiar una línea.
Sin instalación a nivel del sistema
La AppImage funciona en el espacio de usuario. No hace falta sudo, ni instalar paquetes, ni añadir repositorios de terceros. Para equipos con restricciones impuestas por el departamento de TI o distribuciones atípicas, resulta muy útil.
Formato GGUF nativo
LM Studio solo lee GGUF (el formato de llama.cpp). Es el mismo formato que utiliza Ollama internamente, por lo que el 100 % de los modelos populares están disponibles.
i
LM Studio y Ollama coexisten muy bien
Nada impide tener los dos. Ollama en modo daemon para tus scripts y tus integraciones, LM Studio para el chat interactivo y la exploración de nuevos modelos. No usan los mismos puertos (11434 vs 1234) y no interfieren entre sí.

#Prerrequisitos

El kit IA Local

LM Studio funciona en tu Linux. El kit de IA local toma el relevo: los ajustes avanzados de LM Studio (cap. 5) y, cuando surja un problema, un árbol de diagnóstico por síntoma: lentitud, tarjeta gráfica ignorada, modelo que lo olvida todo (cap. 14).

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida
Distribución Linux reciente
Ubuntu 22.04+, Fedora 38+, Debian 12+, Arch o derivados. LM Studio ha sido probado en las principales distribuciones, pero el AppImage es portátil y funciona en otros sistemas (openSUSE, Linux Mint, Pop!_OS).
glibc 2.35+
La AppImage incluye sus dependencias gráficas pero no la glibc. Si estás en una distribución muy antigua (CentOS 7, Debian 10), no funcionará.
FUSE
Los AppImage utilizan FUSE para montarse en modo de lectura. La mayoría de las distribuciones lo instalan por defecto. En Ubuntu 22.04+, necesitarás instalar explícitamente el paquete libfuse2.
8 GB de RAM como mínimo
Para ejecutar un modelo de 7B en Q4. 16 GB para trabajar con comodidad, 32 GB o más para los de 14B o para mantener tu IDE abierto al mismo tiempo.
GPU (opcional pero recomendado)
NVIDIA con drivers recientes (CUDA 12+), AMD con ROCm 6.x, o Intel Arc a través de Vulkan. Sin GPU, funciona en CPU — funcional para modelos de 3B, lento para modelos de 7B.
!
Ubuntu 22.04 y FUSE
Ubuntu 22.04 ha dejado de incluir libfuse2 por defecto, lo que impide que funcionen muchas AppImage y provoca un mensaje poco claro del tipo "dlopen(): error loading libfuse.so.2". Instala el paquete con sudo apt install libfuse2 antes de iniciar LM Studio.

#1. Descargar el AppImage

El sitio oficial detecta automáticamente tu sistema operativo y te propone la versión correcta. Asegúrate de descargar desde lmstudio.ai — existen mirrors dudosos.

Sitio oficial
https://lmstudio.ai
  1. 01
    Descarga el archivo .AppImage
    El binario ocupa entre 500 y 700 MB. Incluye llama.cpp, la interfaz Electron y todo el entorno de ejecución. Guárdalo en ~/Applications/ o ~/.local/bin/ por convención; en realidad, puedes guardarlo en cualquier lugar, ya que el AppImage es autocontenido.
  2. 02
    Hazlo ejecutable
    Con el comando chmod +x. Sin eso, el archivo es simplemente un archivo comprimido inerte.
  3. 03
    Lancez-le
    Abrirlo con un doble clic desde tu gestor de archivos o desde la línea de comandos. Al iniciarse por primera vez, LM Studio extrae su contenido en ~/.cache/AppImage/: es normal y solo vuelve a ocurrir con cada actualización.
Instalación rápida en CLI
mkdir -p ~/Applications
cd ~/Applications
# Remplacez le nom par celui du fichier téléchargé
chmod +x LM_Studio-*.AppImage
./LM_Studio-*.AppImage
→
Integrar LM Studio en el menú de aplicaciones
Instala appimaged o AppImageLauncher: estas herramientas detectan automáticamente los AppImage en ~/Applications/ y crean entradas .desktop para verlos en tu menú, como una aplicación nativa. AppImageLauncher gestiona incluso las actualizaciones.

#2. Primera ejecución

Al iniciar por primera vez, LM Studio pide elegir un nivel de interfaz: User (solo chat), Power User (chat + ajustes), Developer (todo, incluido el servidor). Power User basta para explorar; más adelante podrás pasar a Developer para usar el servidor local, desde Settings → UI Mode.

La barra lateral izquierda organiza las vistas:

Chat
La interfaz principal, tipo ChatGPT. Es la que usarás el 90 % del tiempo.
Discover
La tienda de modelos. Búsqueda en directo en Hugging Face, con un indicador de compatibilidad con el hardware (Full GPU Offload / Partial / Likely too large) basado en tu VRAM detectada.
My Models
Todos tus modelos descargados, con sus tamaños y sus cuantizaciones. Útil para hacer limpieza.
Developer
Servidor local compatible con OpenAI. Visible únicamente en modo Power User o Developer.

#3. Descargar un modelo GGUF

LM Studio solo lee el formato GGUF (el formato binario de llama.cpp, sucesor de GGML). Si un modelo existe en Hugging Face pero no en GGUF, no podrás cargarlo directamente. La gran mayoría de los modelos populares (Qwen 3.5, Gemma 4, Mistral, Granite 4.2, DeepSeek, gpt-oss) tienen versiones GGUF mantenidas por la comunidad.

  1. 01
    Abre Discover y busca un modelo
    Para una primera prueba, escribe Qwen 3.5 9B o Granite 4.2 8B: las apuestas seguras de 2026 para el rango de 6 a 8 GB de VRAM. LM Studio lista las variantes GGUF disponibles, generalmente publicadas por bartowski, unsloth o lmstudio-community.
  2. 02
    Lee las etiquetas de compatibilidad
    A la derecha de cada variante, un indicador verde/naranja/rojo: Full GPU Offload significa que el modelo cabe entero en tu VRAM. Partial = una parte irá a la RAM (más lento). Likely too large = olvídalo.
  3. 03
    Elige la cuantización
    Q4_K_M es el punto ideal para la mayoría de los casos (baja pérdida de calidad, ~50 % del tamaño de FP16). Q5_K_M si tienes entre 30 y 40 % más de VRAM. Q8_0 para la calidad máxima si tienes mucho espacio disponible. FP16 solo para fine-tuning o comparación.
  4. 04
    Haz clic en Download
    Entre 4 y 8 GB para un 7B según la cuantización. La descarga se realiza en segundo plano, puedes iniciar varias al mismo tiempo.
→
Dónde se almacenan los modelos
Por defecto, LM Studio guarda los modelos en ~/.cache/lm-studio/models/. En Linux, esta carpeta puede crecer rápidamente (50-200 GB con unos pocos modelos). Si tu /home está en un SSD pequeño, mueve la carpeta a un disco más grande desde Settings → Model Directory.

Una vez descargado el modelo, vuelve a Chat, selecciónalo en el menú desplegable de la parte superior, ajusta el deslizador GPU offload al máximo disponible y haz clic en Load model. La carga tarda entre 5 y 30 segundos según el tamaño y la velocidad del disco.

#4. Iniciar el servidor local en el puerto 1234

Es ahí donde LM Studio va más allá de un simple chat gráfico. La pestaña Developer expone un servidor HTTP que utiliza exactamente el mismo protocolo que la API de OpenAI. Cualquier cliente de OpenAI (openai-python, LangChain, LlamaIndex, Continue.dev) puede acceder a él sin modificaciones, simplemente cambiando la URL base.

  1. 01
    Pasa al modo Developer
    Settings → UI Mode → Developer. La pestaña Developer (icono de terminal) aparece en la barra lateral.
  2. 02
    Selecciona un modelo
    Menú en la parte superior de la pestaña Developer. El modelo debe estar ya descargado. Puedes cargar varios simultáneamente si la VRAM lo permite.
  3. 03
    Ajusta Context Length y GPU Offload
    Configura GPU Offload al máximo mientras la VRAM lo permita. El valor predeterminado de Context Length, 4096, basta para la mayoría de los usos; auméntalo a 8192 o 16384 para RAG o documentos largos.
  4. 04
    Haz clic en Start Server
    El servidor escucha por defecto en 127.0.0.1:1234. El puerto se puede configurar justo al lado si el 1234 ya está en uso.
Probar el servidor
# Liste des modèles chargés
curl http://localhost:1234/v1/models

# Une complétion chat minimale
curl http://localhost:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "local-model",
    "messages": [
      {"role":"user","content":"Capitale de l'\''Italie ?"}
    ],
    "temperature": 0.2
  }'

En Python, un cliente oficial de OpenAI basta. La clave API puede ser cualquier cadena — LM Studio no la verifica.

Cliente Python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # placeholder, non vérifié
)

resp = client.chat.completions.create(
    model="local-model",
    messages=[
        {"role": "system", "content": "Tu réponds en une phrase."},
        {"role": "user",   "content": "Qu'est-ce qu'un GGUF ?"},
    ],
    stream=True,
)

for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="", flush=True)
i
Logs en tiempo real
La pestaña Developer muestra los Server Logs en tiempo real: cada solicitud entrante, el tiempo de generación, el número de tokens. Es esencial para depurar una integración.

Para exponer el servidor en la LAN (otros ordenadores del equipo), cambia Host de 127.0.0.1 a 0.0.0.0 en los ajustes del servidor. Atención: LM Studio no tiene ninguna autenticación nativa. En una red compartida, coloca Caddy o Nginx con autenticación básica delante del servidor, o restringe el acceso mediante el cortafuegos.

#5. Aceleración GPU bajo Linux

Es el aspecto de LM Studio en Linux que más problemas puede dar. El AppImage incluye varios backends (CPU, CUDA, ROCm, Vulkan) y selecciona uno automáticamente al iniciarse, pero la detección automática a veces se equivoca según los controladores instalados.

NVIDIA (CUDA)
Controladores propietarios 535+ instalados (nvidia-smi debe funcionar). CUDA 12.x está incluido en la AppImage, no es necesario instalarlo por separado. Comprueba en Settings → Hardware que la GPU aparezca en la lista y que el backend sea CUDA.
AMD (ROCm)
Controladores ROCm 6.x instalados en el equipo anfitrión (Radeon RX 6800 XT y modelos más recientes con soporte oficial; RX 6700 XT y RX 7600 suelen funcionar con HSA_OVERRIDE_GFX_VERSION). Tu usuario debe pertenecer a los grupos render y video.
Intel Arc / iGPU
Backend Vulkan, rendimiento aceptable en Arc A770/A750, pero inferior al de NVIDIA/AMD. Instala vulkan-tools para comprobar con vulkaninfo que se detecta la GPU.
Sin GPU
Uso automático de la CPU como alternativa. Para un Granite 4.2 8B Q4 en un Ryzen 7, espera entre 5 y 8 tokens/segundo. Un modelo de 3B como Qwen 3.5 2B o Granite 4.2 3B sigue siendo muy utilizable. Por encima de 14B, la paciencia se vuelve un problema.

El deslizador GPU offload en Chat o Developer controla cuántas capas del modelo se cargan en la GPU. Ponlo al máximo mientras la VRAM lo permita. Verifica el consumo real en un terminal:

Monitorear la VRAM
# NVIDIA
nvidia-smi -l 1

# AMD (radeontop ou rocm-smi)
rocm-smi --showmeminfo vram
Valores orientativos de VRAM por tamaño de modelo (Q4)
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Estos valores aumentan un poco si incrementas la longitud del contexto por encima de 4096.
Referencias de GPU
La RTX 3060 de 12 GB cubre cómodamente los modelos de 7B a 14B. La RTX 4070 de 12 GB: lo mismo, con margen. La RTX 4080 de 16 GB: 14B en Q5 y los primeros modelos de 24B. La RTX 4090 de 24 GB: los modelos de 32B en Q4 y los de 70B en Q3. El Mac M4 Pro con 24–48 GB de memoria unificada: lo mismo en Apple Silicon, pero a través de la versión de LM Studio para macOS.
!
La trampa del cambio silencioso a la CPU
Si la VRAM es insuficiente para el modelo con la longitud de contexto solicitada, LM Studio traslada algunas capas a la RAM sin indicarlo siempre con claridad. Obtienes 2-5 tokens/seg en lugar de 40+. Revisa Settings → Hardware o nvidia-smi durante la generación: si la VRAM no está saturada, es que parte de la ejecución se realiza en la CPU.

#Errores frecuentes

El AppImage no se inicia
Inícialo desde un terminal para ver el mensaje de error. El más común: falta libfuse2 en Ubuntu 22.04+ (sudo apt install libfuse2 resuelve el problema). Después: glibc demasiado antigua (LM Studio requiere 2.35+, por lo que CentOS 7 y Debian 10 quedan descartados).
La tarjeta gráfica no se utiliza
Verifica nvidia-smi (o rocm-smi). Si la tarjeta gráfica no aparece: drivers ausentes o demasiado antiguos. Si aparece pero LM Studio sigue en CPU: en Settings → Hardware se puede forzar el backend (CUDA/ROCm/Vulkan). En AMD, el usuario debe estar en los grupos render y video — sal y vuelve a conectarte después del usermod.
El modelo es lento a pesar de la GPU
VRAM saturada y offload parcial silencioso. Reduce la longitud del contexto, baja el deslizador de GPU offload para medir el umbral o elige una cuantización más agresiva (Q5 → Q4 → Q3).
Puerto 1234 ya ocupado
A menudo está ocupado por otro servicio de desarrollo. Cambia el puerto en Developer → Settings o termina el proceso: ss -tulpn | grep 1234. No es necesario tocar el firewall para usar localhost.
Actualizaciones automáticas que rompen la compatibilidad
LM Studio se actualiza automáticamente por defecto. En entornos controlados (empresa, integración CI/CD), desactiva las actualizaciones automáticas en Settings → Updates. Anota el número de versión que funciona para poder volver atrás si es necesario.
Sin autocompletado en CLI
El AppImage no ofrece una CLI con muchas funciones. Para tareas avanzadas de scripting, la API HTTP del servidor (puerto 1234) sigue siendo la opción adecuada. Si necesitas una CLI de verdad, llama.cpp o Ollama son más adecuados.

#Para ir más allá

Tienes LM Studio instalado, un GGUF cargado y un servidor compatible con OpenAI en funcionamiento. Los siguientes pasos naturales son:

Aprovechar a fondo el servidor API
La guía Convertir LM Studio en un servidor API detalla el streaming, la ejecución de varios modelos en paralelo, el acceso seguro desde la LAN y los ajustes de rendimiento.
Comparar con Ollama en Linux
La guía Instalar Ollama en Linux cubre la otra pila de software popular, más orientada a funcionar como daemon o servidor. Para muchos, la combinación Ollama (daemon) + LM Studio (como interfaz cliente sobre Ollama) es la ideal.
Elegir la cuantización adecuada
La guía Elegir la cuantización (Q4, Q5, Q8, FP16) compara visualmente las pérdidas de calidad reales y ayuda a decidir entre calidad y VRAM, especialmente útil cuando descargas tus propios GGUF.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.