LM Studio en Linux: Ubuntu, Debian, Arch, Fedora (2026)
LM Studio en Linux es una AppImage de ~600 MB que incluye una interfaz gráfica, una tienda de modelos conectada a Hugging Face, un motor de inferencia llama.cpp y un servidor compatible con OpenAI. No requiere instalación en el sistema, ni un demonio, ni añadir un repositorio: un archivo ejecutable y listo. Esta guía cubre la instalación, la descarga de un GGUF, el inicio del servidor local y los problemas específicos de Linux (permisos, FUSE, GPU).
#¿Por qué LM Studio en Linux?
En Linux, la solución habitual para un LLM local es Ollama: demonio systemd, interfaz de línea de comandos clara, escucha por defecto en localhost:11434. Es excelente para el servidor. LM Studio aborda otro enfoque: el de la estación de trabajo con interfaz gráfica.
- Una interfaz completa sin terminal
- Chat, navegador de modelos Hugging Face, gestor de descargas, ajustes de sampling: todo en interfaz gráfica. Útil si quieres probar rápidamente varios modelos antes de pasar a producción.
- Un servidor compatible con OpenAI en un clic
- La pestaña Developer ofrece un endpoint en http://localhost:1234/v1 que utiliza el protocolo OpenAI. Cualquier SDK (openai-python, LangChain, Continue.dev) puede conectarse a él sin cambiar una línea.
- Sin instalación a nivel del sistema
- La AppImage funciona en el espacio de usuario. No hace falta sudo, ni instalar paquetes, ni añadir repositorios de terceros. Para equipos con restricciones impuestas por el departamento de TI o distribuciones atípicas, resulta muy útil.
- Formato GGUF nativo
- LM Studio solo lee GGUF (el formato de llama.cpp). Es el mismo formato que utiliza Ollama internamente, por lo que el 100 % de los modelos populares están disponibles.
#Prerrequisitos
LM Studio funciona en tu Linux. El kit de IA local toma el relevo: los ajustes avanzados de LM Studio (cap. 5) y, cuando surja un problema, un árbol de diagnóstico por síntoma: lentitud, tarjeta gráfica ignorada, modelo que lo olvida todo (cap. 14).
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
- Distribución Linux reciente
- Ubuntu 22.04+, Fedora 38+, Debian 12+, Arch o derivados. LM Studio ha sido probado en las principales distribuciones, pero el AppImage es portátil y funciona en otros sistemas (openSUSE, Linux Mint, Pop!_OS).
- glibc 2.35+
- La AppImage incluye sus dependencias gráficas pero no la glibc. Si estás en una distribución muy antigua (CentOS 7, Debian 10), no funcionará.
- FUSE
- Los AppImage utilizan FUSE para montarse en modo de lectura. La mayoría de las distribuciones lo instalan por defecto. En Ubuntu 22.04+, necesitarás instalar explícitamente el paquete libfuse2.
- 8 GB de RAM como mínimo
- Para ejecutar un modelo de 7B en Q4. 16 GB para trabajar con comodidad, 32 GB o más para los de 14B o para mantener tu IDE abierto al mismo tiempo.
- GPU (opcional pero recomendado)
- NVIDIA con drivers recientes (CUDA 12+), AMD con ROCm 6.x, o Intel Arc a través de Vulkan. Sin GPU, funciona en CPU — funcional para modelos de 3B, lento para modelos de 7B.
#1. Descargar el AppImage
El sitio oficial detecta automáticamente tu sistema operativo y te propone la versión correcta. Asegúrate de descargar desde lmstudio.ai — existen mirrors dudosos.
- 01Descarga el archivo .AppImageEl binario ocupa entre 500 y 700 MB. Incluye llama.cpp, la interfaz Electron y todo el entorno de ejecución. Guárdalo en ~/Applications/ o ~/.local/bin/ por convención; en realidad, puedes guardarlo en cualquier lugar, ya que el AppImage es autocontenido.
- 02Hazlo ejecutableCon el comando chmod +x. Sin eso, el archivo es simplemente un archivo comprimido inerte.
- 03Lancez-leAbrirlo con un doble clic desde tu gestor de archivos o desde la línea de comandos. Al iniciarse por primera vez, LM Studio extrae su contenido en ~/.cache/AppImage/: es normal y solo vuelve a ocurrir con cada actualización.
#2. Primera ejecución
Al iniciar por primera vez, LM Studio pide elegir un nivel de interfaz: User (solo chat), Power User (chat + ajustes), Developer (todo, incluido el servidor). Power User basta para explorar; más adelante podrás pasar a Developer para usar el servidor local, desde Settings → UI Mode.
La barra lateral izquierda organiza las vistas:
- Chat
- La interfaz principal, tipo ChatGPT. Es la que usarás el 90 % del tiempo.
- Discover
- La tienda de modelos. Búsqueda en directo en Hugging Face, con un indicador de compatibilidad con el hardware (Full GPU Offload / Partial / Likely too large) basado en tu VRAM detectada.
- My Models
- Todos tus modelos descargados, con sus tamaños y sus cuantizaciones. Útil para hacer limpieza.
- Developer
- Servidor local compatible con OpenAI. Visible únicamente en modo Power User o Developer.
#3. Descargar un modelo GGUF
LM Studio solo lee el formato GGUF (el formato binario de llama.cpp, sucesor de GGML). Si un modelo existe en Hugging Face pero no en GGUF, no podrás cargarlo directamente. La gran mayoría de los modelos populares (Qwen 3.5, Gemma 4, Mistral, Granite 4.2, DeepSeek, gpt-oss) tienen versiones GGUF mantenidas por la comunidad.
- 01Abre Discover y busca un modeloPara una primera prueba, escribe Qwen 3.5 9B o Granite 4.2 8B: las apuestas seguras de 2026 para el rango de 6 a 8 GB de VRAM. LM Studio lista las variantes GGUF disponibles, generalmente publicadas por bartowski, unsloth o lmstudio-community.
- 02Lee las etiquetas de compatibilidadA la derecha de cada variante, un indicador verde/naranja/rojo: Full GPU Offload significa que el modelo cabe entero en tu VRAM. Partial = una parte irá a la RAM (más lento). Likely too large = olvídalo.
- 03Elige la cuantizaciónQ4_K_M es el punto ideal para la mayoría de los casos (baja pérdida de calidad, ~50 % del tamaño de FP16). Q5_K_M si tienes entre 30 y 40 % más de VRAM. Q8_0 para la calidad máxima si tienes mucho espacio disponible. FP16 solo para fine-tuning o comparación.
- 04Haz clic en DownloadEntre 4 y 8 GB para un 7B según la cuantización. La descarga se realiza en segundo plano, puedes iniciar varias al mismo tiempo.
Una vez descargado el modelo, vuelve a Chat, selecciónalo en el menú desplegable de la parte superior, ajusta el deslizador GPU offload al máximo disponible y haz clic en Load model. La carga tarda entre 5 y 30 segundos según el tamaño y la velocidad del disco.
#4. Iniciar el servidor local en el puerto 1234
Es ahí donde LM Studio va más allá de un simple chat gráfico. La pestaña Developer expone un servidor HTTP que utiliza exactamente el mismo protocolo que la API de OpenAI. Cualquier cliente de OpenAI (openai-python, LangChain, LlamaIndex, Continue.dev) puede acceder a él sin modificaciones, simplemente cambiando la URL base.
- 01Pasa al modo DeveloperSettings → UI Mode → Developer. La pestaña Developer (icono de terminal) aparece en la barra lateral.
- 02Selecciona un modeloMenú en la parte superior de la pestaña Developer. El modelo debe estar ya descargado. Puedes cargar varios simultáneamente si la VRAM lo permite.
- 03Ajusta Context Length y GPU OffloadConfigura GPU Offload al máximo mientras la VRAM lo permita. El valor predeterminado de Context Length, 4096, basta para la mayoría de los usos; auméntalo a 8192 o 16384 para RAG o documentos largos.
- 04Haz clic en Start ServerEl servidor escucha por defecto en 127.0.0.1:1234. El puerto se puede configurar justo al lado si el 1234 ya está en uso.
En Python, un cliente oficial de OpenAI basta. La clave API puede ser cualquier cadena — LM Studio no la verifica.
Para exponer el servidor en la LAN (otros ordenadores del equipo), cambia Host de 127.0.0.1 a 0.0.0.0 en los ajustes del servidor. Atención: LM Studio no tiene ninguna autenticación nativa. En una red compartida, coloca Caddy o Nginx con autenticación básica delante del servidor, o restringe el acceso mediante el cortafuegos.
#5. Aceleración GPU bajo Linux
Es el aspecto de LM Studio en Linux que más problemas puede dar. El AppImage incluye varios backends (CPU, CUDA, ROCm, Vulkan) y selecciona uno automáticamente al iniciarse, pero la detección automática a veces se equivoca según los controladores instalados.
- NVIDIA (CUDA)
- Controladores propietarios 535+ instalados (nvidia-smi debe funcionar). CUDA 12.x está incluido en la AppImage, no es necesario instalarlo por separado. Comprueba en Settings → Hardware que la GPU aparezca en la lista y que el backend sea CUDA.
- AMD (ROCm)
- Controladores ROCm 6.x instalados en el equipo anfitrión (Radeon RX 6800 XT y modelos más recientes con soporte oficial; RX 6700 XT y RX 7600 suelen funcionar con HSA_OVERRIDE_GFX_VERSION). Tu usuario debe pertenecer a los grupos render y video.
- Intel Arc / iGPU
- Backend Vulkan, rendimiento aceptable en Arc A770/A750, pero inferior al de NVIDIA/AMD. Instala vulkan-tools para comprobar con vulkaninfo que se detecta la GPU.
- Sin GPU
- Uso automático de la CPU como alternativa. Para un Granite 4.2 8B Q4 en un Ryzen 7, espera entre 5 y 8 tokens/segundo. Un modelo de 3B como Qwen 3.5 2B o Granite 4.2 3B sigue siendo muy utilizable. Por encima de 14B, la paciencia se vuelve un problema.
El deslizador GPU offload en Chat o Developer controla cuántas capas del modelo se cargan en la GPU. Ponlo al máximo mientras la VRAM lo permita. Verifica el consumo real en un terminal:
- Valores orientativos de VRAM por tamaño de modelo (Q4)
- 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Estos valores aumentan un poco si incrementas la longitud del contexto por encima de 4096.
- Referencias de GPU
- La RTX 3060 de 12 GB cubre cómodamente los modelos de 7B a 14B. La RTX 4070 de 12 GB: lo mismo, con margen. La RTX 4080 de 16 GB: 14B en Q5 y los primeros modelos de 24B. La RTX 4090 de 24 GB: los modelos de 32B en Q4 y los de 70B en Q3. El Mac M4 Pro con 24–48 GB de memoria unificada: lo mismo en Apple Silicon, pero a través de la versión de LM Studio para macOS.
#Errores frecuentes
- El AppImage no se inicia
- Inícialo desde un terminal para ver el mensaje de error. El más común: falta libfuse2 en Ubuntu 22.04+ (sudo apt install libfuse2 resuelve el problema). Después: glibc demasiado antigua (LM Studio requiere 2.35+, por lo que CentOS 7 y Debian 10 quedan descartados).
- La tarjeta gráfica no se utiliza
- Verifica nvidia-smi (o rocm-smi). Si la tarjeta gráfica no aparece: drivers ausentes o demasiado antiguos. Si aparece pero LM Studio sigue en CPU: en Settings → Hardware se puede forzar el backend (CUDA/ROCm/Vulkan). En AMD, el usuario debe estar en los grupos render y video — sal y vuelve a conectarte después del usermod.
- El modelo es lento a pesar de la GPU
- VRAM saturada y offload parcial silencioso. Reduce la longitud del contexto, baja el deslizador de GPU offload para medir el umbral o elige una cuantización más agresiva (Q5 → Q4 → Q3).
- Puerto 1234 ya ocupado
- A menudo está ocupado por otro servicio de desarrollo. Cambia el puerto en Developer → Settings o termina el proceso: ss -tulpn | grep 1234. No es necesario tocar el firewall para usar localhost.
- Actualizaciones automáticas que rompen la compatibilidad
- LM Studio se actualiza automáticamente por defecto. En entornos controlados (empresa, integración CI/CD), desactiva las actualizaciones automáticas en Settings → Updates. Anota el número de versión que funciona para poder volver atrás si es necesario.
- Sin autocompletado en CLI
- El AppImage no ofrece una CLI con muchas funciones. Para tareas avanzadas de scripting, la API HTTP del servidor (puerto 1234) sigue siendo la opción adecuada. Si necesitas una CLI de verdad, llama.cpp o Ollama son más adecuados.
#Para ir más allá
Tienes LM Studio instalado, un GGUF cargado y un servidor compatible con OpenAI en funcionamiento. Los siguientes pasos naturales son:
- Aprovechar a fondo el servidor API
- La guía Convertir LM Studio en un servidor API detalla el streaming, la ejecución de varios modelos en paralelo, el acceso seguro desde la LAN y los ajustes de rendimiento.
- Comparar con Ollama en Linux
- La guía Instalar Ollama en Linux cubre la otra pila de software popular, más orientada a funcionar como daemon o servidor. Para muchos, la combinación Ollama (daemon) + LM Studio (como interfaz cliente sobre Ollama) es la ideal.
- Elegir la cuantización adecuada
- La guía Elegir la cuantización (Q4, Q5, Q8, FP16) compara visualmente las pérdidas de calidad reales y ayuda a decidir entre calidad y VRAM, especialmente útil cuando descargas tus propios GGUF.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.