LM Studio : tutorial completo 2026 (instalación, API)
LM Studio es una app de escritorio que convierte tu máquina en un servidor local de LLM sin tocar el terminal. La versión 0.3+ añade soporte de MCP, un mejor motor GGUF y una experiencia de descarga de modelos directamente desde Hugging Face. Aquí tienes un tutorial LM Studio 2026 completo: instalación en los tres sistemas operativos, primer modelo, servidor compatible con OpenAI en el puerto 1234, y comparación honesta con Ollama y Jan.
#Primer resultado: descarga, carga, verificación
La documentación oficial describe el proceso Discover → descarga → Chat → carga del modelo. Elige el archivo para tu motor: GGUF para llama.cpp, o una distribución MLX compatible en Apple Silicon. Un modelo descargado no está aún cargado. Comienza con un contexto corto, luego plantea una pregunta sencilla antes de añadir documentos o un servidor API.
En caso de memoria insuficiente, reduce el contexto y elige un archivo más pequeño; controla el offload GPU. El modelo y el contexto comparten el presupuesto con el sistema en Apple Silicon. Las instrucciones para Windows/macOS se revisan en la documentación; el directorio del 12 de septiembre se ejecutó bajo Linux con Ollama, no con LM Studio.
- Guía oficial de primeros pasos
- Parámetros oficiales de carga
- Verificar el presupuesto de memoria
- Ficha de Qwen3 8B
- Elige un primer recorrido gratuito
#¿Por qué LM Studio en 2026?
LM Studio está instalado y tu primer modelo responde. Los siguientes pasos están en el kit de IA Local: elegir el modelo adecuado para tu máquina (cap. 3), sacar más partido a LM Studio (cap. 5) y luego hacer que lea tus propios documentos (cap. 8).
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
LM Studio ocupa un nicho concreto: el usuario que quiere una aplicación gráfica de verdad, no un daemon de línea de comandos. Abres la aplicación, buscas un modelo en la barra de búsqueda integrada (que apunta a Hugging Face), haces clic en Download y chateas. Ningún archivo de configuración, ninguna línea de comandos.
Bajo el capó, LM Studio incluye llama.cpp con soporte para CUDA, Metal, Vulkan y ROCm, así como un motor MLX dedicado a los Mac con Apple Silicon. La versión 0.3 incorporó la pantalla «Power User» para mostrar todos los parámetros (tipo de caché KV, flash attention, offload a la GPU capa por capa), y la 0.3.x añadió soporte nativo para servidores MCP: puedes conectar tu modelo local a herramientas como un sistema de archivos o una base de datos, sin programar.
#Prerrequisitos
- Windows
- Windows 10/11 de 64 bits. Se requiere AVX2 (todas las CPU desde 2014). Compatibilidad con CUDA si la GPU es NVIDIA; con Vulkan en caso contrario.
- macOS
- macOS 13.4+ en Apple Silicon (M1/M2/M3/M4). Los Mac Intel dejaron de contar con soporte a partir de la versión 0.3.
- Linux
- AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch reciente). Build ARM64 disponible para SBC.
- RAM
- 16 GB como mínimo para un uso cómodo; 8 GB son justos. Para un modelo de 14B en Q4, prevé 12 GB libres; para uno de 32B, 24 GB.
- Disco
- Calcula entre 30 y 50 GB: un modelo de 14B en Q4 pesa aproximadamente 9 GB, y descargarás varios.
#1. Instalación en Windows, Mac y Linux
Descarga el instalador correspondiente a tu sistema operativo desde el sitio oficial. Sin paquetes npm ni Homebrew: es una aplicación de escritorio convencional.
- 01WindowsEjecuta LM-Studio-Setup.exe. SmartScreen puede bloquear el binario al iniciarlo por primera vez: haz clic en «Más información» y luego en «Ejecutar de todas formas». La aplicación se instala en %LOCALAPPDATA%\Programs\lm-studio.
- 02macOSAbre el .dmg y arrastra LM Studio.app a /Applications. Al abrir la aplicación por primera vez, Gatekeeper puede pedirte que la autorices en Ajustes → Privacidad y seguridad. En Apple Silicon, el motor MLX está activado por defecto.
- 03LinuxDescarga el AppImage, hazlo ejecutable con chmod +x LM_Studio-0.3.x.AppImage y luego ejecútalo. Para integrarlo en el menú, utiliza AppImageLauncher o crea un archivo .desktop manualmente.
#2. Descargar Qwen3-Coder en GGUF
La pestaña Discover (lupa) es tu interfaz con Hugging Face. Escribe el nombre de un modelo, elige una cuantización y haz clic en Download. Para este tutorial usamos Qwen3-Coder-30B-A3B, el modelo de referencia para programación con pesos abiertos para quienes tienen 16 GB de VRAM o más.
- 01Buscar el modeloEn Discover, escribe "qwen3-coder". LM Studio muestra los repositorios GGUF compatibles (generalmente bartowski, unsloth, lmstudio-community). Prefiere los repositorios lmstudio-community o bartowski: sus GGUF han sido validados para la versión actual del motor.
- 02Elegir la cuantizaciónPara 24 GB de VRAM, Q4_K_M es el punto ideal (calidad ~99% del FP16, tamaño ~17 GB). Para 16 GB, baja a Q3_K_M. Para 32 GB o Mac Studio, Q5_K_M o Q8_0 si se quiere precisión máxima.
- 03Iniciar descargaHaz clic en Download. El progreso se muestra en la pestaña Downloads. Con una conexión de fibra, calcula unos 5 minutos para un archivo de 17 GB.
- 04Cargar el modeloVe a la pestaña Chat, abre el selector de la parte superior y elige Qwen3-Coder. Si estás en el modo Power User, ajusta GPU Offload (por defecto, LM Studio usa el valor máximo seguro), Context Length (32k es una longitud cómoda para trabajar con código) y activa Flash Attention.
#3. Primer chat y verificación de la GPU
Con el modelo cargado, haz una pregunta en Chat. LM Studio muestra al final de cada respuesta los tokens/segundo, el tiempo de primer token y el uso real de VRAM. Es más claro que ejecutar nvidia-smi paralelamente.
En una RTX 4090, Qwen3-Coder-30B-A3B en Q4 alcanza alrededor de 90-120 tok/s gracias a su arquitectura MoE (3B activos de un total de 30B). En un M4 Pro de 48 GB, puedes esperar 35-50 tok/s con el motor MLX. En una RTX 3060 de 12 GB, el modelo de 30B no cabe: cambia a Qwen 3.5 9B (~6,6 GB en Q4), que cabe holgadamente y deja margen para el contexto.
#4. Servidor compatible con OpenAI en el puerto 1234
Es la ventaja que muchos no conocen: LM Studio expone un servidor HTTP compatible con la API de OpenAI, por defecto en http://localhost:1234. Puedes conectar cualquier cliente de OpenAI (SDK de Python, LangChain, Continue.dev, Cursor, tu propia aplicación) a LM Studio sin cambiar una sola línea de la lógica de negocio, solo la URL base y la clave.
- 01Activar Developer ModeEn la esquina inferior izquierda, cambia el rol de usuario a "Developer". La pestaña Local Server (icono de terminal) aparece en la barra de la izquierda.
- 02Iniciar el servidorPestaña Local Server → elige el modelo que quieres exponer en el menú superior → haz clic en Start Server. Por defecto, el servidor escucha en localhost:1234. Marca "Serve on Local Network" si quieres exponerlo a las demás máquinas de tu LAN.
- 03Verificar el endpointEl servidor expone las rutas /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (si hay un modelo de embeddings cargado). Prueba primero la lista de modelos.
#5. Soporte nativo de MCP
Desde la 0.3.17, LM Studio soporta el Protocolo de Contexto de Modelo (MCP) — el estándar introducido por Anthropic en 2024 para conectar herramientas externas a un LLM. Concretamente: tu modelo local puede acceder a tu sistema de archivos, ejecutar SQL, llamar a una API, siempre que se configure un servidor MCP.
La configuración se realiza en el archivo mcp.json, accesible desde el menú Program → Edit mcp.json. Aquí tienes un ejemplo que añade el servidor filesystem oficial de Anthropic y un servidor SQLite.
Una vez registrado, las herramientas MCP aparecen en el icono de enchufe (plug) del chat. Puedes activarlas cuando las necesites. El modelo decide después cuándo llamarlas: resulta útil para crear un pequeño agente local sin programar, por ejemplo, «resume todos los PDF de la carpeta Recherche» o «cuántas filas hay en la tabla users».
#LM Studio vs Ollama vs Jan
Las tres herramientas persiguen el mismo objetivo (LLM en local sin nube), con filosofías diferentes.
- LM Studio
- Aplicación de escritorio con muchas funciones, búsqueda HF integrada, servidor API en el puerto :1234, soporte MCP, MLX en Mac. De código cerrado, pero gratuita. Ideal si quieres una solución todo en uno con una interfaz gráfica sólida.
- Ollama
- Daemon ligero + CLI, escucha en :11434, enorme biblioteca de modelos preconfigurados (ollama run qwen3.5:9b), API estable, integraciones por todas partes (Cline, Open WebUI, n8n). De código abierto. Ideal si te sientes cómodo en el terminal y quieres usarlo sin interfaz gráfica.
- Jan
- Aplicación de escritorio de código abierto (AGPL), con una filosofía radical de dar prioridad al funcionamiento sin conexión, más reciente y con menos funciones que LM Studio. Una opción interesante si te importa el código abierto y quieres una aplicación de escritorio.
#Solución de problemas
- El modelo no se carga (OOM)
- Reduce manualmente el GPU Offload en los Settings del chat. Si cargas el 100 % en la GPU y falla, baja al 80 %: algunas capas pasan a la RAM; es más lento, pero funciona.
- Muy pocos tokens por segundo
- Comprueba que Flash Attention esté activado y que KV cache type esté en Q8_0 (no FP16). En modo Power User, estos ajustes están en la barra lateral derecha del chat.
- El servidor API no responde
- Confirma que estás en Developer Mode y que el botón Start Server está verde. En Windows, el cortafuegos puede bloquear el puerto 1234: autoriza LM Studio en el cortafuegos de Windows Defender.
- Modelo no encontrado en la búsqueda
- LM Studio solo muestra los repositorios GGUF compatibles con su versión de llama.cpp. Para los modelos muy recientes, actualiza LM Studio (Help → Check for Updates) o descarga el GGUF manualmente y colócalo en la carpeta models.
- Linux: AppImage no se inicia
- Instala libfuse2 (sudo apt install libfuse2 en Ubuntu 22.04+). En Wayland, exporta QT_QPA_PLATFORM=xcb si la aplicación no se muestra correctamente.
#Para ir más allá
Tres opciones naturales según lo que quieras hacer a continuación:
- Comparar más en detalle
- La guía « LM Studio vs Ollama : ¿cuál elegir en 2026? » compara característica por característica, con una tabla de decisión según tu perfil.
- Conectar LM Studio a tus PDF
- «RAG local con LM Studio: hablar con tus documentos» explica la función Chat with Documents, sus limitaciones y cuándo pasar a AnythingLLM.
- Acelerar aún más la inferencia
- «LM Studio y el MTP (Multi-Token Prediction)» detalla cómo activar el MTP en los modelos compatibles para aumentar el rendimiento entre un 30 y un 80 % en términos de tokens por segundo.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.