Principiante 12 minInterfaces

LM Studio : tutorial completo 2026 (instalación, API)

LM Studio es una app de escritorio que convierte tu máquina en un servidor local de LLM sin tocar el terminal. La versión 0.3+ añade soporte de MCP, un mejor motor GGUF y una experiencia de descarga de modelos directamente desde Hugging Face. Aquí tienes un tutorial LM Studio 2026 completo: instalación en los tres sistemas operativos, primer modelo, servidor compatible con OpenAI en el puerto 1234, y comparación honesta con Ollama y Jan.

Por Mohamed Meguedmi·Actualización 2026-09-12·Probado en Windows 11

#Primer resultado: descarga, carga, verificación

La documentación oficial describe el proceso Discover → descarga → Chat → carga del modelo. Elige el archivo para tu motor: GGUF para llama.cpp, o una distribución MLX compatible en Apple Silicon. Un modelo descargado no está aún cargado. Comienza con un contexto corto, luego plantea una pregunta sencilla antes de añadir documentos o un servidor API.

En caso de memoria insuficiente, reduce el contexto y elige un archivo más pequeño; controla el offload GPU. El modelo y el contexto comparten el presupuesto con el sistema en Apple Silicon. Las instrucciones para Windows/macOS se revisan en la documentación; el directorio del 12 de septiembre se ejecutó bajo Linux con Ollama, no con LM Studio.

Verificar los modelos instalados y estimar la carga
lms ls
# Remplacer MODEL_KEY par une clé réellement affichée :
lms load MODEL_KEY --context-length 4096 --estimate-only

#¿Por qué LM Studio en 2026?

El kit IA Local

LM Studio está instalado y tu primer modelo responde. Los siguientes pasos están en el kit de IA Local: elegir el modelo adecuado para tu máquina (cap. 3), sacar más partido a LM Studio (cap. 5) y luego hacer que lea tus propios documentos (cap. 8).

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

LM Studio ocupa un nicho concreto: el usuario que quiere una aplicación gráfica de verdad, no un daemon de línea de comandos. Abres la aplicación, buscas un modelo en la barra de búsqueda integrada (que apunta a Hugging Face), haces clic en Download y chateas. Ningún archivo de configuración, ninguna línea de comandos.

Bajo el capó, LM Studio incluye llama.cpp con soporte para CUDA, Metal, Vulkan y ROCm, así como un motor MLX dedicado a los Mac con Apple Silicon. La versión 0.3 incorporó la pantalla «Power User» para mostrar todos los parámetros (tipo de caché KV, flash attention, offload a la GPU capa por capa), y la 0.3.x añadió soporte nativo para servidores MCP: puedes conectar tu modelo local a herramientas como un sistema de archivos o una base de datos, sin programar.

i
Licencia y uso comercial
LM Studio es gratuito para uso personal. Para uso comercial en una empresa, desde la versión 0.3.5 puedes completar por tu cuenta el formulario "LM Studio at Work": es gratuito, pero debes rellenarlo. Por defecto no se envía telemetría del modelo.

#Prerrequisitos

Windows
Windows 10/11 de 64 bits. Se requiere AVX2 (todas las CPU desde 2014). Compatibilidad con CUDA si la GPU es NVIDIA; con Vulkan en caso contrario.
macOS
macOS 13.4+ en Apple Silicon (M1/M2/M3/M4). Los Mac Intel dejaron de contar con soporte a partir de la versión 0.3.
Linux
AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch reciente). Build ARM64 disponible para SBC.
RAM
16 GB como mínimo para un uso cómodo; 8 GB son justos. Para un modelo de 14B en Q4, prevé 12 GB libres; para uno de 32B, 24 GB.
Disco
Calcula entre 30 y 50 GB: un modelo de 14B en Q4 pesa aproximadamente 9 GB, y descargarás varios.

#1. Instalación en Windows, Mac y Linux

Descarga el instalador correspondiente a tu sistema operativo desde el sitio oficial. Sin paquetes npm ni Homebrew: es una aplicación de escritorio convencional.

Sitio oficial
https://lmstudio.ai/download
  1. 01
    Windows
    Ejecuta LM-Studio-Setup.exe. SmartScreen puede bloquear el binario al iniciarlo por primera vez: haz clic en «Más información» y luego en «Ejecutar de todas formas». La aplicación se instala en %LOCALAPPDATA%\Programs\lm-studio.
  2. 02
    macOS
    Abre el .dmg y arrastra LM Studio.app a /Applications. Al abrir la aplicación por primera vez, Gatekeeper puede pedirte que la autorices en Ajustes → Privacidad y seguridad. En Apple Silicon, el motor MLX está activado por defecto.
  3. 03
    Linux
    Descarga el AppImage, hazlo ejecutable con chmod +x LM_Studio-0.3.x.AppImage y luego ejecútalo. Para integrarlo en el menú, utiliza AppImageLauncher o crea un archivo .desktop manualmente.
Linux — primer inicio
chmod +x LM_Studio-0.3.x.AppImage
./LM_Studio-0.3.x.AppImage
→
Onboarding 2026
Al iniciar LM Studio 0.3+ por primera vez, puedes elegir entre los modos «User», «Power User» y «Developer». El modo Power User permite un control detallado (GPU layers, KV cache, flash attention); el modo Developer añade la pestaña Local Server. Empieza en Power User; pasarás a Developer cuando te resulte útil la API del servidor.

#2. Descargar Qwen3-Coder en GGUF

La pestaña Discover (lupa) es tu interfaz con Hugging Face. Escribe el nombre de un modelo, elige una cuantización y haz clic en Download. Para este tutorial usamos Qwen3-Coder-30B-A3B, el modelo de referencia para programación con pesos abiertos para quienes tienen 16 GB de VRAM o más.

  1. 01
    Buscar el modelo
    En Discover, escribe "qwen3-coder". LM Studio muestra los repositorios GGUF compatibles (generalmente bartowski, unsloth, lmstudio-community). Prefiere los repositorios lmstudio-community o bartowski: sus GGUF han sido validados para la versión actual del motor.
  2. 02
    Elegir la cuantización
    Para 24 GB de VRAM, Q4_K_M es el punto ideal (calidad ~99% del FP16, tamaño ~17 GB). Para 16 GB, baja a Q3_K_M. Para 32 GB o Mac Studio, Q5_K_M o Q8_0 si se quiere precisión máxima.
  3. 03
    Iniciar descarga
    Haz clic en Download. El progreso se muestra en la pestaña Downloads. Con una conexión de fibra, calcula unos 5 minutos para un archivo de 17 GB.
  4. 04
    Cargar el modelo
    Ve a la pestaña Chat, abre el selector de la parte superior y elige Qwen3-Coder. Si estás en el modo Power User, ajusta GPU Offload (por defecto, LM Studio usa el valor máximo seguro), Context Length (32k es una longitud cómoda para trabajar con código) y activa Flash Attention.
→
VRAM por tamaño (Q4_K_M)
Referencias rápidas: 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Si LM Studio no permite cargar el modelo completamente en la GPU, pasa a ejecutar parte del modelo en la CPU: es viable, pero entre 5 y 10 veces más lento.

#3. Primer chat y verificación de la GPU

Con el modelo cargado, haz una pregunta en Chat. LM Studio muestra al final de cada respuesta los tokens/segundo, el tiempo de primer token y el uso real de VRAM. Es más claro que ejecutar nvidia-smi paralelamente.

Prueba rápida
# Dans le chat LM Studio :
Écris une fonction Python qui parse un CSV streaming
sans charger tout le fichier en mémoire.

En una RTX 4090, Qwen3-Coder-30B-A3B en Q4 alcanza alrededor de 90-120 tok/s gracias a su arquitectura MoE (3B activos de un total de 30B). En un M4 Pro de 48 GB, puedes esperar 35-50 tok/s con el motor MLX. En una RTX 3060 de 12 GB, el modelo de 30B no cabe: cambia a Qwen 3.5 9B (~6,6 GB en Q4), que cabe holgadamente y deja margen para el contexto.

i
Modo "Just Show Me The Answer"
Por defecto, los modelos de razonamiento muestran su cadena de pensamiento en una sección plegable. En los Settings de un chat, puedes desactivar la visualización del thinking para ver solo la respuesta final. Ten en cuenta que Qwen 3.8 27B tiende a razonar demasiado con su configuración de razonamiento predeterminada: cambia su nivel de esfuerzo a «low» si las respuestas tardan más de lo necesario.

#4. Servidor compatible con OpenAI en el puerto 1234

Es la ventaja que muchos no conocen: LM Studio expone un servidor HTTP compatible con la API de OpenAI, por defecto en http://localhost:1234. Puedes conectar cualquier cliente de OpenAI (SDK de Python, LangChain, Continue.dev, Cursor, tu propia aplicación) a LM Studio sin cambiar una sola línea de la lógica de negocio, solo la URL base y la clave.

  1. 01
    Activar Developer Mode
    En la esquina inferior izquierda, cambia el rol de usuario a "Developer". La pestaña Local Server (icono de terminal) aparece en la barra de la izquierda.
  2. 02
    Iniciar el servidor
    Pestaña Local Server → elige el modelo que quieres exponer en el menú superior → haz clic en Start Server. Por defecto, el servidor escucha en localhost:1234. Marca "Serve on Local Network" si quieres exponerlo a las demás máquinas de tu LAN.
  3. 03
    Verificar el endpoint
    El servidor expone las rutas /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (si hay un modelo de embeddings cargado). Prueba primero la lista de modelos.
Prueba de la API
curl http://localhost:1234/v1/models

curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-coder-30b-a3b",
    "messages": [{"role": "user", "content": "Bonjour"}],
    "stream": false
  }'
Cliente oficial para Python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # ignorée, n'importe quelle chaîne
)

resp = client.chat.completions.create(
    model="qwen3-coder-30b-a3b",
    messages=[{"role": "user", "content": "Refactore ce code en idiomatic Rust : ..."}],
)
print(resp.choices[0].message.content)
→
Carga JIT de modelos
Activa «Just-in-Time Model Loading» en los ajustes del servidor. LM Studio carga entonces automáticamente el modelo solicitado por la petición a la API; resulta práctico si alternas entre varios modelos desde distintos clientes.

#5. Soporte nativo de MCP

Desde la 0.3.17, LM Studio soporta el Protocolo de Contexto de Modelo (MCP) — el estándar introducido por Anthropic en 2024 para conectar herramientas externas a un LLM. Concretamente: tu modelo local puede acceder a tu sistema de archivos, ejecutar SQL, llamar a una API, siempre que se configure un servidor MCP.

La configuración se realiza en el archivo mcp.json, accesible desde el menú Program → Edit mcp.json. Aquí tienes un ejemplo que añade el servidor filesystem oficial de Anthropic y un servidor SQLite.

mcp.json
{
  "mcpServers": {
    "filesystem": {
      "command": "npx",
      "args": [
        "-y",
        "@modelcontextprotocol/server-filesystem",
        "/home/user/Documents"
      ]
    },
    "sqlite": {
      "command": "uvx",
      "args": ["mcp-server-sqlite", "--db-path", "/home/user/data.db"]
    }
  }
}

Una vez registrado, las herramientas MCP aparecen en el icono de enchufe (plug) del chat. Puedes activarlas cuando las necesites. El modelo decide después cuándo llamarlas: resulta útil para crear un pequeño agente local sin programar, por ejemplo, «resume todos los PDF de la carpeta Recherche» o «cuántas filas hay en la tabla users».

!
¿Qué modelo para el uso de herramientas?
No todos los modelos son buenos en tool calling. Qwen3-Coder 30B-A3B, GLM 4.7 Flash (excelente en agentes), Devstral 24B y Mistral Small 24B funcionan bien, como cualquier modelo entrenado explícitamente para el function calling. Los modelos pequeños (< 7B) suelen inventar nombres de herramientas: pruébalos antes de desplegarlos.

#LM Studio vs Ollama vs Jan

Las tres herramientas persiguen el mismo objetivo (LLM en local sin nube), con filosofías diferentes.

LM Studio
Aplicación de escritorio con muchas funciones, búsqueda HF integrada, servidor API en el puerto :1234, soporte MCP, MLX en Mac. De código cerrado, pero gratuita. Ideal si quieres una solución todo en uno con una interfaz gráfica sólida.
Ollama
Daemon ligero + CLI, escucha en :11434, enorme biblioteca de modelos preconfigurados (ollama run qwen3.5:9b), API estable, integraciones por todas partes (Cline, Open WebUI, n8n). De código abierto. Ideal si te sientes cómodo en el terminal y quieres usarlo sin interfaz gráfica.
Jan
Aplicación de escritorio de código abierto (AGPL), con una filosofía radical de dar prioridad al funcionamiento sin conexión, más reciente y con menos funciones que LM Studio. Una opción interesante si te importa el código abierto y quieres una aplicación de escritorio.
→
Combo ganador
Muchos usuarios avanzados ejecutan Ollama como daemon de servidor (24/7, sin interfaz gráfica) y usan LM Studio como cliente/explorador para probar nuevos modelos antes de implementarlos en Ollama. Ambos pueden coexistir — no escuchan el mismo puerto.

#Solución de problemas

El modelo no se carga (OOM)
Reduce manualmente el GPU Offload en los Settings del chat. Si cargas el 100 % en la GPU y falla, baja al 80 %: algunas capas pasan a la RAM; es más lento, pero funciona.
Muy pocos tokens por segundo
Comprueba que Flash Attention esté activado y que KV cache type esté en Q8_0 (no FP16). En modo Power User, estos ajustes están en la barra lateral derecha del chat.
El servidor API no responde
Confirma que estás en Developer Mode y que el botón Start Server está verde. En Windows, el cortafuegos puede bloquear el puerto 1234: autoriza LM Studio en el cortafuegos de Windows Defender.
Modelo no encontrado en la búsqueda
LM Studio solo muestra los repositorios GGUF compatibles con su versión de llama.cpp. Para los modelos muy recientes, actualiza LM Studio (Help → Check for Updates) o descarga el GGUF manualmente y colócalo en la carpeta models.
Linux: AppImage no se inicia
Instala libfuse2 (sudo apt install libfuse2 en Ubuntu 22.04+). En Wayland, exporta QT_QPA_PLATFORM=xcb si la aplicación no se muestra correctamente.

#Para ir más allá

Tres opciones naturales según lo que quieras hacer a continuación:

Comparar más en detalle
La guía « LM Studio vs Ollama : ¿cuál elegir en 2026? » compara característica por característica, con una tabla de decisión según tu perfil.
Conectar LM Studio a tus PDF
«RAG local con LM Studio: hablar con tus documentos» explica la función Chat with Documents, sus limitaciones y cuándo pasar a AnythingLLM.
Acelerar aún más la inferencia
«LM Studio y el MTP (Multi-Token Prediction)» detalla cómo activar el MTP en los modelos compatibles para aumentar el rendimiento entre un 30 y un 80 % en términos de tokens por segundo.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.