LM Studio para principiantes: primer chat local en 10 minutos
LM Studio es la solución más cercana a ChatGPT para la IA local: una aplicación gráfica, una tienda integrada para buscar y descargar modelos, un chat que se parece a lo que conoces. Cero líneas de comando. Ideal para comenzar sin terminal.
#¿Qué es LM Studio?
Una aplicación de escritorio (Windows, macOS, Linux) que empaqueta cuatro cosas en una sola interfaz: un explorador de modelos conectado a Hugging Face, un gestor de descargas, un motor de inferencia (llama.cpp bajo el capó) y un chat.
La herramienta es gratuita para uso personal. Para uso comercial en una empresa, se requiere una licencia a partir de la versión 0.3.
#1. Instalación
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
- 01Elige tu plataformaWindows .exe, macOS .dmg (Apple Silicon o Intel), Linux .AppImage. Los binarios ocupan entre 400 y 600 MB; es normal, incluyen llama.cpp y sus dependencias.
- 02Ejecuta el instaladorEn Windows, la instalación se realiza en %LOCALAPPDATA% (no se requieren derechos de administrador). En Mac, arrastra a Aplicaciones. En Linux, haz que el AppImage sea ejecutable: chmod +x LM_Studio_*.AppImage.
- 03Primer inicioLM Studio te pregunta qué nivel de interfaz quieres mostrar (Power user o Developer). Power user basta de sobra para empezar; podrás cambiarlo más adelante.
#2. Vista general
La barra lateral izquierda contiene las 5 vistas esenciales:
- 💬 Chat
- La interfaz principal de conversación. Se parece a ChatGPT.
- 🔍 Discover
- La «tienda» de modelos. Búsqueda en directo en Hugging Face, descarga en un clic.
- 📁 My Models
- Todos los modelos que has descargado, con su tamaño y sus cuantizaciones.
- 💻 Developer
- Modo de servidor local compatible con OpenAI (ver más abajo).
- ⚙️ Settings
- Parámetros globales: carpeta de modelos, tema, integraciones.
#3. Descargar tu primer modelo
Haz clic en 🔍 Discover. La barra de búsqueda busca directamente en Hugging Face. Para una primera prueba en 2026, escribe Qwen 3.5 9B —la mejor opción para 8 GB de VRAM (256k de contexto, visión, licencia Apache 2.0).
- 01Mira los tags de compatibilidadA la derecha de cada resultado, LM Studio muestra Full GPU Offload possible, Partial GPU Offload o Likely too large. Estas indicaciones se basan en el hardware detectado en tu equipo: basta con elegir un resultado marcado en verde.
- 02Elige la cuantización adecuadaPara un 9B como Qwen 3.5 9B en 8 GB de VRAM: Q4_K_M es el punto ideal. Para 12 GB o más: Q5_K_M o Q6_K (o incluso Q8_0 en el 9B). Para 16 GB o más: Q8_0 para la máxima calidad.
- 03Haz clic en DownloadEntre 4 y 8 GB según la cuantización. LM Studio muestra el progreso en directo.
#4. Primera conversación
- 01Vuelve a la pestaña ChatEn la parte superior, haz clic en el selector "Select a model to load" y elige el modelo que acabas de descargar.
- 02Ajusta la carga de trabajo transferida a la GPULM Studio ofrece un control deslizante: 0 = todo en CPU (lento, pero siempre funciona), máximo = todo en GPU (rápido, pero falla si la VRAM es insuficiente). Pon el control en el valor máximo propuesto por defecto.
- 03Haz clic en Load modelLa carga tarda entre 5 y 30 segundos según el tamaño del modelo y la velocidad de tu disco.
- 04Escribe tu preguntaEn el campo de abajo. Enter para enviar. El modelo responde en streaming, token por token.
#5. Ajustar la calidad de las respuestas
Panel de la derecha durante una conversación. Tres ajustes bastan para cambiar el 90 % del comportamiento:
- Temperature
- 0.2 = factual, determinista. 0.7 = equilibrado (predeterminado). 1.2 = creativo, a veces errático. Auméntala si el modelo es demasiado repetitivo.
- Context Length
- Cuántos tokens anteriores puede «ver» el modelo. 4096 por defecto. Aumenta el valor a 8192 o 16384 para documentos largos; ten en cuenta que consume VRAM.
- Prompt de sistema
- El mensaje invisible que define el rol y las reglas. Ejemplo: "Eres un asistente jurídico francés. Responde citando siempre el artículo de ley aplicable."
#6. Modo servidor local (API)
LM Studio expone un servidor HTTP compatible con la API de OpenAI. Cualquier herramienta que se comunique con ChatGPT puede entonces ejecutarse localmente.
- 01Pestaña DeveloperElige un modelo y haz clic en Start Server (por defecto en el puerto 1234).
- 02Prueba con curlDesde un terminal, un simple GET verifica que el servidor responda.
En tus scripts Python, basta con cambiar base_url a http://localhost:1234/v1 y usar cualquier clave API ficticia. Todo lo que funciona con OpenAI funciona.
#Limitaciones que debes conocer
- No completamente open source
- La aplicación en sí es propietaria; solo el motor llama.cpp que utiliza es de código abierto. Si buscas software 100 % libre, opta por Jan u Ollama.
- Actualizaciones automáticas
- LM Studio se actualiza por sí solo. Práctico, pero inesperado en un entorno profesional controlado.
- Licencia comercial de pago
- Para uso empresarial, leer las condiciones. El uso personal y educativo sigue siendo gratuito.
- Sin scripting nativo
- A diferencia de Ollama, no hay CLI. Las automatizaciones solo se realizan a través del servidor API.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.