LM Studio: guía completa 2026
LM Studio es una de las formas más sencillas de usar un LLM localmente en Windows, macOS y Linux: interfaz gráfica limpia, búsqueda integrada de modelos, servidor compatible con OpenAI en un solo clic. Esta guía te ayuda a empezar a usar LM Studio en francés: dónde cambiar el idioma, cómo interpretar la interfaz, cómo encontrar modelos de calidad que funcionen en francés y qué ajustes realmente importan (contexto, temperatura, cuantización).
#¿Por qué LM Studio en francés?
LM Studio reúne lo que importa para empezar: no requiere usar la línea de comandos, detecta automáticamente la GPU, permite gestionar los modelos desde la interfaz y ofrece un servidor local compatible con OpenAI que se puede utilizar desde cualquier aplicación. Para el público francófono, hay dos preguntas recurrentes: ¿está la interfaz disponible en francés y dónde se pueden encontrar modelos que respondan correctamente en francés?
La respuesta rápida: sí para la interfaz (el francés está entre los idiomas oficiales) y sí para los modelos: Mistral Small, Qwen 3.5 / 3.8 y Gemma 4 manejan muy bien el francés. Queda por saber cuáles cargar según tu VRAM y lo que quieras hacer.
#1. Poner la interfaz en francés
Ya has recorrido LM Studio. El kit IA Local llega hasta el final: LM Studio de la A a la Z (cap. 4), sus ajustes avanzados (cap. 5) y cuándo preferir un modelo francés en lugar de uno generalista (cap. 10).
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
LM Studio inicia por defecto en el idioma del sistema. Si tu OS está en francés, probablemente ya esté así. De lo contrario, el cambio tarda diez segundos.
- 01Abrir los ajustesHaz clic en el icono de engranaje en la esquina inferior izquierda de la ventana principal, o usa el atajo Ctrl+, (Cmd+, en macOS).
- 02Sección General → LanguageEn el panel Settings, localiza la sección General. El menú Language enumera los idiomas disponibles.
- 03Elegir FrancésSelecciona Français en el menú desplegable. La interfaz cambia inmediatamente, sin necesidad de reiniciar.
#2. Recorrido por la interfaz
Una vez abierto, LM Studio muestra cinco áreas principales en la barra lateral izquierda. A continuación se explica para qué sirve cada una.
- Chat (icono de burbuja)
- Pantalla principal: conversación con el modelo cargado. Selector de modelo arriba, parámetros a la derecha, historial de chats a la izquierda.
- Descubrir / Search (icono de lupa)
- Búsqueda de modelos en Hugging Face. Filtros por arquitectura, tamaño, formato (GGUF, MLX). Es aquí donde descargas los modelos.
- Mis modelos (icono de carpeta)
- Lista de todo lo descargado en tu disco, con peso, cuantización y ruta local. Permite desinstalar para liberar espacio.
- Servidor local (ícono de terminal)
- Activa un endpoint compatible con OpenAI en http://localhost:1234. Es indispensable para conectar aplicaciones externas (VS Code, n8n, scripts Python) a LM Studio.
- Ajustes (icono de engranaje)
- Idioma, tema, carpeta de modelos, elección del backend GPU (CUDA, ROCm, Metal, Vulkan), opciones de desarrollo.
#3. Encontrar buenos modelos para trabajar en francés
La pestaña Descubrir consulta directamente Hugging Face. Para un uso en francés, la búsqueda directa por palabra clave da resultados desiguales: muchos modelos afirman ser compatibles con el francés, pero generan alucinaciones en cuanto se sale de los temas sencillos. El método que funciona:
- 01Filtrar por editor confiableEscribe mistralai, Qwen o google en la búsqueda. Estas tres familias (Mistral, Qwen 3.5/3.8, Gemma 4) tienen un nivel de francés nativo o casi nativo. Evita los modelos que usuarios anónimos han vuelto a subir; da preferencia a las cuentas oficiales o a bartowski / lmstudio-community para las versiones GGUF ya preparadas.
- 02Verificar el formatoLM Studio lee el formato GGUF (y MLX en Apple Silicon). Si el modelo solo tiene pesos safetensors brutos, no será ejecutable directamente. La tarjeta del modelo lo indica.
- 03Elegir una cuantización adecuadaA menudo se ofrecen varios archivos: Q4_K_M, Q5_K_M, Q8_0. Q4_K_M es la opción equilibrada por defecto. La sección de cuantización, más abajo, lo explica en detalle.
- 04Iniciar descargaBotón Download a la derecha del archivo. La barra de abajo de la app muestra el progreso. Puedes seguir usando otro modelo mientras tanto.
#4. Modelos recomendados para el francés
Tres familias destacan para un uso en francés en 2026. La elección adecuada depende principalmente de la VRAM que tengas disponible.
#Mistral (francés nativo)
Publicado por Mistral AI, una empresa francesa. El francés recibe un tratamiento de primer nivel, no el de un complemento. En 2026, la oferta local se centra en la gama de 24B, bajo licencia Apache 2.0:
- Mistral Small 24B (Q4_K_M ≈ 14 GB)
- El generalista francófono de referencia, para 16 GB o más de VRAM. Licencia Apache 2.0. Calidad cercana a la de un modelo propietario en tareas complejas en francés (redacción, síntesis, razonamiento).
- Devstral 24B (Q4_K_M ≈ 14 GB)
- La misma base Mistral, especializada como agente de programación (Apache 2.0). Si programas en francés, es el compañero ideal: 16 GB o más de VRAM.
Para menos de 16 GB de VRAM, consulta Qwen o Gemma a continuación: Mistral no tiene actualmente un modelo generalista pequeño actualizado en este rango.
#Qwen 3.5 / 3.8 (sólido rendimiento multilingüe)
Publicado por Alibaba, bajo la licencia Apache 2.0. Según la información oficial, está entrenado en decenas de idiomas, incluido el francés, con un nivel de coherencia poco común. Es la familia que mejor cubre todos los rangos de VRAM, desde la CPU hasta las tarjetas de gran capacidad.
- Qwen 3.5 4B Instruct (Q4_K_M ≈ 3,4 GB)
- El nuevo «modelo pequeño por defecto». Funciona con 4-6 GB de VRAM o en CPU. Sorprendente en francés por su tamaño, ideal para clasificación / extracción.
- Qwen 3.5 9B Instruct (Q4_K_M ≈ 6,6 GB)
- LA opción para 8 GB en 2026: 256k de contexto nativo y visión (imágenes). El punto ideal para 8-12 GB de VRAM (RTX 3060/4070). En Q8_0 (≈ 11 GB), con 12 GB de VRAM, la calidad sube aún más.
- Qwen 3.8 27B Instruct (Q4_K_M ≈ 18 GB)
- Para 24 GB de VRAM (RTX 3090/4090). Lanzado el 14/08/2026: 262k de contexto, visión, el más «parecido a Copilot» del grupo. Consejo: si razona demasiado, ajusta su razonamiento a low en los parámetros.
#Gemma 4 (Google)
Desde Gemma 4 (abril de 2026), la familia utiliza la licencia Apache 2.0 y admite el francés de forma nativa, con capacidades multimodales (texto + imagen) como ventaja adicional. Su estilo suele ser más «limpio» que el de los modelos Llama anteriores. Tres tamaños cubren todos los presupuestos: Gemma 4 E2B (Q4 ≈ 4,3 GB) para una tarjeta pequeña o para ejecutarlo en CPU, Gemma 4 12B (Q4 ≈ 7,6 GB), multimodal para 8-12 GB de VRAM, y Gemma 4 26B-A4B (Q4 ≈ 19 GB), un modelo MoE multimodal rápido para 24 GB.
#5. Explicación de la cuantización
Todos los modelos GGUF mostrados en LM Studio están cuantizados. Entender lo que significa evita descargar 30 GB sin sentido.
Un LLM almacena sus pesos como números de coma flotante. En la versión original (FP16), cada peso ocupa 2 bytes, por lo que un modelo 7B ocupa unos 14 GB. La cuantización reduce la precisión de estos pesos para ahorrar espacio, a costa de una ligera pérdida de calidad.
- Q4_K_M (recomendado por defecto)
- 4 bits por peso de media. Divide el tamaño entre ~4 respecto a FP16. Pérdida de calidad mínima (~1-2% en los benchmarks). Es la opción razonable en el 90% de los casos.
- Q5_K_M
- 5 bits por peso. ~20% más grande que Q4_K_M, calidad casi indistinguible del FP16. Elige este si tienes espacio de VRAM disponible y un uso exigente (código, redacción larga).
- Q8_0
- 8 bits par poids. Quasi-équivalent al FP16 en calidad pero 2× más grande que Q4_K_M. Pertinente para fine-tuning o benchmarks de referencia.
- Q3_K_S / Q2_K
- Cuantizaciones muy agresivas. Pérdida de calidad visible en tareas complejas. Reservar para los casos en los que sea absolutamente necesario hacer que un modelo grande quepa en poca VRAM.
- FP16 (no cuantizado)
- Precisión nativa. 2 bytes por peso. Evitar a menos que tengas la VRAM necesaria y que la máxima calidad sea crucial.
#6. Contexto y temperatura
En el panel derecho del chat, dos ajustes tienen un impacto percibido mucho mayor que los demás.
#Context Length (longitud de contexto)
La cantidad de tokens que el modelo puede «ver» a la vez: tu prompt, el historial del chat y la respuesta. LM Studio la fija por defecto en 2048 o 4096, una cantidad reducida: una conversación algo extensa o un documento pegado en el chat supera pronto el límite, y el modelo olvida el principio.
- Conversaciones cortas (asistente general)
- 4096 tokens son suficientes. Ahorra VRAM, no hay ralentización.
- Análisis de documentos (resumen, Q&A)
- 16k a 32k. Asegúrate de que el modelo soporte nativamente este contexto (Qwen 3.5 9B : 256k, Qwen 3.8 27B : 262k, Granite 4.2 8B : 128k).
- Código y largos informes
- 32k+. La VRAM consumida aumenta rápidamente — típicamente entre +3 y +4 GB entre 4k y 32k en un 7B.
#Temperatura
Controla la aleatoriedad de las respuestas. Cuanto más alta sea, más riesgos toma el modelo al elegir la siguiente palabra; cuanto más baja sea, más se ciñe a la más probable.
- 0,0 – 0,3 (determinista)
- Para extracción de datos, clasificación, programación, o cualquier tarea en la que quieras la misma respuesta cada vez. El modelo puede parecer seco o repetitivo.
- 0,4 – 0,7 (equilibrado, predeterminado)
- Para asistente general, preguntas y respuestas, resúmenes. Buen equilibrio entre coherencia y variedad. LM Studio comienza a menudo en 0.7.
- 0.8 – 1.2 (creativo)
- Para redacción libre, brainstorming, ficción. El modelo toma más libertades estilísticas. Más allá de 1.2, se vuelve incoherente rápidamente.
#Consejos y posibles problemas
- El modelo responde en inglés pese a que se le habla en francés
- Añade un prompt de sistema explícito: «Respondes únicamente en francés, incluso si la pregunta se formula en inglés». Los modelos que no son de Mistral a veces lo necesitan.
- Descargas interrumpidas
- LM Studio no siempre reanuda las descargas correctamente. Si una descarga se atasca, elimina el archivo parcial en Mis modelos y vuelve a iniciarla. Es preferible usar una conexión estable para los modelos grandes (> 10 GB).
- Retirar un modelo de la memoria para liberar la VRAM
- El botón Eject en la parte superior del chat retira el modelo de la memoria. Resulta útil antes de iniciar otro programa que consuma muchos recursos de la GPU (un juego, renderizado de vídeo).
- Varios chats en paralelo
- Cada chat mantiene su propio historial y sus propios parámetros. Útil para comparar dos modelos uno al lado del otro con la misma pregunta.
- Prompt de sistema por modelo
- El prompt de sistema configurado en el panel derecho se guarda con la conversación, no con el modelo. Para mantener un comportamiento persistente, crea un preset (botón Save Preset).
- Modelos MLX en Mac
- En Apple Silicon, LM Studio ofrece versiones MLX además de GGUF. A igual tamaño, MLX es más rápido. Mistral y Qwen tienen sus versiones MLX oficiales.
#Para ir más allá
Tienes LM Studio en francés, sabes elegir un modelo FR y ajustar los parámetros importantes. Los siguientes pasos naturales son:
- Activar el servidor local
- La guía Convertir LM Studio en un servidor API detalla cómo exponer el endpoint compatible con OpenAI en http://localhost:1234 y conectarlo a VS Code, n8n o a un script Python.
- Comparar con Ollama
- La guía Ollama vs LM Studio vs Jan vs GPT4All compara las herramientas GUI/CLI. Muchos combinan Ollama (daemon) + LM Studio (interfaz cliente) para aprovechar lo mejor de ambos.
- Profundizar en la cuantización
- La guía «Elegir la cuantización (Q4, Q5, Q8, FP16)» compara visualmente las pérdidas reales de calidad según las tareas.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.