Principiante 8 minFrancés

LM Studio: guía completa 2026

LM Studio es una de las formas más sencillas de usar un LLM localmente en Windows, macOS y Linux: interfaz gráfica limpia, búsqueda integrada de modelos, servidor compatible con OpenAI en un solo clic. Esta guía te ayuda a empezar a usar LM Studio en francés: dónde cambiar el idioma, cómo interpretar la interfaz, cómo encontrar modelos de calidad que funcionen en francés y qué ajustes realmente importan (contexto, temperatura, cuantización).

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué LM Studio en francés?

LM Studio reúne lo que importa para empezar: no requiere usar la línea de comandos, detecta automáticamente la GPU, permite gestionar los modelos desde la interfaz y ofrece un servidor local compatible con OpenAI que se puede utilizar desde cualquier aplicación. Para el público francófono, hay dos preguntas recurrentes: ¿está la interfaz disponible en francés y dónde se pueden encontrar modelos que respondan correctamente en francés?

La respuesta rápida: sí para la interfaz (el francés está entre los idiomas oficiales) y sí para los modelos: Mistral Small, Qwen 3.5 / 3.8 y Gemma 4 manejan muy bien el francés. Queda por saber cuáles cargar según tu VRAM y lo que quieras hacer.

i
Lo que cubre esta guía
Uso de LM Studio en una máquina donde ya está instalado. Si aún no lo tienes, la guía Comenzar con LM Studio (Windows/macOS) o LM Studio en Linux cubre la instalación. Aquí nos enfocamos en el uso en francés.

#1. Poner la interfaz en francés

El kit IA Local

Ya has recorrido LM Studio. El kit IA Local llega hasta el final: LM Studio de la A a la Z (cap. 4), sus ajustes avanzados (cap. 5) y cuándo preferir un modelo francés en lugar de uno generalista (cap. 10).

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

LM Studio inicia por defecto en el idioma del sistema. Si tu OS está en francés, probablemente ya esté así. De lo contrario, el cambio tarda diez segundos.

  1. 01
    Abrir los ajustes
    Haz clic en el icono de engranaje en la esquina inferior izquierda de la ventana principal, o usa el atajo Ctrl+, (Cmd+, en macOS).
  2. 02
    Sección General → Language
    En el panel Settings, localiza la sección General. El menú Language enumera los idiomas disponibles.
  3. 03
    Elegir Francés
    Selecciona Français en el menú desplegable. La interfaz cambia inmediatamente, sin necesidad de reiniciar.
→
Traducción parcial
Algunas etiquetas muy técnicas (nombres de arquitecturas, parámetros avanzados del sampler) siguen en inglés incluso en modo francés. Es intencionado: son términos comunes a toda la comunidad LLM, así que conviene reconocerlos tal cual.

#2. Recorrido por la interfaz

Una vez abierto, LM Studio muestra cinco áreas principales en la barra lateral izquierda. A continuación se explica para qué sirve cada una.

Chat (icono de burbuja)
Pantalla principal: conversación con el modelo cargado. Selector de modelo arriba, parámetros a la derecha, historial de chats a la izquierda.
Descubrir / Search (icono de lupa)
Búsqueda de modelos en Hugging Face. Filtros por arquitectura, tamaño, formato (GGUF, MLX). Es aquí donde descargas los modelos.
Mis modelos (icono de carpeta)
Lista de todo lo descargado en tu disco, con peso, cuantización y ruta local. Permite desinstalar para liberar espacio.
Servidor local (ícono de terminal)
Activa un endpoint compatible con OpenAI en http://localhost:1234. Es indispensable para conectar aplicaciones externas (VS Code, n8n, scripts Python) a LM Studio.
Ajustes (icono de engranaje)
Idioma, tema, carpeta de modelos, elección del backend GPU (CUDA, ROCm, Metal, Vulkan), opciones de desarrollo.
i
El panel de la derecha en el chat
Durante una conversación, el panel derecho muestra los parámetros del modelo (prompt del sistema, temperatura, top-p, longitud del contexto, etc.). Aquí es donde se ajusta realmente el comportamiento, no en la sección global Settings.

#3. Encontrar buenos modelos para trabajar en francés

La pestaña Descubrir consulta directamente Hugging Face. Para un uso en francés, la búsqueda directa por palabra clave da resultados desiguales: muchos modelos afirman ser compatibles con el francés, pero generan alucinaciones en cuanto se sale de los temas sencillos. El método que funciona:

  1. 01
    Filtrar por editor confiable
    Escribe mistralai, Qwen o google en la búsqueda. Estas tres familias (Mistral, Qwen 3.5/3.8, Gemma 4) tienen un nivel de francés nativo o casi nativo. Evita los modelos que usuarios anónimos han vuelto a subir; da preferencia a las cuentas oficiales o a bartowski / lmstudio-community para las versiones GGUF ya preparadas.
  2. 02
    Verificar el formato
    LM Studio lee el formato GGUF (y MLX en Apple Silicon). Si el modelo solo tiene pesos safetensors brutos, no será ejecutable directamente. La tarjeta del modelo lo indica.
  3. 03
    Elegir una cuantización adecuada
    A menudo se ofrecen varios archivos: Q4_K_M, Q5_K_M, Q8_0. Q4_K_M es la opción equilibrada por defecto. La sección de cuantización, más abajo, lo explica en detalle.
  4. 04
    Iniciar descarga
    Botón Download a la derecha del archivo. La barra de abajo de la app muestra el progreso. Puedes seguir usando otro modelo mientras tanto.
!
Atención a la VRAM mostrada
LM Studio indica si un modelo cabe en VRAM con una pastilla verde/amarilla/roja. Esta estimación no siempre tiene en cuenta la longitud de contexto que planeas usar. Un modelo anunciado verde con 4096 tokens puede convertirse en rojo con 32k. Verifica después de cargar con ollama-style nvidia-smi.

#4. Modelos recomendados para el francés

Tres familias destacan para un uso en francés en 2026. La elección adecuada depende principalmente de la VRAM que tengas disponible.

#Mistral (francés nativo)

Publicado por Mistral AI, una empresa francesa. El francés recibe un tratamiento de primer nivel, no el de un complemento. En 2026, la oferta local se centra en la gama de 24B, bajo licencia Apache 2.0:

Mistral Small 24B (Q4_K_M ≈ 14 GB)
El generalista francófono de referencia, para 16 GB o más de VRAM. Licencia Apache 2.0. Calidad cercana a la de un modelo propietario en tareas complejas en francés (redacción, síntesis, razonamiento).
Devstral 24B (Q4_K_M ≈ 14 GB)
La misma base Mistral, especializada como agente de programación (Apache 2.0). Si programas en francés, es el compañero ideal: 16 GB o más de VRAM.

Para menos de 16 GB de VRAM, consulta Qwen o Gemma a continuación: Mistral no tiene actualmente un modelo generalista pequeño actualizado en este rango.

#Qwen 3.5 / 3.8 (sólido rendimiento multilingüe)

Publicado por Alibaba, bajo la licencia Apache 2.0. Según la información oficial, está entrenado en decenas de idiomas, incluido el francés, con un nivel de coherencia poco común. Es la familia que mejor cubre todos los rangos de VRAM, desde la CPU hasta las tarjetas de gran capacidad.

Qwen 3.5 4B Instruct (Q4_K_M ≈ 3,4 GB)
El nuevo «modelo pequeño por defecto». Funciona con 4-6 GB de VRAM o en CPU. Sorprendente en francés por su tamaño, ideal para clasificación / extracción.
Qwen 3.5 9B Instruct (Q4_K_M ≈ 6,6 GB)
LA opción para 8 GB en 2026: 256k de contexto nativo y visión (imágenes). El punto ideal para 8-12 GB de VRAM (RTX 3060/4070). En Q8_0 (≈ 11 GB), con 12 GB de VRAM, la calidad sube aún más.
Qwen 3.8 27B Instruct (Q4_K_M ≈ 18 GB)
Para 24 GB de VRAM (RTX 3090/4090). Lanzado el 14/08/2026: 262k de contexto, visión, el más «parecido a Copilot» del grupo. Consejo: si razona demasiado, ajusta su razonamiento a low en los parámetros.

#Gemma 4 (Google)

Desde Gemma 4 (abril de 2026), la familia utiliza la licencia Apache 2.0 y admite el francés de forma nativa, con capacidades multimodales (texto + imagen) como ventaja adicional. Su estilo suele ser más «limpio» que el de los modelos Llama anteriores. Tres tamaños cubren todos los presupuestos: Gemma 4 E2B (Q4 ≈ 4,3 GB) para una tarjeta pequeña o para ejecutarlo en CPU, Gemma 4 12B (Q4 ≈ 7,6 GB), multimodal para 8-12 GB de VRAM, y Gemma 4 26B-A4B (Q4 ≈ 19 GB), un modelo MoE multimodal rápido para 24 GB.

→
Probar antes de adoptar
Descarga 2-3 candidatos y plantéales las mismas preguntas técnicas de tu ámbito en francés (vocabulario profesional, abreviaturas en francés, concordancias complicadas). En 10 minutos sabrás cuál responde a tu necesidad real: la VRAM que ahorras con un modelo más pequeño que responde correctamente compensa más que usar uno grande que duda.

#5. Explicación de la cuantización

Todos los modelos GGUF mostrados en LM Studio están cuantizados. Entender lo que significa evita descargar 30 GB sin sentido.

Un LLM almacena sus pesos como números de coma flotante. En la versión original (FP16), cada peso ocupa 2 bytes, por lo que un modelo 7B ocupa unos 14 GB. La cuantización reduce la precisión de estos pesos para ahorrar espacio, a costa de una ligera pérdida de calidad.

Q4_K_M (recomendado por defecto)
4 bits por peso de media. Divide el tamaño entre ~4 respecto a FP16. Pérdida de calidad mínima (~1-2% en los benchmarks). Es la opción razonable en el 90% de los casos.
Q5_K_M
5 bits por peso. ~20% más grande que Q4_K_M, calidad casi indistinguible del FP16. Elige este si tienes espacio de VRAM disponible y un uso exigente (código, redacción larga).
Q8_0
8 bits par poids. Quasi-équivalent al FP16 en calidad pero 2× más grande que Q4_K_M. Pertinente para fine-tuning o benchmarks de referencia.
Q3_K_S / Q2_K
Cuantizaciones muy agresivas. Pérdida de calidad visible en tareas complejas. Reservar para los casos en los que sea absolutamente necesario hacer que un modelo grande quepa en poca VRAM.
FP16 (no cuantizado)
Precisión nativa. 2 bytes por peso. Evitar a menos que tengas la VRAM necesaria y que la máxima calidad sea crucial.
i
Referencias de VRAM por tamaño (Q4)
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Añade ~1 GB por cada bloque de 8k de contexto por encima de 4096 tokens.

#6. Contexto y temperatura

En el panel derecho del chat, dos ajustes tienen un impacto percibido mucho mayor que los demás.

#Context Length (longitud de contexto)

La cantidad de tokens que el modelo puede «ver» a la vez: tu prompt, el historial del chat y la respuesta. LM Studio la fija por defecto en 2048 o 4096, una cantidad reducida: una conversación algo extensa o un documento pegado en el chat supera pronto el límite, y el modelo olvida el principio.

Conversaciones cortas (asistente general)
4096 tokens son suficientes. Ahorra VRAM, no hay ralentización.
Análisis de documentos (resumen, Q&A)
16k a 32k. Asegúrate de que el modelo soporte nativamente este contexto (Qwen 3.5 9B : 256k, Qwen 3.8 27B : 262k, Granite 4.2 8B : 128k).
Código y largos informes
32k+. La VRAM consumida aumenta rápidamente — típicamente entre +3 y +4 GB entre 4k y 32k en un 7B.

#Temperatura

Controla la aleatoriedad de las respuestas. Cuanto más alta sea, más riesgos toma el modelo al elegir la siguiente palabra; cuanto más baja sea, más se ciñe a la más probable.

0,0 – 0,3 (determinista)
Para extracción de datos, clasificación, programación, o cualquier tarea en la que quieras la misma respuesta cada vez. El modelo puede parecer seco o repetitivo.
0,4 – 0,7 (equilibrado, predeterminado)
Para asistente general, preguntas y respuestas, resúmenes. Buen equilibrio entre coherencia y variedad. LM Studio comienza a menudo en 0.7.
0.8 – 1.2 (creativo)
Para redacción libre, brainstorming, ficción. El modelo toma más libertades estilísticas. Más allá de 1.2, se vuelve incoherente rápidamente.
→
Top-p en lugar de top-k
Si modificas los parámetros avanzados, top-p (alrededor de 0.9) es más moderno y estable que top-k. Deja los demás ajustes (frequency penalty, presence penalty) en sus valores predeterminados salvo que tengas una necesidad específica: rara vez resuelven un problema real y a menudo generan efectos secundarios extraños.

#Consejos y posibles problemas

El modelo responde en inglés pese a que se le habla en francés
Añade un prompt de sistema explícito: «Respondes únicamente en francés, incluso si la pregunta se formula en inglés». Los modelos que no son de Mistral a veces lo necesitan.
Descargas interrumpidas
LM Studio no siempre reanuda las descargas correctamente. Si una descarga se atasca, elimina el archivo parcial en Mis modelos y vuelve a iniciarla. Es preferible usar una conexión estable para los modelos grandes (> 10 GB).
Retirar un modelo de la memoria para liberar la VRAM
El botón Eject en la parte superior del chat retira el modelo de la memoria. Resulta útil antes de iniciar otro programa que consuma muchos recursos de la GPU (un juego, renderizado de vídeo).
Varios chats en paralelo
Cada chat mantiene su propio historial y sus propios parámetros. Útil para comparar dos modelos uno al lado del otro con la misma pregunta.
Prompt de sistema por modelo
El prompt de sistema configurado en el panel derecho se guarda con la conversación, no con el modelo. Para mantener un comportamiento persistente, crea un preset (botón Save Preset).
Modelos MLX en Mac
En Apple Silicon, LM Studio ofrece versiones MLX además de GGUF. A igual tamaño, MLX es más rápido. Mistral y Qwen tienen sus versiones MLX oficiales.

#Para ir más allá

Tienes LM Studio en francés, sabes elegir un modelo FR y ajustar los parámetros importantes. Los siguientes pasos naturales son:

Activar el servidor local
La guía Convertir LM Studio en un servidor API detalla cómo exponer el endpoint compatible con OpenAI en http://localhost:1234 y conectarlo a VS Code, n8n o a un script Python.
Comparar con Ollama
La guía Ollama vs LM Studio vs Jan vs GPT4All compara las herramientas GUI/CLI. Muchos combinan Ollama (daemon) + LM Studio (interfaz cliente) para aprovechar lo mejor de ambos.
Profundizar en la cuantización
La guía «Elegir la cuantización (Q4, Q5, Q8, FP16)» compara visualmente las pérdidas reales de calidad según las tareas.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.