Intermedio 10 minOllama

Mistral Magistral: instalar el modelo de razonamiento

Magistral es el modelo de razonamiento de Mistral AI: un modelo que «piensa en voz alta» antes de responder, como DeepSeek R1 o OpenAI o1, pero con una calidad nativa en francés que ningún otro modelo de razonamiento de pesos abiertos alcanza. Esta guía muestra cómo instalar Mistral Magistral en local mediante Ollama, configurarlo con la plantilla de prompt adecuada y compararlo honestamente con DeepSeek R1 destilado.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué Magistral en lugar de otro modelo de razonamiento?

Los modelos de razonamiento (reasoning models) generan una cadena de pensamiento explícita antes de la respuesta final. En problemas complejos —matemáticas, lógica, código delicado, análisis jurídico— consiguen entre 10 y 30 puntos más en los benchmarks que un modelo generalista del mismo tamaño. El coste: son más lentos y más verbosos.

Hasta la llegada de Magistral, las opciones de pesos abiertos eran principalmente chinas: DeepSeek R1 y sus modelos destilados, Qwen3 en modo thinking, GLM. Todas razonan perfectamente en inglés y en chino, pero su cadena de pensamiento cambia regularmente al chino incluso cuando el prompt está en francés. Magistral está entrenado específicamente para mantener la traza de razonamiento en el idioma del prompt.

Razonamiento multilingüe nativo
La cadena de pensamiento permanece en francés cuando escribes en francés. No hay cambios bruscos al chino o al inglés.
Apache 2.0 en la versión Small
Uso comercial autorizado, fine-tuning libre, redistribución permitida. No hay zonas grises como con algunas licencias "open" restrictivas.
Base Mistral Small 3.1
Buena calidad de escritura en francés heredada de la base, lo que se observa en la redacción de respuestas jurídicas o administrativas.
Contexto de 40k tokens
Suficiente para un enunciado largo de problema, varios artículos de código o un contrato de unas decenas de páginas.
i
Razonamiento = tokens adicionales
Cuenta con entre 500 y 3000 tokens de "pensamiento" antes de cada respuesta final. Con una GPU modesta, ten paciencia: una pregunta compleja puede requerir entre 30 y 60 segundos de generación continua antes de la primera línea útil.

#Magistral Small vs Magistral Medium

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Mistral AI publica Magistral en dos versiones, y la confusión es frecuente. Para instalar Mistral Magistral localmente, solo la versión Small es usable — la Medium solo está disponible a través de la API.

Magistral Small (24B)
Pesos abiertos bajo la licencia Apache 2.0. Es ESTE modelo el que se instala en local. 24 mil millones de parámetros, derivado de Mistral Small 3.1.
Magistral Medium
Propietario, accesible únicamente a través de la API de Mistral o de Le Chat. Rendimiento superior, pero no se puede alojar en tu propia infraestructura. Queda fuera del alcance de esta guía.
→
Un pequeño consejo sobre el nombre
En Ollama Hub, el modelo se llama simplemente `magistral`. No es necesario especificar "small": la versión Medium no se distribuye para su ejecución local de todos modos.

#Requisitos de hardware

Magistral Small tiene 24B parámetros. En cuantización Q4_K_M (el estándar Ollama), se necesitan aproximadamente 14 GB de VRAM para cargar el modelo, más 1 a 3 GB para el contexto según la longitud.

Mínimo cómodo
RTX 4080 16 GB, RTX 4090 24 GB, RTX 3090 24 GB, o Mac Apple Silicon con 24 GB de memoria unificada.
Al límite, pero viable
RTX 4070 Ti Super de 16 GB (Q4 cabe justo, contexto corto obligatorio) o Mac de la serie M de 16 GB con offload parcial.
Insuficiente
Cualquier GPU de 12 GB o menos. El modelo desborda la VRAM y pasa a usar la RAM del sistema, y la velocidad cae a 2-4 tokens/segundo, algo inutilizable para un modelo que debe producir miles de tokens antes de responder.
Ollama y drivers
Ollama ≥ 0.5.x, drivers NVIDIA recientes (CUDA 12) o Metal en Mac. Compruébalo con `ollama --version`.
!
¿No tienes una GPU de 24 GB? Reconsidéralo
Magistral no es un modelo para probar sin una GPU potente. Con 12 GB o menos, esperarás varios minutos por respuesta. Opta mejor por una versión destilada de DeepSeek R1 de 7B-14B: menos buena en francés, pero utilizable en hardware modesto.

#1. Instalación mediante Ollama

Magistral Small está disponible en Ollama Hub desde el lanzamiento oficial de Mistral. La instalación se realiza con un solo comando.

  1. 01
    Verifica que Ollama esté funcionando
    En Windows/macOS, la aplicación debe estar en ejecución (icono en la barra de tareas). En Linux, `systemctl status ollama` confirma que el servicio está activo.
  2. 02
    Descargar el modelo
    La cuantización predeterminada proporcionada por Ollama es Q4_K_M. Ofrece un buen equilibrio para 16-24 GB de VRAM.
  3. 03
    Primer inicio
    Ollama descarga ~14 GB al primer `pull`. La descarga inicial puede tardar entre 10 y 30 minutos según tu conexión.
  4. 04
    Prueba de carga
    Ejecuta `ollama run magistral` y luego plantea una pregunta breve. Si el modelo responde después de 5-10 segundos de "warmup", todo va bien.
Terminal
ollama pull magistral
ollama run magistral

Para comprobar que el modelo utiliza realmente la GPU y no la RAM de la CPU, un comando de comprobación:

Estado de ejecución
ollama ps

En la columna PROCESSOR, debes ver `100% GPU`. Si ves `45% CPU / 55% GPU`, tu VRAM es insuficiente: Ollama ha recurrido parcialmente a la RAM. El modelo funcionará, pero a 1-3 tokens/segundo.

#2. La plantilla oficial de prompt

Magistral utiliza un formato de prompt específico para activar correctamente el razonamiento. Ollama ya incluye esta plantilla en el Modelfile oficial, pero conviene entenderla para no alterarla involuntariamente con un prompt de sistema mal colocado.

Estructura esperada, simplificada:

Formato bruto (interno al modelo)
<s>[SYSTEM_PROMPT]Vous êtes un assistant qui raisonne soigneusement avant de répondre.[/SYSTEM_PROMPT][INST]Question utilisateur[/INST]
<think>
Chaîne de raisonnement interne...
</think>
Réponse finale</s>

En la práctica, nunca escribes estas etiquetas a mano: Ollama las inserta automáticamente. Lo que debes saber es que el modelo espera que le pidas que razone. Un prompt de sistema corto y claro mejora notablemente la calidad.

Configurar el prompt del sistema
ollama run magistral
>>> /set system "Tu es un assistant rigoureux. Avant chaque réponse, analyse le problème étape par étape en français. Réponds de manière concise après ton raisonnement."
→
No es necesario pedir "piensa bien"
A diferencia de un modelo generalista, Magistral razona por defecto. No es necesario escribir "tómate tu tiempo" ni "piensa paso a paso": ya es su modo normal. En cambio, pedirle explícitamente que razone en francés en el prompt de sistema ayuda a fijar el idioma.

#3. Primeros tests prácticos en francés

Aquí tienes tres prompts para evaluar rápidamente Magistral en tareas típicas. Ten en cuenta que las respuestas llegan en dos fases: primero la cadena de pensamiento (`<think>...</think>`), luego la respuesta final.

Prueba 1 — Problema lógico
>>> Trois personnes se partagent 17 chevaux selon les proportions 1/2, 1/3, 1/9. Comment faire sans couper aucun cheval ?

Magistral desarrollará el razonamiento clásico del camello prestado. Calcula entre 1500 y 2500 tokens de razonamiento antes de la respuesta final clara y numerada.

Prueba 2 — Código Python
>>> Écris une fonction Python qui trouve le plus long sous-tableau dont la somme vaut zéro. Complexité O(n).

Buena oportunidad para ver la calidad algorítmica. Magistral suele proponer la solución con un diccionario de sumas de prefijos, explicando su elección de estructura de datos durante la fase de razonamiento.

Prueba 3 — Redacción jurídica FR
>>> Rédige une clause de non-concurrence pour un CDI de développeur en France, conforme au droit du travail français actuel.

En este tipo de solicitud, la calidad lingüística de Magistral en francés marca la diferencia. La cláusula generada es sintácticamente correcta, menciona las condiciones de validez (limitación temporal, limitación geográfica y contraprestación económica) y utiliza el vocabulario jurídico francés, en lugar de ser una traducción torpe del inglés.

#4. Rendimiento: AIME, matemáticas, código

Mistral AI ha comunicado cifras oficiales sobre Magistral Small y Medium. Los valores que se indican a continuación son las puntuaciones de Small (la única versión que se puede autoalojar), redondeadas. Sirven solo como referencia: tus resultados varían según la cuantización y el muestreo.

AIME 2024 (olimpiadas de matemáticas)
Magistral Small ~70 %, frente a ~50 % para Mistral Small 3.1, que no es un modelo de razonamiento. La mejora que aporta el modo de razonamiento es enorme en este tipo de problema.
LiveCodeBench (código)
Puntuación equivalente o ligeramente superior a Qwen3-Coder 30B-A3B en problemas de nivel medio, inferior en niveles difíciles.
MMLU FR
Comparable a Mistral Small 3.1 base: el razonamiento no aporta nada en los cuestionarios de opción múltiple de conocimientos generales, donde la respuesta está memorizada o no lo está.
GPQA Diamond (razonamiento científico)
Mejora clara con el modo thinking, en torno al 50-55 % frente al 35-40 % del modelo base sin razonamiento.
i
Cuantización y pérdida de calidad
Todos los benchmarks oficiales se miden en FP16. En Q4_K_M (el formato predeterminado de Ollama), calcula una pérdida de entre 1 y 3 puntos en AIME. Si tienes 24 GB de VRAM, pasar a Q5_K_M o Q6_K permite recuperar ese margen, a cambio de una velocidad de generación ligeramente inferior.

#5. Magistral Small vs DeepSeek R1 destilado 14B

La comparación útil para el francófono es con DeepSeek-R1-Distill-Qwen-14B, el competidor directo con pesos abiertos para quien quiere razonamiento local. Ambos tienen sus fortalezas: esto es lo que muestran las pruebas prácticas.

Huella de memoria
DeepSeek R1 14B Q4 ≈ 9 GB, Magistral 24B Q4 ≈ 14 GB. Ventaja clara para DeepSeek si tu GPU tiene un máximo de 12 GB.
Calidad del razonamiento en FR
Magistral mantiene el francés desde el principio hasta el final. DeepSeek R1 destilado cambia regularmente a chino o inglés en la cadena de pensamiento, incluso con un prompt de sistema FR estricto. Ventaja de Magistral.
Calidad de la respuesta final FR
Magistral produce un francés de mayor calidad (vocabulario, concordancia, registro). DeepSeek R1 14B comete errores de uso típicos de un modelo traducido. Ventaja para Magistral.
Matemáticas puras (AIME, AMC)
DeepSeek R1 destilado 14B es ligeramente mejor que Magistral Small en problemas muy formales. Ventaja DeepSeek.
Código
Empate en la práctica. Ambos generan código correcto en problemas de dificultad media. En código en francés (comentarios, nombres de variables), Magistral es más limpio.
Velocidad de generación
DeepSeek 14B es ~1,7× más rápido con la misma cantidad de VRAM, simplemente por su tamaño. Para una sesión interactiva, eso cuenta.
→
El veredicto práctico
Si trabajas principalmente en francés —derecho, escritura, soporte a usuarios, código comentado en francés—, Magistral Small es mejor. Si trabajas con matemáticas formales o con una GPU de 12 GB, sigue usando DeepSeek R1 destilado 14B.

#6. Caso de uso: análisis jurídico en local

La combinación de calidad en francés + razonamiento + autoalojamiento convierte a Magistral en un excelente candidato para tareas jurídicas sensibles. El contenido jurídico nunca sale de tu máquina: un argumento decisivo ante un despacho que no puede enviar sus expedientes a OpenAI.

Tres casos concretos que funcionan bien:

Análisis de cláusula contractual
Pegar una cláusula, pedir la identificación de los riesgos para una u otra parte. Magistral explica su razonamiento, lo que hace que el análisis sea auditable —un humano puede verificar dónde el modelo vio un problema.
Comparación de versiones
Pegar dos versiones de una adenda, pedir la lista de diferencias sustanciales (no cosméticas) y su impacto. El modo de razonamiento ayuda a separar el ruido de lo sustancial.
Redacción de nota interna
Solicitar una nota de síntesis a partir de un texto legal o de una sentencia. La calidad lingüística en francés es aquí el factor diferenciador.
Ejemplo de prompt jurídico
>>> /set system "Tu es un juriste qui analyse les contrats en droit français. Raisonne méthodiquement avant de conclure. Cite les principes juridiques mobilisés."
>>> Analyse cette clause de mobilité géographique : [coller le texte]
!
El LLM no reemplaza a un abogado
Magistral puede generar alucinaciones sobre el derecho francés: citar un artículo que no existe o referenciar incorrectamente una sentencia. Su valor consiste en estructurar el pensamiento jurídico y acelerar un primer borrador, no en producir una conclusión que se pueda firmar tal cual. Todo pasaje destinado a un cliente o a un juez debe ser validado por una persona competente.

#Solución de problemas

El modelo cambia al inglés durante el razonamiento
Refuerza el prompt del sistema con una instrucción explícita: "Piensa y responde únicamente en francés." Si no es suficiente, añade un primer mensaje corto en francés para fijar el idioma antes de la pregunta real.
Respuestas truncadas antes de la conclusión
El modelo ha agotado su presupuesto de tokens durante el razonamiento. Aumenta la ventana con `/set parameter num_ctx 16384` y `/set parameter num_predict 4096`.
Generación a 1-2 tokens/segundo
El modelo se ejecuta en la CPU o con offload parcial. `ollama ps` lo confirma. Soluciones: liberar VRAM (cerrar Chrome / Steam), pasar a una cuantización más agresiva como Q3_K_M o aceptar que esta GPU no es suficiente.
Las etiquetas <think> aparecen en la respuesta final
Es el comportamiento esperado en modo sin procesar. Una interfaz como Open WebUI o LM Studio las oculta automáticamente dentro de un bloque desplegable "reasoning". En la CLI de Ollama, siguen visibles: es así por diseño.
El modelo «alucina» sobre hechos recientes
Los conocimientos de Magistral Small quedan fijados en la fecha de su entrenamiento. Para responder a preguntas sobre hechos actualizados (jurisprudencia reciente, actualidad), se necesita un pipeline RAG, no solo el modelo por sí mismo.

#Para ir más allá

Magistral es un excelente modelo FR para quien tenga la GPU necesaria. Algunas ideas para aprovechar al máximo tu instalación:

Comparar con DeepSeek R1 en tu máquina
La guía de instalación de DeepSeek R1 muestra cómo instalar la versión destilada de 14B junto con Magistral para comparar ambos modelos con tus propios prompts.
Conectar Magistral a tus PDF jurídicos
La guía PrivateGPT v2 describe un pipeline RAG 100% local que complementa perfectamente Magistral para análisis documental confidencial.
Elegir la cuantización más adecuada
Si dudas entre Q4_K_M, Q5_K_M o Q6_K, la guía "Elegir la cuantización" explica los compromisos. En un modelo de razonamiento, las pérdidas de cuantización se ven más que en un modelo generalista.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.