Mistral Magistral: instalar el modelo de razonamiento
Magistral es el modelo de razonamiento de Mistral AI: un modelo que «piensa en voz alta» antes de responder, como DeepSeek R1 o OpenAI o1, pero con una calidad nativa en francés que ningún otro modelo de razonamiento de pesos abiertos alcanza. Esta guía muestra cómo instalar Mistral Magistral en local mediante Ollama, configurarlo con la plantilla de prompt adecuada y compararlo honestamente con DeepSeek R1 destilado.
#¿Por qué Magistral en lugar de otro modelo de razonamiento?
Los modelos de razonamiento (reasoning models) generan una cadena de pensamiento explícita antes de la respuesta final. En problemas complejos —matemáticas, lógica, código delicado, análisis jurídico— consiguen entre 10 y 30 puntos más en los benchmarks que un modelo generalista del mismo tamaño. El coste: son más lentos y más verbosos.
Hasta la llegada de Magistral, las opciones de pesos abiertos eran principalmente chinas: DeepSeek R1 y sus modelos destilados, Qwen3 en modo thinking, GLM. Todas razonan perfectamente en inglés y en chino, pero su cadena de pensamiento cambia regularmente al chino incluso cuando el prompt está en francés. Magistral está entrenado específicamente para mantener la traza de razonamiento en el idioma del prompt.
- Razonamiento multilingüe nativo
- La cadena de pensamiento permanece en francés cuando escribes en francés. No hay cambios bruscos al chino o al inglés.
- Apache 2.0 en la versión Small
- Uso comercial autorizado, fine-tuning libre, redistribución permitida. No hay zonas grises como con algunas licencias "open" restrictivas.
- Base Mistral Small 3.1
- Buena calidad de escritura en francés heredada de la base, lo que se observa en la redacción de respuestas jurídicas o administrativas.
- Contexto de 40k tokens
- Suficiente para un enunciado largo de problema, varios artículos de código o un contrato de unas decenas de páginas.
#Magistral Small vs Magistral Medium
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Mistral AI publica Magistral en dos versiones, y la confusión es frecuente. Para instalar Mistral Magistral localmente, solo la versión Small es usable — la Medium solo está disponible a través de la API.
- Magistral Small (24B)
- Pesos abiertos bajo la licencia Apache 2.0. Es ESTE modelo el que se instala en local. 24 mil millones de parámetros, derivado de Mistral Small 3.1.
- Magistral Medium
- Propietario, accesible únicamente a través de la API de Mistral o de Le Chat. Rendimiento superior, pero no se puede alojar en tu propia infraestructura. Queda fuera del alcance de esta guía.
#Requisitos de hardware
Magistral Small tiene 24B parámetros. En cuantización Q4_K_M (el estándar Ollama), se necesitan aproximadamente 14 GB de VRAM para cargar el modelo, más 1 a 3 GB para el contexto según la longitud.
- Mínimo cómodo
- RTX 4080 16 GB, RTX 4090 24 GB, RTX 3090 24 GB, o Mac Apple Silicon con 24 GB de memoria unificada.
- Al límite, pero viable
- RTX 4070 Ti Super de 16 GB (Q4 cabe justo, contexto corto obligatorio) o Mac de la serie M de 16 GB con offload parcial.
- Insuficiente
- Cualquier GPU de 12 GB o menos. El modelo desborda la VRAM y pasa a usar la RAM del sistema, y la velocidad cae a 2-4 tokens/segundo, algo inutilizable para un modelo que debe producir miles de tokens antes de responder.
- Ollama y drivers
- Ollama ≥ 0.5.x, drivers NVIDIA recientes (CUDA 12) o Metal en Mac. Compruébalo con `ollama --version`.
#1. Instalación mediante Ollama
Magistral Small está disponible en Ollama Hub desde el lanzamiento oficial de Mistral. La instalación se realiza con un solo comando.
- 01Verifica que Ollama esté funcionandoEn Windows/macOS, la aplicación debe estar en ejecución (icono en la barra de tareas). En Linux, `systemctl status ollama` confirma que el servicio está activo.
- 02Descargar el modeloLa cuantización predeterminada proporcionada por Ollama es Q4_K_M. Ofrece un buen equilibrio para 16-24 GB de VRAM.
- 03Primer inicioOllama descarga ~14 GB al primer `pull`. La descarga inicial puede tardar entre 10 y 30 minutos según tu conexión.
- 04Prueba de cargaEjecuta `ollama run magistral` y luego plantea una pregunta breve. Si el modelo responde después de 5-10 segundos de "warmup", todo va bien.
Para comprobar que el modelo utiliza realmente la GPU y no la RAM de la CPU, un comando de comprobación:
En la columna PROCESSOR, debes ver `100% GPU`. Si ves `45% CPU / 55% GPU`, tu VRAM es insuficiente: Ollama ha recurrido parcialmente a la RAM. El modelo funcionará, pero a 1-3 tokens/segundo.
#2. La plantilla oficial de prompt
Magistral utiliza un formato de prompt específico para activar correctamente el razonamiento. Ollama ya incluye esta plantilla en el Modelfile oficial, pero conviene entenderla para no alterarla involuntariamente con un prompt de sistema mal colocado.
Estructura esperada, simplificada:
En la práctica, nunca escribes estas etiquetas a mano: Ollama las inserta automáticamente. Lo que debes saber es que el modelo espera que le pidas que razone. Un prompt de sistema corto y claro mejora notablemente la calidad.
#3. Primeros tests prácticos en francés
Aquí tienes tres prompts para evaluar rápidamente Magistral en tareas típicas. Ten en cuenta que las respuestas llegan en dos fases: primero la cadena de pensamiento (`<think>...</think>`), luego la respuesta final.
Magistral desarrollará el razonamiento clásico del camello prestado. Calcula entre 1500 y 2500 tokens de razonamiento antes de la respuesta final clara y numerada.
Buena oportunidad para ver la calidad algorítmica. Magistral suele proponer la solución con un diccionario de sumas de prefijos, explicando su elección de estructura de datos durante la fase de razonamiento.
En este tipo de solicitud, la calidad lingüística de Magistral en francés marca la diferencia. La cláusula generada es sintácticamente correcta, menciona las condiciones de validez (limitación temporal, limitación geográfica y contraprestación económica) y utiliza el vocabulario jurídico francés, en lugar de ser una traducción torpe del inglés.
#4. Rendimiento: AIME, matemáticas, código
Mistral AI ha comunicado cifras oficiales sobre Magistral Small y Medium. Los valores que se indican a continuación son las puntuaciones de Small (la única versión que se puede autoalojar), redondeadas. Sirven solo como referencia: tus resultados varían según la cuantización y el muestreo.
- AIME 2024 (olimpiadas de matemáticas)
- Magistral Small ~70 %, frente a ~50 % para Mistral Small 3.1, que no es un modelo de razonamiento. La mejora que aporta el modo de razonamiento es enorme en este tipo de problema.
- LiveCodeBench (código)
- Puntuación equivalente o ligeramente superior a Qwen3-Coder 30B-A3B en problemas de nivel medio, inferior en niveles difíciles.
- MMLU FR
- Comparable a Mistral Small 3.1 base: el razonamiento no aporta nada en los cuestionarios de opción múltiple de conocimientos generales, donde la respuesta está memorizada o no lo está.
- GPQA Diamond (razonamiento científico)
- Mejora clara con el modo thinking, en torno al 50-55 % frente al 35-40 % del modelo base sin razonamiento.
#5. Magistral Small vs DeepSeek R1 destilado 14B
La comparación útil para el francófono es con DeepSeek-R1-Distill-Qwen-14B, el competidor directo con pesos abiertos para quien quiere razonamiento local. Ambos tienen sus fortalezas: esto es lo que muestran las pruebas prácticas.
- Huella de memoria
- DeepSeek R1 14B Q4 ≈ 9 GB, Magistral 24B Q4 ≈ 14 GB. Ventaja clara para DeepSeek si tu GPU tiene un máximo de 12 GB.
- Calidad del razonamiento en FR
- Magistral mantiene el francés desde el principio hasta el final. DeepSeek R1 destilado cambia regularmente a chino o inglés en la cadena de pensamiento, incluso con un prompt de sistema FR estricto. Ventaja de Magistral.
- Calidad de la respuesta final FR
- Magistral produce un francés de mayor calidad (vocabulario, concordancia, registro). DeepSeek R1 14B comete errores de uso típicos de un modelo traducido. Ventaja para Magistral.
- Matemáticas puras (AIME, AMC)
- DeepSeek R1 destilado 14B es ligeramente mejor que Magistral Small en problemas muy formales. Ventaja DeepSeek.
- Código
- Empate en la práctica. Ambos generan código correcto en problemas de dificultad media. En código en francés (comentarios, nombres de variables), Magistral es más limpio.
- Velocidad de generación
- DeepSeek 14B es ~1,7× más rápido con la misma cantidad de VRAM, simplemente por su tamaño. Para una sesión interactiva, eso cuenta.
#6. Caso de uso: análisis jurídico en local
La combinación de calidad en francés + razonamiento + autoalojamiento convierte a Magistral en un excelente candidato para tareas jurídicas sensibles. El contenido jurídico nunca sale de tu máquina: un argumento decisivo ante un despacho que no puede enviar sus expedientes a OpenAI.
Tres casos concretos que funcionan bien:
- Análisis de cláusula contractual
- Pegar una cláusula, pedir la identificación de los riesgos para una u otra parte. Magistral explica su razonamiento, lo que hace que el análisis sea auditable —un humano puede verificar dónde el modelo vio un problema.
- Comparación de versiones
- Pegar dos versiones de una adenda, pedir la lista de diferencias sustanciales (no cosméticas) y su impacto. El modo de razonamiento ayuda a separar el ruido de lo sustancial.
- Redacción de nota interna
- Solicitar una nota de síntesis a partir de un texto legal o de una sentencia. La calidad lingüística en francés es aquí el factor diferenciador.
#Solución de problemas
- El modelo cambia al inglés durante el razonamiento
- Refuerza el prompt del sistema con una instrucción explícita: "Piensa y responde únicamente en francés." Si no es suficiente, añade un primer mensaje corto en francés para fijar el idioma antes de la pregunta real.
- Respuestas truncadas antes de la conclusión
- El modelo ha agotado su presupuesto de tokens durante el razonamiento. Aumenta la ventana con `/set parameter num_ctx 16384` y `/set parameter num_predict 4096`.
- Generación a 1-2 tokens/segundo
- El modelo se ejecuta en la CPU o con offload parcial. `ollama ps` lo confirma. Soluciones: liberar VRAM (cerrar Chrome / Steam), pasar a una cuantización más agresiva como Q3_K_M o aceptar que esta GPU no es suficiente.
- Las etiquetas <think> aparecen en la respuesta final
- Es el comportamiento esperado en modo sin procesar. Una interfaz como Open WebUI o LM Studio las oculta automáticamente dentro de un bloque desplegable "reasoning". En la CLI de Ollama, siguen visibles: es así por diseño.
- El modelo «alucina» sobre hechos recientes
- Los conocimientos de Magistral Small quedan fijados en la fecha de su entrenamiento. Para responder a preguntas sobre hechos actualizados (jurisprudencia reciente, actualidad), se necesita un pipeline RAG, no solo el modelo por sí mismo.
#Para ir más allá
Magistral es un excelente modelo FR para quien tenga la GPU necesaria. Algunas ideas para aprovechar al máximo tu instalación:
- Comparar con DeepSeek R1 en tu máquina
- La guía de instalación de DeepSeek R1 muestra cómo instalar la versión destilada de 14B junto con Magistral para comparar ambos modelos con tus propios prompts.
- Conectar Magistral a tus PDF jurídicos
- La guía PrivateGPT v2 describe un pipeline RAG 100% local que complementa perfectamente Magistral para análisis documental confidencial.
- Elegir la cuantización más adecuada
- Si dudas entre Q4_K_M, Q5_K_M o Q6_K, la guía "Elegir la cuantización" explica los compromisos. En un modelo de razonamiento, las pérdidas de cuantización se ven más que en un modelo generalista.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.