Mejor LLM open-source para la educación y enseñanza
Elegir un LLM de código abierto para la educación consiste en encontrar un equilibrio entre la calidad pedagógica del razonamiento, la capacidad de explicar un concepto paso a paso y el bajo consumo de recursos de hardware que exige un despliegue en un centro educativo o en el equipo del docente. El LLM de código abierto para la educación ofrece una ventaja decisiva sobre los servicios propietarios: control de los datos de los alumnos, ausencia de cuotas, cumplimiento del RGPD más sencillo y costo marginal nulo tras la instalación. Este artículo compara los modelos abiertos más pertinentes para la tutoría, la generación de ejercicios, la ayuda con los deberes, la corrección automática y la producción de contenidos pedagógicos multilingües, con sus requisitos de VRAM, licencias y casos de uso concretos para pasar de depender de Khanmigo a tener un tutor local soberano.
¿Qué criterios para un LLM pedagógico?
Un modelo destinado a la enseñanza no se elige como un modelo para programación. Los criterios prioritarios:
- Razonamiento en múltiples pasos : capacidad para descomponer un problema de matemáticas o física sin saltarse pasos lógicos. Las puntuaciones de AIME y MATH (publicadas en Papers With Code) son indicadores útiles.
- Conocimientos generales (MMLU) : cobertura de disciplinas (historia, biología, economía). Los modelos que obtienen > 80 % en MMLU son candidatos serios para la educación secundaria y superior.
- Calidad del francés : crítica para el público francófono. Los modelos europeos como Mistral Large 3 675B o Apertus 70B (Swiss AI) tienen ventaja nativa, al igual que Salamandra 40B Instruct entrenado en corpus multilingües europeos.
- Licencia permisiva : Apache 2.0 o MIT para permitir un despliegue en el ámbito educativo sin trabas jurídicas. La licencia Llama Community impone restricciones sobre el número de usuarios activos mensuales.
- Ventana de contexto : para cargar un manual o varios trabajos escritos. Llama 4 Scout 109B anuncia 10 millones de tokens de contexto, Seed-OSS 36B Instruct ofrece 524.288 tokens.
- Alucinaciones controladas : un tutor que inventa una fórmula es peor que un manual. Preferir modelos con modo "razonamiento" explícito como DeepSeek R1 671B o QwQ 32B.
Para un análisis más amplio de los criterios de selección, ver el guía general para elegir un LLM en quelllm.fr.
Tutoría escolar y secundaria-bachillerato: los modelos de 30-70B
Para un puesto de trabajo docente equipado con una tarjeta de 24 GB (RTX 4090, RTX 5090) o una estación de trabajo con dos GPU, la gama de 30-70B es el punto óptimo. Permite un razonamiento satisfactorio sin saturar la VRAM.
- Qwen 3 32B (Apache 2.0) : VRAM Q4 ~19 GB, contexto 131 072 tokens. Excelente en matemáticas y en francés escrito, soporte nativo de la cadena de pensamiento. Perfil detallado en HuggingFace Qwen.
- Gemma 4 31B (licencia Gemma): 18 GB en Q4, 256 000 tokens de contexto. Respuestas bien calibradas para un público escolar, tono medido.
- Llama 3.3 70B Instruct (Llama 3.3 Community): 40 GB en Q4. Referencia absoluta para la cultura general, puntuación MMLU elevada. Evitar si la institución supera los 700 millones de usuarios activos mensuales — un umbral que rara vez se alcanza en entornos educativos.
- DeepSeek R2 32B (MIT): 19 GB en Q4, razonamiento explícito. Buen candidato para ayudar con ejercicios de matemáticas y de física y química.
- OLMo 3 32B (Apache 2.0, Allen AI): 19 GB en Q4. Particularidad: modelo completamente abierto (pesos + datos + receta de entrenamiento), valioso para un uso académico en el que importa la reproducibilidad. Consulta el repositorio oficial de Allen AI.
- Apertus 70B (Apache 2.0): 40 GB en Q4. Modelo multilingüe europeo, diseñado por Swiss AI con enfoque de soberanía.
Para un comparativo numérico, consultar la página Qwen 3 32B vs Llama 3.3 70B.
Uso eficiente de recursos: modelos de 30-40B al alcance de una GPU de consumo
Para un instituto equipado con una sola RTX 4090, o un centro de documentación e información (CDI) que comparta un equipo, sigue siendo necesario elegir un modelo que requiera menos de 24 GB de VRAM en Q4.
- Qwen 3.6 35B-A3B (Apache 2.0): 21 GB en Q4, arquitectura MoE con 3B de parámetros activos. Velocidad de inferencia alta porque solo los expertos relevantes se activan en cada token. Ideal para un tutor que responde con rapidez en clase.
- Seed-OSS 36B Instruct (Apache 2.0, ByteDance): 22 GB en Q4, contexto de 524 288 tokens. Permite analizar un manual completo o una disertación larga sin dividirlos en fragmentos.
- Salamandra 40B Instruct (Apache 2.0, Barcelona Supercomputing Center) : 24 GB en Q4. Entrenado específicamente para lenguas europeas, entre ellas el francés y el español. Documentado en HuggingFace BSC-LT.
- Yi 1.5 34B Chat (Apache 2.0, 01.AI): 20 GB en Q4. Buena versatilidad, pero contexto limitado a 4096 tokens: reservar para interacciones cortas.
Tokens/sec estimados en RTX 4090 en Q4: 35-50 tok/s para modelos 32B densos, 80-120 tok/s para los MoE como Qwen 3.6 35B-A3B. Ver el benchmark de velocidad en quelllm.fr.
Casos de uso: generar ejercicios, corregir trabajos de alumnos, explicar un concepto
Generación de ejercicios diferenciados. Un profesor establece un objetivo pedagógico y tres niveles (apoyo, estándar, profundización). Mistral Small 4 (Apache 2.0, 119B, 72 GB en Q4) genera enunciados bien formulados en francés y respeta las instrucciones de dificultad. Qwen 3.5 122B-A10B (73 GB en Q4) con sus 10B activos ofrece un excelente equilibrio entre velocidad y calidad para producción en masa.
Corrección de trabajos breves de alumnos. La función-grilla (enunciado + criterios + copia de alumno) exige rigor. DeepSeek R1 Distill 32B (MIT, 19 GB en Q4) o QwQ 32B (Apache 2.0) manejan bien las rúbricas estructuradas. Mantener a un docente humano en el proceso sigue siendo necesario para la asignación final de notas.
Tutoría conversacional tipo Khanmigo. El objetivo es guiar sin dar la respuesta. Llama 3.3 70B Instruct et Gemma 4 31B tienen comportamientos alineados con la pedagogía socrática. Para un Alternativa a Khanmigo completamente local, estos dos modelos combinados con una RAG documental sobre los programas oficiales constituyen una base sólida.
Divulgación multimodal. Para explicar un esquema de ciencias de la vida y de la Tierra o comentar una figura histórica, pasar a un modelo de visión-lenguaje: Qwen 3 VL 235B-A22B (142 GB en Q4) o LLaVA-OneVision 72B (42 GB en Q4) para establecimientos adecuadamente equipados.
Soberanía, cumplimiento normativo y alojamiento en el centro educativo
El despliegue de una Tutor de IA local en un establecimiento escolar plantea tres preguntas concretas:
- Hosting : un servidor académico o municipal, sin tráfico saliente hacia una nube extranjera. Los modelos con licencias MIT y Apache 2.0 (DeepSeek R2 32B, Mistral Small 4, OLMo 3 32B) no limitan la redistribución interna.
- Conformidad con el RGPD : ningún prompt de un alumno se expone a terceros. El reglamento europeo (EUR-Lex 2016/679) es más sencillo de cumplir con un modelo on-premise.
- Filtrado y seguridad : sigue siendo necesario un sistema de moderación previa (clasificador, lista negra de prompts). Ningún LLM abierto es intrínsecamente seguro para un público de menores sin salvaguardas explícitas.
Para explorar las implicaciones de una arquitectura soberana, ver el guía de despliegue on-premise en quelllm.fr.
FAQ
P: ¿Qué LLM de código abierto elegir con un presupuesto para una sola GPU RTX 4090?
En una sola RTX 4090 (24 GB de VRAM), optar por Qwen 3 32B o Gemma 4 31B en cuantización Q4 (~19 GB) deja margen para el contexto. Para un mejor ratio velocidad/calidad, Qwen 3.6 35B-A3B en MoE entrega respuestas más rápidas gracias a sus 3B de parámetros activos.
P: ¿Existe una verdadera alternativa local a Khanmigo?
Sí. Llama 3.3 70B Instruct o Apertus 70B combinados con una base documental RAG (manuales, programas oficiales) y un prompt de sistema pedagógico socrático reproducen la función de tutoría de Khanmigo, sin transmitir datos de alumnos a terceros. Prever ~40 GB de VRAM y una estación con 2 GPU de 24 GB.
P: ¿Son suficientes los modelos europeos para el francés escolar?
Mistral Large 3 675B et Mistral Small 4 (Apache 2.0) destacan en francés y respetan las convenciones tipográficas. Salamandra 40B Instruct (Apache 2.0, BSC) y Apertus 70B (Swiss AI) se entrenan en corpus multilingües europeos con una alta proporción de francés — relevantes para un uso soberano.
P: ¿Qué licencia elegir para un despliegue en academia?
Apache 2.0 y MIT son las licencias más seguras: no tienen restricciones de uso comercial ni umbrales de usuarios. La licencia Llama Community impone condiciones por encima de los 700 millones de usuarios activos mensuales; rara vez suponen una limitación para un centro educativo, pero hay que validarlas con el servicio jurídico de la autoridad educativa regional.
P: ¿Se necesita un modelo de "razonamiento" para la tutoría de matemáticas?
Para la educación secundaria básica, un modelo generalista como Gemma 4 31B basta. Para el bachillerato científico y la educación superior, pasar a DeepSeek R1 Distill 32B, QwQ 32B o DeepSeek R2 32B que exponen su cadena de pensamiento. Las puntuaciones AIME publicadas en HuggingFace Open LLM Leaderboard confirman su superioridad en problemas de múltiples etapas.
P: ¿Cómo evitar las alucinaciones en un uso pedagógico?
Tres medidas que pueden combinarse: (1) conectar el modelo a una base RAG de manuales y planes de estudio oficiales, (2) mostrar siempre la cadena de razonamiento cuando se use un modelo de razonamiento, (3) establecer pautas en el prompt del sistema ("si no estás seguro, dilo explícitamente"). Ninguna medida aislada elimina los errores.
Conclusión
La elección de un LLM de código abierto para la educación depende del hardware disponible, del idioma objetivo y del nivel educativo. Para secundaria y bachillerato con una sola GPU, Qwen 3 32B, Gemma 4 31B o Qwen 3.6 35B-A3B son puntos de entrada sólidos; para un despliegue soberano a escala de una institución, Mistral Small 4, Apertus 70B o Llama 3.3 70B Instruct ofrecen una calidad comparable a la de los servicios propietarios. Para afinar la elección según tu hardware exacto, utiliza el configurador quelllm.fr o explora el catálogo completo de los 249 modelos.