Mejor LLM open-source para la educación y enseñanza

Elegir un LLM de código abierto para la educación consiste en encontrar un equilibrio entre la calidad pedagógica del razonamiento, la capacidad de explicar un concepto paso a paso y el bajo consumo de recursos de hardware que exige un despliegue en un centro educativo o en el equipo del docente. El LLM de código abierto para la educación ofrece una ventaja decisiva sobre los servicios propietarios: control de los datos de los alumnos, ausencia de cuotas, cumplimiento del RGPD más sencillo y costo marginal nulo tras la instalación. Este artículo compara los modelos abiertos más pertinentes para la tutoría, la generación de ejercicios, la ayuda con los deberes, la corrección automática y la producción de contenidos pedagógicos multilingües, con sus requisitos de VRAM, licencias y casos de uso concretos para pasar de depender de Khanmigo a tener un tutor local soberano.

¿Qué criterios para un LLM pedagógico?

Un modelo destinado a la enseñanza no se elige como un modelo para programación. Los criterios prioritarios:

Para un análisis más amplio de los criterios de selección, ver el guía general para elegir un LLM en quelllm.fr.

Tutoría escolar y secundaria-bachillerato: los modelos de 30-70B

Para un puesto de trabajo docente equipado con una tarjeta de 24 GB (RTX 4090, RTX 5090) o una estación de trabajo con dos GPU, la gama de 30-70B es el punto óptimo. Permite un razonamiento satisfactorio sin saturar la VRAM.

Para un comparativo numérico, consultar la página Qwen 3 32B vs Llama 3.3 70B.

Uso eficiente de recursos: modelos de 30-40B al alcance de una GPU de consumo

Para un instituto equipado con una sola RTX 4090, o un centro de documentación e información (CDI) que comparta un equipo, sigue siendo necesario elegir un modelo que requiera menos de 24 GB de VRAM en Q4.

Tokens/sec estimados en RTX 4090 en Q4: 35-50 tok/s para modelos 32B densos, 80-120 tok/s para los MoE como Qwen 3.6 35B-A3B. Ver el benchmark de velocidad en quelllm.fr.

Casos de uso: generar ejercicios, corregir trabajos de alumnos, explicar un concepto

Generación de ejercicios diferenciados. Un profesor establece un objetivo pedagógico y tres niveles (apoyo, estándar, profundización). Mistral Small 4 (Apache 2.0, 119B, 72 GB en Q4) genera enunciados bien formulados en francés y respeta las instrucciones de dificultad. Qwen 3.5 122B-A10B (73 GB en Q4) con sus 10B activos ofrece un excelente equilibrio entre velocidad y calidad para producción en masa.

Corrección de trabajos breves de alumnos. La función-grilla (enunciado + criterios + copia de alumno) exige rigor. DeepSeek R1 Distill 32B (MIT, 19 GB en Q4) o QwQ 32B (Apache 2.0) manejan bien las rúbricas estructuradas. Mantener a un docente humano en el proceso sigue siendo necesario para la asignación final de notas.

Tutoría conversacional tipo Khanmigo. El objetivo es guiar sin dar la respuesta. Llama 3.3 70B Instruct et Gemma 4 31B tienen comportamientos alineados con la pedagogía socrática. Para un Alternativa a Khanmigo completamente local, estos dos modelos combinados con una RAG documental sobre los programas oficiales constituyen una base sólida.

Divulgación multimodal. Para explicar un esquema de ciencias de la vida y de la Tierra o comentar una figura histórica, pasar a un modelo de visión-lenguaje: Qwen 3 VL 235B-A22B (142 GB en Q4) o LLaVA-OneVision 72B (42 GB en Q4) para establecimientos adecuadamente equipados.

Soberanía, cumplimiento normativo y alojamiento en el centro educativo

El despliegue de una Tutor de IA local en un establecimiento escolar plantea tres preguntas concretas:

  1. Hosting : un servidor académico o municipal, sin tráfico saliente hacia una nube extranjera. Los modelos con licencias MIT y Apache 2.0 (DeepSeek R2 32B, Mistral Small 4, OLMo 3 32B) no limitan la redistribución interna.
  2. Conformidad con el RGPD : ningún prompt de un alumno se expone a terceros. El reglamento europeo (EUR-Lex 2016/679) es más sencillo de cumplir con un modelo on-premise.
  3. Filtrado y seguridad : sigue siendo necesario un sistema de moderación previa (clasificador, lista negra de prompts). Ningún LLM abierto es intrínsecamente seguro para un público de menores sin salvaguardas explícitas.

Para explorar las implicaciones de una arquitectura soberana, ver el guía de despliegue on-premise en quelllm.fr.

FAQ

P: ¿Qué LLM de código abierto elegir con un presupuesto para una sola GPU RTX 4090?

En una sola RTX 4090 (24 GB de VRAM), optar por Qwen 3 32B o Gemma 4 31B en cuantización Q4 (~19 GB) deja margen para el contexto. Para un mejor ratio velocidad/calidad, Qwen 3.6 35B-A3B en MoE entrega respuestas más rápidas gracias a sus 3B de parámetros activos.

P: ¿Existe una verdadera alternativa local a Khanmigo?

Sí. Llama 3.3 70B Instruct o Apertus 70B combinados con una base documental RAG (manuales, programas oficiales) y un prompt de sistema pedagógico socrático reproducen la función de tutoría de Khanmigo, sin transmitir datos de alumnos a terceros. Prever ~40 GB de VRAM y una estación con 2 GPU de 24 GB.

P: ¿Son suficientes los modelos europeos para el francés escolar?

Mistral Large 3 675B et Mistral Small 4 (Apache 2.0) destacan en francés y respetan las convenciones tipográficas. Salamandra 40B Instruct (Apache 2.0, BSC) y Apertus 70B (Swiss AI) se entrenan en corpus multilingües europeos con una alta proporción de francés — relevantes para un uso soberano.

P: ¿Qué licencia elegir para un despliegue en academia?

Apache 2.0 y MIT son las licencias más seguras: no tienen restricciones de uso comercial ni umbrales de usuarios. La licencia Llama Community impone condiciones por encima de los 700 millones de usuarios activos mensuales; rara vez suponen una limitación para un centro educativo, pero hay que validarlas con el servicio jurídico de la autoridad educativa regional.

P: ¿Se necesita un modelo de "razonamiento" para la tutoría de matemáticas?

Para la educación secundaria básica, un modelo generalista como Gemma 4 31B basta. Para el bachillerato científico y la educación superior, pasar a DeepSeek R1 Distill 32B, QwQ 32B o DeepSeek R2 32B que exponen su cadena de pensamiento. Las puntuaciones AIME publicadas en HuggingFace Open LLM Leaderboard confirman su superioridad en problemas de múltiples etapas.

P: ¿Cómo evitar las alucinaciones en un uso pedagógico?

Tres medidas que pueden combinarse: (1) conectar el modelo a una base RAG de manuales y planes de estudio oficiales, (2) mostrar siempre la cadena de razonamiento cuando se use un modelo de razonamiento, (3) establecer pautas en el prompt del sistema ("si no estás seguro, dilo explícitamente"). Ninguna medida aislada elimina los errores.

Conclusión

La elección de un LLM de código abierto para la educación depende del hardware disponible, del idioma objetivo y del nivel educativo. Para secundaria y bachillerato con una sola GPU, Qwen 3 32B, Gemma 4 31B o Qwen 3.6 35B-A3B son puntos de entrada sólidos; para un despliegue soberano a escala de una institución, Mistral Small 4, Apertus 70B o Llama 3.3 70B Instruct ofrecen una calidad comparable a la de los servicios propietarios. Para afinar la elección según tu hardware exacto, utiliza el configurador quelllm.fr o explora el catálogo completo de los 249 modelos.

Artículo publicado y actualizado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.