Mejor LLM open-source para traducción multilingüe
Encontrar un LLM de código abierto para traducción de alto rendimiento sin depender de una API propietaria se ha convertido en un reto concreto para los equipos que manejan volúmenes de contenido multilingüe (contratos, soporte al cliente, documentación técnica). A diferencia de una API en la nube facturada por token, un modelo de pesos abiertos alojado localmente ofrece un control total sobre los datos traducidos y un coste fijo independiente del volumen. Este artículo repasa los modelos generalistas del catálogo más adecuados para la traducción, la configuración de hardware necesaria y el lugar de modelos especializados como Aya 32B o Madlad-400 en este panorama.
¿Por qué elegir un modelo de pesos abiertos para la traducción?
La traducción de documentos sensibles (jurídicos, de recursos humanos o médicos) plantea un problema de confidencialidad cuando el texto pasa por una API de terceros. Un modelo ejecutado localmente mediante llama.cpp, vLLM o Ollama elimina este tránsito por la red: los archivos permanecen en la infraestructura de la empresa. Este razonamiento se detalla en nuestra guía sobre la traducción de documentos con un LLM local y en el dedicado a atención al cliente multilingüe.
La segunda ventaja radica en la licencia. La mayoría de los modelos multilingües recientes del catálogo están publicados bajo Apache 2.0 o MIT, lo que permite un uso comercial sin regalías; un punto que hay que verificar sistemáticamente antes de un despliegue en producción.
Modelos generalistas multilingües recomendados
Los grandes modelos mixture-of-experts publicados en 2025-2026 cubren generalmente varias decenas de idiomas nativamente, gracias a corpus de entrenamiento masivamente multilingües. Entre las opciones del catálogo:
- Qwen 3.5 397B-A17B — 397B parámetros, licencia Apache 2.0, VRAM Q4 estimada en ~240 GB, contexto de 262 000 tokens. Alibaba entrena su familia Qwen con un corpus muy multilingüe que incluye numerosos pares de lenguas asiáticas y europeas (ficha del modelo, Alibaba en Hugging Face).
- Mistral Large 3 675B — 675B parámetros, Apache 2.0, VRAM Q4 ~405 GB, contexto 256 000 tokens. Mistral AI enfatiza las lenguas europeas desde el diseño de sus modelos (ficha del modelo, Mistral AI en Hugging Face).
- GLM 5.3 Flash 320B-A18B — 320B de parámetros, licencia MIT, VRAM Q4 ~186 GB, contexto de 128 000 tokens, una opción más ligera para desplegar que los modelos superiores a 400B (ficha del modelo, Zhipu AI en Hugging Face).
- DeepSeek V3.2 — 685 mil millones de parámetros, licencia MIT, VRAM Q4 ~410 GB, contexto de 128 000 tokens (ficha del modelo, DeepSeek en Hugging Face).
- Mistral Small 4 — 119B parámetros, Apache 2.0, VRAM Q4 ~72 GB, contexto de 256.000 tokens: la mejor opción de esta comparativa para un equipo con una sola GPU de 80 GB o un Mac con memoria unificada (ficha del modelo).
Para textos largos (contratos, manuales técnicos), priorizar una ventana de contexto amplia importa tanto como el tamaño del modelo: por encima de 100 000 tokens, el documento entero cabe en una sola solicitud sin dividirlo manualmente, lo que preserva la coherencia terminológica.
Modelos especializados de traducción: Aya 32B y Madlad-400
Fuera de los modelos generales del catálogo, dos familias están específicamente diseñadas para la traducción multilingüe y aparecen frecuentemente en los comparativos: Aya 32B (familia Aya Expanse de Cohere, orientada a la cobertura de más de 20 idiomas) y Madlad-400 (entrenado con un corpus que abarca más de 400 idiomas). Estos modelos no aparecen en el catálogo principal de QuéLLM y sus especificaciones exactas (VRAM por cuantización, tokens/segundo) deben confirmarse caso por caso según la variante probada.
Para situar a Aya 32B frente a generalistas comparables, ver nuestra comparación Aya Expanse 32B vs Qwen 2.5 32B así como la versión más ligera Aya Expanse 8B vs Llama 3 8B. En la práctica, un modelo especializado como Aya destaca en lenguas con pocos datos de entrenamiento, mientras que un modelo generalista de gran tamaño como Qwen 3.5 o Mistral Large 3 sigue siendo más versátil para contenido mixto (traducción + reformulación + resumen en el mismo pipeline).
Configuración de hardware y cuantización
La elección de la cuantización determina directamente la VRAM necesaria:
- Q4 : este es el nivel de referencia utilizado para los datos de este catálogo — aproximadamente 0,58 a 0,6 GB por millardo de parámetros para las arquitecturas MoE recientes.
- Q8 : aproximadamente el doble de la VRAM Q4 (estimada), con una pérdida de calidad en la traducción generalmente despreciable.
- FP16 : aproximadamente cuatro veces la VRAM necesaria en Q4 (estimación), reservado para despliegues con varias GPU de gama alta.
Para una estación de trabajo con una sola GPU de 24 GB o 32 GB, solo los modelos compactos como Mistral Small 4 en cuantización Q4 siguen siendo accesibles; los modelos de más de 200B requieren un clúster o un Mac con una gran capacidad de memoria unificada. Nuestro guía multilingüe europea y nuestra selección de modelos francófonos detallan los compromisos entre VRAM y calidad para configuraciones más modestas.
La velocidad en tokens/segundo varía mucho según la GPU, la longitud del contexto y la carga concurrente; sin una medición en el hardware objetivo, esta cifra queda pendiente de confirmación en lugar de estimarse a priori.
Casos de uso concretos
- Atención al cliente multilingüe : un modelo como GLM 5.3 Flash, más ligero para alojar, permite procesar tickets en varios idiomas con latencia controlada — detalles en el guía de atención al cliente multilingüe.
- Traducción de documentos largos : Mistral Large 3 o DeepSeek V3.2, con su contexto ampliado, evitan tener que dividir contratos o manuales en fragmentos — ver la guía de traducción de documentos.
- Evaluación de calidad : antes de un despliegue, comparar las puntuaciones multilingües de los modelos candidatos en elOpen LLM Leaderboard y verificar la documentación del modelo en Hugging Face Hub.
FAQ
P: ¿Cuál es el mejor LLM de código abierto para traducciones en volumen?
Para un volumen importante con hardware disponible, Qwen 3.5 397B-A17B o Mistral Large 3 675B ofrecen una buena cobertura multilingüe bajo licencia Apache 2.0. Para una infraestructura más modesta, Mistral Small 4 (119B, VRAM Q4 ~72 GB) sigue siendo la opción más accesible del catálogo.
P: ¿Aya 32B es mejor que los modelos generalistas del catálogo?
En lenguas poco representadas en los corpus generalistas, Aya 32B puede ofrecer un rendimiento superior. En pares de lenguas comunes (inglés-francés, inglés-chino), los modelos generalistas como Qwen 3.5 o GLM 5.3 Flash suelen ser competitivos, con un contexto más largo. Ver la comparación Aya Expanse 32B vs Qwen 2.5 32B.
P: ¿Es adecuado el Madlad-400 para un despliegue empresarial?
Madlad-400 busca ofrecer una cobertura lingüística muy amplia (más de 400 idiomas), útil para casos de nicho. Sus especificaciones precisas de VRAM por cuantización deben confirmarse según la variante utilizada; no figura en el catálogo principal de este comparativo.
P: ¿Se necesita una GPU dedicada para ejecutar un LLM de traducción localmente?
Depende del tamaño del modelo elegido. Un modelo compacto como Mistral Small 4 en Q4 cabe en una GPU de 24-32 GB o en un Mac con suficiente memoria unificada. Los modelos de más de 300B requieren varias GPU o una máquina con mucha memoria unificada.
P: ¿Qué licencia elegir para uso comercial?
Preferir Apache 2.0 o MIT, que no imponen regalías ni restricciones de uso comercial — es el caso de Qwen 3.5, Mistral Large 3, GLM 5.3 Flash y DeepSeek V3.2 en esta comparativa. Verificar siempre la licencia exacta en la ficha del modelo antes del despliegue.
P: ¿Cómo medir la calidad de traducción antes de elegir un modelo?
Probar en una muestra representativa del dominio (contratos, tickets de soporte, documentación) en lugar de depender únicamente de benchmarks genéricos como MMLU. Consultar también elOpen LLM Leaderboard para obtener una primera indicación del nivel general antes de realizar una prueba específica del ámbito profesional.
Conclusión
Elegir un LLM de código abierto para traducción depende principalmente del volumen que haya que procesar y del hardware disponible: los modelos generalistas como Qwen 3.5, Mistral Large 3 o GLM 5.3 Flash cubren la mayoría de los casos de uso con licencias permisivas, mientras que modelos especializados como Aya 32B o Madlad-400 siguen siendo relevantes para lenguas con pocos recursos. Para afinar esta elección según tu configuración de hardware, utiliza el configurador o explora todo el catálogo.
El hardware para ejecutar un LLM localmente
Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:
Enlaces de afiliación — QuéLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.