Mejor LLM RGPD on-premise para empresas 2026
Elegir un LLM RGPD on-premise se ha convertido en un tema central para las direcciones técnicas europeas que desean industrializar el procesamiento de documentos sin exponer sus datos a un proveedor SaaS de fuera de Europa. Un LLM RGPD on-premise correctamente desplegado garantiza que los prompts, las salidas y los posibles registros nunca abandonen el entorno controlado por la empresa, lo que simplifica considerablemente las evaluaciones de impacto (AIPD) y las obligaciones del artículo 32 del reglamento. Este artículo repasa los modelos de pesos abiertos relevantes en 2026, sus requisitos de hardware, su licencia, sus casos de uso y los aspectos operativos que requieren atención antes de un despliegue en producción.
¿Por qué un LLM conforme al RGPD en tus propias instalaciones en lugar de una API gestionada?
El reglamento (UE) 2016/679 (ver el texto consolidado en EUR-Lex) impone un control estricto de las transferencias fuera de la UE y una demostración clara de las bases jurídicas del tratamiento. Una API alojada por un proveedor externo introduce sistemáticamente un encargado del tratamiento adicional, cláusulas contractuales tipo (CCT) que deben mantenerse y, en algunos casos, una exposición a leyes extraterritoriales como el CLOUD Act. En cambio, un despliegue en las instalaciones de la empresa (o en una nube privada bajo su control) elimina esta cadena de dependencias.
Otras tres motivaciones se repiten en las observaciones sobre el terreno:
- Soberanía contractual : ningún cambio en los Términos y condiciones del proveedor puede interrumpir el servicio.
- Dominio del fine-tuning : los corpus internos del ámbito profesional permanecen en el sistema de información, lo que evita los riesgos de filtración a través de embeddings.
- Costo marginal previsible : una vez amortizado el hardware, la inferencia ya no depende del costo por millón de tokens.
El ecosistema de pesos abiertos, catalogado en plataformas como Hugging Face o a través de los servidores de inferencia vLLM, permite hoy cubrir casi todos los casos de uso empresarial sin dependencia externa. Para una visión más amplia de las arquitecturas, ver también nuestra guía de LLM open-source en empresas.
Qué modelos de pesos abiertos elegir en 2026
La elección de un LLM soberano empresarial depende de un equilibrio entre calidad bruta, tamaño de contexto, licencia y huella de VRAM. A continuación, una selección representativa extraída de nuestro catálogo completo, clasificada por perfil de uso.
Perfil "centro de datos de alta densidad" (>200 GB de VRAM en Q4)
- DeepSeek V4 Pro 1.6T : 1600 mil millones de parámetros, licencia MIT, contexto de 1 000 000 de tokens, VRAM en Q4 estimada en ~960 GB. Uso previsto: RAG documental a gran escala sobre archivos jurídicos o reglamentarios.
- MiMo V2.5 Pro : 1020B, MIT, contexto 1M, VRAM Q4 ~595 GB. Buena versatilidad multilingüe.
- Mistral Large 3 675B : 675B, Apache 2.0, contexto 256.000, VRAM Q4 ~405 GB. Ventaja francesa: proveedor con sede en París, alojamiento que puede controlarse íntegramente dentro de la UE.
- GLM-5.1 : 744B, MIT, contexto 200 000, VRAM Q4 ~445 GB.
- Llama 4 Maverick 400B : 400B, licencia Llama 4 Community (atención a las cláusulas de uso comercial por encima de 700M MAU), contexto 1M.
Perfil "clúster intermedio" (60-200 GB VRAM Q4)
- Qwen 3 235B-A22B : 235B en mezcla de expertos (22B activados), Apache 2.0, contexto 131 072. Excelente relación entre calidad y coste de inferencia gracias al MoE.
- MiniMax-M2.7 : 229B, Apache 2.0, contexto 205 000.
- Mixtral 8x22B Instruct : 141B (39B activos), Apache 2.0, contexto 64 000. Referencia europea sólida para cargas de trabajo RAG.
- Qwen 3.5 122B-A10B : 122B, Apache 2.0, contexto 262 000.
- gpt-oss 120B : 117B, Apache 2.0, contexto 128 000.
- Llama 4 Scout 109B : 109B, licencia Llama 4 Community, contexto de 10M tokens (a confirmar en la práctica con prompts muy largos).
Perfil "servidor con una sola GPU" (20-60 GB de VRAM en Q4)
- Llama 3.3 70B Instruct : 70B, licencia Llama 3.3 Community, contexto 128 000. Cabe en dos RTX 6000 Ada o en un H100 80 GB en Q4.
- Apertus 70B : 70B, Apache 2.0, contexto 65 536. Modelo de origen suizo, interesante para las organizaciones que buscan un desarrollador europeo en sentido amplio.
- Mixtral 8x7B : 47B, Apache 2.0, contexto 32 768. Sigue siendo pertinente para cargas de trabajo por lotes que no dependen demasiado de los últimos avances del estado del arte.
- Salamandra 40B Instruct : 40B, Apache 2.0, contexto 8192. Procedente del Barcelona Supercomputing Center, entrenado en un corpus multilingüe europeo.
- Qwen 3 32B et Qwen 2.5 Coder 32B : 32B, Apache 2.0. Usos previstos: RAG generalista y asistente interno de programación.
Para una comparación más detallada en el segmento 70B, ver Llama 3.3 70B vs Mixtral 8x22B.
Consumo de VRAM, cuantización y velocidad de generación
La estimación de la VRAM depende de la cuantización elegida. Como primera aproximación, para un modelo denso:
- FP16 : ~2 bytes por parámetro
- Q8 : ~1 byte por parámetro
- Q5_K_M : ~0,7 octeto por parámetro (estimado)
- Q4_K_M : ~0,55 a 0,60 bytes por parámetro
Para arquitecturas MoE como Mixtral 8x22B Instruct o Qwen 3 235B-A22B, la VRAM necesaria corresponde al almacenamiento de todos los expertos, incluso si solo algunos están activados por token. Es la memoria la que limita, no el cálculo. El artículo sobre Mixtral 8x7B en arXiv detalla este mecanismo.
En cuanto a velocidad, los valores en tokens/segundo varían mucho según el motor de inferencia (vLLM, TensorRT-LLM, llama.cpp, SGLang), la longitud del contexto efectivo y el procesamiento por lotes. Algunas magnitudes aproximadas observadas (por confirmar con tu carga de trabajo):
- Llama 3.3 70B Q4 en un H100 de 80 GB con vLLM: ~35-50 tokens/seg con un único flujo, varios cientos en procesamiento por lotes.
- Mixtral 8x7B Q4 en RTX 4090 24 GB con offload parcial: ~20-30 tokens/seg (estimado).
- Qwen 3 30B-A3B Q4 en RTX 6000 Ada 48 GB: ~60-80 tokens/seg en single-stream (estimado), favorecido por la arquitectura MoE.
- DeepSeek R1 671B Q4 en un nodo 8×H200: ~15-25 tokens/s en un único flujo (por confirmar según la versión de inferencia).
Para dimensionar con precisión un servidor, el configurador quelllm.fr cruza GPU, RAM y modelos compatibles.
Licencias: lo que realmente cambia en producción
Une IA conforme al RGPD no basta: también se necesita una licencia compatible con tu modelo de negocio. Tres familias dominan:
- Apache 2.0 (Mistral, Qwen, gpt-oss, Mixtral, Snowflake, MiniMax, IBM Granite, BSC Salamandra…): uso comercial libre, redistribución autorizada, cláusula de protección de patentes. Es la licencia más sencilla para un despliegue empresarial.
- MIT (DeepSeek V3.2, R1, V4 Pro, GLM-5.1, Ling 2.6, MiMo, Ring-1T, dots.llm1, Seed-OSS): aún más permisiva, pero sin cláusula de patentes explícita.
- Llama Community (Meta): uso comercial autorizado salvo cuando se superan los 700 millones de usuarios activos mensuales, con cláusulas de uso aceptable. Se puede consultar en el sitio Llama.
- Gemma (Google): comercial, pero con una política de usos prohibidos que debe respetarse.
Para organizaciones que buscan la trazabilidad máxima, OLMo 3 32B de Allen AI también publica sus conjuntos de entrenamiento, lo que facilita algunas auditorías (ver el blog de Allen AI). En Europa, Mistral Large 3 675B et Apertus 70B son las opciones clave. Más detalles en nuestra página mejor LLM francés.
Pruebas y casos de uso para un LLM auto-hospedado empresarial
Las puntuaciones públicas deben tratarse con precaución: las metodologías varían y la contaminación de los conjuntos de prueba ya está documentada. Algunos puntos de referencia extraídos de las fichas de modelos de Hugging Face:
- MMLU (conocimientos generales 5-shot): los modelos >200B alcanzan típicamente el 85-89 %. DeepSeek R1 671B, Qwen 3 235B-A22B et Mistral Large 3 675B se sitúan en esta zona (a confirmar según el pipeline de evaluación).
- HumanEval / MBPP (código Python): Qwen 2.5 Coder 32B et Qwen3-Coder-Next 80B-A3B son candidatos serios para un asistente de código interno.
- AIME 2024/2025 (razonamiento matemático): DeepSeek R1 671B, QwQ 32B et Ring-1T están posicionados en este segmento "reasoning".
- Long-context (RULER, LongBench) : Llama 4 Scout 109B, Seed-OSS 36B Instruct (524.288 tokens) y MiMo V2.5 Pro destacan con contextos largos.
Casos de uso típicos para la dirección de sistemas de información:
- RAG documental interno : 32-70B son más que suficientes. Ver mejor LLM para RAG y nuestro guía de RAG on-premise.
- Asistente jurídico / de cumplimiento normativo : preferir un contexto ≥ 128 000 tokens y un modelo multilingüe sólido (Mistral Large 3, Qwen 3 235B).
- Generación de código : Qwen 2.5/3 Coder, Laguna XS.2, DeepSeek R2 32B.
- Multimodal : Qwen 3 VL 235B-A22B, Molmo 72B, LLaVA-OneVision 72B para el análisis de documentos escaneados.
- Cargas de trabajo ligeras y en el edge : Granite 4.0 H-Small 32B-A9B, Gemma 4 31B, Qwen 3 30B-A3B.
Ver también nuestra comparativa DeepSeek R1 vs Llama 3.3 70B para decidir entre razonamiento y costo de hardware.
Arquitectura objetivo: del POC a la producción
Un despliegue on-premise robusto se organiza alrededor de cuatro capas:
- Capa de hardware : GPU NVIDIA (H100/H200/B200, RTX 6000 Ada, L40S) o alternativas AMD MI300X. Para cargas de trabajo >400B, un nodo 8×H100 80 GB o 8×H200 141 GB es el mínimo realista.
- Capa de inferencia : vLLM o SGLang para la tasa de procesamiento, TensorRT-LLM para la latencia, llama.cpp para servidores sin GPU dedicada. La documentación vLLM cubre la mayoría de los modelos mencionados aquí.
- Capa de orquestación : Kubernetes con el NVIDIA GPU Operator, KEDA para el escalado, y un gateway tipo LiteLLM o Envoy para la unificación de las APIs compatibles con OpenAI.
- Capa de cumplimiento normativo : registro cifrado de los prompts con un periodo de conservación breve, enmascaramiento de información personal identificable a la entrada (Presidio, recomendaciones de la CNIL sobre la IA), registro de actividades de tratamiento actualizado, EIPD documentada.
En cuanto a observabilidad, herramientas como Langfuse o OpenTelemetry permiten rastrear las cadenas RAG sin enviar los logs a un SaaS. Para una aproximación estructurada, consulta nuestro guía de despliegue de LLM en producción y la lista de comprobación de seguridad de LLM.
FAQ
P: ¿Un LLM con pesos abiertos descargado desde Hugging Face cumple automáticamente con el RGPD?
No. La licencia del modelo y su lugar de ejecución son dos cuestiones distintas. Descargar los pesos de Mistral Large 3 o DeepSeek R1 y ejecutarlos en un centro de datos europeo bajo tu control elimina la transferencia de datos de los usuarios fuera de la UE, pero sigues siendo responsable de los tratamientos (artículo 24 del RGPD): evaluación de impacto relativa a la protección de datos, plazos de conservación, derechos de las personas y seguridad de los accesos.
P: ¿Qué cuantización elegir para un LLM sujeto al RGPD y alojado en las instalaciones de la empresa sin degradar la calidad?
Para producción, Q5_K_M o Q4_K_M ofrecen el mejor equilibrio calidad/VRAM en modelos >30B según las evaluaciones comunitarias publicadas en Hugging Face. Por debajo (Q3, Q2), la pérdida se vuelve medible en tareas de razonamiento. Para usos regulatorios sensibles, Q8 o FP16 siguen siendo recomendables si la VRAM lo permite, especialmente en modelos <70B.
P: ¿Se puede hacer fine-tuning con datos personales cumpliendo la normativa?
Sí, siempre que se documenten la base legal, la EIPD y la retención. Los modelos bajo licencia Apache 2.0 (Mistral, Qwen, gpt-oss, IBM Granite) o MIT (DeepSeek, GLM) autorizan explícitamente el fine-tuning comercial. LoRA y QLoRA permiten mantener los adaptadores separados de los pesos base, lo que facilita la eliminación a solicitud de una persona interesada si el corpus lo justifica.
P: ¿Mixtral 8x22B o Llama 3.3 70B para comenzar?
Mixtral 8x22B Instruct consume más VRAM (82 GB Q4 contra 40 GB) pero cuenta con una licencia Apache 2.0 más fácil de integrar jurídicamente que la Llama Community License. Llama 3.3 70B Instruct sigue siendo muy sólido en francés y en tareas generales. Para un primer proyecto interno, Llama 3.3 70B suele ser más accesible desde el punto de vista del hardware; para un producto redistribuible, Mixtral es más sencillo desde el punto de vista de la licencia.
P: ¿Se necesita un clúster H100 para un LLM autoalojado en una empresa?
No siempre. Un servidor con 2×RTX 6000 Ada 48 GB o un H100 80 GB basta para ejecutar Llama 3.3 70B o Qwen 3 32B en Q4 en cargas de trabajo RAG de equipo. El cluster multi-GPU se vuelve necesario a partir de modelos >100B en precisión completa o >400B cuantizados. El configurador quelllm.fr calcula el hardware mínimo viable.
P: ¿Los modelos de origen chino (DeepSeek, Qwen, GLM, MiMo) plantean un problema con el RGPD?
El RGPD se refiere al tratamiento de los datos, no al origen de los pesos. Un modelo DeepSeek ejecutado localmente no se comunica con un servidor de terceros: es un archivo de parámetros. Las obligaciones que hay que comprobar son la licencia (MIT para DeepSeek, Apache 2.0 para Qwen) y las posibles restricciones sectoriales internas. La revisión de seguridad (análisis estático de los pesos, sandboxing) sigue siendo recomendable, como para cualquier artefacto externo.
Conclusión
Adoptar un LLM RGPD on-premise en 2026 ya no es un proyecto exploratorio: el ecosistema de pesos abiertos cubre todos los perfiles de carga, desde Qwen 3 30B-A3B en una sola GPU hasta DeepSeek V4 Pro 1.6T en un clúster denso, con licencias Apache 2.0 o MIT compatibles con el uso en producción. La verdadera dificultad se desplaza hacia el dimensionamiento del hardware y la industrialización. Para identificar el modelo adecuado para tu hardware y tus restricciones, abre el configurador o explora el catálogo completo de los 249 modelos indexados.