Mejor LLM RGPD on-premise para empresas 2026

Elegir un LLM RGPD on-premise se ha convertido en un tema central para las direcciones técnicas europeas que desean industrializar el procesamiento de documentos sin exponer sus datos a un proveedor SaaS de fuera de Europa. Un LLM RGPD on-premise correctamente desplegado garantiza que los prompts, las salidas y los posibles registros nunca abandonen el entorno controlado por la empresa, lo que simplifica considerablemente las evaluaciones de impacto (AIPD) y las obligaciones del artículo 32 del reglamento. Este artículo repasa los modelos de pesos abiertos relevantes en 2026, sus requisitos de hardware, su licencia, sus casos de uso y los aspectos operativos que requieren atención antes de un despliegue en producción.

¿Por qué un LLM conforme al RGPD en tus propias instalaciones en lugar de una API gestionada?

El reglamento (UE) 2016/679 (ver el texto consolidado en EUR-Lex) impone un control estricto de las transferencias fuera de la UE y una demostración clara de las bases jurídicas del tratamiento. Una API alojada por un proveedor externo introduce sistemáticamente un encargado del tratamiento adicional, cláusulas contractuales tipo (CCT) que deben mantenerse y, en algunos casos, una exposición a leyes extraterritoriales como el CLOUD Act. En cambio, un despliegue en las instalaciones de la empresa (o en una nube privada bajo su control) elimina esta cadena de dependencias.

Otras tres motivaciones se repiten en las observaciones sobre el terreno:

El ecosistema de pesos abiertos, catalogado en plataformas como Hugging Face o a través de los servidores de inferencia vLLM, permite hoy cubrir casi todos los casos de uso empresarial sin dependencia externa. Para una visión más amplia de las arquitecturas, ver también nuestra guía de LLM open-source en empresas.

Qué modelos de pesos abiertos elegir en 2026

La elección de un LLM soberano empresarial depende de un equilibrio entre calidad bruta, tamaño de contexto, licencia y huella de VRAM. A continuación, una selección representativa extraída de nuestro catálogo completo, clasificada por perfil de uso.

Perfil "centro de datos de alta densidad" (>200 GB de VRAM en Q4)

Perfil "clúster intermedio" (60-200 GB VRAM Q4)

Perfil "servidor con una sola GPU" (20-60 GB de VRAM en Q4)

Para una comparación más detallada en el segmento 70B, ver Llama 3.3 70B vs Mixtral 8x22B.

Consumo de VRAM, cuantización y velocidad de generación

La estimación de la VRAM depende de la cuantización elegida. Como primera aproximación, para un modelo denso:

Para arquitecturas MoE como Mixtral 8x22B Instruct o Qwen 3 235B-A22B, la VRAM necesaria corresponde al almacenamiento de todos los expertos, incluso si solo algunos están activados por token. Es la memoria la que limita, no el cálculo. El artículo sobre Mixtral 8x7B en arXiv detalla este mecanismo.

En cuanto a velocidad, los valores en tokens/segundo varían mucho según el motor de inferencia (vLLM, TensorRT-LLM, llama.cpp, SGLang), la longitud del contexto efectivo y el procesamiento por lotes. Algunas magnitudes aproximadas observadas (por confirmar con tu carga de trabajo):

Para dimensionar con precisión un servidor, el configurador quelllm.fr cruza GPU, RAM y modelos compatibles.

Licencias: lo que realmente cambia en producción

Une IA conforme al RGPD no basta: también se necesita una licencia compatible con tu modelo de negocio. Tres familias dominan:

Para organizaciones que buscan la trazabilidad máxima, OLMo 3 32B de Allen AI también publica sus conjuntos de entrenamiento, lo que facilita algunas auditorías (ver el blog de Allen AI). En Europa, Mistral Large 3 675B et Apertus 70B son las opciones clave. Más detalles en nuestra página mejor LLM francés.

Pruebas y casos de uso para un LLM auto-hospedado empresarial

Las puntuaciones públicas deben tratarse con precaución: las metodologías varían y la contaminación de los conjuntos de prueba ya está documentada. Algunos puntos de referencia extraídos de las fichas de modelos de Hugging Face:

Casos de uso típicos para la dirección de sistemas de información:

Ver también nuestra comparativa DeepSeek R1 vs Llama 3.3 70B para decidir entre razonamiento y costo de hardware.

Arquitectura objetivo: del POC a la producción

Un despliegue on-premise robusto se organiza alrededor de cuatro capas:

  1. Capa de hardware : GPU NVIDIA (H100/H200/B200, RTX 6000 Ada, L40S) o alternativas AMD MI300X. Para cargas de trabajo >400B, un nodo 8×H100 80 GB o 8×H200 141 GB es el mínimo realista.
  2. Capa de inferencia : vLLM o SGLang para la tasa de procesamiento, TensorRT-LLM para la latencia, llama.cpp para servidores sin GPU dedicada. La documentación vLLM cubre la mayoría de los modelos mencionados aquí.
  3. Capa de orquestación : Kubernetes con el NVIDIA GPU Operator, KEDA para el escalado, y un gateway tipo LiteLLM o Envoy para la unificación de las APIs compatibles con OpenAI.
  4. Capa de cumplimiento normativo : registro cifrado de los prompts con un periodo de conservación breve, enmascaramiento de información personal identificable a la entrada (Presidio, recomendaciones de la CNIL sobre la IA), registro de actividades de tratamiento actualizado, EIPD documentada.

En cuanto a observabilidad, herramientas como Langfuse o OpenTelemetry permiten rastrear las cadenas RAG sin enviar los logs a un SaaS. Para una aproximación estructurada, consulta nuestro guía de despliegue de LLM en producción y la lista de comprobación de seguridad de LLM.

FAQ

P: ¿Un LLM con pesos abiertos descargado desde Hugging Face cumple automáticamente con el RGPD?

No. La licencia del modelo y su lugar de ejecución son dos cuestiones distintas. Descargar los pesos de Mistral Large 3 o DeepSeek R1 y ejecutarlos en un centro de datos europeo bajo tu control elimina la transferencia de datos de los usuarios fuera de la UE, pero sigues siendo responsable de los tratamientos (artículo 24 del RGPD): evaluación de impacto relativa a la protección de datos, plazos de conservación, derechos de las personas y seguridad de los accesos.

P: ¿Qué cuantización elegir para un LLM sujeto al RGPD y alojado en las instalaciones de la empresa sin degradar la calidad?

Para producción, Q5_K_M o Q4_K_M ofrecen el mejor equilibrio calidad/VRAM en modelos >30B según las evaluaciones comunitarias publicadas en Hugging Face. Por debajo (Q3, Q2), la pérdida se vuelve medible en tareas de razonamiento. Para usos regulatorios sensibles, Q8 o FP16 siguen siendo recomendables si la VRAM lo permite, especialmente en modelos <70B.

P: ¿Se puede hacer fine-tuning con datos personales cumpliendo la normativa?

Sí, siempre que se documenten la base legal, la EIPD y la retención. Los modelos bajo licencia Apache 2.0 (Mistral, Qwen, gpt-oss, IBM Granite) o MIT (DeepSeek, GLM) autorizan explícitamente el fine-tuning comercial. LoRA y QLoRA permiten mantener los adaptadores separados de los pesos base, lo que facilita la eliminación a solicitud de una persona interesada si el corpus lo justifica.

P: ¿Mixtral 8x22B o Llama 3.3 70B para comenzar?

Mixtral 8x22B Instruct consume más VRAM (82 GB Q4 contra 40 GB) pero cuenta con una licencia Apache 2.0 más fácil de integrar jurídicamente que la Llama Community License. Llama 3.3 70B Instruct sigue siendo muy sólido en francés y en tareas generales. Para un primer proyecto interno, Llama 3.3 70B suele ser más accesible desde el punto de vista del hardware; para un producto redistribuible, Mixtral es más sencillo desde el punto de vista de la licencia.

P: ¿Se necesita un clúster H100 para un LLM autoalojado en una empresa?

No siempre. Un servidor con 2×RTX 6000 Ada 48 GB o un H100 80 GB basta para ejecutar Llama 3.3 70B o Qwen 3 32B en Q4 en cargas de trabajo RAG de equipo. El cluster multi-GPU se vuelve necesario a partir de modelos >100B en precisión completa o >400B cuantizados. El configurador quelllm.fr calcula el hardware mínimo viable.

P: ¿Los modelos de origen chino (DeepSeek, Qwen, GLM, MiMo) plantean un problema con el RGPD?

El RGPD se refiere al tratamiento de los datos, no al origen de los pesos. Un modelo DeepSeek ejecutado localmente no se comunica con un servidor de terceros: es un archivo de parámetros. Las obligaciones que hay que comprobar son la licencia (MIT para DeepSeek, Apache 2.0 para Qwen) y las posibles restricciones sectoriales internas. La revisión de seguridad (análisis estático de los pesos, sandboxing) sigue siendo recomendable, como para cualquier artefacto externo.

Conclusión

Adoptar un LLM RGPD on-premise en 2026 ya no es un proyecto exploratorio: el ecosistema de pesos abiertos cubre todos los perfiles de carga, desde Qwen 3 30B-A3B en una sola GPU hasta DeepSeek V4 Pro 1.6T en un clúster denso, con licencias Apache 2.0 o MIT compatibles con el uso en producción. La verdadera dificultad se desplaza hacia el dimensionamiento del hardware y la industrialización. Para identificar el modelo adecuado para tu hardware y tus restricciones, abre el configurador o explora el catálogo completo de los 249 modelos indexados.

Artículo publicado y actualizado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.