Mejor LLM open-source para el sector jurídico 2026
Elegir un LLM jurídico de código abierto en 2026 responde a una exigencia profesional precisa: mantener el control de los datos de los clientes, respetar el secreto profesional y desplegar un modelo bajo una licencia permisiva en infraestructura interna. Esta guía compara los modelos de pesos abiertos más pertinentes para bufetes de abogados, departamentos jurídicos y legaltechs francófonos, con especificaciones de hardware, licencias verificables y casos de uso adaptados al derecho francés. A continuación encontrarás una selección extraída del catálogo QuéLLM, un panorama de las familias Mistral, DeepSeek, Qwen y Llama, recomendaciones de VRAM según el tamaño de la organización y, por último, una sección de preguntas frecuentes que resuelve las dudas sobre licencias, RGPD y confidencialidad.
¿Por qué un LLM de código abierto para el sector jurídico?
El sector jurídico maneja datos sensibles: expedientes de clientes, acuerdos, documentos procesales, jurisprudencia no publicada. Alojar un modelo en servidores propios (o en una nube soberana) elimina la transmisión de prompts a un tercero y facilita el cumplimiento del RGPD así como con las obligaciones delLey de Inteligencia Artificial europea cuya aplicación ha entrado en vigor progresivamente desde 2024.
Tres beneficios concretos para una IA para despachos de abogados autoalojada:
- Confidencialidad : ningún prompt sale del ámbito del despacho, lo que protege el secreto profesional garantizado por el artículo 66-5 de la ley de 1971.
- Fine-tuning sectorial : adaptación posible con un corpus jurisprudencial interno (sentencias de tribunales de apelación, doctrina, modelos de escritos de conclusiones).
- Costos controlados : sin facturación por token, el costo se reduce a la infraestructura GPU y a la energía.
Los modelos bajo licencia Apache 2.0 o MIT se deben preferir: permiten el uso comercial, la modificación y la redistribución sin cláusula de compartición obligatoria. Las licencias comunitarias (Llama, Gemma) siguen siendo utilizables pero exigen un análisis contractual — ver el guía de licencias de pesos abiertos.
Modelos recomendados para redacción jurídica en francés
El francés jurídico sigue siendo un ámbito en el que pocos modelos destacan en zero-shot. Los actores europeos y los grandes modelos multilingües ofrecen los mejores resultados.
Familia Mistral — la opción francesa
- Mistral Large 3 675B (Apache 2.0, Mistral AI) — 675B parámetros, ~405 GB de VRAM en Q4, contexto de 256 000 tokens. Diseñado en Francia, domina la sintaxis jurídica en francés y admite documentos muy extensos (escritos procesales, conclusiones, contratos consolidados). Ficha: Mistral Large 3.
- Mistral Small 4 (Apache 2.0) — 119B, ~72 GB VRAM Q4, contexto 256 000. Buen equilibrio para un bufete de tamaño medio con 2× A100 80GB o 4× RTX 6000 Ada. Hoja de datos: Mistral Small 4.
- Mixtral 8x22B Instruct (Apache 2.0) — 141B (39B activos en MoE), ~82 GB VRAM Q4. Solución Mistral jurídico robusta, ya probada en varios despliegues legaltech. Ficha: Mixtral 8x22B.
- Mixtral 8x7B (Apache 2.0) — 47B, ~26 GB VRAM en Q4. El más accesible para comenzar (1× RTX 4090 + offload CPU posible). Ficha: Mixtral 8x7B.
Mistral AI publica sus tokenizers y pesos en HuggingFace, lo que simplifica la auditoría interna.
Familia Qwen — de alto rendimiento y multilingüe
Alibaba publica una gama Qwen bajo Apache 2.0 cuyo rendimiento multilingüe incluye el francés.
- Qwen 3 235B-A22B (~142 GB VRAM Q4, ctx 131 072) — arquitectura MoE con 22B de parámetros activos, adecuada para resumir sentencias extensas. Ficha: Qwen 3 235B.
- Qwen 3.5 122B-A10B (~73 GB VRAM Q4, ctx 262 000) — 10B activos, latencia reducida para redacción interactiva.
- Qwen 3 32B (~19 GB VRAM Q4) — desplegable en una sola RTX 4090 o A6000. Hoja de datos: Qwen 3 32B.
- Qwen 3 VL 235B-A22B — variante de visión para OCR de documentos escaneados y lectura de tablas. Ficha: Qwen 3 VL 235B.
Ver el comparativo Mistral Large 3 vs Qwen 3 235B para elegir entre el dominio nativo del francés y la versatilidad multilingüe.
Familia DeepSeek — razonamiento largo
DeepSeek destaca en el razonamiento estructurado, útil para el análisis de argumentos jurídicos, las calificaciones jurídicas y la construcción de argumentaciones.
- DeepSeek V3.2 (MIT, 685B, ~410 GB VRAM Q4, contexto 128 000) — Hoja de datos: DeepSeek V3.2.
- DeepSeek R1 671B (MIT, ~400 GB VRAM Q4) — modelo de razonamiento publicado con el artículo R1 en arXiv. Ficha: DeepSeek R1 671B.
- DeepSeek R1 Distill 32B (~19 GB de VRAM en Q4): versión destilada para un servidor con una sola GPU. Ficha: DeepSeek R1 Distill 32B.
- DeepSeek R2 32B (~19 GB VRAM Q4, contexto 128 000) — iteración 2026 con razonamiento mejorado.
Especificaciones de hardware según el tamaño del despacho
La VRAM necesaria depende de la cuantización elegida. Regla aproximada (a confirmar según la implementación de llama.cpp o vLLM):
- Q4 (4 bits): ~0,60 GB por millardo de parámetros
- Q5 : ~0,75 GB / B
- Q8 : ~1,20 GB / B
- FP16 : ~2,00 GB / B
Despacho individual o pequeña estructura (1 a 5 abogados)
Presupuesto GPU 2 000–6 000 €, 1× RTX 4090 24 GB o 1× RTX 6000 Ada 48 GB :
- Qwen 3 30B-A3B (~19 GB Q4, 3B activos en MoE — latencia muy baja) — fiche
- Mixtral 8x7B Q4 (~26 GB, offload parcial)
- Gemma 4 31B (Gemma license, ~18 GB Q4, ctx 256 000) — fiche
- Qwen 3.6 35B-A3B (~21 GB Q4)
Ver mejor LLM para 24 GB de VRAM para la selección completa.
Despacho mediano (10 a 50 abogados)
Servidor con 2× A100 de 80 GB o 4× L40S de 48 GB:
- Mistral Small 4 Q4 ~72 GB
- Mixtral 8x22B Q4 ~82 GB
- Qwen 3.5 122B-A10B Q4 ~73 GB
- gpt-oss 120B (Apache 2.0, OpenAI) ~70 GB — fiche
Gran departamento jurídico o empresa legaltech
Clúster de 8× H100 de 80 GB (640 GB de VRAM agregada) o 4× MI300X de 192 GB:
- Mistral Large 3 675B Q4 ~405 GB
- DeepSeek V3.2 ~410 GB Q4
- Llama 4 Maverick 400B (~240 GB Q4, ctx 1 000 000) — fiche
Para las arquitecturas multi-GPU y el paralelismo de tensores, consultar el guía de inferencia distribuida y la documentación vLLM.
Benchmarks relevantes para el derecho
Ningún benchmark público evalúa específicamente el derecho francés, pero pueden utilizarse varios indicadores indirectos:
- MMLU (subcategorías
professional_lawetinternational_law) — cubre principalmente el derecho estadounidense, pero sirve de indicador. Referencia: artículo de MMLU. - LegalBench (proyecto HuggingFace) — 162 tareas jurídicas en inglés.
- MMLU-Pro — versión más exigente, útil para la calificación jurídica mediante una cadena de razonamiento.
En estas evaluaciones (cifras públicas pendientes de confirmar según las versiones):
- Mistral Large 3 : MMLU estimado ~86 %
- DeepSeek V3.2 : MMLU ~88 %, MMLU-Pro ~75 %
- Qwen 3 235B-A22B : MMLU ~87 %
- Llama 3.3 70B Instruct : MMLU ~82 %, contexto 128 000 — fiche
Para comparar código y razonamiento (útil para automatizar las operaciones jurídicas y el análisis de cláusulas), ver mejor LLM de código et mejor LLM de razonamiento.
Casos de uso concretos en un despacho
- Síntesis de documentos procesales : Mistral Large 3 o Qwen 3.5 122B-A10B, con un contexto ≥ 200 000 tokens que permite procesar un expediente completo.
- Redacción de primer borrador (escritos de conclusiones, cartas, consultas): Mistral Small 4 o Mixtral 8x22B, suficientes para producir un borrador revisado por el abogado.
- Búsqueda de jurisprudencia asistida por RAG : pipeline Qwen 3 32B + base vectorial Légifrance/Doctrine, desplegable en un servidor único.
- Análisis de contratos y detección de cláusulas : DeepSeek R2 32B o QwQ 32B para la descomposición lógica de los compromisos — ficha QwQ 32B.
- Anonimización automática de resoluciones : Granite 4.0 H-Small 32B-A9B (Apache 2.0, IBM, ~19 GB Q4) — fiche.
- OCR y lectura de documentos escaneados : Qwen 3 VL 235B-A22B para multimodalidad documental.
Un proyecto europeo soberano merece mención: Apertus 70B (Swiss AI, Apache 2.0, ~40 GB Q4) — fiche — entrenado con especial atención a la conformidad europea y a los idiomas oficiales suizos, entre ellos el francés.
Rendimiento de inferencia (tokens/segundo)
Estimaciones para configuraciones habituales (deben confirmarse según el entorno de ejecución y el tamaño del lote):
- Mixtral 8x7B Q4 en RTX 4090 mediante llama.cpp: ~40-60 tok/s en single-stream
- Qwen 3 32B Q4 en RTX 6000 Ada mediante vLLM: ~35-50 tok/s
- Mistral Small 4 Q4 en 2× A100 80GB mediante vLLM: ~25-40 tok/s
- Mistral Large 3 Q4 en 8× H100 80GB: ~15-30 tok/s, con un rendimiento mucho mayor en el procesamiento por lotes
Ver los métodos de medición del colectivo llama.cpp para los protocolos de benchmark reproducibles.
FAQ
P: ¿Qué licencia elegir para un despliegue comercial en un despacho?
Preferir Apache 2.0 (Mistral, Qwen, Mixtral, gpt-oss, Apertus) o MIT (DeepSeek). Estas licencias autorizan explícitamente el uso comercial, la modificación y la redistribución sin cláusula que obligue a compartir. Las licencias comunitarias Llama y Gemma son utilizables, pero imponen límites de usuarios (Llama) o restricciones de uso (Gemma) que conviene revisar con la dirección jurídica antes del despliegue.
P: ¿Un LLM de código abierto alojado internamente cumple con el RGPD?
El autoalojamiento elimina la transferencia de datos a terceros, lo que ya resuelve una parte importante de los riesgos. Sin embargo, el cumplimiento final depende de la evaluación de impacto (AIPD), del registro de actividades de tratamiento y de los plazos de conservación de los prompts y las respuestas generadas. El despliegue autoalojado facilita el cumplimiento, pero no lo garantiza por completo: sigue siendo necesaria una auditoría del DPO.
P: ¿Cuánta VRAM para Mistral Large 3?
En cuantización Q4, Mistral Large 3 675B requiere aproximadamente 405 GB de VRAM agregada, es decir, 6× H100 80GB o 3× MI300X 192GB. En Q8 (más preciso), prever ~810 GB. Para una calidad casi equivalente con una huella reducida, Mixtral 8x22B (~82 GB Q4) o Mistral Small 4 (~72 GB Q4) constituyen alternativas razonables.
P: ¿Qué modelo para el derecho francés con una sola GPU de 24 GB?
Con 24 GB de VRAM (RTX 4090, RTX 3090), los mejores candidatos son Qwen 3 30B-A3B (~19 GB Q4, baja latencia gracias al MoE), Mixtral 8x7B Q4 (~26 GB con offload ligero), Gemma 4 31B (~18 GB Q4) o DeepSeek R2 32B (~19 GB Q4). Ver la selección detallada en mejor LLM para 24 GB de VRAM.
P: ¿Se puede hacer un ajuste fino de un modelo con tu propia jurisprudencia?
Sí, a través de LoRA o QLoRA con modelos bajo licencia Apache 2.0 o MIT. Calcula entre 24 y 80 GB de VRAM según el tamaño del modelo base y el rango LoRA elegido. Los modelos MoE (Mixtral, Qwen MoE) requieren precauciones especiales con el enrutamiento. Ver la guía de fine-tuning jurídico para buenas prácticas con corpus anotados.
P: ¿Conviene optar por un modelo denso o MoE en un despacho jurídico?
Un modelo dense (Llama 3.3 70B, Qwen 3 32B) ofrece una calidad homogénea y una integración RAG sencilla. Un modelo MoE (Mixtral 8x22B, Qwen 3 235B-A22B) ofrece una mejor relación entre calidad y coste de inferencia porque solo los expertos activos consumen recursos de cómputo, pero requiere más VRAM total para cargar todos los expertos. Para un uso interactivo (redacción asistida), el MoE resulta ventajoso; para el procesamiento por lotes (análisis masivo), el modelo denso sigue siendo competitivo.
Conclusión
La elección de un LLM jurídico de código abierto en 2026 se basa en tres ejes: licencia permisiva (priorizando Apache 2.0 o MIT), calidad en francés (Mistral a la cabeza, seguido de Qwen y DeepSeek) y un presupuesto realista para GPU (desde la RTX 4090 hasta el clúster H100). Para afinar tu selección según la VRAM disponible y tu caso de uso concreto, ejecuta el configurador QuéLLM o explora el catálogo completo de los 249 modelos indexados.