Mejor LLM open-source para el sector médico en 2026
Elegir un LLM médico de código abierto en 2026 implica sopesar la confidencialidad de los datos de los pacientes, la precisión clínica y el presupuesto para GPU. El LLM médico de código abierto autoalojado sigue siendo la vía preferida para cumplir con el RGPD y el secreto profesional, sin extraer expedientes hacia una API de terceros. Esta guía repasa los modelos de pesos abiertos más pertinentes para los usos sanitarios (síntesis de informes, codificación CIM-10, ayuda al diagnóstico diferencial, búsqueda bibliográfica), con especificaciones de VRAM, licencias y benchmarks verificables.
¿Por qué un modelo autoalojado para la salud?
Los datos personales de salud están sujetos al artículo 9 del RGPD y exigen un alojamiento HDS en Francia. Una API en la nube, incluso cifrada, expone al consultorio o al hospital a una transferencia fuera de la UE y complica la auditoría. El autoalojamiento de un modelo de pesos abiertos en una GPU local o en un servidor en las propias instalaciones elimina este riesgo.
El segundo argumento es la trazabilidad. Un modelo con los pesos alojados localmente (pesos fijos, prompt de sistema versionado) produce resultados reproducibles, a diferencia de un endpoint propietario cuyos pesos pueden cambiar sin previo aviso. Para un LLM para diagnóstico utilizado como apoyo a la toma de decisiones médicas, esta reproducibilidad es necesaria para calificar el dispositivo a efectos del Reglamento MDR 2017/745.
El proyecto MedGemma de Google Health, a menudo citado como referencia, ilustra el enfoque: pesos abiertos, fine-tuning sobre corpus médicos públicos (MIMIC, PubMed), evaluación transparente. Para un panorama más amplio de las familias disponibles, ver nuestro catálogo completo de los 249 modelos indexados.
Familias de modelos adaptadas a usos clínicos
Ningún modelo generalista está oficialmente homologado como dispositivo médico en 2026. La elección se basa en la calidad del razonamiento médico, medida mediante los benchmarks MedQA, MedMCQA, PubMedQA y MMLU-Medical, teniendo también en cuenta las limitaciones del hardware.
Modelos de razonamiento (diagnóstico diferencial, síntesis de casos)
- DeepSeek R1 671B (671B, MIT) — VRAM Q4 ~400 GB, ctx 128 000. El razonamiento chain-of-thought nativo ayuda en casos complejos. Puntuaciones MedQA estimadas alrededor del 88 % en pass@1.
- DeepSeek R2 32B (32B, MIT) — VRAM Q4 ~19 GB, ctx 128 000. Versión destilada que funciona en una sola RTX 5090, adecuada para una consulta o un servicio hospitalario.
- QwQ 32B (32B, Apache 2.0) — razonamiento largo, contexto 131 072. Rendimiento MMLU-Medical por confirmar tras evaluación independiente.
- DeepSeek R1 Distill 32B (32B, MIT) — alternativa ligera para centros sin GPU H100.
Modelos generales sólidos para la salud
- Llama 3.3 70B Instruct (70B, Llama 3.3 Community) — VRAM Q4 ~40 GB. Bien documentado en la literatura médica en francés, base frecuente para el fine-tuning.
- Mistral Large 3 675B (675B, Apache 2.0) — proveedor europeo con sede en París, contexto de 256 000 tokens útil para incorporar un expediente completo.
- Mistral Small 4 (119B, Apache 2.0) — VRAM Q4 ~72 GB, buen equilibrio para un servidor con 2× A100 de 80 GB.
- Qwen 3 235B-A22B (235B MoE, Apache 2.0) — arquitectura mixture-of-experts, 22B parámetros activos, latencia aceptable.
- gpt-oss 120B (117B, Apache 2.0) — modelo abierto de OpenAI, ctx 128 000.
Modelos multimodales para imagen médica e informes escaneados
- Qwen 3 VL 235B-A22B (235B, Apache 2.0) — visión-lenguaje, ctx 262 144. Permite leer informes PDF escaneados o gráficos.
- LLaVA-OneVision 72B (72B, Apache 2.0) — alternativa académica documentada en arXiv.
- Molmo 72B (72B, Apache 2.0) — visión de código abierto deAllen AI.
VRAM, cuantización y hardware objetivo
El dimensionamiento del hardware condiciona todo despliegue deIA local para el sector sanitario. Los valores siguientes corresponden a la inferencia y excluyen el entrenamiento por lotes.
Para un puesto de trabajo individual (consulta privada, médico investigador) : - Qwen 3.6 35B-A3B — Q4 ~21 GB, cabe en una RTX 5090 32 GB - Granite 4.0 H-Small 32B-A9B – Q4 ~19 GB, licencia Apache 2.0 de IBM Research - Gemma 4 31B — Q4 ~18 GB, licencia Gemma (que hay que leer antes del despliegue clínico) - Seed-OSS 36B Instruct — ctx 524 288, útil para incorporar varios expedientes
Para un servicio hospitalario (1 a 2 servidores DGX o H100) : - Llama 4 Scout 109B — Q4 ~65 GB, contexto de 10 millones de tokens (a confirmar en producción) - Mistral Small 4 — Q4 ~72 GB - Qwen 3.5 122B-A10B — Q4 ~73 GB - Mixtral 8x22B Instruct — Q4 ~82 GB, una opción fiable para la redacción médica
Para un hospital universitario o una empresa de software sanitario (clúster de varios nodos) : - DeepSeek V3.2 — Q4 ~410 GB - GLM-5.1 — Q4 ~445 GB, ctx 200 000 - Mistral Large 3 675B — Q4 ~405 GB
Las estimaciones para Q5 añaden ~25 % y las de FP16 duplican estos volúmenes. Para afinar, utiliza el configurador de GPU que considera el KV-cache con contexto completo.
Licencias: lo que se permite en el ámbito clínico y lo que supone un impedimento
La licencia determina si puedes integrar el modelo en un producto facturado a un establecimiento de salud.
- Apache 2.0 (Mistral, Qwen, IBM Granite, gpt-oss, Mixtral): uso comercial libre, modificaciones permitidas y derechos de uso de patentes concedidos. La vía más sencilla para un dispositivo médico.
- MIT (DeepSeek, MiMo, Ring-1T, GLM): equivalente en la práctica, sin cláusula explícita sobre patentes.
- Llama 3 / 3.3 / 4 Community : uso comercial autorizado bajo el umbral de 700 millones de usuarios activos mensuales, restricciones en ciertos usos militares. Leer la licencia oficial de Meta antes del despliegue.
- Gemma (Google): prohíbe ciertos usos, cláusula de actualización unilateral de restricciones. Más delicado para un producto médico certificado.
Para actores europeos preocupados por la soberanía, Mistral Large 3 675B, Apertus 70B (Swiss AI) y Salamandra 40B Instruct (Barcelona Supercomputing Center) ofrecen pesos que pueden alojarse íntegramente en la UE. Compara estas opciones en la página Mistral vs Llama.
Benchmarks médicos: lo que significan las cifras
Los benchmarks médicos públicos más utilizados en 2026:
- MedQA (USMLE) : preguntas de opción múltiple similares a las de un examen médico estadounidense. Referencia histórica, ver el artículo original en arXiv.
- MedMCQA : cuestionario indio de opción múltiple, amplia cobertura de especialidades.
- PubMedQA : razonamiento sobre resúmenes de PubMed.
- MMLU-Medical : subconjunto médico de MMLU.
- MultiMedQA : agregado publicado por Google Research.
Las puntuaciones MedQA de los modelos generalistas en pass@1 (estimaciones procedentes de las fichas de modelos de HuggingFace y de artículos técnicos, que deben confirmarse para usos críticos):
- DeepSeek R1 671B : ~88 %
- Llama 3.3 70B : ~82 %
- Mixtral 8x22B : ~78 %
- Qwen 3 32B : ~80 % (estimado)
Para la programación de herramientas de pipeline biomédico (parseo de FHIR, scripts de extracción de imágenes DICOM), Qwen 2.5 Coder 32B o Qwen3-Coder-Next 80B-A3B alcanzan puntuaciones HumanEval superiores al 85 %.
Atención : una puntuación alta en el benchmark MedQA no equivale a una autorización de comercialización. Un dispositivo médico de clase IIa o superior requiere una validación clínica conforme a la norma IEC 62304 y al reglamento MDR.
Casos de uso concretos y pipeline recomendado
Síntesis de informe quirúrgico : Mistral Small 4 o Llama 3.3 70B, contexto de 128 000 tokens. Prompt estructurado que pide un resumen SOAP. Ver nuestro guía de fine-tuning para el sector sanitario.
Ayuda con la codificación CIM-10 y CCAM : Granite 4.0 H-Small con base RAG sobre la nomenclatura oficial. IBM publica evaluaciones sobre su hub Granite.
Búsqueda bibliográfica PubMed : Qwen 3 VL 235B-A22B para leer las figuras, combinado con un índice vectorial. Ver la guía RAG médica.
Ayuda en el diagnóstico diferencial : DeepSeek R1 671B o DeepSeek R2 32B para el razonamiento paso a paso. Siempre con validación humana, como asistente y no como sustituto.
Teleconsulta y transcripción : combinar Whisper-large-v3 (repo OpenAI) primero, y luego Mistral Large 3 para dar formato.
Para comparar con otros sectores, consulta mejor LLM jurídico o Mejor LLM para código.
FAQ
P: ¿Está MedGemma incluido en quelllm.fr?
MedGemma no aparece aún en el catálogo de los 249 modelos indexados, porque las variantes especializadas en salud se siguen por separado. Para un despliegue inmediato, Gemma 4 31B sirve de base bajo la licencia Gemma, para realizar un ajuste fino con un corpus interno. La familia MedGemma está documentada por Google Health en HuggingFace y sigue siendo compatible con un servidor vLLM estándar.
P: ¿Qué VRAM mínima se necesita para un uso clínico individual?
Calcula entre 20 y 24 GB para ejecutar un modelo de 32B en Q4 con un contexto de 32 000 tokens útiles. Una RTX 5090 de 32 GB, una RTX 6000 Ada de 48 GB o un Mac Studio M3 Ultra de 96 GB sirven. Con menos de 16 GB, estás limitado a modelos de 7B-13B, cuya calidad médica se considera insuficiente para un uso profesional.
P: ¿Se puede desplegar un LLM médico de código abierto en producción sin certificación?
Para un uso interno de ayuda a la redacción sin intervenir en la toma de decisiones médicas, sí. En cuanto un módulo influye en un diagnóstico, una prescripción o el triaje de pacientes, entras en el ámbito del reglamento MDR 2017/745. La documentación ANSM sobre dispositivos médicos digitales especifica los umbrales.
P: ¿Qué diferencia hay entre DeepSeek R1 y R2 para la salud?
DeepSeek R1 671B sigue siendo la referencia en razonamiento prolongado y profundidad enciclopédica, pero exige ~400 GB de VRAM. DeepSeek R2 32B es una versión destilada que funciona en una sola GPU, con aproximadamente el 90 % del rendimiento en MedQA según los informes técnicos disponibles (por confirmar).
P: ¿Los modelos chinos representan un riesgo para los datos de pacientes?
Los modelos de pesos abiertos (DeepSeek, Qwen, GLM, MiMo) se ejecutan localmente sin telemetría saliente. El riesgo no es la exfiltración de datos, sino el sesgo cultural en las patologías, la posología y los protocolos. Se requiere una evaluación interna con casos en francés. Compara con Mistral vs DeepSeek.
P: ¿Qué modelo para transcripción médica en francés?
Para la transcripción en bruto, Whisper-large-v3 sigue siendo la referencia. Para dar formato de informe a la transcripción literal, Mistral Small 4 o Llama 3.3 70B ofrecen un francés médico natural. Añade un prompt de sistema que especifique la especialidad correspondiente.
Conclusión
La elección de un LLM médico de código abierto en 2026 depende ante todo del hardware disponible y del marco regulatorio que se busca cumplir. Para un consultorio, DeepSeek R2 32B o Granite 4.0 H-Small son suficientes. Para un hospital universitario, Mistral Large 3 675B o DeepSeek R1 671B abordan casos complejos. Refina tu selección con el configurador de GPU o explora el catálogo completo filtrado por licencia y VRAM.