Mejor LLM open-source para el sector médico en 2026

Elegir un LLM médico de código abierto en 2026 implica sopesar la confidencialidad de los datos de los pacientes, la precisión clínica y el presupuesto para GPU. El LLM médico de código abierto autoalojado sigue siendo la vía preferida para cumplir con el RGPD y el secreto profesional, sin extraer expedientes hacia una API de terceros. Esta guía repasa los modelos de pesos abiertos más pertinentes para los usos sanitarios (síntesis de informes, codificación CIM-10, ayuda al diagnóstico diferencial, búsqueda bibliográfica), con especificaciones de VRAM, licencias y benchmarks verificables.

¿Por qué un modelo autoalojado para la salud?

Los datos personales de salud están sujetos al artículo 9 del RGPD y exigen un alojamiento HDS en Francia. Una API en la nube, incluso cifrada, expone al consultorio o al hospital a una transferencia fuera de la UE y complica la auditoría. El autoalojamiento de un modelo de pesos abiertos en una GPU local o en un servidor en las propias instalaciones elimina este riesgo.

El segundo argumento es la trazabilidad. Un modelo con los pesos alojados localmente (pesos fijos, prompt de sistema versionado) produce resultados reproducibles, a diferencia de un endpoint propietario cuyos pesos pueden cambiar sin previo aviso. Para un LLM para diagnóstico utilizado como apoyo a la toma de decisiones médicas, esta reproducibilidad es necesaria para calificar el dispositivo a efectos del Reglamento MDR 2017/745.

El proyecto MedGemma de Google Health, a menudo citado como referencia, ilustra el enfoque: pesos abiertos, fine-tuning sobre corpus médicos públicos (MIMIC, PubMed), evaluación transparente. Para un panorama más amplio de las familias disponibles, ver nuestro catálogo completo de los 249 modelos indexados.

Familias de modelos adaptadas a usos clínicos

Ningún modelo generalista está oficialmente homologado como dispositivo médico en 2026. La elección se basa en la calidad del razonamiento médico, medida mediante los benchmarks MedQA, MedMCQA, PubMedQA y MMLU-Medical, teniendo también en cuenta las limitaciones del hardware.

Modelos de razonamiento (diagnóstico diferencial, síntesis de casos)

Modelos generales sólidos para la salud

Modelos multimodales para imagen médica e informes escaneados

VRAM, cuantización y hardware objetivo

El dimensionamiento del hardware condiciona todo despliegue deIA local para el sector sanitario. Los valores siguientes corresponden a la inferencia y excluyen el entrenamiento por lotes.

Para un puesto de trabajo individual (consulta privada, médico investigador) : - Qwen 3.6 35B-A3B — Q4 ~21 GB, cabe en una RTX 5090 32 GB - Granite 4.0 H-Small 32B-A9B – Q4 ~19 GB, licencia Apache 2.0 de IBM Research - Gemma 4 31B — Q4 ~18 GB, licencia Gemma (que hay que leer antes del despliegue clínico) - Seed-OSS 36B Instruct — ctx 524 288, útil para incorporar varios expedientes

Para un servicio hospitalario (1 a 2 servidores DGX o H100) : - Llama 4 Scout 109B — Q4 ~65 GB, contexto de 10 millones de tokens (a confirmar en producción) - Mistral Small 4 — Q4 ~72 GB - Qwen 3.5 122B-A10B — Q4 ~73 GB - Mixtral 8x22B Instruct — Q4 ~82 GB, una opción fiable para la redacción médica

Para un hospital universitario o una empresa de software sanitario (clúster de varios nodos) : - DeepSeek V3.2 — Q4 ~410 GB - GLM-5.1 — Q4 ~445 GB, ctx 200 000 - Mistral Large 3 675B — Q4 ~405 GB

Las estimaciones para Q5 añaden ~25 % y las de FP16 duplican estos volúmenes. Para afinar, utiliza el configurador de GPU que considera el KV-cache con contexto completo.

Licencias: lo que se permite en el ámbito clínico y lo que supone un impedimento

La licencia determina si puedes integrar el modelo en un producto facturado a un establecimiento de salud.

Para actores europeos preocupados por la soberanía, Mistral Large 3 675B, Apertus 70B (Swiss AI) y Salamandra 40B Instruct (Barcelona Supercomputing Center) ofrecen pesos que pueden alojarse íntegramente en la UE. Compara estas opciones en la página Mistral vs Llama.

Benchmarks médicos: lo que significan las cifras

Los benchmarks médicos públicos más utilizados en 2026:

Las puntuaciones MedQA de los modelos generalistas en pass@1 (estimaciones procedentes de las fichas de modelos de HuggingFace y de artículos técnicos, que deben confirmarse para usos críticos):

Para la programación de herramientas de pipeline biomédico (parseo de FHIR, scripts de extracción de imágenes DICOM), Qwen 2.5 Coder 32B o Qwen3-Coder-Next 80B-A3B alcanzan puntuaciones HumanEval superiores al 85 %.

Atención : una puntuación alta en el benchmark MedQA no equivale a una autorización de comercialización. Un dispositivo médico de clase IIa o superior requiere una validación clínica conforme a la norma IEC 62304 y al reglamento MDR.

Casos de uso concretos y pipeline recomendado

Síntesis de informe quirúrgico : Mistral Small 4 o Llama 3.3 70B, contexto de 128 000 tokens. Prompt estructurado que pide un resumen SOAP. Ver nuestro guía de fine-tuning para el sector sanitario.

Ayuda con la codificación CIM-10 y CCAM : Granite 4.0 H-Small con base RAG sobre la nomenclatura oficial. IBM publica evaluaciones sobre su hub Granite.

Búsqueda bibliográfica PubMed : Qwen 3 VL 235B-A22B para leer las figuras, combinado con un índice vectorial. Ver la guía RAG médica.

Ayuda en el diagnóstico diferencial : DeepSeek R1 671B o DeepSeek R2 32B para el razonamiento paso a paso. Siempre con validación humana, como asistente y no como sustituto.

Teleconsulta y transcripción : combinar Whisper-large-v3 (repo OpenAI) primero, y luego Mistral Large 3 para dar formato.

Para comparar con otros sectores, consulta mejor LLM jurídico o Mejor LLM para código.

FAQ

P: ¿Está MedGemma incluido en quelllm.fr?

MedGemma no aparece aún en el catálogo de los 249 modelos indexados, porque las variantes especializadas en salud se siguen por separado. Para un despliegue inmediato, Gemma 4 31B sirve de base bajo la licencia Gemma, para realizar un ajuste fino con un corpus interno. La familia MedGemma está documentada por Google Health en HuggingFace y sigue siendo compatible con un servidor vLLM estándar.

P: ¿Qué VRAM mínima se necesita para un uso clínico individual?

Calcula entre 20 y 24 GB para ejecutar un modelo de 32B en Q4 con un contexto de 32 000 tokens útiles. Una RTX 5090 de 32 GB, una RTX 6000 Ada de 48 GB o un Mac Studio M3 Ultra de 96 GB sirven. Con menos de 16 GB, estás limitado a modelos de 7B-13B, cuya calidad médica se considera insuficiente para un uso profesional.

P: ¿Se puede desplegar un LLM médico de código abierto en producción sin certificación?

Para un uso interno de ayuda a la redacción sin intervenir en la toma de decisiones médicas, sí. En cuanto un módulo influye en un diagnóstico, una prescripción o el triaje de pacientes, entras en el ámbito del reglamento MDR 2017/745. La documentación ANSM sobre dispositivos médicos digitales especifica los umbrales.

P: ¿Qué diferencia hay entre DeepSeek R1 y R2 para la salud?

DeepSeek R1 671B sigue siendo la referencia en razonamiento prolongado y profundidad enciclopédica, pero exige ~400 GB de VRAM. DeepSeek R2 32B es una versión destilada que funciona en una sola GPU, con aproximadamente el 90 % del rendimiento en MedQA según los informes técnicos disponibles (por confirmar).

P: ¿Los modelos chinos representan un riesgo para los datos de pacientes?

Los modelos de pesos abiertos (DeepSeek, Qwen, GLM, MiMo) se ejecutan localmente sin telemetría saliente. El riesgo no es la exfiltración de datos, sino el sesgo cultural en las patologías, la posología y los protocolos. Se requiere una evaluación interna con casos en francés. Compara con Mistral vs DeepSeek.

P: ¿Qué modelo para transcripción médica en francés?

Para la transcripción en bruto, Whisper-large-v3 sigue siendo la referencia. Para dar formato de informe a la transcripción literal, Mistral Small 4 o Llama 3.3 70B ofrecen un francés médico natural. Añade un prompt de sistema que especifique la especialidad correspondiente.

Conclusión

La elección de un LLM médico de código abierto en 2026 depende ante todo del hardware disponible y del marco regulatorio que se busca cumplir. Para un consultorio, DeepSeek R2 32B o Granite 4.0 H-Small son suficientes. Para un hospital universitario, Mistral Large 3 675B o DeepSeek R1 671B abordan casos complejos. Refina tu selección con el configurador de GPU o explora el catálogo completo filtrado por licencia y VRAM.

Artículo publicado y actualizado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.