Todo sobre Granite Guardian de IBM para el cumplimiento IA
Granite Guardian es el clasificador de seguridad de IBM: un pequeño modelo cuya única tarea es leer una entrada o una salida de un LLM y responder «riesgoso» o «seguro». La versión 4.1 (abril de 2026, licencia Apache 2.0) se ejecuta íntegramente en local mediante Ollama y cubre los riesgos propios de los agentes: jailbreaks, llamadas a herramientas alucinadas y respuestas RAG no fundamentadas. Esta guía muestra cómo instalarlo, invocarlo e interponerlo antes de tus agentes locales, sin enviar nunca un prompt a la nube.
#¿Por qué una protección local para tus agentes?
Un LLM que responde en un chat es fácil de supervisar: lees la respuesta. Un agente, en cambio, encadena llamadas a herramientas, lee documentos RAG y toma decisiones sin que nadie revise cada paso. Es exactamente ahí donde ocurren los incidentes: un prompt inyectado en un documento desencadena una acción no deseada, una llamada a una herramienta se inventa por completo, una respuesta «factual» es en realidad una alucinación. Necesitas un componente que inspeccione este flujo continuamente.
Lo habitual es llamar a una API de moderación en la nube (OpenAI Moderation, Azure Content Safety). El problema es que has elegido precisamente la ejecución en local para que tus prompts y tus datos no salgan de tu máquina. Enviar cada mensaje a un servicio de moderación remoto anula todo el beneficio de confidencialidad. Granite Guardian resuelve esta paradoja: es una salvaguarda que se ejecuta junto a tus modelos, en la misma máquina.
#Granite Guardian, ¿qué es exactamente?
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Granite Guardian pertenece a la familia Granite de IBM. Es un clasificador de seguridad entrenado para detectar contenidos problemáticos en las entradas y salidas de LLM. La versión 4.1 (abril de 2026) se publica bajo la licencia Apache 2.0, lo que permite su uso comercial y modificación sin pagar regalías —un punto clave para un despliegue empresarial.
- Rol
- Detector, no generador. Recibe un texto y devuelve una señal de riesgo (yes/no + puntuación de probabilidad).
- Tamaños
- Una variante compacta (~2B) para reducir la latencia y una variante más grande (~8B) para captar mejor los matices. La de 2B basta para la mayoría de los mecanismos de protección en línea.
- Licencia
- Apache 2.0 — uso comercial, redistribución y fine-tuning permitidos.
- Especialidad 4.1
- Riesgos de los agentes: detección de llamadas a herramientas alucinadas y verificación de que las respuestas RAG estén bien fundamentadas en el contexto proporcionado.
- Formato
- Un prompt estructurado indica el tipo de riesgo que se debe evaluar; el modelo responde con un veredicto que parseas.
#Los riesgos que detecta Granite Guardian
El modelo cubre dos grandes familias. Primero, los riesgos «clásicos» del contenido; después, los riesgos propios de los sistemas basados en agentes y de RAG: ahí es donde destaca la versión 4.1.
- Jailbreak / inyección
- Intentos de eludir las instrucciones del sistema, incluidas las inyecciones ocultas en un documento o una página web que lee el agente.
- Contenido dañino
- Violencia, contenido sexual, incitación a actos peligrosos, discursos de odio: tanto en la entrada como en la salida.
- Groundedness (RAG)
- ¿La respuesta está realmente respaldada por los documentos recuperados o el modelo ha inventado algo? Detecta la alucinación en RAG.
- Relevancia del contexto
- ¿Los pasajes recuperados están realmente relacionados con la pregunta? Un contexto fuera de tema es una señal de desviación del retriever.
- Alucinación en llamadas a funciones
- ¿El agente invoca una herramienta que no existe o con argumentos incoherentes respecto a lo que el usuario pidió?
#Prerrequisitos
Granite Guardian se ejecuta junto a tu modelo principal, por lo que debes prever su VRAM además de la del agente. La buena noticia: la variante 2B es ligera.
- Ollama instalado
- El demonio escucha por defecto en http://localhost:11434. Consultar la guía de instalación de Ollama si aún no está instalado.
- VRAM (Guardian 2B, Q4_K_M)
- ≈ 2 GB. Se suma a tu modelo de agente. Una RTX 3060 12GB puede manejar sin problemas un 7B más el Guardian.
- VRAM (Guardian 8B, Q4_K_M)
- ≈ 5 GB, si quieres la variante más refinada y tienes margen de memoria (RTX 4080 16GB, M4 Pro).
- Quantization
- Q4_K_M recomendado para equilibrar latencia/calidad. Q8_0 si tienes margen y quieres minimizar la pérdida en la toma de decisiones de riesgo.
#Instalar el modelo
- 01Verificar que Ollama esté en ejecuciónEl comando `ollama list` debe responder sin errores. De lo contrario, inicia el daemon (`ollama serve` en Linux, o la aplicación en Windows/macOS).
- 02Obtener la etiqueta oficialBusca «granite-guardian» en ollama.com/library y anota exactamente la etiqueta de la variante 2B. Los nombres de etiquetas cambian de versión en versión, no los adivines.
- 03Descargar el modeloUn simple `ollama pull` descarga los pesos cuantizados en formato GGUF. Calcula entre 1 y 2 GB de descarga para la versión 2B.
- 04ConfirmarVuelve a ejecutar `ollama list`: el modelo debe aparecer con su tamaño. Ya estás listo para interrogarlo.
#Primera llamada al mecanismo de protección
El principio: le envías al Guardian el texto a evaluar, especificando el tipo de riesgo. El modelo devuelve un veredicto que tú interpretas. Lo más sencillo es usar la API compatible con OpenAI de Ollama, en el mismo endpoint local.
#Proteger un agente: llamadas a herramientas y RAG
El verdadero interés de la 4.1 aparece cuando supervisas un agente. Se coloca Guardian en tres puntos: antes de que el agente reciba la entrada (jailbreak/inyección), después de una recuperación RAG (groundedness) y antes de ejecutar una llamada a una herramienta (alucinación de función).
- 01Filtrar la entradaCada mensaje del usuario —y cada documento externo leído por el agente— pasa primero por Guardian en modo jailbreak/inyección. Un documento web que contiene una trampa se intercepta antes de llegar al modelo principal.
- 02Verificar el grounding RAGDespués de recuperar los pasajes, envía la pregunta, los pasajes y la respuesta candidata en modo groundedness al Guardian. Si juzga que la respuesta no está fundamentada, la rechazas o desencadenas una nueva recuperación.
- 03Validar el tool-callAntes de ejecutar una llamada a una herramienta, haz que se evalúe la coherencia entre la solicitud del usuario y la herramienta invocada. Una llamada alucinada (herramienta inexistente, argumentos incoherentes) se bloquea antes de que produzca cualquier efecto secundario.
#Casos de uso del RGPD y del cumplimiento normativo
Ejecutar la moderación en local no es solo una comodidad técnica: es un argumento a favor del cumplimiento normativo. Según el RGPD y el AI Act, cada transferencia de datos personales a un servicio de terceros debe justificarse, someterse a un marco definido y documentarse. Un mecanismo de protección en la nube te obligaría a enviar prompts —potencialmente llenos de datos personales— a un encargado del tratamiento adicional.
- Cero transferencias
- El texto evaluado nunca abandona tu infraestructura. No hay ningún encargado del tratamiento que preste servicios de moderación al que debas incluir en el registro de actividades de tratamiento ni cuya intervención debas regular mediante un DPA.
- Trazabilidad
- Registras localmente cada dictamen (riesgo detectado, tipo, puntuación). Es útil para demostrar una supervisión efectiva conforme al AI Act en los sistemas de riesgo.
- Minimización
- Guardian bloquea de antemano las entradas maliciosas que podrían exfiltrar datos a través del agente, lo que reduce la superficie expuesta a incidentes.
- Soberanía
- Modelo con licencia Apache 2.0 ejecutado en hardware que tú controlas: sin dependencia de la disponibilidad ni de las condiciones de un proveedor externo.
#Solución de problemas y consejos
- Veredicto siempre idéntico
- Si todo devuelve «no», verifica que el tipo de riesgo se haya transmitido correctamente (rol system) y que la etiqueta del modelo sea la correcta. Un modelo genérico no hará el trabajo de un Guardian.
- Latencia demasiado alta
- Pasa del modelo de 8B al de 2B, aplica cuantización Q4_K_M y mantén el modelo cargado (keep-alive de Ollama) para evitar que se vuelva a cargar en cada llamada.
- Parsing frágil
- No asumas el formato. Registra la salida bruta unos días en preproducción, luego escribe un parser tolerante (minúsculas, trim, prefijo).
- Dos modelos en VRAM
- Guardian y el agente deben caber juntos en la memoria. En una tarjeta de 12 GB, limítate a un agente 7B Q4 + Guardian 2B Q4 (~7 GB en total).
- Falsos positivos molestos
- Ajusta el tipo de riesgo evaluado a tu uso real en lugar de activar todos los detectores. Los equipos acaban desactivando un filtro demasiado restrictivo.
#Para ir más allá
Granite Guardian se enmarca en un enfoque más amplio de privacidad y cumplimiento normativo en local. Tres guías para completar el panorama: la lista de verificación de privacidad para comprobar que no se filtra nada de tu máquina, la guía sobre LLM locales y RGPD para conocer el marco legal completo, y la guía sobre IA local en la empresa para organizar un despliegue que cumpla la normativa.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.