Granite 4 de IBM en local: instalación y casos d'usage
IBM desarrolla discretamente una de las familias de LLM con pesos abiertos más interesantes para las empresas: Granite. Esta guía muestra cómo instalar Granite 4 en local con Ollama, explica la arquitectura híbrida Mamba que reduce la memoria necesaria, detalla la licencia Apache 2.0 sin cláusulas engañosas y se centra en los usos —RAG, llamadas a funciones y tareas empresariales— en los que Granite realmente destaca frente a los modelos para el público general.
#¿Por qué Granite 4 en lugar de otro modelo?
Granite no está diseñado para encabezar las clasificaciones de chatbots. IBM tiene un objetivo diferente: modelos fiables, con un consumo reducido de memoria y sin problemas jurídicos, pensados para integrarse en aplicaciones empresariales. No se elige Granite para hablar de filosofía, sino para conectar un modelo con una base documental, hacer que utilice herramientas o ejecutarlo a bajo coste en hardware modesto.
Tres cosas distinguen a Granite 4 del resto de los modelos de pesos abiertos. En primer lugar, una arquitectura híbrida Mamba que reduce considerablemente el consumo de memoria, especialmente con contextos largos. En segundo lugar, una licencia Apache 2.0 estricta, sin las restricciones de uso que imponen Llama o Gemma. Por último, un trabajo de trazabilidad y gobernanza —modelos firmados, datos de entrenamiento documentados, certificación ISO 42001— que las direcciones de TI y los departamentos jurídicos saben apreciar. Es un modelo pensado para superar una revisión de cumplimiento, no solo un benchmark.
#La arquitectura híbrida Mamba y su ahorro de memoria
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
El verdadero argumento técnico de Granite 4 es su arquitectura. Un transformador clásico se basa completamente en la atención: con cada nuevo token, el modelo vuelve a leer todo el contexto y almacena una «caché KV» que crece linealmente con la longitud de la conversación. Cuanto más largo es el contexto, más se dispara el consumo de VRAM y más se ralentiza la inferencia. Es la conocida limitación de los contextos largos al ejecutar modelos en local.
Mamba pertenece a otra familia: los modelos de espacio de estados (state space models). En lugar de leer todo de nuevo, una capa Mamba mantiene un estado recurrente de tamaño fijo que resume el pasado. Consecuencia: la memoria no crece con la longitud del contexto, y la velocidad de procesamiento se mantiene estable incluso en documentos muy largos. El defecto de Mamba solo es que recuerda con menos precisión los detalles lejanos.
Granite 4 combina los dos. La mayoría de los bloques son capas Mamba-2 (eficientes), intercaladas con una minoría de bloques de atención (precisos): una proporción de aproximadamente nueve capas Mamba por una capa de atención. Se mantiene así la mayor parte del ahorro de memoria mientras se conserva la capacidad de la atención para recuperar un detalle exacto. En la práctica, Granite 4 funciona con mucha menos RAM/VRAM que un transformador de tamaño similar, especialmente cuando el contexto supera unos pocos miles de tokens.
#Micro, Tiny y Small: ¿qué variante elegir?
Granite 4 se ofrece en varios tamaños, con sufijos que indican el hardware al que está dirigido. Las versiones marcadas «H» usan la arquitectura híbrida; se proporciona una versión no híbrida para los entornos que aún no son compatibles con Mamba.
- Granite 4 Micro (~3B, denso)
- El más pequeño, denso e híbrido. Ideal para ejecutarlo en CPU, con poca VRAM o en entornos edge. Cabe en ~2 GB en Q4. Perfecto para extracción, clasificación y RAG ligero.
- Granite 4 Tiny-H (~7B, MoE)
- Mezcla de expertos híbrida: muchos parámetros en total, pero pocos activos en cada token, por lo que es rápida. Buen equilibrio entre calidad y velocidad en una tarjeta de gama de entrada.
- Granite 4 Small-H (~32B, MoE)
- La gama alta accesible: calidad similar a la de los grandes modelos para tareas profesionales, manteniendo la huella de memoria reducida del modelo híbrido. Destinado a estaciones de trabajo o servidores.
- Variante no híbrida
- Existe una versión con arquitectura transformer clásica para los entornos de ejecución que aún no admiten Mamba. Reservar únicamente para casos de compatibilidad: se pierde el ahorro de memoria.
Para empezar, Micro basta para validar los casos de uso y funciona en cualquier equipo. Pasa a Tiny-H o Small-H una vez que sepas qué quieres llevar a producción y hayas medido una insuficiencia de calidad.
#Prerrequisitos y VRAM
El único requisito de software es tener Ollama instalado y actualizado: el demonio escucha por defecto en http://localhost:11434. Asegúrate de tener una versión reciente: la compatibilidad con las capas Mamba de Granite 4 requiere una versión bastante reciente de Ollama; de lo contrario, el modelo no se cargará.
- Micro (3B) en Q4
- ≈ 2 GB de VRAM. También funciona en CPU con 8 GB de RAM, despacio pero con fiabilidad. Una RTX 3060 de 12 GB ofrece un margen muy cómodo.
- Tiny-H (7B MoE) en Q4
- ≈ 5 GB de VRAM para los pesos, pero la activación parcial de MoE hace que la inferencia sea ligera. Una tarjeta de 8–12 GB es más que suficiente.
- Small-H (32B MoE) en Q4
- ≈ 19 GB de VRAM. RTX 4090 de 24 GB o Mac con 32–48 GB de memoria unificada. El diseño híbrido limita el aumento drástico del consumo de memoria con contextos largos.
- Margen para el contexto
- Gracias a Mamba, la caché KV ocupa mucha menos memoria que en un transformador equivalente: puedes aspirar a contextos grandes sin duplicar la VRAM.
#Instalar Granite 4 mediante Ollama
La instalación sigue el procedimiento habitual de Ollama. El modelo está publicado en la biblioteca oficial con el nombre granite4; las variantes se seleccionan mediante etiquetas. Comprueba el nombre exacto de las etiquetas en ollama.com/library antes de descargar un tamaño específico, ya que cambian de una versión a otra.
- 01Verificar OllamaConfirma que el daemon esté funcionando y actualizado. Una versión antigua no conoce las capas Mamba de Granite 4.
- 02Descargar el modeloDescarga la variante elegida con ollama pull. Comienza con Micro para probar rápidamente sin saturar tu disco ni tu tarjeta.
- 03Iniciar un primer chatollama run ouvre une session interactive. Posez une question métier — résumé d'un texte, extraction de champs — plutôt qu'une devinette généraliste.
- 04Conectar una interfazConfigura Open WebUI o LM Studio para que utilicen el endpoint local y puedas trabajar cómodamente, o llama directamente a la API HTTP desde tu aplicación.
Para usarlo en aplicaciones, Ollama expone una API compatible con OpenAI en el mismo puerto. Por lo tanto, puedes reutilizar cualquier cliente existente simplemente cambiando la URL base y el nombre del modelo.
#Apache 2.0, la licencia sin trampas para empresas
Es un punto que los equipos jurídicos revisan antes de los benchmarks. Granite 4 se publica bajo la licencia Apache 2.0, una licencia de código abierto permisiva y probada. Puedes usarlo comercialmente, modificarlo, redistribuirlo e integrarlo en un producto cerrado, sin umbral de usuarios ni cláusula de uso aceptable que debas vigilar.
Este matiz importa frente a las alternativas populares. La «Llama Community License» de Meta no es una verdadera licencia de código abierto: impone restricciones por encima de 700 millones de usuarios mensuales y prohíbe ciertos usos. Las condiciones de Gemma (Google) también regulan el uso mediante una política de usos prohibidos. Apache 2.0 no tiene nada de eso: es una licencia estándar que los departamentos jurídicos ya conocen y aprueban sin negociación.
- Uso comercial
- Autorizado sin condiciones de tamaño ni de sector. No hay umbral de usuarios a supervisar.
- Modificación y fine-tuning
- Puedes adaptar el modelo y mantener tus pesos privados, sin obligación de publicarlos.
- Redistribución
- Integración posible en un producto propietario, conservando la mención de la licencia.
- Gobernanza de IBM
- Modelos firmados criptográficamente, datos documentados y certificación ISO 42001 — argumentos concretos para una revisión de conformidad.
#RAG y llamadas a funciones, los puntos fuertes de Granite
Es aquí donde Granite justifica su existencia. IBM ha entrenado específicamente estos modelos para dos usos empresariales: el RAG (responder a partir de documentos proporcionados) y el function calling (llamar a herramientas de forma fiable). Estas son precisamente las piezas que necesitamos para construir un asistente empresarial útil, y no un simple chatbot.
En RAG, Granite sigue de cerca el contexto proporcionado y limita las alucinaciones: tiende a basarse en los pasajes introducidos en lugar de inventar. Esto, junto con la arquitectura híbrida que procesa documentos largos sin disparar el consumo de VRAM, lo convierte en un buen motor para consultar una base documental en local. A menudo basta con la versión Micro, lo que hace que el RAG sea accesible en hardware modesto.
En cuanto al uso de herramientas, Granite genera llamadas a funciones bien formadas y respeta los esquemas JSON esperados. Es la base de un agente: el modelo decide llamar a una función, lee el resultado y continúa. Combinado con un contexto largo de bajo costo, permite obtener automatizaciones empresariales fiables sin depender de la nube.
- RAG documental
- Punto fuerte claro: buen seguimiento del contexto, baja tasa de información inventada y un contexto largo con poco consumo de memoria. Ideal para una base de conocimientos interna.
- Llamada a funciones
- Llamadas a herramientas fiables y JSON válido: la base de los agentes locales y de las integraciones con un sistema existente.
- Extracción estructurada
- Transformar un texto libre en campos limpios (fechas, importes, entidades). La versión Micro ya lo hace muy bien.
- Conversación generalista
- Aceptable sin ser excepcional. No es en este ámbito donde Granite busca destacar.
#Solución de problemas
- El modelo no se carga (error de arquitectura)
- Tu Ollama es demasiado antiguo para las capas Mamba de Granite 4. Actualiza Ollama a una versión reciente y vuelve a realizar el pull.
- « model not found » al hacer pull
- La etiqueta no existe con ese nombre. Revisa la ortografía exacta en ollama.com/library — los tags de variantes cambian de una versión a otra.
- Respuestas fuera de tema en RAG
- El contexto está mal formateado o contiene demasiado ruido. Estructura los pasajes insertados, reduce su número y pide explícitamente que se responda únicamente a partir de los documentos proporcionados.
- Llamadas a herramientas mal formadas
- El esquema JSON es ambiguo. Simplifica la definición, haz explícitos los campos obligatorios, y prueba primero con una sola herramienta antes de usar varias.
- Caída drástica de velocidad en Small-H
- Parte del modelo se carga en la RAM por falta de VRAM. «ollama ps» muestra el reparto entre GPU y CPU. Pasa a Tiny-H o Micro, o baja un nivel de cuantización.
- « Connection refused »
- El demonio Ollama no se ha iniciado. Compruébalo con «ollama ps» para asegurarte de que esté escuchando bien en http://localhost:11434.
#Para ir más allá
Granite se basa en componentes ya tratados en el sitio. Estas guías amplían la presente guía:
- Instalar Ollama en Linux
- El requisito previo si el demonio aún no está configurado: script de instalación, servicio systemd y configuración de GPU NVIDIA/AMD.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para equilibrar calidad y VRAM en Granite Small-H, donde cada nivel de cuantización cambia lo que cabe en tu tarjeta.
- IA local en empresas: RGPD, soberanía y despliegue
- El complemento natural de la licencia Apache 2.0: cómo desplegar Granite en una organización cumpliendo la normativa.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.