Intermedio 10 minIBM

Granite 4 de IBM en local: instalación y casos d'usage

IBM desarrolla discretamente una de las familias de LLM con pesos abiertos más interesantes para las empresas: Granite. Esta guía muestra cómo instalar Granite 4 en local con Ollama, explica la arquitectura híbrida Mamba que reduce la memoria necesaria, detalla la licencia Apache 2.0 sin cláusulas engañosas y se centra en los usos —RAG, llamadas a funciones y tareas empresariales— en los que Granite realmente destaca frente a los modelos para el público general.

Por Clara M.·Actualización 2026-07-30·Probado en Windows, macOS y Linux

#¿Por qué Granite 4 en lugar de otro modelo?

Granite no está diseñado para encabezar las clasificaciones de chatbots. IBM tiene un objetivo diferente: modelos fiables, con un consumo reducido de memoria y sin problemas jurídicos, pensados para integrarse en aplicaciones empresariales. No se elige Granite para hablar de filosofía, sino para conectar un modelo con una base documental, hacer que utilice herramientas o ejecutarlo a bajo coste en hardware modesto.

Tres cosas distinguen a Granite 4 del resto de los modelos de pesos abiertos. En primer lugar, una arquitectura híbrida Mamba que reduce considerablemente el consumo de memoria, especialmente con contextos largos. En segundo lugar, una licencia Apache 2.0 estricta, sin las restricciones de uso que imponen Llama o Gemma. Por último, un trabajo de trazabilidad y gobernanza —modelos firmados, datos de entrenamiento documentados, certificación ISO 42001— que las direcciones de TI y los departamentos jurídicos saben apreciar. Es un modelo pensado para superar una revisión de cumplimiento, no solo un benchmark.

i
Granite busca la integración, no la conversación
Si buscas el mejor asistente generalista en francés, Qwen3 o Mistral seguirán estando a menudo por delante. Granite destaca cuando se convierte en un componente: motor de RAG, orquestador de herramientas, extractor de datos estructurados en un pipeline.

#La arquitectura híbrida Mamba y su ahorro de memoria

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

El verdadero argumento técnico de Granite 4 es su arquitectura. Un transformador clásico se basa completamente en la atención: con cada nuevo token, el modelo vuelve a leer todo el contexto y almacena una «caché KV» que crece linealmente con la longitud de la conversación. Cuanto más largo es el contexto, más se dispara el consumo de VRAM y más se ralentiza la inferencia. Es la conocida limitación de los contextos largos al ejecutar modelos en local.

Mamba pertenece a otra familia: los modelos de espacio de estados (state space models). En lugar de leer todo de nuevo, una capa Mamba mantiene un estado recurrente de tamaño fijo que resume el pasado. Consecuencia: la memoria no crece con la longitud del contexto, y la velocidad de procesamiento se mantiene estable incluso en documentos muy largos. El defecto de Mamba solo es que recuerda con menos precisión los detalles lejanos.

Granite 4 combina los dos. La mayoría de los bloques son capas Mamba-2 (eficientes), intercaladas con una minoría de bloques de atención (precisos): una proporción de aproximadamente nueve capas Mamba por una capa de atención. Se mantiene así la mayor parte del ahorro de memoria mientras se conserva la capacidad de la atención para recuperar un detalle exacto. En la práctica, Granite 4 funciona con mucha menos RAM/VRAM que un transformador de tamaño similar, especialmente cuando el contexto supera unos pocos miles de tokens.

→
La ganancia es máxima en contexto largo
Con un prompt corto, la diferencia con un transformer clásico es modesta. Pero carga un documento grande o una conversación larga y la diferencia aumenta: donde un modelo clásico satura tu tarjeta, Granite mantiene un consumo de memoria casi constante.

#Micro, Tiny y Small: ¿qué variante elegir?

Granite 4 se ofrece en varios tamaños, con sufijos que indican el hardware al que está dirigido. Las versiones marcadas «H» usan la arquitectura híbrida; se proporciona una versión no híbrida para los entornos que aún no son compatibles con Mamba.

Granite 4 Micro (~3B, denso)
El más pequeño, denso e híbrido. Ideal para ejecutarlo en CPU, con poca VRAM o en entornos edge. Cabe en ~2 GB en Q4. Perfecto para extracción, clasificación y RAG ligero.
Granite 4 Tiny-H (~7B, MoE)
Mezcla de expertos híbrida: muchos parámetros en total, pero pocos activos en cada token, por lo que es rápida. Buen equilibrio entre calidad y velocidad en una tarjeta de gama de entrada.
Granite 4 Small-H (~32B, MoE)
La gama alta accesible: calidad similar a la de los grandes modelos para tareas profesionales, manteniendo la huella de memoria reducida del modelo híbrido. Destinado a estaciones de trabajo o servidores.
Variante no híbrida
Existe una versión con arquitectura transformer clásica para los entornos de ejecución que aún no admiten Mamba. Reservar únicamente para casos de compatibilidad: se pierde el ahorro de memoria.

Para empezar, Micro basta para validar los casos de uso y funciona en cualquier equipo. Pasa a Tiny-H o Small-H una vez que sepas qué quieres llevar a producción y hayas medido una insuficiencia de calidad.

#Prerrequisitos y VRAM

El único requisito de software es tener Ollama instalado y actualizado: el demonio escucha por defecto en http://localhost:11434. Asegúrate de tener una versión reciente: la compatibilidad con las capas Mamba de Granite 4 requiere una versión bastante reciente de Ollama; de lo contrario, el modelo no se cargará.

Micro (3B) en Q4
≈ 2 GB de VRAM. También funciona en CPU con 8 GB de RAM, despacio pero con fiabilidad. Una RTX 3060 de 12 GB ofrece un margen muy cómodo.
Tiny-H (7B MoE) en Q4
≈ 5 GB de VRAM para los pesos, pero la activación parcial de MoE hace que la inferencia sea ligera. Una tarjeta de 8–12 GB es más que suficiente.
Small-H (32B MoE) en Q4
≈ 19 GB de VRAM. RTX 4090 de 24 GB o Mac con 32–48 GB de memoria unificada. El diseño híbrido limita el aumento drástico del consumo de memoria con contextos largos.
Margen para el contexto
Gracias a Mamba, la caché KV ocupa mucha menos memoria que en un transformador equivalente: puedes aspirar a contextos grandes sin duplicar la VRAM.
i
Referencia para la cuantización
Q4_K_M sigue siendo la recomendación por defecto (mejor relación calidad/tamaño). Aumenta a Q5_K_M o Q8_0 si tienes espacio en VRAM y buscas precisión máxima en tareas de extracción sensibles.

#Instalar Granite 4 mediante Ollama

La instalación sigue el procedimiento habitual de Ollama. El modelo está publicado en la biblioteca oficial con el nombre granite4; las variantes se seleccionan mediante etiquetas. Comprueba el nombre exacto de las etiquetas en ollama.com/library antes de descargar un tamaño específico, ya que cambian de una versión a otra.

  1. 01
    Verificar Ollama
    Confirma que el daemon esté funcionando y actualizado. Una versión antigua no conoce las capas Mamba de Granite 4.
  2. 02
    Descargar el modelo
    Descarga la variante elegida con ollama pull. Comienza con Micro para probar rápidamente sin saturar tu disco ni tu tarjeta.
  3. 03
    Iniciar un primer chat
    ollama run ouvre une session interactive. Posez une question métier — résumé d'un texte, extraction de champs — plutôt qu'une devinette généraliste.
  4. 04
    Conectar una interfaz
    Configura Open WebUI o LM Studio para que utilicen el endpoint local y puedas trabajar cómodamente, o llama directamente a la API HTTP desde tu aplicación.
Terminal — instalar y ejecutar Granite 4
# Vérifier la version d'Ollama (doit être récente)
ollama --version

# Tirer la variante Micro (la plus légère)
ollama pull granite4:micro

# Lancer une session interactive
ollama run granite4:micro

# Vérifier ce qui tourne et la répartition GPU/CPU
ollama ps

Para usarlo en aplicaciones, Ollama expone una API compatible con OpenAI en el mismo puerto. Por lo tanto, puedes reutilizar cualquier cliente existente simplemente cambiando la URL base y el nombre del modelo.

Terminal — llamada a la API local
curl http://localhost:11434/api/chat -d '{
  "model": "granite4:micro",
  "messages": [
    { "role": "user", "content": "Résume ce texte en trois points : ..." }
  ],
  "stream": false
}'

#Apache 2.0, la licencia sin trampas para empresas

Es un punto que los equipos jurídicos revisan antes de los benchmarks. Granite 4 se publica bajo la licencia Apache 2.0, una licencia de código abierto permisiva y probada. Puedes usarlo comercialmente, modificarlo, redistribuirlo e integrarlo en un producto cerrado, sin umbral de usuarios ni cláusula de uso aceptable que debas vigilar.

Este matiz importa frente a las alternativas populares. La «Llama Community License» de Meta no es una verdadera licencia de código abierto: impone restricciones por encima de 700 millones de usuarios mensuales y prohíbe ciertos usos. Las condiciones de Gemma (Google) también regulan el uso mediante una política de usos prohibidos. Apache 2.0 no tiene nada de eso: es una licencia estándar que los departamentos jurídicos ya conocen y aprueban sin negociación.

Uso comercial
Autorizado sin condiciones de tamaño ni de sector. No hay umbral de usuarios a supervisar.
Modificación y fine-tuning
Puedes adaptar el modelo y mantener tus pesos privados, sin obligación de publicarlos.
Redistribución
Integración posible en un producto propietario, conservando la mención de la licencia.
Gobernanza de IBM
Modelos firmados criptográficamente, datos documentados y certificación ISO 42001 — argumentos concretos para una revisión de conformidad.
!
Revisa siempre la licencia de la variante
Apache 2.0 cubre la familia principal Granite 4, pero un fine-tune de terceros redistribuido en Ollama puede estar sujeto a otras condiciones. Revisa la ficha del modelo antes de un despliegue en producción.

#RAG y llamadas a funciones, los puntos fuertes de Granite

Es aquí donde Granite justifica su existencia. IBM ha entrenado específicamente estos modelos para dos usos empresariales: el RAG (responder a partir de documentos proporcionados) y el function calling (llamar a herramientas de forma fiable). Estas son precisamente las piezas que necesitamos para construir un asistente empresarial útil, y no un simple chatbot.

En RAG, Granite sigue de cerca el contexto proporcionado y limita las alucinaciones: tiende a basarse en los pasajes introducidos en lugar de inventar. Esto, junto con la arquitectura híbrida que procesa documentos largos sin disparar el consumo de VRAM, lo convierte en un buen motor para consultar una base documental en local. A menudo basta con la versión Micro, lo que hace que el RAG sea accesible en hardware modesto.

En cuanto al uso de herramientas, Granite genera llamadas a funciones bien formadas y respeta los esquemas JSON esperados. Es la base de un agente: el modelo decide llamar a una función, lee el resultado y continúa. Combinado con un contexto largo de bajo costo, permite obtener automatizaciones empresariales fiables sin depender de la nube.

RAG documental
Punto fuerte claro: buen seguimiento del contexto, baja tasa de información inventada y un contexto largo con poco consumo de memoria. Ideal para una base de conocimientos interna.
Llamada a funciones
Llamadas a herramientas fiables y JSON válido: la base de los agentes locales y de las integraciones con un sistema existente.
Extracción estructurada
Transformar un texto libre en campos limpios (fechas, importes, entidades). La versión Micro ya lo hace muy bien.
Conversación generalista
Aceptable sin ser excepcional. No es en este ámbito donde Granite busca destacar.
Ejemplo — definición de una herramienta para function calling
{
  "type": "function",
  "function": {
    "name": "chercher_facture",
    "description": "Récupère une facture par son numéro",
    "parameters": {
      "type": "object",
      "properties": {
        "numero": { "type": "string", "description": "Numéro de facture" }
      },
      "required": ["numero"]
    }
  }
}

#Solución de problemas

El modelo no se carga (error de arquitectura)
Tu Ollama es demasiado antiguo para las capas Mamba de Granite 4. Actualiza Ollama a una versión reciente y vuelve a realizar el pull.
« model not found » al hacer pull
La etiqueta no existe con ese nombre. Revisa la ortografía exacta en ollama.com/library — los tags de variantes cambian de una versión a otra.
Respuestas fuera de tema en RAG
El contexto está mal formateado o contiene demasiado ruido. Estructura los pasajes insertados, reduce su número y pide explícitamente que se responda únicamente a partir de los documentos proporcionados.
Llamadas a herramientas mal formadas
El esquema JSON es ambiguo. Simplifica la definición, haz explícitos los campos obligatorios, y prueba primero con una sola herramienta antes de usar varias.
Caída drástica de velocidad en Small-H
Parte del modelo se carga en la RAM por falta de VRAM. «ollama ps» muestra el reparto entre GPU y CPU. Pasa a Tiny-H o Micro, o baja un nivel de cuantización.
« Connection refused »
El demonio Ollama no se ha iniciado. Compruébalo con «ollama ps» para asegurarte de que esté escuchando bien en http://localhost:11434.

#Para ir más allá

Granite se basa en componentes ya tratados en el sitio. Estas guías amplían la presente guía:

Instalar Ollama en Linux
El requisito previo si el demonio aún no está configurado: script de instalación, servicio systemd y configuración de GPU NVIDIA/AMD.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para equilibrar calidad y VRAM en Granite Small-H, donde cada nivel de cuantización cambia lo que cabe en tu tarjeta.
IA local en empresas: RGPD, soberanía y despliegue
El complemento natural de la licencia Apache 2.0: cómo desplegar Granite en una organización cumpliendo la normativa.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.