Intermedio 10 minGemma

Gemma 4 localmente con Ollama: instalación, VRAM, perfs

Gemma 4 es la nueva generación de modelos de pesos abiertos de Google, lanzada en 2026. Multimodalidad nativa, contexto largo, licencia Apache 2.0 y tres tamaños útiles en la biblioteca de Ollama: E2B (compacto), 12B y 26B-A4B (un MoE). Esta guía te muestra cómo ejecutar Gemma 4 con Ollama, qué cuantización elegir según tu VRAM, los órdenes de magnitud en tokens/segundo en RTX y Apple Silicon, y qué cambia concretamente en comparación con Gemma 3.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué Gemma 4 en local?

Gemma 4 es uno de los mejores modelos de pesos abiertos de su tamaño para el francés. El 12B Q4 cabe cómodamente en 8 a 12 GB de VRAM, lo que permite usarlo en una RTX 3060, una 4070 o un Mac de la serie M de gama media. El 26B-A4B, un modelo MoE que solo activa 4B de parámetros, aprovecha tarjetas de 24 GB (3090, 4090, 7900 XTX) y los Mac con abundante memoria unificada, sin dejar de ser rápido. Para usarlo como asistente en francés, en RAG o en programación general, es una excelente opción por defecto.

La otra razón para ejecutarlo en local: desde abril de 2026 Gemma 4 se publica bajo la licencia Apache 2.0, lo que elimina las restricciones de las antiguas Gemma Terms of Use (uso comercial, redistribución y fine-tuning libres), y Ollama gestiona el pull, la cuantización y la inferencia sin que tengas que tocar directamente Python, CUDA o llama.cpp.

i
En dos palabras
Gemma 4 + Ollama supone un comando para descargar el modelo, un comando para conversar y un endpoint compatible con OpenAI en localhost:11434. El resto son ajustes.

#Lo que cambia respecto a Gemma 3

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Gemma 3 (marzo de 2025) incorporó capacidades multimodales y un contexto de 128k. Gemma 4 conserva estos avances y mejora en tres aspectos: calidad (un gran salto medido en los benchmarks de razonamiento y código), eficiencia (el modelo de 12B sustituye con ventaja al de 27B de Gemma 3 en muchas tareas, y el 26B-A4B con arquitectura MoE ejecuta el equivalente de un modelo grande a la velocidad de uno pequeño) y tokenizer (un vocabulario más denso, que reduce el número de tokens para una generación equivalente y, por tanto, permite obtener más tokens útiles por segundo).

Tamaños
Gemma 3: 1B, 4B, 12B, 27B (densos). Gemma 4: E2B (compacta), 12B (densa) y 26B-A4B (MoE, 4B activos). La gama mejora en eficiencia en lugar de aumentar en tamaño bruto.
Multimodal
Visión nativa en el 12B y el 26B-A4B (texto + imágenes). El E2B sigue siendo la variante compacta orientada al texto.
Contexto
128k tokens en toda la gama. Las mismas limitaciones de memoria que antes: la caché KV ocupa rápidamente mucha memoria.
Tokenizer
SentencePiece, vocabulario revisado para cubrir mejor el francés, el código y las lenguas con escritura no latina. Con un prompt equivalente, se consumen aproximadamente entre un 5 % y un 15 % menos de tokens.
Licencia
Apache 2.0 desde abril de 2026. Uso comercial, redistribución y fine-tuning libres, sin una cláusula específica de uso aceptable: un verdadero cambio respecto a los Gemma Terms of Use de Gemma 3.
→
Cuándo conservar Gemma 3
Si ya tienes un pipeline RAG consolidado con Gemma 3 12B y la calidad te basta, no migres solo por hacerlo. Gemma 4 12B es mejor, pero el ligero aumento del consumo de VRAM (~8 GB frente a ~7 GB en Q4) y el reajuste de los prompts solo se justifican si estás llegando a los límites de Gemma 3 12B.

#Prerrequisitos

Ollama instalado
Versión reciente (≥ 0.5). Consultar las guías de instalación para Windows, macOS o Linux si aún no se ha instalado.
Espacio en disco
Prever 4,3 GB para el E2B, 7,6 GB para el 12B Q4 y 19 GB para el 26B-A4B Q4. Las variantes Q5 y Q8 del 12B y del 26B ocupan entre 1,3 y 2 veces más espacio.
VRAM o memoria unificada
Mínimo práctico: 6 GB para el E2B, de 8 a 12 GB para el 12B en Q4, 24 GB para el 26B-A4B en Q4. Con menos memoria, parte del modelo pasa a ejecutarse en la CPU y la velocidad cae drásticamente.
Controladores GPU actualizados
CUDA 12.x para NVIDIA, ROCm 6.x para AMD, Metal nativo para Apple Silicon. Ollama detecta el backend por sí solo.

#1. Descarga y ejecución con un solo comando

La etiqueta de Ollama para Gemma 4 sigue la convención habitual: gemma4 (latest apunta por defecto al 12B Q4), gemma4:e2b-it-qat, gemma4:12b, gemma4:26b. Para especificar la cuantización, se añade un sufijo: gemma4:12b-instruct-q4_K_M.

Pull y lanzamiento directo
ollama run gemma4:12b

Al primer lanzamiento, Ollama descarga el modelo (~7,6 GB para el 12B Q4) y abre directamente un prompt interactivo. En las siguientes ejecuciones, el lanzamiento es instantáneo siempre que el modelo permanezca en caché en memoria.

Solo descarga (sin ejecutar)
ollama pull gemma4:e2b-it-qat
ollama pull gemma4:12b
ollama pull gemma4:26b
i
Elegir explícitamente la cuantización
Por defecto Ollama usa Q4_K_M, que es el mejor equilibrio entre calidad y memoria en el 95 % de los casos. Para ir más lejos: gemma4:12b-instruct-q5_K_M (calidad ligeramente mejor, +25 % de VRAM), gemma4:12b-instruct-q8_0 (similar al FP16, +100 % de VRAM). El E2B, en cambio, se distribuye directamente en QAT int4 (gemma4:e2b-it-qat) y no tiene una variante más pesada útil. El FP16 puro solo tiene interés en fine-tuning.

Para comprobar en tiempo real qué está cargado en la VRAM:

Estado de los modelos cargados
ollama ps

La columna PROCESSOR debe mostrar 100% GPU. Si ves 70%/30% GPU/CPU, significa que parte del modelo se está cargando fuera de la VRAM: pasa a una cuantización más agresiva o a un modelo de menor tamaño.

#2. VRAM por tamaño y cuantización

Las cifras que aparecen a continuación incluyen los pesos del modelo más una caché KV para una ventana de contexto de 8k tokens (el valor predeterminado de Ollama). Para ampliarla a 32k o 128k, calcula entre 2 y 8 GB adicionales según el tamaño.

Gemma 4 E2B — QAT int4
≈ 4,5 GB de VRAM. Variante compacta (QAT, ~2B activos al estilo de MatFormer). Funciona en cualquier GTX 1660 (6 GB), RTX 3050 (8 GB) o Mac con 8 GB de memoria unificada.
Gemma 4 12B — Q4_K_M
≈ 8 GB de VRAM. Equipos idóneos: RTX 3060 de 12 GB, 4070 de 12 GB, 5070 de 12 GB, Mac de 16 GB o más.
Gemma 4 12B — Q5_K_M
≈ 9,5 GB de VRAM. Cabe en 12 GB con un contexto modesto; con 16 GB hay más margen (4070 Ti Super, 5080).
Gemma 4 12B — Q8_0
≈ 13 GB de VRAM. Reservado para tarjetas de 16 GB o más o equipos Apple Silicon con abundante memoria.
Gemma 4 26B-A4B — Q4_K_M
≈ 19 GB de VRAM. Punto óptimo: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio. MoE: solo carga 4B activos, por lo que es rápido a pesar de la memoria que ocupa.
Gemma 4 26B-A4B — Q5_K_M
≈ 23 GB de VRAM. En el límite superior para una tarjeta de 24 GB; en caso contrario, optar por un Mac con 48 GB o más de memoria unificada o por una configuración multi-GPU.
Gemma 4 26B-A4B — Q8_0
≈ 30 GB de VRAM. Para tarjetas con 32 GB o más (RTX 5090) o Mac con 48 GB o más de memoria unificada.
!
La trampa del contexto de 128k
Activar la ventana máxima (num_ctx=131072) en el 12B puede añadir entre 4 y 6 GB a la caché KV. Si el modelo apenas cabe en Q4 a 8k, a 32k superará la memoria disponible. Aumenta el contexto por etapas y vigila ollama ps.

#3. Tokens/segundo: RTX y Apple Silicon

Órdenes de magnitud observados con una versión reciente de Ollama, contexto de 8k, prompt corto y generación de 200 tokens. Las cifras varían ±15 % según el contenido generado y la versión de Ollama. Como el 26B-A4B es un MoE (4B activos), funciona mucho más rápido que un modelo denso de 26B una vez cargado en memoria.

RTX 3060 12 GB
Gemma 4 E2B: ~90 tok/s. Gemma 4 12B Q4: ~28 tok/s. 26B-A4B: excede la VRAM disponible (19 GB), evitar.
RTX 4070 12 GB
E2B: ~130 tok/s. 12B Q4: ~46 tok/s. 26B-A4B: no cabe.
RTX 4080 Super 16 GB
12B Q4: ~66 tok/s. 12B Q8: ~40 tok/s. 26B-A4B: no cabe en 16 GB.
RTX 4090 24 GB
12B Q4 : ~100 tok/s. 26B-A4B Q4 : ~58 tok/s. 26B-A4B Q5 : ~50 tok/s.
RTX 5090 32 GB
12B Q4: ~150 tok/s. 26B-A4B Q4: ~88 tok/s. 26B-A4B Q8: ~48 tok/s.
Mac M3 Max 64 GB
12B Q4: ~38 tok/s. 26B-A4B Q4: ~30 tok/s. Gran estabilidad gracias a la memoria unificada.
Mac M4 Pro 48 GB
12B Q4: ~34 tok/s. 26B-A4B Q4: ~24 tok/s. El MoE funciona sin problemas y sigue siendo ágil para su tamaño.
Mac M4 Max 128 GB
26B-A4B Q4: ~36 tok/s. 26B-A4B Q8: ~20 tok/s. El Mac que mejor se desenvuelve con el 26B en el día a día.
→
Referencia práctica
Por encima de 30 tok/s, el uso interactivo es fluido. Entre 15 y 30 tok/s, sigue siendo aceptable para el chat, pero resulta lento con respuestas largas. Por debajo de 10 tok/s, resérvalo para el procesamiento por lotes o para tareas en las que de todos modos esperas a que termine.

#4. Primer prompt y ajustes útiles

Gemma 4 responde bien en francés sin un prompt de sistema específico, pero conviene ajustar algunos parámetros según el caso de uso.

Prueba rápida
ollama run gemma4:12b
>>> Explique la différence entre un index B-tree et un index hash en SQL, en 5 lignes.

Para ajustar los parámetros sobre la marcha desde el prompt interactivo:

Parámetros en sesión
/set parameter temperature 0.3
/set parameter num_ctx 16384
/set parameter num_predict 800
temperature
0.7 por defecto. Disminuye a 0.2-0.4 para contenido factual, código o RAG. Aumenta a 0.9-1.1 para brainstorming.
num_ctx
Ventana de contexto. 4096 o 8192 por defecto según la compilación. Auméntala según tu caso de uso y la VRAM disponible.
num_predict
Número máximo de tokens generados. -1 para ilimitado (hasta el stop). Útil para limitar la longitud de las respuestas.
repeat_penalty
1.1 por defecto. Si Gemma 4 entra en un bucle, sube a 1.15-1.2. Si las respuestas parecen demasiado elaboradas, baja a 1.05.
i
Guardar los ajustes de forma persistente
Para fijar un prompt de sistema y unos parámetros, crea un Modelfile: FROM gemma4:12b, luego SYSTEM "...", PARAMETER temperature 0.3, etc. Ejecuta ollama create monassistant -f Modelfile y después invoca monassistant como un modelo normal.

#5. API y integración desde tu código

Ollama expone un endpoint compatible con OpenAI en http://localhost:11434/v1. Cualquier SDK que se comunique con OpenAI funciona simplemente configurando base_url para que apunte a tu servidor local.

Python — SDK openai
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # valeur ignorée, mais le SDK l'exige
)

resp = client.chat.completions.create(
    model="gemma4:12b",
    messages=[
        {"role": "system", "content": "Tu réponds en français, de manière concise."},
        {"role": "user", "content": "Résume la photosynthèse en 3 lignes."},
    ],
    temperature=0.3,
)
print(resp.choices[0].message.content)

Para la versión multimodal (12B y 26B-A4B), la imagen se incluye en el mensaje en base64 o mediante una URL local —el mismo protocolo que GPT-4o.

Visión mediante curl
curl http://localhost:11434/api/generate -d '{
  "model": "gemma4:12b",
  "prompt": "Décris cette image en français.",
  "images": ["'"$(base64 -w0 photo.jpg)"'"],
  "stream": false
}'

#Solución de problemas

"Error: model gemma4 not found"
La etiqueta no existe aún en tu versión de Ollama, o hay un error de escritura. Revisa con ollama list los modelos instalados y la documentación de la biblioteca Ollama para los tags oficiales.
Modelo que se ejecuta parcialmente en la CPU
ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
Velocidad dividida por 3 después de algunas horas
El KV-cache se fragmenta con ciertos controladores. Reinicia el servicio Ollama (sudo systemctl restart ollama en Linux, reiniciar la aplicación en Mac/Windows).
Respuestas truncadas después de ~400 palabras
num_predict demasiado bajo. Establece un valor de 2048 o de -1 para que no haya límite, y aumenta num_ctx en consecuencia.
Francés poco preciso en E2B
Es normal: el E2B es potente para su tamaño, pero sigue siendo una variante compacta. Si necesitas un alto nivel de calidad en francés, elige el 12B.
OOM en RTX 4060 8 GB en 12B
El 12B en Q4 cabe justo en 8 GB, sin margen para el contexto. O usa gemma4:e2b-it-qat, o acepta que parte del modelo se ejecute en la CPU (~3-5 tok/s), o cambia de tarjeta.

#Para ir más allá

Ya tienes Gemma 4 en marcha. Algunas ideas para ir más allá según lo que quieras hacer con él:

Qué es Ollama y cómo funciona
Si descubres Ollama, esta guía para principiantes repasa los comandos esenciales y el modelo mental completo.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para entender exactamente qué estás sacrificando al pasar del Q8 al Q4, y cuándo realmente importa.
Open WebUI con Ollama
Para una interfaz similar a ChatGPT sobre Gemma 4: historial de conversaciones, RAG integrado y uso compartido entre varios usuarios.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.