Gemma 4 localmente con Ollama: instalación, VRAM, perfs
Gemma 4 es la nueva generación de modelos de pesos abiertos de Google, lanzada en 2026. Multimodalidad nativa, contexto largo, licencia Apache 2.0 y tres tamaños útiles en la biblioteca de Ollama: E2B (compacto), 12B y 26B-A4B (un MoE). Esta guía te muestra cómo ejecutar Gemma 4 con Ollama, qué cuantización elegir según tu VRAM, los órdenes de magnitud en tokens/segundo en RTX y Apple Silicon, y qué cambia concretamente en comparación con Gemma 3.
#¿Por qué Gemma 4 en local?
Gemma 4 es uno de los mejores modelos de pesos abiertos de su tamaño para el francés. El 12B Q4 cabe cómodamente en 8 a 12 GB de VRAM, lo que permite usarlo en una RTX 3060, una 4070 o un Mac de la serie M de gama media. El 26B-A4B, un modelo MoE que solo activa 4B de parámetros, aprovecha tarjetas de 24 GB (3090, 4090, 7900 XTX) y los Mac con abundante memoria unificada, sin dejar de ser rápido. Para usarlo como asistente en francés, en RAG o en programación general, es una excelente opción por defecto.
La otra razón para ejecutarlo en local: desde abril de 2026 Gemma 4 se publica bajo la licencia Apache 2.0, lo que elimina las restricciones de las antiguas Gemma Terms of Use (uso comercial, redistribución y fine-tuning libres), y Ollama gestiona el pull, la cuantización y la inferencia sin que tengas que tocar directamente Python, CUDA o llama.cpp.
#Lo que cambia respecto a Gemma 3
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Gemma 3 (marzo de 2025) incorporó capacidades multimodales y un contexto de 128k. Gemma 4 conserva estos avances y mejora en tres aspectos: calidad (un gran salto medido en los benchmarks de razonamiento y código), eficiencia (el modelo de 12B sustituye con ventaja al de 27B de Gemma 3 en muchas tareas, y el 26B-A4B con arquitectura MoE ejecuta el equivalente de un modelo grande a la velocidad de uno pequeño) y tokenizer (un vocabulario más denso, que reduce el número de tokens para una generación equivalente y, por tanto, permite obtener más tokens útiles por segundo).
- Tamaños
- Gemma 3: 1B, 4B, 12B, 27B (densos). Gemma 4: E2B (compacta), 12B (densa) y 26B-A4B (MoE, 4B activos). La gama mejora en eficiencia en lugar de aumentar en tamaño bruto.
- Multimodal
- Visión nativa en el 12B y el 26B-A4B (texto + imágenes). El E2B sigue siendo la variante compacta orientada al texto.
- Contexto
- 128k tokens en toda la gama. Las mismas limitaciones de memoria que antes: la caché KV ocupa rápidamente mucha memoria.
- Tokenizer
- SentencePiece, vocabulario revisado para cubrir mejor el francés, el código y las lenguas con escritura no latina. Con un prompt equivalente, se consumen aproximadamente entre un 5 % y un 15 % menos de tokens.
- Licencia
- Apache 2.0 desde abril de 2026. Uso comercial, redistribución y fine-tuning libres, sin una cláusula específica de uso aceptable: un verdadero cambio respecto a los Gemma Terms of Use de Gemma 3.
#Prerrequisitos
- Ollama instalado
- Versión reciente (≥ 0.5). Consultar las guías de instalación para Windows, macOS o Linux si aún no se ha instalado.
- Espacio en disco
- Prever 4,3 GB para el E2B, 7,6 GB para el 12B Q4 y 19 GB para el 26B-A4B Q4. Las variantes Q5 y Q8 del 12B y del 26B ocupan entre 1,3 y 2 veces más espacio.
- VRAM o memoria unificada
- Mínimo práctico: 6 GB para el E2B, de 8 a 12 GB para el 12B en Q4, 24 GB para el 26B-A4B en Q4. Con menos memoria, parte del modelo pasa a ejecutarse en la CPU y la velocidad cae drásticamente.
- Controladores GPU actualizados
- CUDA 12.x para NVIDIA, ROCm 6.x para AMD, Metal nativo para Apple Silicon. Ollama detecta el backend por sí solo.
#1. Descarga y ejecución con un solo comando
La etiqueta de Ollama para Gemma 4 sigue la convención habitual: gemma4 (latest apunta por defecto al 12B Q4), gemma4:e2b-it-qat, gemma4:12b, gemma4:26b. Para especificar la cuantización, se añade un sufijo: gemma4:12b-instruct-q4_K_M.
Al primer lanzamiento, Ollama descarga el modelo (~7,6 GB para el 12B Q4) y abre directamente un prompt interactivo. En las siguientes ejecuciones, el lanzamiento es instantáneo siempre que el modelo permanezca en caché en memoria.
Para comprobar en tiempo real qué está cargado en la VRAM:
La columna PROCESSOR debe mostrar 100% GPU. Si ves 70%/30% GPU/CPU, significa que parte del modelo se está cargando fuera de la VRAM: pasa a una cuantización más agresiva o a un modelo de menor tamaño.
#2. VRAM por tamaño y cuantización
Las cifras que aparecen a continuación incluyen los pesos del modelo más una caché KV para una ventana de contexto de 8k tokens (el valor predeterminado de Ollama). Para ampliarla a 32k o 128k, calcula entre 2 y 8 GB adicionales según el tamaño.
- Gemma 4 E2B — QAT int4
- ≈ 4,5 GB de VRAM. Variante compacta (QAT, ~2B activos al estilo de MatFormer). Funciona en cualquier GTX 1660 (6 GB), RTX 3050 (8 GB) o Mac con 8 GB de memoria unificada.
- Gemma 4 12B — Q4_K_M
- ≈ 8 GB de VRAM. Equipos idóneos: RTX 3060 de 12 GB, 4070 de 12 GB, 5070 de 12 GB, Mac de 16 GB o más.
- Gemma 4 12B — Q5_K_M
- ≈ 9,5 GB de VRAM. Cabe en 12 GB con un contexto modesto; con 16 GB hay más margen (4070 Ti Super, 5080).
- Gemma 4 12B — Q8_0
- ≈ 13 GB de VRAM. Reservado para tarjetas de 16 GB o más o equipos Apple Silicon con abundante memoria.
- Gemma 4 26B-A4B — Q4_K_M
- ≈ 19 GB de VRAM. Punto óptimo: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio. MoE: solo carga 4B activos, por lo que es rápido a pesar de la memoria que ocupa.
- Gemma 4 26B-A4B — Q5_K_M
- ≈ 23 GB de VRAM. En el límite superior para una tarjeta de 24 GB; en caso contrario, optar por un Mac con 48 GB o más de memoria unificada o por una configuración multi-GPU.
- Gemma 4 26B-A4B — Q8_0
- ≈ 30 GB de VRAM. Para tarjetas con 32 GB o más (RTX 5090) o Mac con 48 GB o más de memoria unificada.
#3. Tokens/segundo: RTX y Apple Silicon
Órdenes de magnitud observados con una versión reciente de Ollama, contexto de 8k, prompt corto y generación de 200 tokens. Las cifras varían ±15 % según el contenido generado y la versión de Ollama. Como el 26B-A4B es un MoE (4B activos), funciona mucho más rápido que un modelo denso de 26B una vez cargado en memoria.
- RTX 3060 12 GB
- Gemma 4 E2B: ~90 tok/s. Gemma 4 12B Q4: ~28 tok/s. 26B-A4B: excede la VRAM disponible (19 GB), evitar.
- RTX 4070 12 GB
- E2B: ~130 tok/s. 12B Q4: ~46 tok/s. 26B-A4B: no cabe.
- RTX 4080 Super 16 GB
- 12B Q4: ~66 tok/s. 12B Q8: ~40 tok/s. 26B-A4B: no cabe en 16 GB.
- RTX 4090 24 GB
- 12B Q4 : ~100 tok/s. 26B-A4B Q4 : ~58 tok/s. 26B-A4B Q5 : ~50 tok/s.
- RTX 5090 32 GB
- 12B Q4: ~150 tok/s. 26B-A4B Q4: ~88 tok/s. 26B-A4B Q8: ~48 tok/s.
- Mac M3 Max 64 GB
- 12B Q4: ~38 tok/s. 26B-A4B Q4: ~30 tok/s. Gran estabilidad gracias a la memoria unificada.
- Mac M4 Pro 48 GB
- 12B Q4: ~34 tok/s. 26B-A4B Q4: ~24 tok/s. El MoE funciona sin problemas y sigue siendo ágil para su tamaño.
- Mac M4 Max 128 GB
- 26B-A4B Q4: ~36 tok/s. 26B-A4B Q8: ~20 tok/s. El Mac que mejor se desenvuelve con el 26B en el día a día.
#4. Primer prompt y ajustes útiles
Gemma 4 responde bien en francés sin un prompt de sistema específico, pero conviene ajustar algunos parámetros según el caso de uso.
Para ajustar los parámetros sobre la marcha desde el prompt interactivo:
- temperature
- 0.7 por defecto. Disminuye a 0.2-0.4 para contenido factual, código o RAG. Aumenta a 0.9-1.1 para brainstorming.
- num_ctx
- Ventana de contexto. 4096 o 8192 por defecto según la compilación. Auméntala según tu caso de uso y la VRAM disponible.
- num_predict
- Número máximo de tokens generados. -1 para ilimitado (hasta el stop). Útil para limitar la longitud de las respuestas.
- repeat_penalty
- 1.1 por defecto. Si Gemma 4 entra en un bucle, sube a 1.15-1.2. Si las respuestas parecen demasiado elaboradas, baja a 1.05.
#5. API y integración desde tu código
Ollama expone un endpoint compatible con OpenAI en http://localhost:11434/v1. Cualquier SDK que se comunique con OpenAI funciona simplemente configurando base_url para que apunte a tu servidor local.
Para la versión multimodal (12B y 26B-A4B), la imagen se incluye en el mensaje en base64 o mediante una URL local —el mismo protocolo que GPT-4o.
#Solución de problemas
- "Error: model gemma4 not found"
- La etiqueta no existe aún en tu versión de Ollama, o hay un error de escritura. Revisa con ollama list los modelos instalados y la documentación de la biblioteca Ollama para los tags oficiales.
- Modelo que se ejecuta parcialmente en la CPU
- ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
- Velocidad dividida por 3 después de algunas horas
- El KV-cache se fragmenta con ciertos controladores. Reinicia el servicio Ollama (sudo systemctl restart ollama en Linux, reiniciar la aplicación en Mac/Windows).
- Respuestas truncadas después de ~400 palabras
- num_predict demasiado bajo. Establece un valor de 2048 o de -1 para que no haya límite, y aumenta num_ctx en consecuencia.
- Francés poco preciso en E2B
- Es normal: el E2B es potente para su tamaño, pero sigue siendo una variante compacta. Si necesitas un alto nivel de calidad en francés, elige el 12B.
- OOM en RTX 4060 8 GB en 12B
- El 12B en Q4 cabe justo en 8 GB, sin margen para el contexto. O usa gemma4:e2b-it-qat, o acepta que parte del modelo se ejecute en la CPU (~3-5 tok/s), o cambia de tarjeta.
#Para ir más allá
Ya tienes Gemma 4 en marcha. Algunas ideas para ir más allá según lo que quieras hacer con él:
- Qué es Ollama y cómo funciona
- Si descubres Ollama, esta guía para principiantes repasa los comandos esenciales y el modelo mental completo.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para entender exactamente qué estás sacrificando al pasar del Q8 al Q4, y cuándo realmente importa.
- Open WebUI con Ollama
- Para una interfaz similar a ChatGPT sobre Gemma 4: historial de conversaciones, RAG integrado y uso compartido entre varios usuarios.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.