Gemma 3 (Google) en local: guía completa 2026
Gemma 3 es la familia de modelos de pesos abiertos de Google lanzada en marzo de 2025. Cuatro tamaños (1B, 4B, 12B, 27B), visión integrada a partir de 4B, contexto de 128k y un sólido soporte multilingüe que incluye un francés correcto. Esta guía cubre la instalación local de Gemma 3 con Ollama paso a paso, la licencia de Google que debes conocer y dónde destaca realmente el modelo.
#¿Por qué Gemma 3?
Gemma 3 es la tercera iteración de los modelos de pesos abiertos de Google DeepMind, derivados de la misma investigación que Gemini. La familia abarca cuatro tamaños muy distintos —de 1B a 27B—, lo que permite ajustarse exactamente al nivel de hardware que tengas a tu disposición, desde un portátil sin GPU hasta una estación de trabajo de 24 GB.
Tres características hacen que Gemma 3 destaque entre los modelos de esta categoría: un contexto de 128k de serie (solo 32k para la versión de 1B), visión multimodal integrada desde la versión de 4B sin necesidad de cargar un modelo separado y un trabajo explícito en el soporte multilingüe (la documentación de Google afirma que cubre más de 140 idiomas en las versiones de 4B y superiores).
#Los 4 tamaños de Gemma 3
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Elegir el tamaño adecuado es la decisión más importante. Aquí tienes la correspondencia entre usos y hardware:
- gemma3:1b
- Solo texto, contexto de 32k. Para ejecución exclusivamente en CPU, Raspberry Pi 5 o un Mac M1 de 8 GB. Calidad limitada, pero respuestas instantáneas. Adecuado para clasificación y reformulación breve.
- gemma3:4b
- Multimodal (texto + imagen), contexto 128k. El nivel "laptop": funciona cómodamente con 6 GB de VRAM o un Mac M2/M3 de 16 GB. Calidad razonable para tareas generales.
- gemma3:12b
- Multimodal, contexto 128k. El nivel "PC de gama media": RTX 3060 12 GB, 4070, M3 Pro 18 GB. Un nivel de calidad que permite usarlo de verdad en el día a día.
- gemma3:27b
- Multimodal, contexto 128k. El nivel "workstation": RTX 3090/4090, M3 Max. El mejor Gemma 3, comparable a modelos de categoría superior en muchas tareas
#Requisitos de VRAM (cuantización Q4_K_M)
- gemma3:1b
- ≈ 1 GB de VRAM o de RAM. Funciona en cualquier máquina, incluso en un Raspberry Pi 5.
- gemma3:4b
- ≈ 3 GB de VRAM. RTX 3050 6 GB, GTX 1660 6 GB, MacBook Air M2 8 GB son suficientes.
- gemma3:12b
- ≈ 8 GB de VRAM. RTX 3060 12 GB, RTX 4070 12 GB, Mac M3 Pro 18 GB unificados.
- gemma3:27b
- ≈ 17 GB de VRAM en Q4. RTX 3090/4090 de 24 GB o Mac M3/M4 Max de 36 GB o más. En Q3 (con menor calidad), cabe en 16 GB.
Agrega aproximadamente 1 a 4 GB para el caché KV según la longitud de contexto que realmente uses. Cargar el contexto completo de 128k de un modelo de 27B requiere más VRAM de la que ocupa el modelo por sí solo.
#1. Instalación local de Gemma 3 con Ollama
Si Ollama aún no está instalado, sigue primero la guía de instalación de Ollama para tu sistema operativo. Una vez que Ollama esté en marcha, puedes descargar Gemma 3 con un solo comando.
Ollama descarga el modelo (aproximadamente 3,3 GB para la 4B en Q4), luego lo inicia directamente en modo interactivo. Cuando aparezca el prompt >>>, puedes probarlo.
El demonio de Ollama escucha en http://localhost:11434: puedes conectarle Open WebUI, LM Studio como cliente, Continue.dev o cualquier cliente compatible con OpenAI.
#2. Capacidades multilingües y calidad en francés
El trabajo de Google en multilingüismo sigue siendo un verdadero punto fuerte de Gemma 3 frente a los modelos pequeños centrados en el inglés. El francés está bien representado en el corpus de entrenamiento: casi nunca verás que el modelo cambie al inglés durante una respuesta, algo que sigue siendo un defecto recurrente en modelos más pequeños. Las generaciones de 2026 (Qwen 3.5, Granite 4.2) se han puesto al día en francés, pero Gemma 3 sigue estando a la altura en este ámbito.
- Gemma 3 4B
- Francés correcto para tareas sencillas (resumen, reformulación, clasificación). En textos largos, algunas expresiones siguen siendo poco naturales.
- Gemma 3 12B
- Nivel de "asistente utilizable en francés". Buen dominio de la gramática, vocabulario variado y pocos anglicismos innecesarios. Comparable a Qwen 3.5 9B en este aspecto.
- Gemma 3 27B
- Muy buen francés. Al nivel de Mistral Small 24B para la redacción, ligeramente por debajo en razonamiento formal, pero a menudo mejor en matices y estilo.
#3. Visión multimodal integrada
A partir de la versión 4B, Gemma 3 acepta imágenes de entrada: no es necesario cargar un modelo de visión separado. El mismo binario maneja texto y visión, con un codificador SigLIP integrado. Útil para OCR, descripción de imágenes o análisis de capturas de pantalla.
Con la API de Python, se pasa la imagen en formato base64 o mediante una ruta local:
#4. Contexto 128k en la práctica
El contexto de 128k de Gemma 3 (excepto 1B limitado a 32k) es suficiente para procesar un libro corto, un conjunto completo de documentación o varias horas de transcripción. Por defecto, Ollama carga un contexto mucho más corto (típicamente 4k o 8k) para ahorrar VRAM — debes extenderlo explícitamente.
O bien a través de la API, pasando la opción num_ctx en el momento de la solicitud:
#Licencia Gemma: lo que debes saber
Gemma 3 NO está bajo licencia Apache 2.0 ni MIT como Mistral, Qwen o DeepSeek. Google utiliza su propia licencia: las «Gemma Terms of Use». Permite el uso comercial, incluida la distribución de modelos derivados, pero impone dos restricciones que las licencias realmente libres no tienen.
- Política de usos prohibidos
- Debes respetar la Gemma Prohibited Use Policy (no generar CSAM, no cometer violaciones flagrantes de derechos, etc.). Google puede modificar esta lista unilateralmente.
- Transmisión de las condiciones
- Si redistribuyes el modelo (o un modelo derivado), debes transmitir la licencia Gemma a tus usuarios y hacer que acepten las mismas restricciones.
- No hay "copyleft"
- Tus aplicaciones que llaman a Gemma 3 NO heredan su licencia. Solo los pesos redistribuidos la heredan.
#Gemma 3 27B vs Llama 4 Scout
Los dos modelos se posicionan en el segmento "gama alta accesible en local". Para elegir, hay que comparar lo que realmente los diferencia:
- Arquitectura
- Gemma 3 27B es un modelo denso (27 mil millones de parámetros, todos activos). Llama 4 Scout es un MoE (17 mil millones activos, 109 mil millones en total): ofrece un rendimiento mucho mayor con la misma cantidad de VRAM cuando cabe en ella, pero exige poder cargar todos los expertos.
- VRAM mínima
- Gemma 3 27B Q4 : ≈ 17 GB. Llama 4 Scout Q4 : ≈ 60 GB (todos los expertos cargados). En una sola RTX 4090, solo Gemma 3 27B cabe cómodamente.
- Contexto
- Gemma 3: 128k. Llama 4 Scout: 10M (teóricos, menos en la práctica). Si realmente procesas más de 128k tokens, Scout lleva ventaja.
- Visión
- Ambos son multimodales de forma nativa. Calidad comparable en tareas generales.
- FR
- Gemma 3 es ligeramente mejor en francés de uso cotidiano. Llama 4 Scout es más fuerte en razonamiento formal y en código.
- Licencia
- Gemma Terms of Use frente a Llama 4 Community License. Ninguna de las dos cumple los criterios de la OSI; ambas permiten el uso comercial con restricciones específicas.
#Solución de problemas
- "Out of memory" al cargar
- VRAM insuficiente para el tamaño elegido. Baja a un tamaño menor (gemma3:12b → gemma3:4b) o pasa a una cuantización más agresiva (Q4 → Q3). No fuerces el offload a la CPU con modelos de 27B: se vuelve inutilizable.
- Imágenes rechazadas
- Probablemente estás usando gemma3:1b, que solo admite texto. Cambia como mínimo a gemma3:4b para disponer de capacidades de visión.
- Contexto ignorado por encima de 4k
- Ollama carga un num_ctx por defecto muy corto. Extiéndelo explícitamente con /set parameter num_ctx 32768 o mediante la opción API options={'num_ctx': 32768}.
- Generación lenta en 12B/27B con GPU
- Comprueba con ollama ps que la columna PROCESSOR indique 100% GPU. Si ves un porcentaje de CPU, es que el modelo y el contexto no caben en la VRAM: reduce num_ctx.
- Respuestas truncadas
- Aumenta num_predict (por defecto 128 en algunos clientes). Para Ollama CLI: /set parameter num_predict 2048.
#Para ir más allá
Gemma 3 es un excelente punto de partida versátil. Aquí tienes algunas opciones que encajan según lo que quieras hacer con él:
- Comparar con Gemma 4
- La guía "Gemma 4 en local con Ollama" muestra la evolución de la familia y en qué casos merece la pena actualizar.
- Elegir bien la cuantización
- La guía "Elegir la cuantización (Q4, Q5, Q8, FP16)" detalla los compromisos que se aplican especialmente bien a los 4 tamaños de Gemma 3.
- Aprovechar la visión en un pipeline
- La guía "LLM multimodal de visión en local" ofrece recetas de Python concretas (OCR, descripción, análisis) directamente aplicables a Gemma 3 4B/12B/27B.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.