Principiante 9 minOllama

Gemma 3 (Google) en local: guía completa 2026

Gemma 3 es la familia de modelos de pesos abiertos de Google lanzada en marzo de 2025. Cuatro tamaños (1B, 4B, 12B, 27B), visión integrada a partir de 4B, contexto de 128k y un sólido soporte multilingüe que incluye un francés correcto. Esta guía cubre la instalación local de Gemma 3 con Ollama paso a paso, la licencia de Google que debes conocer y dónde destaca realmente el modelo.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué Gemma 3?

Gemma 3 es la tercera iteración de los modelos de pesos abiertos de Google DeepMind, derivados de la misma investigación que Gemini. La familia abarca cuatro tamaños muy distintos —de 1B a 27B—, lo que permite ajustarse exactamente al nivel de hardware que tengas a tu disposición, desde un portátil sin GPU hasta una estación de trabajo de 24 GB.

Tres características hacen que Gemma 3 destaque entre los modelos de esta categoría: un contexto de 128k de serie (solo 32k para la versión de 1B), visión multimodal integrada desde la versión de 4B sin necesidad de cargar un modelo separado y un trabajo explícito en el soporte multilingüe (la documentación de Google afirma que cubre más de 140 idiomas en las versiones de 4B y superiores).

i
En dos palabras
Gemma 3 = la familia "polivalente" de Google. No es la más fuerte en un benchmark en particular, pero sí una de las más completas: 4 tamaños, visión, contexto largo y capacidades multilingües. Ideal como modelo predeterminado en una máquina determinada.

#Los 4 tamaños de Gemma 3

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Elegir el tamaño adecuado es la decisión más importante. Aquí tienes la correspondencia entre usos y hardware:

gemma3:1b
Solo texto, contexto de 32k. Para ejecución exclusivamente en CPU, Raspberry Pi 5 o un Mac M1 de 8 GB. Calidad limitada, pero respuestas instantáneas. Adecuado para clasificación y reformulación breve.
gemma3:4b
Multimodal (texto + imagen), contexto 128k. El nivel "laptop": funciona cómodamente con 6 GB de VRAM o un Mac M2/M3 de 16 GB. Calidad razonable para tareas generales.
gemma3:12b
Multimodal, contexto 128k. El nivel "PC de gama media": RTX 3060 12 GB, 4070, M3 Pro 18 GB. Un nivel de calidad que permite usarlo de verdad en el día a día.
gemma3:27b
Multimodal, contexto 128k. El nivel "workstation": RTX 3090/4090, M3 Max. El mejor Gemma 3, comparable a modelos de categoría superior en muchas tareas
→
Si tienes dudas
Empieza por la versión de 4B. Es el modelo más pequeño que incluye visión y un contexto de 128k, y funciona prácticamente en cualquier equipo. Podrás pasar a 12B o 27B una vez que sepas si la calidad te resulta suficiente.

#Requisitos de VRAM (cuantización Q4_K_M)

gemma3:1b
≈ 1 GB de VRAM o de RAM. Funciona en cualquier máquina, incluso en un Raspberry Pi 5.
gemma3:4b
≈ 3 GB de VRAM. RTX 3050 6 GB, GTX 1660 6 GB, MacBook Air M2 8 GB son suficientes.
gemma3:12b
≈ 8 GB de VRAM. RTX 3060 12 GB, RTX 4070 12 GB, Mac M3 Pro 18 GB unificados.
gemma3:27b
≈ 17 GB de VRAM en Q4. RTX 3090/4090 de 24 GB o Mac M3/M4 Max de 36 GB o más. En Q3 (con menor calidad), cabe en 16 GB.

Agrega aproximadamente 1 a 4 GB para el caché KV según la longitud de contexto que realmente uses. Cargar el contexto completo de 128k de un modelo de 27B requiere más VRAM de la que ocupa el modelo por sí solo.

#1. Instalación local de Gemma 3 con Ollama

Si Ollama aún no está instalado, sigue primero la guía de instalación de Ollama para tu sistema operativo. Una vez que Ollama esté en marcha, puedes descargar Gemma 3 con un solo comando.

Terminal
ollama run gemma3:4b

Ollama descarga el modelo (aproximadamente 3,3 GB para la 4B en Q4), luego lo inicia directamente en modo interactivo. Cuando aparezca el prompt >>>, puedes probarlo.

Descargar sin ejecutar
ollama pull gemma3:1b
ollama pull gemma3:4b
ollama pull gemma3:12b
ollama pull gemma3:27b

El demonio de Ollama escucha en http://localhost:11434: puedes conectarle Open WebUI, LM Studio como cliente, Continue.dev o cualquier cliente compatible con OpenAI.

→
Elegir la cuantización adecuada
La etiqueta predeterminada (por ejemplo: gemma3:12b) apunta a Q4_K_M, el mejor equilibrio calidad/memoria para la mayoría de los usos. Para mayor calidad a costa de más VRAM, utiliza gemma3:12b-it-q5_K_M o q8_0.

#2. Capacidades multilingües y calidad en francés

El trabajo de Google en multilingüismo sigue siendo un verdadero punto fuerte de Gemma 3 frente a los modelos pequeños centrados en el inglés. El francés está bien representado en el corpus de entrenamiento: casi nunca verás que el modelo cambie al inglés durante una respuesta, algo que sigue siendo un defecto recurrente en modelos más pequeños. Las generaciones de 2026 (Qwen 3.5, Granite 4.2) se han puesto al día en francés, pero Gemma 3 sigue estando a la altura en este ámbito.

Gemma 3 4B
Francés correcto para tareas sencillas (resumen, reformulación, clasificación). En textos largos, algunas expresiones siguen siendo poco naturales.
Gemma 3 12B
Nivel de "asistente utilizable en francés". Buen dominio de la gramática, vocabulario variado y pocos anglicismos innecesarios. Comparable a Qwen 3.5 9B en este aspecto.
Gemma 3 27B
Muy buen francés. Al nivel de Mistral Small 24B para la redacción, ligeramente por debajo en razonamiento formal, pero a menudo mejor en matices y estilo.
Prueba rápida en FR
>>> Résume en 3 points clés les enjeux de la souveraineté numérique européenne.

1. **Dépendance technologique** : 80% du cloud européen repose sur trois acteurs américains...
2. **Conformité réglementaire** : le RGPD et l'AI Act créent un cadre que les fournisseurs hors-UE...
3. **Capacité industrielle** : la course aux semi-conducteurs et aux modèles d'IA...

#3. Visión multimodal integrada

A partir de la versión 4B, Gemma 3 acepta imágenes de entrada: no es necesario cargar un modelo de visión separado. El mismo binario maneja texto y visión, con un codificador SigLIP integrado. Útil para OCR, descripción de imágenes o análisis de capturas de pantalla.

CLI Ollama con imagen
ollama run gemma3:12b
>>> Décris cette capture d'écran et identifie les éléments d'interface : /chemin/vers/screenshot.png

Con la API de Python, se pasa la imagen en formato base64 o mediante una ruta local:

API de Python de Ollama
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{
        'role': 'user',
        'content': 'Extrais le texte visible sur cette facture.',
        'images': ['/chemin/vers/facture.jpg'],
    }]
)
print(response['message']['content'])
i
Calidad de la visión: una valoración realista
Gemma 3 vision ofrece resultados aceptables en la descripción general, el OCR de documentos limpios y la lectura de interfaces. Para el OCR de fotos borrosas o de textos manuscritos, un modelo de visión más reciente y más grande como Qwen 3.8 27B (visión) sigue siendo mejor. Para el razonamiento espacial complejo (contar objetos, entender un esquema técnico), todo sigue siendo mejorable: esto se aplica a todos los LLM de pesos abiertos.

#4. Contexto 128k en la práctica

El contexto de 128k de Gemma 3 (excepto 1B limitado a 32k) es suficiente para procesar un libro corto, un conjunto completo de documentación o varias horas de transcripción. Por defecto, Ollama carga un contexto mucho más corto (típicamente 4k o 8k) para ahorrar VRAM — debes extenderlo explícitamente.

Expandir el contexto en CLI
ollama run gemma3:12b
>>> /set parameter num_ctx 32768

O bien a través de la API, pasando la opción num_ctx en el momento de la solicitud:

Contexto ampliado mediante API
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{'role': 'user', 'content': 'Résume ce document : ...'}],
    options={'num_ctx': 32768},
)
!
El contexto consume VRAM
Cada token de contexto ocupa memoria para la caché KV. Pasar de 8k a 128k en un modelo de 12B puede añadir entre 4 y 6 GB al consumo de VRAM. Si agotas la VRAM, el modelo pasa a descargar parte del procesamiento en la CPU y la velocidad cae en picado. Amplía progresivamente: 16k → 32k → 64k según tu necesidad real.

#Licencia Gemma: lo que debes saber

Gemma 3 NO está bajo licencia Apache 2.0 ni MIT como Mistral, Qwen o DeepSeek. Google utiliza su propia licencia: las «Gemma Terms of Use». Permite el uso comercial, incluida la distribución de modelos derivados, pero impone dos restricciones que las licencias realmente libres no tienen.

Política de usos prohibidos
Debes respetar la Gemma Prohibited Use Policy (no generar CSAM, no cometer violaciones flagrantes de derechos, etc.). Google puede modificar esta lista unilateralmente.
Transmisión de las condiciones
Si redistribuyes el modelo (o un modelo derivado), debes transmitir la licencia Gemma a tus usuarios y hacer que acepten las mismas restricciones.
No hay "copyleft"
Tus aplicaciones que llaman a Gemma 3 NO heredan su licencia. Solo los pesos redistribuidos la heredan.
!
Para uso profesional
Para un uso sencillo como SaaS interno o en un producto (el usuario final nunca ve los pesos), Gemma 3 se puede utilizar sin problemas. Para publicar un modelo ajustado mediante fine-tuning o integrar Gemma 3 en un producto de código abierto distribuido con los pesos, lee antes la licencia: la diferencia respecto a una licencia verdaderamente permisiva se vuelve significativa. Ten en cuenta que Google adoptó la licencia Apache 2.0 para la siguiente generación, Gemma 4 (abril de 2026): si la redistribución de los pesos es importante para ti, esta generación elimina precisamente esa restricción.

#Gemma 3 27B vs Llama 4 Scout

Los dos modelos se posicionan en el segmento "gama alta accesible en local". Para elegir, hay que comparar lo que realmente los diferencia:

Arquitectura
Gemma 3 27B es un modelo denso (27 mil millones de parámetros, todos activos). Llama 4 Scout es un MoE (17 mil millones activos, 109 mil millones en total): ofrece un rendimiento mucho mayor con la misma cantidad de VRAM cuando cabe en ella, pero exige poder cargar todos los expertos.
VRAM mínima
Gemma 3 27B Q4 : ≈ 17 GB. Llama 4 Scout Q4 : ≈ 60 GB (todos los expertos cargados). En una sola RTX 4090, solo Gemma 3 27B cabe cómodamente.
Contexto
Gemma 3: 128k. Llama 4 Scout: 10M (teóricos, menos en la práctica). Si realmente procesas más de 128k tokens, Scout lleva ventaja.
Visión
Ambos son multimodales de forma nativa. Calidad comparable en tareas generales.
FR
Gemma 3 es ligeramente mejor en francés de uso cotidiano. Llama 4 Scout es más fuerte en razonamiento formal y en código.
Licencia
Gemma Terms of Use frente a Llama 4 Community License. Ninguna de las dos cumple los criterios de la OSI; ambas permiten el uso comercial con restricciones específicas.
→
Veredicto
Con una sola GPU de 24 GB: Gemma 3 27B. Con un Mac Studio Ultra o una configuración con varias GPU: Llama 4 Scout resulta pertinente por las ventajas del MoE. Muchos usuarios mantienen ambos modelos instalados y alternan entre ellos según la tarea.

#Solución de problemas

"Out of memory" al cargar
VRAM insuficiente para el tamaño elegido. Baja a un tamaño menor (gemma3:12b → gemma3:4b) o pasa a una cuantización más agresiva (Q4 → Q3). No fuerces el offload a la CPU con modelos de 27B: se vuelve inutilizable.
Imágenes rechazadas
Probablemente estás usando gemma3:1b, que solo admite texto. Cambia como mínimo a gemma3:4b para disponer de capacidades de visión.
Contexto ignorado por encima de 4k
Ollama carga un num_ctx por defecto muy corto. Extiéndelo explícitamente con /set parameter num_ctx 32768 o mediante la opción API options={'num_ctx': 32768}.
Generación lenta en 12B/27B con GPU
Comprueba con ollama ps que la columna PROCESSOR indique 100% GPU. Si ves un porcentaje de CPU, es que el modelo y el contexto no caben en la VRAM: reduce num_ctx.
Respuestas truncadas
Aumenta num_predict (por defecto 128 en algunos clientes). Para Ollama CLI: /set parameter num_predict 2048.

#Para ir más allá

Gemma 3 es un excelente punto de partida versátil. Aquí tienes algunas opciones que encajan según lo que quieras hacer con él:

Comparar con Gemma 4
La guía "Gemma 4 en local con Ollama" muestra la evolución de la familia y en qué casos merece la pena actualizar.
Elegir bien la cuantización
La guía "Elegir la cuantización (Q4, Q5, Q8, FP16)" detalla los compromisos que se aplican especialmente bien a los 4 tamaños de Gemma 3.
Aprovechar la visión en un pipeline
La guía "LLM multimodal de visión en local" ofrece recetas de Python concretas (OCR, descripción, análisis) directamente aplicables a Gemma 3 4B/12B/27B.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.