Intermedio 12 minOllama

Llama 4 Scout localmente: instalación y pruebas iniciales con Ollama

Llama 4 Scout es el más pequeño de los tres modelos de la familia Llama 4 de Meta. También es el único que cabe en una estación de trabajo de gama alta para ejecutarse en local; Maverick y Behemoth siguen reservados a la nube o a servidores dedicados. Esta guía muestra cómo instalar Llama 4 Scout con Ollama, cuánta VRAM se necesita realmente (la promesa de MoE a menudo se entiende mal) y cómo aprovechar sus dos ventajas distintivas: la multimodalidad nativa y el contexto de 10M tokens.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué instalar Llama 4 Scout localmente con Ollama?

Scout es el único modelo de la línea Llama 4 diseñado para funcionar en una sola máquina. Meta lo ha posicionado como el "modelo de estación de trabajo" de la familia: multimodal nativamente (texto + imágenes), ventana de contexto anunciada de 10 millones de tokens y arquitectura MoE (Mixture of Experts) que activa solo una fracción de los parámetros por cada token.

En concreto, en comparación con un modelo denso de tamaño equivalente, Scout ofrece una menor latencia (pocos parámetros activos por token), una memoria de contexto mucho mayor y visión incluida sin un modelo separado. El precio que hay que pagar: un tamaño considerable en disco (todos los expertos deben permanecer cargados en VRAM para que funcione el enrutamiento).

i
MoE en dos palabras
Un modelo MoE como Scout contiene N «expertos» (subredes especializadas). En cada token, un router elige k (normalmente 1 o 2). Solo se ejecutan esos k expertos. Resultado: la velocidad de inferencia es la de un modelo pequeño, pero la calidad tiende a la del grande. Todos los parámetros permanecen en VRAM; solo el cálculo es parcial.

#Scout, Maverick, Behemoth: quién hace qué

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
Scout (17B activos)
El modelo para estaciones de trabajo. 16 expertos, ~109B parámetros totales. Multimodal. Contexto de 10M tokens. Destinado a RTX 4090, M3/M4 Max/Ultra o una configuración multi-GPU de 48 GB o más.
Maverick (17B activos)
El modelo para servidores. 128 expertos, ~400B parámetros totales. El mismo número de parámetros activos que Scout, pero mucho más conocimiento codificado. Pensado para un servidor con 8 H100 o un clúster. Fuera del alcance de la mayoría de las configuraciones locales.
Behemoth (288B activos)
El modelo de frontera. ~2T parámetros totales. No se puede ejecutar en local sin un centro de datos. Resulta especialmente útil como modelo «profesor» para destilar los otros dos.
→
¿Cuál elegir?
Si lees esta guía y vas a instalar en local, la opción es Scout. Maverick requiere como mínimo un servidor multi-GPU de gama alta; a ese nivel, las guías de DeepSeek V4 Flash o Qwen3.7 Max son más pertinentes.

#VRAM real: lo que no dice la ficha técnica

El error clásico con los modelos MoE consiste en razonar a partir de los parámetros activos. "17B activos = cabe en 12 GB en Q4": falso. Para que el routing funcione, todos los expertos deben permanecer en memoria. Scout en Q4_K_M requiere mucha más memoria de lo que sus 17B activos podrían sugerir.

Q4_K_M (recomendado)
≈ 65 GB de VRAM para el modelo solo. Añadir ~4 GB para un contexto razonable (32k tokens). Total ≈ 70 GB.
Q5_K_M
≈ 78 GB. Pequeño incremento de calidad en la mayoría de tareas frente al Q4_K_M.
Q8_0
≈ 115 GB. Reservado para benchmarks de referencia.
FP16
≈ 220 GB. Solo en la nube o con varios servidores.
!
No para una GPU de 24 GB
Si tienes una RTX 4090 o una única 3090, Scout no funcionará correctamente. Puedes forzar la transferencia de parte del modelo a la CPU, pero la velocidad cae drásticamente (< 2 tokens/seg). Para una GPU de 24 GB, considera mejor Qwen3-30B-A3B o Mistral Small 24B. Para una RTX 5090 de 32 GB, Qwen 3.6 35B-A3B sigue siendo una opción más adecuada que Scout con parte del modelo transferida a la CPU.

Configuraciones que permiten ejecutar Scout de forma cómoda localmente:

Mac Studio M3 Ultra / M5 Ultra con 96 GB o más
La mejor plataforma de consumo para Scout. Memoria unificada, sin offload, ~25-40 tokens/s según la cuantización.
2x RTX 4090 / 2x 5090
48 GB o 64 GB acumulados, suficientes para Q4_K_M con contexto ampliado. Contar con llama.cpp o Ollama con la variable OLLAMA_NUM_GPU.
Workstation RTX 6000 Ada (48 GB) o A6000
Scout Q4 cabe holgadamente, con margen para el contexto.

#Prerrequisitos

Ollama 0.6 o más reciente
La compatibilidad con Llama 4 se añadió a partir de Ollama 0.6. Comprueba la versión con ollama --version y actualiza si es anterior.
70 GB de espacio en disco libre
La etiqueta Q4_K_M pesa aproximadamente 65 GB. Reserva un margen amplio para la caché.
Ancho de banda de memoria elevado
En Mac: buscar ≥ 400 GB/s (M3 Max y superiores). En PC: DDR5 si se prevé descargar parte del procesamiento en la CPU.
Una conexión estable
La descarga inicial puede durar de 1 a 3 horas según tu enlace. ollama pull supporte la reanudación en caso de interrupción.

#1. Instalar Llama 4 Scout con Ollama

Si Ollama aún no está instalado, sigue primero la guía adecuada para tu sistema. Luego, la descarga de Scout se realiza con un solo comando.

Terminal — descarga del modelo
ollama pull llama4:scout

Este tag apunta por defecto a la cuantización Q4_K_M. Si deseas forzar otra variante:

Variantes disponibles
ollama pull llama4:scout-q5_K_M
ollama pull llama4:scout-q8_0
ollama pull llama4:scout-fp16

Una vez finalizada la descarga, lista los modelos para confirmar el tamaño real:

Verificación
ollama list
i
Paciencia durante la primera carga
Cargar 65 GB en VRAM lleva tiempo: entre 30 segundos y 2 minutos según el SSD. Las cargas posteriores son más rápidas gracias a la caché del sistema operativo.

#2. Prueba inicial: texto y razonamiento

Lanza una sesión interactiva para validar el correcto funcionamiento antes de tocar el resto.

Sesión interactiva
ollama run llama4:scout

Cuando aparezca el prompt >>>, comprueba el idioma y la calidad del razonamiento con una prueba sencilla:

Prompt de prueba
>>> Explique en 4 phrases ce qu'est un modèle MoE, puis donne un avantage et un inconvénient.

[Réponse attendue : explication structurée en français, distinction entre paramètres totaux et actifs, mention de la latence comme avantage et de la VRAM comme inconvénient.]

Mientras la conversación está en curso, abre un segundo terminal para observar la carga:

Supervisar la carga
ollama ps

La columna SIZE debe reflejar el tamaño efectivo de los pesos cargados. En PROCESSOR, lo ideal es que aparezca 100% GPU. Si ves una combinación CPU/GPU, significa que la VRAM no basta y que Ollama recurre al offload: la velocidad se verá gravemente afectada.

#3. Prueba de visión en francés

Scout es multimodal de forma nativa: la imagen y el texto pasan por el mismo backbone, a diferencia de un enfoque que añade un codificador visual separado a un modelo puramente textual. Esto da mejores resultados en tareas que mezclan ambas modalidades (OCR contextual, lectura de esquemas, descripción detallada).

Con la API REST de Ollama, se envía la imagen en base64 en el campo images:

Prueba de visión en Python
import base64, requests, json

with open('facture.jpg', 'rb') as f:
    img_b64 = base64.b64encode(f.read()).decode()

response = requests.post(
    'http://localhost:11434/api/generate',
    json={
        'model': 'llama4:scout',
        'prompt': 'Décris cette image en français. Si c\'est un document, extrais les montants et la date.',
        'images': [img_b64],
        'stream': False,
    }
)
print(response.json()['response'])

En casos típicos (captura de pantalla de una interfaz, foto de una pizarra, escaneo de un PDF), Scout produce una descripción detallada y mantiene la coherencia en francés incluso cuando la imagen contiene texto en inglés. Está un nivel por encima de un pequeño modelo de visión generalista como Qwen 3.5 9B en los detalles estructurados.

→
Formato de imagen
JPEG y PNG funcionan. Evita imágenes demasiado grandes (> 4 MB): Ollama las redimensiona, pero es costoso. Redimensiónalas previamente a un máximo de 1024 px en el lado más largo antes de enviarlas.

#4. Contexto de 10M tokens: promesa y realidad

Meta anuncia una ventana de contexto de 10 millones de tokens para Scout. En la práctica, hay dos límites al ejecutarlo en local.

La caché KV se dispara
Con 1 millón de tokens, la caché KV añade fácilmente entre 30 y 50 GB a la VRAM utilizada por el modelo. Más allá, es necesario activar la cuantización de la caché KV (opción num_ctx + parámetros experimentales) o resignarse a descargar la caché a la RAM del sistema para su procesamiento en CPU.
La calidad disminuye bien antes de alcanzar 10M
Los benchmarks independientes (RULER, NoLiMa) muestran una caída en el rendimiento útil alrededor de 256k-512k tokens, a pesar del entrenamiento de contexto largo. Más allá, es técnicamente posible pero poco confiable.

Para aprovechar un contexto amplio sin que todo se bloquee, configura Ollama mediante un Modelfile:

Modelfile para contexto de 128k
FROM llama4:scout

PARAMETER num_ctx 131072
PARAMETER num_predict 4096
PARAMETER temperature 0.6
Creación de la variante
ollama create llama4-scout-128k -f Modelfile
ollama run llama4-scout-128k
!
128k ya es mucho
Un contexto de 128k tokens ya representa aproximadamente 250 páginas de texto. Para el 95 % de los casos de uso local (base de código completa, PDF largos, archivos de tickets), es más que suficiente y mucho más estable que las configuraciones de 1M+.

#Scout vs Qwen3-30B-A3B: la verdadera comparativa

Qwen3-30B-A3B es el otro MoE que se considera seriamente para uso local en 2026: 30B totales, 3B activos, contexto nativo de 256k. La comparación vale la pena, porque los dos no juegan en la misma categoría en términos de hardware.

Consumo de VRAM en Q4
Scout ≈ 65 GB. Qwen3-30B-A3B ≈ 18 GB. La diferencia es enorme y cambia por completo el perfil de la máquina necesaria.
Velocidad de generación
Con cifras comparables de parámetros activos (17B frente a 3B), Qwen3-30B-A3B es más rápido en tokens/segundo: normalmente entre 2 y 3 veces más rápido en la misma máquina, cuando ambos modelos caben en memoria.
Calidad de razonamiento
En los benchmarks públicos MMLU-Pro y GPQA, Scout sigue por delante de Qwen3-30B-A3B. La diferencia se reduce mucho al activar el modo thinking de Qwen3.
Multimodalidad
Scout es nativamente multimodal. Qwen3-30B-A3B no lo es —debes usar un modelo de visión separado como Qwen 3.5 9B en paralelo si quieres visión en la misma pila.
Contexto largo
Scout apunta a 10M (256k de forma estable en la práctica). Qwen3-30B-A3B ofrece 256k de forma nativa, con un comportamiento más predecible y un menor consumo de caché KV.
→
Veredicto práctico
Si tienes un Mac Studio Ultra, una configuración con 2× RTX 4090 o una A6000, elige Scout por su visión nativa y su calidad. Si usas una sola RTX 4090, una 3090 o un Mac M3 Max de 36-64 GB, elige Qwen3-30B-A3B: es una elección racional y claramente más rápida. Usar Scout con offload a la CPU en este tipo de máquinas parece una buena idea, pero no lo es.

#Solución de problemas

"Error: model requires more system memory than is available"
Tu VRAM y tu RAM combinadas son insuficientes. O bien pasas a una cuantización más agresiva (poco habitual con Q4, que ya está bastante ajustada), o bien cambias de modelo. No hay magia en Ollama.
Velocidad < 5 tokens/segundo en GPU de 24 GB
Estás utilizando offload a la CPU. Compruébalo con ollama ps: la columna PROCESSOR debe mostrar 100% GPU. Si no es así, Scout no es adecuado para tu máquina.
Respuestas truncadas
Aumenta num_predict (por defecto, 128 en algunas configuraciones). Con /set parameter num_predict 2048 en la sesión, o mediante un Modelfile.
Fallos al superar los 64k tokens
La caché KV satura la VRAM. Reduce num_ctx o activa la cuantización de la caché KV mediante OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0 en el entorno.
Imagen rechazada con "unsupported image format"
Convierte a JPEG o PNG estándar. Según la versión de Ollama, no todos los formatos WebP, HEIC y AVIF son compatibles.

#Para ir más allá

Una vez que Scout esté operativo, merece la pena explorar varias vías para aprovechar sus particularidades.

Elegir bien la cuantización
Q4_K_M es el punto ideal para Scout, pero entender cuándo subir a Q5 o Q8 depende del caso de uso, especialmente en tareas multimodales, donde la cuantización puede degradar la calidad más que en tareas de texto puro.
Aprovechar la visión localmente
La guía de visión dedicada cubre los patrones de prompt que realmente funcionan (OCR contextual, extracción estructurada, comparación de imágenes) con Scout y sus competidores multimodales como Qwen 3.5 9B y Gemma 4 12B.
Modelfile para personalizar
Más allá de num_ctx, un Modelfile permite fijar un system prompt, un formato de salida JSON, una temperatura adecuada para tu caso — útil para no reconfigurar en cada sesión.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.