Llama 4 Scout localmente: instalación y pruebas iniciales con Ollama
Llama 4 Scout es el más pequeño de los tres modelos de la familia Llama 4 de Meta. También es el único que cabe en una estación de trabajo de gama alta para ejecutarse en local; Maverick y Behemoth siguen reservados a la nube o a servidores dedicados. Esta guía muestra cómo instalar Llama 4 Scout con Ollama, cuánta VRAM se necesita realmente (la promesa de MoE a menudo se entiende mal) y cómo aprovechar sus dos ventajas distintivas: la multimodalidad nativa y el contexto de 10M tokens.
#¿Por qué instalar Llama 4 Scout localmente con Ollama?
Scout es el único modelo de la línea Llama 4 diseñado para funcionar en una sola máquina. Meta lo ha posicionado como el "modelo de estación de trabajo" de la familia: multimodal nativamente (texto + imágenes), ventana de contexto anunciada de 10 millones de tokens y arquitectura MoE (Mixture of Experts) que activa solo una fracción de los parámetros por cada token.
En concreto, en comparación con un modelo denso de tamaño equivalente, Scout ofrece una menor latencia (pocos parámetros activos por token), una memoria de contexto mucho mayor y visión incluida sin un modelo separado. El precio que hay que pagar: un tamaño considerable en disco (todos los expertos deben permanecer cargados en VRAM para que funcione el enrutamiento).
#Scout, Maverick, Behemoth: quién hace qué
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
- Scout (17B activos)
- El modelo para estaciones de trabajo. 16 expertos, ~109B parámetros totales. Multimodal. Contexto de 10M tokens. Destinado a RTX 4090, M3/M4 Max/Ultra o una configuración multi-GPU de 48 GB o más.
- Maverick (17B activos)
- El modelo para servidores. 128 expertos, ~400B parámetros totales. El mismo número de parámetros activos que Scout, pero mucho más conocimiento codificado. Pensado para un servidor con 8 H100 o un clúster. Fuera del alcance de la mayoría de las configuraciones locales.
- Behemoth (288B activos)
- El modelo de frontera. ~2T parámetros totales. No se puede ejecutar en local sin un centro de datos. Resulta especialmente útil como modelo «profesor» para destilar los otros dos.
#VRAM real: lo que no dice la ficha técnica
El error clásico con los modelos MoE consiste en razonar a partir de los parámetros activos. "17B activos = cabe en 12 GB en Q4": falso. Para que el routing funcione, todos los expertos deben permanecer en memoria. Scout en Q4_K_M requiere mucha más memoria de lo que sus 17B activos podrían sugerir.
- Q4_K_M (recomendado)
- ≈ 65 GB de VRAM para el modelo solo. Añadir ~4 GB para un contexto razonable (32k tokens). Total ≈ 70 GB.
- Q5_K_M
- ≈ 78 GB. Pequeño incremento de calidad en la mayoría de tareas frente al Q4_K_M.
- Q8_0
- ≈ 115 GB. Reservado para benchmarks de referencia.
- FP16
- ≈ 220 GB. Solo en la nube o con varios servidores.
Configuraciones que permiten ejecutar Scout de forma cómoda localmente:
- Mac Studio M3 Ultra / M5 Ultra con 96 GB o más
- La mejor plataforma de consumo para Scout. Memoria unificada, sin offload, ~25-40 tokens/s según la cuantización.
- 2x RTX 4090 / 2x 5090
- 48 GB o 64 GB acumulados, suficientes para Q4_K_M con contexto ampliado. Contar con llama.cpp o Ollama con la variable OLLAMA_NUM_GPU.
- Workstation RTX 6000 Ada (48 GB) o A6000
- Scout Q4 cabe holgadamente, con margen para el contexto.
#Prerrequisitos
- Ollama 0.6 o más reciente
- La compatibilidad con Llama 4 se añadió a partir de Ollama 0.6. Comprueba la versión con ollama --version y actualiza si es anterior.
- 70 GB de espacio en disco libre
- La etiqueta Q4_K_M pesa aproximadamente 65 GB. Reserva un margen amplio para la caché.
- Ancho de banda de memoria elevado
- En Mac: buscar ≥ 400 GB/s (M3 Max y superiores). En PC: DDR5 si se prevé descargar parte del procesamiento en la CPU.
- Una conexión estable
- La descarga inicial puede durar de 1 a 3 horas según tu enlace. ollama pull supporte la reanudación en caso de interrupción.
#1. Instalar Llama 4 Scout con Ollama
Si Ollama aún no está instalado, sigue primero la guía adecuada para tu sistema. Luego, la descarga de Scout se realiza con un solo comando.
Este tag apunta por defecto a la cuantización Q4_K_M. Si deseas forzar otra variante:
Una vez finalizada la descarga, lista los modelos para confirmar el tamaño real:
#2. Prueba inicial: texto y razonamiento
Lanza una sesión interactiva para validar el correcto funcionamiento antes de tocar el resto.
Cuando aparezca el prompt >>>, comprueba el idioma y la calidad del razonamiento con una prueba sencilla:
Mientras la conversación está en curso, abre un segundo terminal para observar la carga:
La columna SIZE debe reflejar el tamaño efectivo de los pesos cargados. En PROCESSOR, lo ideal es que aparezca 100% GPU. Si ves una combinación CPU/GPU, significa que la VRAM no basta y que Ollama recurre al offload: la velocidad se verá gravemente afectada.
#3. Prueba de visión en francés
Scout es multimodal de forma nativa: la imagen y el texto pasan por el mismo backbone, a diferencia de un enfoque que añade un codificador visual separado a un modelo puramente textual. Esto da mejores resultados en tareas que mezclan ambas modalidades (OCR contextual, lectura de esquemas, descripción detallada).
Con la API REST de Ollama, se envía la imagen en base64 en el campo images:
En casos típicos (captura de pantalla de una interfaz, foto de una pizarra, escaneo de un PDF), Scout produce una descripción detallada y mantiene la coherencia en francés incluso cuando la imagen contiene texto en inglés. Está un nivel por encima de un pequeño modelo de visión generalista como Qwen 3.5 9B en los detalles estructurados.
#4. Contexto de 10M tokens: promesa y realidad
Meta anuncia una ventana de contexto de 10 millones de tokens para Scout. En la práctica, hay dos límites al ejecutarlo en local.
- La caché KV se dispara
- Con 1 millón de tokens, la caché KV añade fácilmente entre 30 y 50 GB a la VRAM utilizada por el modelo. Más allá, es necesario activar la cuantización de la caché KV (opción num_ctx + parámetros experimentales) o resignarse a descargar la caché a la RAM del sistema para su procesamiento en CPU.
- La calidad disminuye bien antes de alcanzar 10M
- Los benchmarks independientes (RULER, NoLiMa) muestran una caída en el rendimiento útil alrededor de 256k-512k tokens, a pesar del entrenamiento de contexto largo. Más allá, es técnicamente posible pero poco confiable.
Para aprovechar un contexto amplio sin que todo se bloquee, configura Ollama mediante un Modelfile:
#Scout vs Qwen3-30B-A3B: la verdadera comparativa
Qwen3-30B-A3B es el otro MoE que se considera seriamente para uso local en 2026: 30B totales, 3B activos, contexto nativo de 256k. La comparación vale la pena, porque los dos no juegan en la misma categoría en términos de hardware.
- Consumo de VRAM en Q4
- Scout ≈ 65 GB. Qwen3-30B-A3B ≈ 18 GB. La diferencia es enorme y cambia por completo el perfil de la máquina necesaria.
- Velocidad de generación
- Con cifras comparables de parámetros activos (17B frente a 3B), Qwen3-30B-A3B es más rápido en tokens/segundo: normalmente entre 2 y 3 veces más rápido en la misma máquina, cuando ambos modelos caben en memoria.
- Calidad de razonamiento
- En los benchmarks públicos MMLU-Pro y GPQA, Scout sigue por delante de Qwen3-30B-A3B. La diferencia se reduce mucho al activar el modo thinking de Qwen3.
- Multimodalidad
- Scout es nativamente multimodal. Qwen3-30B-A3B no lo es —debes usar un modelo de visión separado como Qwen 3.5 9B en paralelo si quieres visión en la misma pila.
- Contexto largo
- Scout apunta a 10M (256k de forma estable en la práctica). Qwen3-30B-A3B ofrece 256k de forma nativa, con un comportamiento más predecible y un menor consumo de caché KV.
#Solución de problemas
- "Error: model requires more system memory than is available"
- Tu VRAM y tu RAM combinadas son insuficientes. O bien pasas a una cuantización más agresiva (poco habitual con Q4, que ya está bastante ajustada), o bien cambias de modelo. No hay magia en Ollama.
- Velocidad < 5 tokens/segundo en GPU de 24 GB
- Estás utilizando offload a la CPU. Compruébalo con ollama ps: la columna PROCESSOR debe mostrar 100% GPU. Si no es así, Scout no es adecuado para tu máquina.
- Respuestas truncadas
- Aumenta num_predict (por defecto, 128 en algunas configuraciones). Con /set parameter num_predict 2048 en la sesión, o mediante un Modelfile.
- Fallos al superar los 64k tokens
- La caché KV satura la VRAM. Reduce num_ctx o activa la cuantización de la caché KV mediante OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0 en el entorno.
- Imagen rechazada con "unsupported image format"
- Convierte a JPEG o PNG estándar. Según la versión de Ollama, no todos los formatos WebP, HEIC y AVIF son compatibles.
#Para ir más allá
Una vez que Scout esté operativo, merece la pena explorar varias vías para aprovechar sus particularidades.
- Elegir bien la cuantización
- Q4_K_M es el punto ideal para Scout, pero entender cuándo subir a Q5 o Q8 depende del caso de uso, especialmente en tareas multimodales, donde la cuantización puede degradar la calidad más que en tareas de texto puro.
- Aprovechar la visión localmente
- La guía de visión dedicada cubre los patrones de prompt que realmente funcionan (OCR contextual, extracción estructurada, comparación de imágenes) con Scout y sus competidores multimodales como Qwen 3.5 9B y Gemma 4 12B.
- Modelfile para personalizar
- Más allá de num_ctx, un Modelfile permite fijar un system prompt, un formato de salida JSON, una temperatura adecuada para tu caso — útil para no reconfigurar en cada sesión.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.