Principiante 11 minPor VRAM

¿Qué LLM para 8 GB de VRAM? ?

Respuesta directa

Con 8 GB de VRAM, busca un modelo de 8 a 9 mil millones de parámetros en Q4: Qwen 3.5 9B (6 GB de pesos) o Granite 4.2 8B (4,6 GB), con un contexto de unos pocos miles de tokens. Un 12B en Q4 apenas cabe; un 14B supera la capacidad de la VRAM. Deja aproximadamente 1 GB de margen para la caché KV y el sistema.

Ocho gigabytes de VRAM siguen siendo la capacidad más común en las tarjetas vendidas en los últimos años. Esta guía explica qué cabe, cómo calcular tu margen, qué tarjetas tienen realmente 8 GB y cuándo pasar a 12 o 16 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Para pasar a 16 GB de VRAM: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Con 8 GB de VRAM: modelos de 4 a 9 mil millones de parámetros

Con 8 GB de VRAM, la opción adecuada es un modelo de 8 a 9 mil millones de parámetros en Q4, como Qwen 3.5 9B (6 GB de peso según el catálogo QuelLLM) o Granite 4.2 8B (4,6 GB), con un contexto de unos pocos miles de tokens. Un modelo de 12 mil millones en Q4 (7 GB) apenas cabe, sin margen para el contexto. Un modelo de 14 mil millones o más supera la capacidad disponible. El factor decisivo no es solo el peso del modelo: hay que sumar la caché KV, que crece con el contexto, y dejar espacio para el sistema y la salida de vídeo.

El cálculo del presupuesto es sencillo: los pesos del modelo, más la caché KV, más aproximadamente un gigabyte para los búferes y la visualización, deben sumar menos de 8 GB. Con un 9B en Q4 (6 GB), queda por tanto aproximadamente 1 GB para el contexto. Con un 8B más ligero como Granite 4.2 8B (4,6 GB), quedan más de 2 GB. Por eso, la elección del modelo y la del contexto se deciden juntas.

Presupuesto de memoria en 8 GB (peso: catálogo QuelLLM)
Modelo y cuantizaciónTamaño del modeloMargen para la caché KV y el sistemaVeredicto
Granite 4.2 8B Q44,6 GB≈ 3,4 GBCómodo, contexto largo posible
Granite 4.2 8B Q56 GB≈ 2 GBBuen equilibrio
Qwen 3.5 9B Q46 GB≈ 2 GBMejor opción generalista
Qwen 3.5 9B Q57 GB≈ 1 GBContexto muy corto
Gemma 4 12B Q47 GB≈ 1 GBCabe justo, sin margen
Qwen 3.5 4B Q42,3 GB≈ 5,7 GBMuy amplio, para tareas pequeñas

Estos márgenes son orientativos: el tamaño real de la caché KV depende de la arquitectura del modelo y de la longitud del contexto. La mejor forma de comprobarlo es ejecutar el modelo y consultar ollama ps y la herramienta de monitorización de tu tarjeta (nvidia-smi o rocm-smi).

i
Una corrección sobre los tamaños
Una versión anterior de esta guía indicaba 6,6 GB para Qwen 3.5 9B y 7,6 GB para Gemma 4 12B en Q4. El catálogo QuelLLM da 6 y 7 GB. Estos valores están redondeados: mantén siempre un gigaocteto de margen respecto a lo que calcules.

#¿Qué tarjetas tienen 8 GB y cuáles te pueden llevar a engaño?

Muchas gamas existen con distintas capacidades, y el nombre no basta. NVIDIA describe la RTX 3060 con 12 GB o 8 GB, la RTX 4060 con 8 GB, la RTX 4060 Ti con 16 GB o 8 GB y la RTX 5060 Ti con 16 GB o 8 GB, mientras que la RTX 5060 tiene 8 GB. En cuanto a AMD, la RX 9060 XT está disponible en 8 GB, con 320 GB/s de ancho de banda, igual que la versión de 16 GB. Por tanto, comprueba siempre la capacidad en la ficha del modelo exacto antes de comprar o comparar.

NVIDIA 8 GB
RTX 4060, RTX 5060, versiones de 8 GB de RTX 3060, 4060 Ti y 5060 Ti, y las anteriores RTX 3070, 3060 Ti o 2060 Super.
AMD 8 GB
RX 9060 XT 8 GB, RX 7600, RX 6600 XT, RX 5700 XT
Cuidado: RX 7600 XT
Esta tarjeta tiene 16 GB, no 8: la tabla de rendimiento de llama.cpp la incluye con 16 GB de GDDR6. Una versión anterior de esta guía la clasificaba erróneamente como una tarjeta de 8 GB.

En Mac, la memoria es unificada y se comparte con el sistema: un MacBook Air de 8 GB no reserva 8 GB para la IA. Las guías dedicadas al MacBook Air M1 y M2 detallan lo que queda utilizable; si no tienes ninguna tarjeta gráfica dedicada, la guía sobre LLM sin GPU presenta los modelos según la cantidad de RAM.

#Qué velocidad esperar con 8 GB

La generación de texto lee en cada token casi todos los pesos: la velocidad máxima es el ancho de banda de la memoria dividido por el tamaño de los pesos. En una RX 9060 XT de 8 GB (320 GB/s según AMD), el límite teórico es de aproximadamente 53 tokens por segundo para un Qwen 3.5 9B en Q4 (6 GB) y de 70 para un Granite 4.2 8B en Q4 (4,6 GB). Otra tarjeta tendrá un límite distinto; los valores reales siempre son más bajos.

No publicamos cifras de tokens por segundo para cada tarjeta: dependen del controlador, del software y del contexto, y ningún banco de pruebas público que podamos citar cubre estos modelos en estas tarjetas. La tabla comunitaria de llama.cpp, que mide un Llama 2 7B en Q4_0, ofrece una referencia para una tarjeta antigua de 8 GB: 67 tokens/s en generación con una RX 5700 XT bajo ROCm. Para tu hardware, mide: ollama run con la opción --verbose muestra la velocidad de generación.

Medir tu propia velocidad
ollama run <nom-du-modèle> --verbose
!
Cuando el modelo no cabe en la VRAM, la velocidad cae
Si una parte del modelo no cabe en la VRAM, Ollama la coloca en la memoria RAM y en el procesador. La generación pasa entonces a depender de la velocidad de la RAM y suele ser varias veces más lenta. ollama ps muestra la distribución: busca un 100 % en GPU.

#¿Qué modelos elegir con 8 GB según el uso?

El catálogo QuelLLM permite identificar, para cada uso, un modelo con margen. El mayor contexto anunciado por un modelo no quiere decir que puedas usarlo: con 8 GB, es la memoria libre después de los pesos la que limita la longitud real, no el número del catálogo.

Punto de partida por uso (catálogo QuelLLM)
UsoModeloPesos Q4Nota
Conversación y redacciónQwen 3.5 9B6 GBContexto anunciado de 262 000 tokens; en la práctica, con 8 GB solo se puede utilizar un contexto mucho menor.
Tareas comunes, margen amplioGranite 4.2 8B4,6 GBContexto anunciado de 128 000 tokens; deja más espacio para el caché KV
Completado de códigoQwen 2.5 Coder 7B5 GBModelo de código de 7 mil millones, contexto anunciado de 131 072 tokens
Tareas pequeñas en segundo planoQwen 3.5 4B2,3 GBDeja VRAM libre para otras herramientas
Visión y multimodalidadGemma 4 12B7 GBEtiquetado para visión y audio; apenas cabe en 8 GB

Dos precisiones útiles. Los modelos etiquetados como modelos de visión consumen memoria adicional para el codificador de imágenes, por lo que un modelo multimodal de 12 mil millones en Q4 supera rápidamente los 8 GB en cuanto se carga una imagen. Y para el código, un modelo especializado de 7 mil millones en Q4 (5 GB) cabe con margen y responde más rápido que uno generalista más grande, lo que importa para el autocompletado en línea.

#Cinco ajustes para aprovechar al máximo 8 GB

Ninguno de estos ajustes sustituye a la VRAM, pero amplían el límite entre unos cientos de megabytes y un gigabyte, lo que basta para pasar de un contexto de 4.000 tokens a uno de 16.000.

Limitar el contexto
Por defecto, según su documentación, Ollama utiliza una ventana de 4.096 tokens; OLLAMA_CONTEXT_LENGTH la modifica. No configures una ventana de 32.000 tokens si conversas con mensajes cortos.
Cuantizar la caché KV
OLLAMA_KV_CACHE_TYPE=q8_0 reduce casi por la mitad la memoria del caché en comparación con el f16 por defecto; requiere Flash Attention.
Dejar que Flash Attention actúe
Ollama lo utiliza automáticamente cuando el backend y la tarjeta lo permiten; puedes forzarlo con OLLAMA_FLASH_ATTENTION=1.
Liberar la tarjeta
Los navegadores, los juegos y las aplicaciones de vídeo consumen VRAM. Ciérralos antes de cargar un modelo o conecta la pantalla al procesador gráfico integrado, si existe.
Elegir Q4 o Q5 según el margen
Con 8 GB, Q4_K_M es la opción predeterminada adecuada. Pasa a Q5 solo con un modelo más pequeño que deje más de un gigabyte libre.
Ollama con caché KV cuantizada
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=8192 ollama serve

#Lo que 8 GB no permiten: RAG, código, grandes modelos

Un pipeline de RAG completo reúne un modelo de embeddings, posiblemente un reranker, y el LLM que redacta la respuesta. Con 8 GB, este conjunto no cabe con suficiente margen: el modelo de generación por sí solo ocupa de 5 a 6 GB. Dos soluciones: ejecutar el embedder en el procesador, lo cual es totalmente aceptable para la indexación, o elegir un modelo pequeño de generación como Qwen 3.5 4B en Q4 (2,3 GB). Para el autocompletado de código en línea, basta un modelo de 7 mil millones de parámetros; para un agente de código que lee archivos grandes, el contexto requerido supera lo que permiten 8 GB.

Para modelos de 14 a 32 mil millones de parámetros, hay que pasar al siguiente nivel de capacidad. La regla del sitio establece que 14B ≈ 9 GB y 32B ≈ 19 a 20 GB, en Q4 y sin contar el contexto: los modelos de 14B marcan, por tanto, el límite que supera los 8 GB, de ahí el interés de contar con 12 GB, que permiten alojarlos con margen. No cuentes con trucos para trasladar una parte excesiva del modelo a la RAM: un modelo con la mitad alojada en la RAM puede funcionar, pero con velocidades de lectura que desaniman a usarlo de forma interactiva.

#Cuándo pasar a 12 o 16 GB

¿Qué se gana al aumentar la capacidad?
NivelLo que se vuelve posibleGuide
12 GBGemma 4 12B en Q8, Qwen 3.5 9B en Q8, RAG más ligero¿Qué LLM para 12 GB de VRAM?
16 GBModelos de 20 a 24 mil millones en Q4 (gpt-oss 20B, Mistral Small 24B) con un poco de contexto¿Qué LLM para 16 GB de VRAM?
24 GBModelos densos de 27 mil millones en Q4 con contexto largo¿Qué LLM para 24 GB de VRAM?

El criterio adecuado de compra es el precio por gigabyte de VRAM, no el precio de la tarjeta. El seguimiento de precios del sitio lo calcula para cada tarjeta y se actualiza dos veces por semana; consúltalo antes de decidir, ya que las diferencias de precio entre las tarjetas nuevas y las de segunda mano cambian a menudo.

#Preguntas frecuentes

Preguntas frecuentes
¿Cuál es el mejor LLM para 8 GB de VRAM?+
Qwen 3.5 9B en Q4, con aproximadamente 6 GB de pesos según el catálogo QuelLLM, es el mejor modelo generalista, con un contexto de unos pocos miles de tokens. Granite 4.2 8B en Q4 (4,6 GB) deja más margen para un contexto largo. Para la autocompleción de código, basta un modelo especializado de 7 mil millones de parámetros.
¿Se puede ejecutar un 14B en 8 GB?+
No de forma cómoda. La regla del sitio estima unos 9 GB para los pesos de un 14B en Q4, más que la capacidad de la tarjeta. Una parte pasaría al procesador y la velocidad caería en picado. Gemma 4 12B en Q4 (7 GB) apenas cabe, sin margen para el contexto: prefiere un 9B.
¿Cómo saber si el modelo cabe completamente en mi VRAM?+
Inicia la generación de una respuesta y luego escribe ollama ps: la columna PROCESSOR indica la distribución entre GPU y procesador, y el objetivo es 100 % GPU. Si una parte pasa al procesador, reduce el contexto, cuantiza la caché KV con OLLAMA_KV_CACHE_TYPE o elige un modelo más pequeño.
¿Tiene la RX 7600 XT 8 GB?+
No, tiene 16 GB de GDDR6, como muestra la tabla de rendimiento de llama.cpp. Es un error común, ya que la RX 7600 base tiene 8 GB. Revisa siempre la capacidad exacta del modelo: existen varias series en 8 GB y en 16 GB, como la RTX 5060 Ti y la RX 9060 XT.
¿Son suficientes 8 GB para desarrollar una aplicación con un LLM?+
Para prototipar una aplicación de chat o de extracción con un 8B, sí. Para un RAG de producción con embedder, reranker y un modelo de 14 mil millones, no: busca 12 a 16 GB. También puedes ejecutar el embedder en el procesador para liberar VRAM para el LLM.
¿Un Mac con 8 GB es equivalente a un PC con 8 GB de VRAM?+
No. En un Mac, la memoria es unificada y se comparte con el sistema y las aplicaciones: la parte realmente disponible para el modelo es inferior a 8 GB. En un PC con una tarjeta dedicada, los 8 GB de VRAM están reservados para la GPU, lo que deja más espacio para el modelo.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.