¿Qué LLM para 8 GB de VRAM? ?
Con 8 GB de VRAM, busca un modelo de 8 a 9 mil millones de parámetros en Q4: Qwen 3.5 9B (6 GB de pesos) o Granite 4.2 8B (4,6 GB), con un contexto de unos pocos miles de tokens. Un 12B en Q4 apenas cabe; un 14B supera la capacidad de la VRAM. Deja aproximadamente 1 GB de margen para la caché KV y el sistema.
Ocho gigabytes de VRAM siguen siendo la capacidad más común en las tarjetas vendidas en los últimos años. Esta guía explica qué cabe, cómo calcular tu margen, qué tarjetas tienen realmente 8 GB y cuándo pasar a 12 o 16 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para pasar a 16 GB de VRAM: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Con 8 GB de VRAM: modelos de 4 a 9 mil millones de parámetros
Con 8 GB de VRAM, la opción adecuada es un modelo de 8 a 9 mil millones de parámetros en Q4, como Qwen 3.5 9B (6 GB de peso según el catálogo QuelLLM) o Granite 4.2 8B (4,6 GB), con un contexto de unos pocos miles de tokens. Un modelo de 12 mil millones en Q4 (7 GB) apenas cabe, sin margen para el contexto. Un modelo de 14 mil millones o más supera la capacidad disponible. El factor decisivo no es solo el peso del modelo: hay que sumar la caché KV, que crece con el contexto, y dejar espacio para el sistema y la salida de vídeo.
El cálculo del presupuesto es sencillo: los pesos del modelo, más la caché KV, más aproximadamente un gigabyte para los búferes y la visualización, deben sumar menos de 8 GB. Con un 9B en Q4 (6 GB), queda por tanto aproximadamente 1 GB para el contexto. Con un 8B más ligero como Granite 4.2 8B (4,6 GB), quedan más de 2 GB. Por eso, la elección del modelo y la del contexto se deciden juntas.
| Modelo y cuantización | Tamaño del modelo | Margen para la caché KV y el sistema | Veredicto |
|---|---|---|---|
| Granite 4.2 8B Q4 | 4,6 GB | ≈ 3,4 GB | Cómodo, contexto largo posible |
| Granite 4.2 8B Q5 | 6 GB | ≈ 2 GB | Buen equilibrio |
| Qwen 3.5 9B Q4 | 6 GB | ≈ 2 GB | Mejor opción generalista |
| Qwen 3.5 9B Q5 | 7 GB | ≈ 1 GB | Contexto muy corto |
| Gemma 4 12B Q4 | 7 GB | ≈ 1 GB | Cabe justo, sin margen |
| Qwen 3.5 4B Q4 | 2,3 GB | ≈ 5,7 GB | Muy amplio, para tareas pequeñas |
Estos márgenes son orientativos: el tamaño real de la caché KV depende de la arquitectura del modelo y de la longitud del contexto. La mejor forma de comprobarlo es ejecutar el modelo y consultar ollama ps y la herramienta de monitorización de tu tarjeta (nvidia-smi o rocm-smi).
#¿Qué tarjetas tienen 8 GB y cuáles te pueden llevar a engaño?
Muchas gamas existen con distintas capacidades, y el nombre no basta. NVIDIA describe la RTX 3060 con 12 GB o 8 GB, la RTX 4060 con 8 GB, la RTX 4060 Ti con 16 GB o 8 GB y la RTX 5060 Ti con 16 GB o 8 GB, mientras que la RTX 5060 tiene 8 GB. En cuanto a AMD, la RX 9060 XT está disponible en 8 GB, con 320 GB/s de ancho de banda, igual que la versión de 16 GB. Por tanto, comprueba siempre la capacidad en la ficha del modelo exacto antes de comprar o comparar.
- NVIDIA 8 GB
- RTX 4060, RTX 5060, versiones de 8 GB de RTX 3060, 4060 Ti y 5060 Ti, y las anteriores RTX 3070, 3060 Ti o 2060 Super.
- AMD 8 GB
- RX 9060 XT 8 GB, RX 7600, RX 6600 XT, RX 5700 XT
- Cuidado: RX 7600 XT
- Esta tarjeta tiene 16 GB, no 8: la tabla de rendimiento de llama.cpp la incluye con 16 GB de GDDR6. Una versión anterior de esta guía la clasificaba erróneamente como una tarjeta de 8 GB.
En Mac, la memoria es unificada y se comparte con el sistema: un MacBook Air de 8 GB no reserva 8 GB para la IA. Las guías dedicadas al MacBook Air M1 y M2 detallan lo que queda utilizable; si no tienes ninguna tarjeta gráfica dedicada, la guía sobre LLM sin GPU presenta los modelos según la cantidad de RAM.
#Qué velocidad esperar con 8 GB
La generación de texto lee en cada token casi todos los pesos: la velocidad máxima es el ancho de banda de la memoria dividido por el tamaño de los pesos. En una RX 9060 XT de 8 GB (320 GB/s según AMD), el límite teórico es de aproximadamente 53 tokens por segundo para un Qwen 3.5 9B en Q4 (6 GB) y de 70 para un Granite 4.2 8B en Q4 (4,6 GB). Otra tarjeta tendrá un límite distinto; los valores reales siempre son más bajos.
No publicamos cifras de tokens por segundo para cada tarjeta: dependen del controlador, del software y del contexto, y ningún banco de pruebas público que podamos citar cubre estos modelos en estas tarjetas. La tabla comunitaria de llama.cpp, que mide un Llama 2 7B en Q4_0, ofrece una referencia para una tarjeta antigua de 8 GB: 67 tokens/s en generación con una RX 5700 XT bajo ROCm. Para tu hardware, mide: ollama run con la opción --verbose muestra la velocidad de generación.
#¿Qué modelos elegir con 8 GB según el uso?
El catálogo QuelLLM permite identificar, para cada uso, un modelo con margen. El mayor contexto anunciado por un modelo no quiere decir que puedas usarlo: con 8 GB, es la memoria libre después de los pesos la que limita la longitud real, no el número del catálogo.
| Uso | Modelo | Pesos Q4 | Nota |
|---|---|---|---|
| Conversación y redacción | Qwen 3.5 9B | 6 GB | Contexto anunciado de 262 000 tokens; en la práctica, con 8 GB solo se puede utilizar un contexto mucho menor. |
| Tareas comunes, margen amplio | Granite 4.2 8B | 4,6 GB | Contexto anunciado de 128 000 tokens; deja más espacio para el caché KV |
| Completado de código | Qwen 2.5 Coder 7B | 5 GB | Modelo de código de 7 mil millones, contexto anunciado de 131 072 tokens |
| Tareas pequeñas en segundo plano | Qwen 3.5 4B | 2,3 GB | Deja VRAM libre para otras herramientas |
| Visión y multimodalidad | Gemma 4 12B | 7 GB | Etiquetado para visión y audio; apenas cabe en 8 GB |
Dos precisiones útiles. Los modelos etiquetados como modelos de visión consumen memoria adicional para el codificador de imágenes, por lo que un modelo multimodal de 12 mil millones en Q4 supera rápidamente los 8 GB en cuanto se carga una imagen. Y para el código, un modelo especializado de 7 mil millones en Q4 (5 GB) cabe con margen y responde más rápido que uno generalista más grande, lo que importa para el autocompletado en línea.
#Cinco ajustes para aprovechar al máximo 8 GB
Ninguno de estos ajustes sustituye a la VRAM, pero amplían el límite entre unos cientos de megabytes y un gigabyte, lo que basta para pasar de un contexto de 4.000 tokens a uno de 16.000.
- Limitar el contexto
- Por defecto, según su documentación, Ollama utiliza una ventana de 4.096 tokens; OLLAMA_CONTEXT_LENGTH la modifica. No configures una ventana de 32.000 tokens si conversas con mensajes cortos.
- Cuantizar la caché KV
- OLLAMA_KV_CACHE_TYPE=q8_0 reduce casi por la mitad la memoria del caché en comparación con el f16 por defecto; requiere Flash Attention.
- Dejar que Flash Attention actúe
- Ollama lo utiliza automáticamente cuando el backend y la tarjeta lo permiten; puedes forzarlo con OLLAMA_FLASH_ATTENTION=1.
- Liberar la tarjeta
- Los navegadores, los juegos y las aplicaciones de vídeo consumen VRAM. Ciérralos antes de cargar un modelo o conecta la pantalla al procesador gráfico integrado, si existe.
- Elegir Q4 o Q5 según el margen
- Con 8 GB, Q4_K_M es la opción predeterminada adecuada. Pasa a Q5 solo con un modelo más pequeño que deje más de un gigabyte libre.
#Lo que 8 GB no permiten: RAG, código, grandes modelos
Un pipeline de RAG completo reúne un modelo de embeddings, posiblemente un reranker, y el LLM que redacta la respuesta. Con 8 GB, este conjunto no cabe con suficiente margen: el modelo de generación por sí solo ocupa de 5 a 6 GB. Dos soluciones: ejecutar el embedder en el procesador, lo cual es totalmente aceptable para la indexación, o elegir un modelo pequeño de generación como Qwen 3.5 4B en Q4 (2,3 GB). Para el autocompletado de código en línea, basta un modelo de 7 mil millones de parámetros; para un agente de código que lee archivos grandes, el contexto requerido supera lo que permiten 8 GB.
Para modelos de 14 a 32 mil millones de parámetros, hay que pasar al siguiente nivel de capacidad. La regla del sitio establece que 14B ≈ 9 GB y 32B ≈ 19 a 20 GB, en Q4 y sin contar el contexto: los modelos de 14B marcan, por tanto, el límite que supera los 8 GB, de ahí el interés de contar con 12 GB, que permiten alojarlos con margen. No cuentes con trucos para trasladar una parte excesiva del modelo a la RAM: un modelo con la mitad alojada en la RAM puede funcionar, pero con velocidades de lectura que desaniman a usarlo de forma interactiva.
#Cuándo pasar a 12 o 16 GB
| Nivel | Lo que se vuelve posible | Guide |
|---|---|---|
| 12 GB | Gemma 4 12B en Q8, Qwen 3.5 9B en Q8, RAG más ligero | ¿Qué LLM para 12 GB de VRAM? |
| 16 GB | Modelos de 20 a 24 mil millones en Q4 (gpt-oss 20B, Mistral Small 24B) con un poco de contexto | ¿Qué LLM para 16 GB de VRAM? |
| 24 GB | Modelos densos de 27 mil millones en Q4 con contexto largo | ¿Qué LLM para 24 GB de VRAM? |
El criterio adecuado de compra es el precio por gigabyte de VRAM, no el precio de la tarjeta. El seguimiento de precios del sitio lo calcula para cada tarjeta y se actualiza dos veces por semana; consúltalo antes de decidir, ya que las diferencias de precio entre las tarjetas nuevas y las de segunda mano cambian a menudo.
- ¿Qué LLM para 12 GB de VRAM?
- ¿Qué LLM para 16 GB de VRAM?
- Cuantizar la caché KV para ahorrar VRAM
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- LLM en local sin GPU: modelos según la RAM
- Precios de las tarjetas gráficas para IA local
- Fuente: Preguntas frecuentes de Ollama (contexto, caché KV, Flash Attention)
- Fuente: ficha NVIDIA de la familia RTX 5060
- Fuente: ficha de AMD de la RX 9060 XT de 8 GB
- Catálogo QuelLLM de modelos (tamaños en VRAM)
#Preguntas frecuentes
¿Cuál es el mejor LLM para 8 GB de VRAM?+
¿Se puede ejecutar un 14B en 8 GB?+
¿Cómo saber si el modelo cabe completamente en mi VRAM?+
¿Tiene la RX 7600 XT 8 GB?+
¿Son suficientes 8 GB para desarrollar una aplicación con un LLM?+
¿Un Mac con 8 GB es equivalente a un PC con 8 GB de VRAM?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.