¿Qué LLM en RTX 2080 / 2080 Super (8 GB)? ?
Una RTX 2080 o 2080 Super (8 GB de GDDR6) ejecuta sin problemas modelos de 7 a 9 mil millones de parámetros en Q4, como Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB). No hay mediciones públicas para estas dos tarjetas, pero su bus de 256 bits las sitúa al nivel de la 2070 Super, con aproximadamente 88 tokens/s en un modelo de 7B. El límite sigue siendo la capacidad de 8 GB.
Las RTX 2080 (septiembre de 2018) y 2080 Super (julio de 2019) eran tarjetas de gama alta; en 2026 su ventaja para la IA local es escasa, ya que solo tienen 8 GB. Esta guía separa lo documentado de lo estimado, compara estas tarjetas con alternativas de 12 GB y explica cómo verificar que un modelo realmente quepa en la memoria.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#RTX 2080 y 2080 Super: qué pueden ejecutar
En una RTX 2080 o una 2080 Super, un modelo de 7 a 9 mil millones de parámetros en Q4 cabe completamente en la memoria de vídeo y se ejecuta rápido. Según el catálogo QuelLLM, Granite 4.2 8B requiere 4,6 GB en Q4 y Qwen 3.5 9B requiere 6 GB, lo que deja margen para un contexto de unos pocos miles de tokens. Gemma 4 12B (7 GB en Q4) alcanza el límite de los 8 GB y lo supera en cuanto se alarga la conversación. Ninguna de estas dos tarjetas figura en la tabla pública de rendimiento de llama.cpp; aun así, podemos estimar su rendimiento porque comparten el mismo bus de 256 bits que la 2070 Super, con la que se midieron 88 tokens por segundo usando un modelo de 7 mil millones de parámetros en Q4_0. La 2080 Super, cuya memoria es más rápida, debería rendir ligeramente mejor. En resumen: rápida, pero limitada por sus 8 GB.
- RTX 2080
- Septiembre de 2018, 2.944 núcleos CUDA, 8 GB de GDDR6, bus de 256 bits, lo que equivale a 448 GB/s a 14 Gbit/s.
- RTX 2080 Super
- Julio de 2019, 3.072 núcleos CUDA, 8 GB de GDDR6 a 15,5 Gbit/s, lo que equivale a 496 GB/s, aproximadamente un 11 % más que la 2080.
- Para un LLM
- La generación depende principalmente del ancho de banda: la Super gana un poco, la capacidad no cambia.
#Modelos compatibles: aquellos que caben en 8 GB
| Modelo | Peso en Q4 | Lo que se puede esperar con 8 GB |
|---|---|---|
| Granite 4.2 8B | 4,6 GB | Uso cómodo, contexto de varios miles de tokens |
| Qwen 3.5 9B | 6 GB | Cabe en Q4; contexto moderado, ajusta el caché K/V si es necesario |
| Gemma 4 12B | 7 GB | Memoria insuficiente: ya no hay espacio para la caché y el sistema |
| Qwen 3.5 9B en Q8 | 10 GB | No cabe: supera los 8 GB |
El razonamiento es el mismo para todos los modelos: pesos, más caché de contexto, más un margen de aproximadamente un gigabyte para el controlador y la pantalla. Si tu pantalla está conectada a esta tarjeta, una parte de la memoria ya está reservada para ella. Con 8 GB, limitar los pesos a un máximo de 6 GB es una regla segura. Para un contexto más largo, la cuantización de la caché K/V es la herramienta que más beneficio aporta.
#Verificar que un modelo quepa realmente en la tarjeta
Muchas pérdidas de velocidad se deben a un modelo que no cabe completamente en la VRAM: Ollama ejecuta entonces una parte en el procesador, y la tasa de generación cae sin ningún mensaje de error. La documentación de Ollama explica cómo comprobarlo: el comando ollama ps muestra, en la columna Processor, la memoria en la que se ha cargado el modelo. La indicación 100% GPU significa que el modelo está completamente en la tarjeta, mientras que una proporción como 48%/52% CPU/GPU indica una carga repartida entre la RAM y la VRAM.
- 01Cargar el modeloInicia el modelo con ollama run seguido de su nombre y luego envía un primer prompt.
- 02Leer la distribuciónEn otro terminal, escribe ollama ps. Anota la columna Processor y el tamaño anunciado.
- 03Corregir si es necesarioSi el modelo no está al 100 % en la GPU, reduce el contexto, elige una cuantización más ligera o pasa a un modelo más pequeño. Cuantizar la caché K/V también ayuda; la documentación especifica que esto requiere Flash Attention.
- Cuantizar la caché KV: ganar VRAM (contexto largo)
- Solucionar problemas de Ollama: GPU no detectada, lentitud, errores de memoria
#Velocidad: lo que se mide, lo que se estima
La tabla colaborativa de llama.cpp (Llama 2 7B en Q4_0, archivo de 3,56 GiB) incluye la 2070 Super, la 2080 Ti, la 3060 de 12 GB y la 4060 Ti de 8 GB, pero ni la 2080 ni la 2080 Super. La tabla especifica que los resultados varían según el controlador, el sistema y la tarjeta, incluso con el mismo chip. A continuación se presenta lo que se ha medido y después lo que es razonable deducir de ello.
| Tarjeta | Memoria | Bus | Generación | Estado |
|---|---|---|---|---|
| RTX 2070 Super | 8 GB | 256 bits | 88,1 | Medición publicada |
| RTX 2080 / 2080 Super | 8 GB | 256 bits | aproximadamente 88 a 97 | Estimación: mismo bus, memoria más rápida en la Super |
| RTX 2080 Ti | 11 GB | 352 bits | 107,5 | Medición publicada |
| RTX 3060 12 GB | 12 GB | 192 bits | 75,6 | Medición publicada |
| RTX 4060 Ti 8 GB | 8 GB | 128 bits | 63,9 | Medición publicada |
La estimación de la fila 2080 sigue una regla sencilla: a 448 GB/s, la 2080 debería ofrecer una tasa de generación muy cercana a la de la 2070 Super y, a 496 GB/s, la 2080 Super puede ganar hasta un 10 % más, es decir, unos 95 tokens por segundo como orden de magnitud. Es una proyección, no una medición: no la cites como un resultado.
La tabla ofrece una lección útil para quien duda en reemplazar su tarjeta: la RTX 4060 Ti de 8 GB, aunque más reciente, genera más lentamente (63,9 tokens por segundo) que la 2070 Super, porque su bus de 128 bits limita el ancho de banda. En la generación de texto, una generación de GPU más reciente no es sinónimo de mayor velocidad. Lo que aporta es, sobre todo, eficiencia energética y funciones recientes, no capacidad de memoria.
#2080 Super o RTX 3060 12 GB: la capacidad gana
La 3060 de 12 GB genera más lentamente que la 2070 Super (75,6 frente a 88,1 tokens por segundo en la prueba), pero ofrece 4 GB más. Eso es lo que importa para la IA local: en 12 GB, Gemma 4 12B (7 GB en Q4) cabe con margen para el contexto, algo que las tarjetas de 8 GB no permiten. Una 2080 Super no compensa esta desventaja con su velocidad, ya que el aumento hasta unos 95 tokens por segundo no cambia el hecho de que un modelo de 12B no quepa.
| Criterio | RTX 2080 Super | RTX 3060 12 GB |
|---|---|---|
| Memoria | 8 GB | 12 GB |
| Generación (7B Q4_0) | Estimada en torno a 95 tokens/s | 75,6 tokens/s (medición) |
| Modelos de 12 mil millones | No (7 GB de pesos, sin margen) | Sí, con contexto |
| Modelos de 7 a 9 mil millones | Sí | Sí |
La conclusión depende de tu objetivo. Para un asistente de 8 o 9 mil millones de parámetros, tu 2080 es suficiente y pasar a una 3060 de 12 GB no aporta nada en velocidad. Para usar un modelo de 12B o contextos largos, el cambio se justifica. Los precios de ocasión cambian cada semana: consulta el seguimiento en lugar de confiar en un número fijo.
- Precios de las tarjetas gráficas para IA local (seguimiento semanal)
- ¿Qué LLM para RTX 3060 12 GB?
- ¿Qué LLM usar en una RTX 2080 Ti (11 GB)?
#Contexto largo con 8 GB: la caché K/V es decisiva
En una tarjeta de 8 GB, el problema no es el modelo, sino la caché de contexto. Cada token de la conversación añade datos en memoria, y un 8B en Q4 que cabía sin contexto puede superar la memoria disponible cuando pegas un documento largo. En Ollama hay dos mecanismos para evitarlo. Flash Attention, que el software activa automáticamente cuando la tarjeta lo permite, reduce la memoria necesaria a medida que crece el contexto. Una vez activada, permite la cuantización de la caché K/V, cuyo formato q8_0 utiliza aproximadamente la mitad de la memoria del formato predeterminado, según la documentación. El formato q4_0 ahorra más memoria, pero degrada la precisión de forma más visible con contextos largos.
Este ajuste es global: se aplica a todos los modelos servidos por la instancia, lo que resulta práctico en una máquina dedicada, pero debes tenerlo en cuenta si cambias de modelo a menudo. La buena práctica es medir antes de ajustar: carga tu modelo, llena un contexto representativo de tu uso y luego comprueba con ollama ps que el modelo siga al 100 % en la GPU. Si es así, tienes margen; de lo contrario, cuantiza la caché o reduce el contexto.
#Cuando 8 GB ya no son suficientes: los niveles siguientes
| Memoria de la tarjeta | Modelos que ya se pueden ejecutar | Peso en Q4 |
|---|---|---|
| 8 GB (tu tarjeta) | Modelos de 7 a 9 mil millones | 4,6 a 6 GB |
| 12 GB | Gemma 4 12B con contexto | 7 GB |
| 16 GB | gpt-oss 20B (13 GB) o Qwen 3.5 27B (16 GB, con muy poco margen) | 13 a 16 GB |
La lectura de esta tabla es sencilla: cada aumento de memoria abre una categoría de modelos, mientras que la velocidad pura apenas cambia la experiencia más allá de 30 o 40 tokens por segundo. Si dudas sobre si invertir, pregúntate primero qué modelo quieres ejecutar y luego elige la tarjeta que tenga la memoria correspondiente. Un modelo de 27 mil millones en 16 GB ya está al límite; si ese es tu objetivo, considera más bien una tarjeta de 24 GB.
#Controladores y soporte en 2026
La RTX 2080 y la 2080 Ti forman parte de las tarjetas con capacidad de cálculo 7.5 listadas por Ollama, que exige un controlador 550 o más reciente. Esto cubre las versiones actuales de Ollama; si la instalación falla, el primer paso es verificar la versión del controlador con nvidia-smi. Por tanto, no hay ninguna razón para temer un impedimento de software al instalar Ollama o llama.cpp en estas tarjetas. El único aspecto al que hay que prestar atención es la versión del controlador: actualízalo antes de buscar la causa del fallo en otra parte.
#Veredicto 2026
- Consérvala si
- Ya está en tu PC y buscas modelos de 7 a 9 mil millones en Q4. Velocidad ampliamente suficiente, costo nulo.
- No compres para la IA
- Salvo si el precio es bajo y la garantía es clara. A precio similar, una tarjeta de 12 GB aporta más valor que unos cuantos tokens por segundo adicionales.
- Pasa a otra cosa si
- ¿Quieres un 12B, un 14B o más, o un contexto de más de diez mil tokens en un 8B? Entonces necesitas entre 12 y 16 GB.
#Preguntas frecuentes
¿Puede la RTX 2080 ejecutar un modelo de 8 a 9 mil millones de parámetros?+
¿RTX 2080 Super o RTX 2080 Ti para un LLM?+
¿Se puede ejecutar Gemma 4 12B en una RTX 2080 Super?+
¿Cómo saber si mi modelo está completamente en el GPU?+
¿Es una RTX 2080 más rápida que una RTX 4060 Ti 8 GB para generar texto?+
¿Ollama funciona aún en una RTX 2080 en 2026?+
- Fuente: tabla de rendimiento de llama.cpp en CUDA
- Fuente: tarjetas NVIDIA admitidas por Ollama
- Fuente: Preguntas frecuentes de Ollama (ollama ps, caché K/V)
- Fuente: características de las tarjetas GeForce serie 20
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.