Intermedio 11 minRTX 20

¿Qué LLM en RTX 2080 / 2080 Super (8 GB)? ?

Respuesta directa

Una RTX 2080 o 2080 Super (8 GB de GDDR6) ejecuta sin problemas modelos de 7 a 9 mil millones de parámetros en Q4, como Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB). No hay mediciones públicas para estas dos tarjetas, pero su bus de 256 bits las sitúa al nivel de la 2070 Super, con aproximadamente 88 tokens/s en un modelo de 7B. El límite sigue siendo la capacidad de 8 GB.

Las RTX 2080 (septiembre de 2018) y 2080 Super (julio de 2019) eran tarjetas de gama alta; en 2026 su ventaja para la IA local es escasa, ya que solo tienen 8 GB. Esta guía separa lo documentado de lo estimado, compara estas tarjetas con alternativas de 12 GB y explica cómo verificar que un modelo realmente quepa en la memoria.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#RTX 2080 y 2080 Super: qué pueden ejecutar

En una RTX 2080 o una 2080 Super, un modelo de 7 a 9 mil millones de parámetros en Q4 cabe completamente en la memoria de vídeo y se ejecuta rápido. Según el catálogo QuelLLM, Granite 4.2 8B requiere 4,6 GB en Q4 y Qwen 3.5 9B requiere 6 GB, lo que deja margen para un contexto de unos pocos miles de tokens. Gemma 4 12B (7 GB en Q4) alcanza el límite de los 8 GB y lo supera en cuanto se alarga la conversación. Ninguna de estas dos tarjetas figura en la tabla pública de rendimiento de llama.cpp; aun así, podemos estimar su rendimiento porque comparten el mismo bus de 256 bits que la 2070 Super, con la que se midieron 88 tokens por segundo usando un modelo de 7 mil millones de parámetros en Q4_0. La 2080 Super, cuya memoria es más rápida, debería rendir ligeramente mejor. En resumen: rápida, pero limitada por sus 8 GB.

RTX 2080
Septiembre de 2018, 2.944 núcleos CUDA, 8 GB de GDDR6, bus de 256 bits, lo que equivale a 448 GB/s a 14 Gbit/s.
RTX 2080 Super
Julio de 2019, 3.072 núcleos CUDA, 8 GB de GDDR6 a 15,5 Gbit/s, lo que equivale a 496 GB/s, aproximadamente un 11 % más que la 2080.
Para un LLM
La generación depende principalmente del ancho de banda: la Super gana un poco, la capacidad no cambia.

#Modelos compatibles: aquellos que caben en 8 GB

Modelos para RTX 2080 / 2080 Super (peso según el catálogo QuelLLM)
ModeloPeso en Q4Lo que se puede esperar con 8 GB
Granite 4.2 8B4,6 GBUso cómodo, contexto de varios miles de tokens
Qwen 3.5 9B6 GBCabe en Q4; contexto moderado, ajusta el caché K/V si es necesario
Gemma 4 12B7 GBMemoria insuficiente: ya no hay espacio para la caché y el sistema
Qwen 3.5 9B en Q810 GBNo cabe: supera los 8 GB

El razonamiento es el mismo para todos los modelos: pesos, más caché de contexto, más un margen de aproximadamente un gigabyte para el controlador y la pantalla. Si tu pantalla está conectada a esta tarjeta, una parte de la memoria ya está reservada para ella. Con 8 GB, limitar los pesos a un máximo de 6 GB es una regla segura. Para un contexto más largo, la cuantización de la caché K/V es la herramienta que más beneficio aporta.

#Verificar que un modelo quepa realmente en la tarjeta

Muchas pérdidas de velocidad se deben a un modelo que no cabe completamente en la VRAM: Ollama ejecuta entonces una parte en el procesador, y la tasa de generación cae sin ningún mensaje de error. La documentación de Ollama explica cómo comprobarlo: el comando ollama ps muestra, en la columna Processor, la memoria en la que se ha cargado el modelo. La indicación 100% GPU significa que el modelo está completamente en la tarjeta, mientras que una proporción como 48%/52% CPU/GPU indica una carga repartida entre la RAM y la VRAM.

  1. 01
    Cargar el modelo
    Inicia el modelo con ollama run seguido de su nombre y luego envía un primer prompt.
  2. 02
    Leer la distribución
    En otro terminal, escribe ollama ps. Anota la columna Processor y el tamaño anunciado.
  3. 03
    Corregir si es necesario
    Si el modelo no está al 100 % en la GPU, reduce el contexto, elige una cuantización más ligera o pasa a un modelo más pequeño. Cuantizar la caché K/V también ayuda; la documentación especifica que esto requiere Flash Attention.
Controlar la distribución GPU / CPU
ollama ps

#Velocidad: lo que se mide, lo que se estima

La tabla colaborativa de llama.cpp (Llama 2 7B en Q4_0, archivo de 3,56 GiB) incluye la 2070 Super, la 2080 Ti, la 3060 de 12 GB y la 4060 Ti de 8 GB, pero ni la 2080 ni la 2080 Super. La tabla especifica que los resultados varían según el controlador, el sistema y la tarjeta, incluso con el mismo chip. A continuación se presenta lo que se ha medido y después lo que es razonable deducir de ello.

Prueba de llama.cpp, Llama 2 7B Q4_0, generación (tokens/s)
TarjetaMemoriaBusGeneraciónEstado
RTX 2070 Super8 GB256 bits88,1Medición publicada
RTX 2080 / 2080 Super8 GB256 bitsaproximadamente 88 a 97Estimación: mismo bus, memoria más rápida en la Super
RTX 2080 Ti11 GB352 bits107,5Medición publicada
RTX 3060 12 GB12 GB192 bits75,6Medición publicada
RTX 4060 Ti 8 GB8 GB128 bits63,9Medición publicada

La estimación de la fila 2080 sigue una regla sencilla: a 448 GB/s, la 2080 debería ofrecer una tasa de generación muy cercana a la de la 2070 Super y, a 496 GB/s, la 2080 Super puede ganar hasta un 10 % más, es decir, unos 95 tokens por segundo como orden de magnitud. Es una proyección, no una medición: no la cites como un resultado.

La tabla ofrece una lección útil para quien duda en reemplazar su tarjeta: la RTX 4060 Ti de 8 GB, aunque más reciente, genera más lentamente (63,9 tokens por segundo) que la 2070 Super, porque su bus de 128 bits limita el ancho de banda. En la generación de texto, una generación de GPU más reciente no es sinónimo de mayor velocidad. Lo que aporta es, sobre todo, eficiencia energética y funciones recientes, no capacidad de memoria.

#2080 Super o RTX 3060 12 GB: la capacidad gana

La 3060 de 12 GB genera más lentamente que la 2070 Super (75,6 frente a 88,1 tokens por segundo en la prueba), pero ofrece 4 GB más. Eso es lo que importa para la IA local: en 12 GB, Gemma 4 12B (7 GB en Q4) cabe con margen para el contexto, algo que las tarjetas de 8 GB no permiten. Una 2080 Super no compensa esta desventaja con su velocidad, ya que el aumento hasta unos 95 tokens por segundo no cambia el hecho de que un modelo de 12B no quepa.

2080 Super o 3060 de 12 GB: cómo elegir
CriterioRTX 2080 SuperRTX 3060 12 GB
Memoria8 GB12 GB
Generación (7B Q4_0)Estimada en torno a 95 tokens/s75,6 tokens/s (medición)
Modelos de 12 mil millonesNo (7 GB de pesos, sin margen)Sí, con contexto
Modelos de 7 a 9 mil millonesSíSí

La conclusión depende de tu objetivo. Para un asistente de 8 o 9 mil millones de parámetros, tu 2080 es suficiente y pasar a una 3060 de 12 GB no aporta nada en velocidad. Para usar un modelo de 12B o contextos largos, el cambio se justifica. Los precios de ocasión cambian cada semana: consulta el seguimiento en lugar de confiar en un número fijo.

#Contexto largo con 8 GB: la caché K/V es decisiva

En una tarjeta de 8 GB, el problema no es el modelo, sino la caché de contexto. Cada token de la conversación añade datos en memoria, y un 8B en Q4 que cabía sin contexto puede superar la memoria disponible cuando pegas un documento largo. En Ollama hay dos mecanismos para evitarlo. Flash Attention, que el software activa automáticamente cuando la tarjeta lo permite, reduce la memoria necesaria a medida que crece el contexto. Una vez activada, permite la cuantización de la caché K/V, cuyo formato q8_0 utiliza aproximadamente la mitad de la memoria del formato predeterminado, según la documentación. El formato q4_0 ahorra más memoria, pero degrada la precisión de forma más visible con contextos largos.

Linux: forzar Flash Attention y cuantizar la caché en q8_0
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

Este ajuste es global: se aplica a todos los modelos servidos por la instancia, lo que resulta práctico en una máquina dedicada, pero debes tenerlo en cuenta si cambias de modelo a menudo. La buena práctica es medir antes de ajustar: carga tu modelo, llena un contexto representativo de tu uso y luego comprueba con ollama ps que el modelo siga al 100 % en la GPU. Si es así, tienes margen; de lo contrario, cuantiza la caché o reduce el contexto.

#Cuando 8 GB ya no son suficientes: los niveles siguientes

Lo que desbloquea cada nivel de memoria (peso en Q4, catálogo QuelLLM)
Memoria de la tarjetaModelos que ya se pueden ejecutarPeso en Q4
8 GB (tu tarjeta)Modelos de 7 a 9 mil millones4,6 a 6 GB
12 GBGemma 4 12B con contexto7 GB
16 GBgpt-oss 20B (13 GB) o Qwen 3.5 27B (16 GB, con muy poco margen)13 a 16 GB

La lectura de esta tabla es sencilla: cada aumento de memoria abre una categoría de modelos, mientras que la velocidad pura apenas cambia la experiencia más allá de 30 o 40 tokens por segundo. Si dudas sobre si invertir, pregúntate primero qué modelo quieres ejecutar y luego elige la tarjeta que tenga la memoria correspondiente. Un modelo de 27 mil millones en 16 GB ya está al límite; si ese es tu objetivo, considera más bien una tarjeta de 24 GB.

#Controladores y soporte en 2026

La RTX 2080 y la 2080 Ti forman parte de las tarjetas con capacidad de cálculo 7.5 listadas por Ollama, que exige un controlador 550 o más reciente. Esto cubre las versiones actuales de Ollama; si la instalación falla, el primer paso es verificar la versión del controlador con nvidia-smi. Por tanto, no hay ninguna razón para temer un impedimento de software al instalar Ollama o llama.cpp en estas tarjetas. El único aspecto al que hay que prestar atención es la versión del controlador: actualízalo antes de buscar la causa del fallo en otra parte.

#Veredicto 2026

Consérvala si
Ya está en tu PC y buscas modelos de 7 a 9 mil millones en Q4. Velocidad ampliamente suficiente, costo nulo.
No compres para la IA
Salvo si el precio es bajo y la garantía es clara. A precio similar, una tarjeta de 12 GB aporta más valor que unos cuantos tokens por segundo adicionales.
Pasa a otra cosa si
¿Quieres un 12B, un 14B o más, o un contexto de más de diez mil tokens en un 8B? Entonces necesitas entre 12 y 16 GB.

#Preguntas frecuentes

Preguntas frecuentes
¿Puede la RTX 2080 ejecutar un modelo de 8 a 9 mil millones de parámetros?+
Sí. En Q4, Granite 4.2 8B pesa 4,6 GB y Qwen 3.5 9B 6 GB según el catálogo QuelLLM, lo cual cabe en los 8 GB de la tarjeta con un contexto moderado. Su velocidad es comparable a la de una 2070 Super, medida a 88 tokens por segundo en un 7B en Q4_0.
¿RTX 2080 Super o RTX 2080 Ti para un LLM?+
La 2080 Ti tiene 11 GB y un ancho de banda de 616 GB/s; la 2080 Super, 8 GB y 496 GB/s. Para un LLM, los 3 GB adicionales importan más que la velocidad: permiten usar modelos de 12 mil millones de parámetros. Si tu presupuesto lo permite, la 2080 Ti es la mejor opción de las dos.
¿Se puede ejecutar Gemma 4 12B en una RTX 2080 Super?+
No con comodidad. El catálogo indica 7 GB de pesos en Q4, lo que deja apenas un gigabyte para la caché de contexto y el sistema con 8 GB. El modelo se carga, pero Ollama pronto pasa parte de él a la RAM, como te mostrará ollama ps. Es preferible elegir un modelo de 8B o 9B.
¿Cómo saber si mi modelo está completamente en el GPU?+
Usa el comando ollama ps: la columna Processor muestra 100% GPU cuando el modelo está completamente cargado en la tarjeta, y una proporción del tipo 48%/52% CPU/GPU cuando está repartido entre la tarjeta y la memoria del sistema. En este segundo caso, la velocidad cae claramente y conviene reducir el contexto o el modelo.
¿Es una RTX 2080 más rápida que una RTX 4060 Ti 8 GB para generar texto?+
En la tabla pública de llama.cpp, la 4060 Ti de 8 GB genera 63,9 tokens por segundo frente a 88,1 para la 2070 Super, cuyo bus es idéntico al de la 2080. El bus de 128 bits de la 4060 Ti limita su ancho de banda. Por tanto, puedes esperar una mayor velocidad de generación en la 2080, a igualdad de capacidad.
¿Ollama funciona aún en una RTX 2080 en 2026?+
Sí. Ollama lista la RTX 2080 entre las tarjetas con capacidad de cálculo 7.5 y solo requiere un controlador de la versión 550 o posterior. No se ha anunciado ningún fin de soporte para esta familia en la documentación consultada; simplemente revisa las notas de versión de los controladores y de CUDA cuando hagas actualizaciones importantes.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.