¿Qué LLM en RTX 4080 / 4080 Super (16 GB)? ?
La RTX 4080 y la 4080 Super incluyen ambas 16 GB de GDDR6X (716,8 y 736 GB/s): cargan en VRAM todos los modelos de hasta aproximadamente 14 GB, entre ellos Gemma 4 12B, gpt-oss 20B y Mistral Small 24B. Una medición pública realizada por un tercero registra 106 tokens/s en un modelo de 8B en Q4 con una RTX 4080. La diferencia de ancho de banda entre las dos variantes es de aproximadamente un 3 %: no justifica un costo adicional importante.
Las tarjetas RTX 4080 y RTX 4080 Super son las de 16 GB de gama alta de la generación Ada. Para un LLM local, se diferencian menos entre sí que de sus competidoras de igual capacidad: RTX 4070 Ti Super, RTX 5070 Ti, RTX 5080. Esta guía cuantifica la diferencia real entre ambas variantes, lo que permiten 16 GB y la única medición publicada de velocidad de generación que existe para esta tarjeta.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5080 16 GB.
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 4080 para un LLM local: lo que permiten 16 GB y 716 GB/s
Una RTX 4080 o 4080 Super carga en VRAM cualquier modelo de 4B a 24B en Q4: Gemma 4 12B (7,7 a 8 GB), gpt-oss 20B (14 GB) y Mistral Small 24B (14 GB) caben, este último con aproximadamente 2 GB de margen para el contexto. La medición de terceros citada más abajo registra 106 tokens/s durante la generación con un modelo de 8B en Q4 y una RTX 4080, lo que sitúa la tarjeta entre las opciones rápidas para un uso interactivo. El límite es la capacidad: Qwen 3.5 27B pesa 17 GB según Ollama y no cabe. Para modelos de este tamaño, se necesitan 24 GB de VRAM. La 4080 es, por tanto, una tarjeta que destaca por su velocidad con modelos medianos, no por su capacidad.
- Arquitectura
- Ada Lovelace, chip AD103
- Memoria
- 16 GB de GDDR6X en un bus de 256 bits: 716,8 GB/s (4080) y 736 GB/s (4080 Super) según Wikipedia.
- Núcleos CUDA
- 9 728 (4080) y 10 240 (4080 Super) según NVIDIA.
- Potencia
- 320 W de potencia gráfica total en las dos variantes; NVIDIA indica 750 W de alimentación mínima para el PC.
- Precio de lanzamiento
- 1.199 dólares en noviembre de 2022 para la 4080, luego 999 dólares para la 4080 Super en enero de 2024.
#4080 o 4080 Super: la diferencia real para el LLM
La Super añade un 5 % de núcleos CUDA (10 240 frente a 9 728) y un 2,7 % de ancho de banda (736 frente a 716,8 GB/s). En la generación de texto, solo el ancho de banda cuenta realmente: la mejora teórica es, por tanto, inferior al 3 % e imperceptible en el uso. Ambas tarjetas tienen la misma capacidad de 16 GB y el mismo consumo de 320 W, por lo que cargan los mismos modelos. Una 4080 Super solo justifica un sobreprecio si se vende al mismo precio o casi. Los precios de segunda mano cambian cada semana: consulta el seguimiento en lugar de una cifra fija.
| Criterio | RTX 4080 | RTX 4080 Super |
|---|---|---|
| Núcleos CUDA | 9 728 | 10 240 |
| Memoria | 16 GB GDDR6X, 256 bits | 16 GB GDDR6X, 256 bits |
| Ancho de banda | 716,8 GB/s | 736 GB/s |
| Potencia gráfica | 320 W | 320 W |
| Fuente de alimentación mínima | 750 W | 750 W |
| Diferencia de ancho de banda | referencia | aproximadamente un 2,7 % más |
#Qué modelos caben en 16 GB
| Modelo | Tamaño | Margen con 16 GB | Veredicto |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 10,7 GB | Contexto muy largo posible |
| Gemma 4 12B | 7,7 a 8,0 GB | 8 GB | Cómodo |
| gpt-oss 20B | 14 GB | 2 GB | Cabe, con un contexto moderado |
| Mistral Small 24B | 14 GB | 2 GB | Cabe, con un contexto moderado |
| Qwen 3.5 27B | 17 GB | Negativo | No cabe en la VRAM |
Ollama utiliza por defecto un contexto de 4.096 tokens. Con 2 GB de margen, un modelo de 14 GB admite un contexto más largo siempre que se cuantice la caché K/V: Ollama ofrece el formato q8_0, que utiliza aproximadamente la mitad de la memoria del f16, con Flash Attention. Estos dos ajustes son clave para usar gpt-oss 20B o Mistral Small 24B con un contexto de 16.000 tokens.
#La única medición publicada: lo que dice de la 4080
Un repositorio público de GitHub compara GPU con llama.cpp usando LLaMA 3 (instantánea de mayo de 2024, sistema Ubuntu, RunPod). Para la RTX 4080 de 16 GB, registra 106,22 tokens/s al generar 1.024 tokens con un modelo de 8B en Q4_K_M, y 40,29 tokens/s con el mismo modelo en F16, que ocupa 14,96 GB, casi toda la memoria de la tarjeta. Son mediciones de un tercero, sobre un modelo más antiguo que los del sitio, con una versión anterior de llama.cpp: deben interpretarse como un orden de magnitud, no como una promesa.
| Paso | 512 tokens | 1 024 tokens | 8 192 tokens |
|---|---|---|---|
| Generación (tokens/s) | 108,15 | 106,22 | 93,71 |
| Lectura del prompt (tokens/s) | 5 389,74 | 5 064,99 | 2 882,03 |
Dos enseñanzas. En primer lugar, la generación se ralentiza con el contexto: pasar de 512 a 8.192 tokens de contexto supone una pérdida aproximada del 13 % en esta medición, porque la caché K/V se suma a los pesos leídos en cada token. En segundo lugar, se puede calcular la relación entre la medición y el límite máximo teórico: 716,8 GB/s divididos por los 4,58 GB del modelo de 8B en Q4 dan 156 tokens/s; el valor medido alcanza el 68 % de ese límite. En F16, el límite máximo es de 48 tokens/s y el valor medido alcanza el 84 % de ese límite. La relación varía, por tanto, entre el 68 % y el 84 % según el formato.
| Modelo (Q4) | Tamaño del modelo | Límite máximo | Estimación al 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 135 tokens/s | aproximadamente 95 tokens/s |
| Gemma 4 12B | 7,7 GB | 93 tokens/segundo | aproximadamente 65 tokens/s |
| Mistral Small 24B | 14 GB | 51 tokens/s | aproximadamente 36 tokens/s |
Estas estimaciones son válidas para un contexto corto. El modelo gpt-oss 20B solo lee sus expertos activos en cada token: supera a un modelo denso de 14 GB, aunque aquí no se cita ningún valor medido fiable.
#Leer el prompt es mucho más rápido que generar
La misma medición también incluye el procesamiento del prompt, es decir, la lectura de tu pregunta y tus documentos antes de la primera respuesta: 5.065 tokens/s para 1.024 tokens y 2.882 tokens/s para 8.192 tokens. Un documento de aproximadamente 8.000 tokens, unas quince páginas, se lee por tanto en unos tres segundos antes de que comience la generación. Esta etapa está limitada por la capacidad de cálculo y no por el ancho de banda, y es aquí donde se nota la diferencia que marcan los núcleos adicionales de la 4080 frente a una tarjeta de 288 GB/s como la 4060 Ti.
#Usos que se benefician de una 4080: agentes, RAG, código
Una tarjeta de esta velocidad es adecuada para usos que encadenan numerosas generaciones: agentes, bucles de corrección de código, procesamiento por lotes de documentos. A 100 tokens/s con un 8B, un agente que produce 500 tokens por paso responde en unos pocos segundos. Los 16 GB limitan, en cambio, el tamaño del contexto y el número de modelos cargados: mantén un solo modelo de 12B que ocupe 14 GB, más un pequeño modelo de embeddings para un RAG. Un modelo de razonamiento como gpt-oss 20B produce largas reflexiones antes de su respuesta, lo que consume contexto.
| Uso | Configuración | Aspecto a tener en cuenta |
|---|---|---|
| Asistente de código | Modelo de 8B a 12B, contexto de 16.000 tokens, caché q8_0 | Modelos de código de 15 GB o más: contexto casi nulo |
| RAG sobre documentos | Gemma 4 12B y embeddings ligeros | Cargar solo un modelo de generación |
| Chat de calidad | Mistral Small 24B solo | Contexto moderado, 2 GB de margen |
#El modelo se ralentiza: verificar que quepa en la VRAM
Con 16 GB, un modelo de 14 GB deja poco margen, y un contexto que crece puede hacer que parte del modelo se desplace a la RAM del sistema durante la conversación. El síntoma es una generación que se vuelve de repente más lenta: parte del modelo ha pasado a la RAM del sistema. Esta comprobación lleva un minuto y evita concluir erróneamente que la tarjeta es lenta, cuando la causa es la configuración del contexto.
- 01Observar la distribuciónEjecuta ollama ps en un segundo terminal: la columna PROCESSOR debe mostrar 100 % GPU. Una distribución CPU/GPU indica un desbordamiento de la VRAM hacia la RAM del sistema.
- 02Reducir el contextoReduce OLLAMA_CONTEXT_LENGTH a 8192, o a su valor predeterminado de 4096, y luego reinicia el servidor.
- 03Cuantizar la cachéActiva Flash Attention y OLLAMA_KV_CACHE_TYPE=q8_0: la caché K/V utiliza aproximadamente la mitad de la memoria que en f16.
- 04Liberar la VRAMCierra las aplicaciones que utilizan la tarjeta, como juegos y navegadores con aceleración por hardware, y compruébalo con nvidia-smi.
- 05Cambiar de modeloSi ninguna medida es suficiente, pasa a un modelo más ligero, por ejemplo Gemma 4 12B en lugar de Mistral Small 24B.
#4080 frente a la 4070 Ti Super, a la 5070 Ti y a la 5080
| Tarjeta | VRAM | Ancho de banda | Diferencia con la 4080 |
|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 672 GB/s | aproximadamente un 6 % menos |
| RTX 4080 | 16 GB GDDR6X | 716,8 GB/s | referencia |
| RTX 4080 Super | 16 GB GDDR6X | 736 GB/s | aproximadamente un 3 % más |
| RTX 5070 Ti | 16 GB GDDR7 | 896 GB/s | aproximadamente un 25 % más |
| RTX 5080 | 16 GB GDDR7 | 960 GB/s | aproximadamente un 34 % más |
Todas estas tarjetas cargan los mismos modelos, ya que la capacidad es idéntica. Solo cambia la velocidad, proporcionalmente al ancho de banda. La 4080 solo se diferencia de la 4070 Ti Super en un 6 %: si la diferencia de precio es importante, la Ti Super es una mejor compra. Frente a las tarjetas de la generación 50, la 4080 es entre un 20 y un 25 % más lenta, pero sigue sin competencia si su precio de segunda mano es bajo. Esta decisión se basa en el precio, no en la ficha técnica.
- ¿Qué LLM usar en una RTX 4070 Ti Super?
- ¿Qué LLM en RTX 5070 Ti?
- ¿Qué LLM en una RTX 5080?
- Precios de las tarjetas gráficas para IA local
#Veredicto 2026: conservarla, comprarla o dejarla pasar
- Mantén tu 4080 si
- Tus modelos caben en 16 GB. Sigue siendo rápida y nada justifica reemplazarla antes de necesitar 24 GB.
- Cómprala de segunda mano si
- Su precio es claramente inferior al de una 5070 Ti nueva, cuyo ancho de banda es aproximadamente un 25 % mayor.
- Busca 24 GB si
- Quieres modelos de 27B o más: ningún ajuste permite que 17 GB quepan en 16 GB con contexto.
Una tarjeta de 2022 o 2023 puede haberse usado para minería o para jugar intensivamente: pide la factura original si existe y da prioridad a un vendedor que acepte devoluciones. Antes de comprar de segunda mano, comprueba con nvidia-smi que la tarjeta muestre 16 GB, ejecuta un modelo de 14 GB y vigila la temperatura durante una generación larga. La tarjeta consume hasta 320 W: comprueba la fuente de alimentación; NVIDIA recomienda una de al menos 750 W.
- Fuente: especificaciones oficiales de NVIDIA (RTX 4080 y 4080 Super)
- Fuente: mediciones de terceros de la velocidad de generación de llama.cpp en GPU (GitHub)
- Fuente: preguntas frecuentes oficiales de Ollama (Flash Attention, caché K/V)
#Preguntas frecuentes
¿Qué diferencia hay entre RTX 4080 y 4080 Super para un LLM?+
¿Cuál es la velocidad de generación en una RTX 4080?+
¿Puede la RTX 4080 ejecutar Qwen 3.5 27B?+
¿RTX 4080 Super o RTX 4070 Ti Super para un LLM?+
¿Qué fuente de alimentación necesito para una RTX 4080?+
¿Valdría la pena una RTX 4080 de segunda mano para un LLM?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.