Intermedio 11 minRTX 40

¿Qué LLM en RTX 4080 / 4080 Super (16 GB)? ?

Respuesta directa

La RTX 4080 y la 4080 Super incluyen ambas 16 GB de GDDR6X (716,8 y 736 GB/s): cargan en VRAM todos los modelos de hasta aproximadamente 14 GB, entre ellos Gemma 4 12B, gpt-oss 20B y Mistral Small 24B. Una medición pública realizada por un tercero registra 106 tokens/s en un modelo de 8B en Q4 con una RTX 4080. La diferencia de ancho de banda entre las dos variantes es de aproximadamente un 3 %: no justifica un costo adicional importante.

Las tarjetas RTX 4080 y RTX 4080 Super son las de 16 GB de gama alta de la generación Ada. Para un LLM local, se diferencian menos entre sí que de sus competidoras de igual capacidad: RTX 4070 Ti Super, RTX 5070 Ti, RTX 5080. Esta guía cuantifica la diferencia real entre ambas variantes, lo que permiten 16 GB y la única medición publicada de velocidad de generación que existe para esta tarjeta.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5080 16 GB.

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 4080 para un LLM local: lo que permiten 16 GB y 716 GB/s

Una RTX 4080 o 4080 Super carga en VRAM cualquier modelo de 4B a 24B en Q4: Gemma 4 12B (7,7 a 8 GB), gpt-oss 20B (14 GB) y Mistral Small 24B (14 GB) caben, este último con aproximadamente 2 GB de margen para el contexto. La medición de terceros citada más abajo registra 106 tokens/s durante la generación con un modelo de 8B en Q4 y una RTX 4080, lo que sitúa la tarjeta entre las opciones rápidas para un uso interactivo. El límite es la capacidad: Qwen 3.5 27B pesa 17 GB según Ollama y no cabe. Para modelos de este tamaño, se necesitan 24 GB de VRAM. La 4080 es, por tanto, una tarjeta que destaca por su velocidad con modelos medianos, no por su capacidad.

Arquitectura
Ada Lovelace, chip AD103
Memoria
16 GB de GDDR6X en un bus de 256 bits: 716,8 GB/s (4080) y 736 GB/s (4080 Super) según Wikipedia.
Núcleos CUDA
9 728 (4080) y 10 240 (4080 Super) según NVIDIA.
Potencia
320 W de potencia gráfica total en las dos variantes; NVIDIA indica 750 W de alimentación mínima para el PC.
Precio de lanzamiento
1.199 dólares en noviembre de 2022 para la 4080, luego 999 dólares para la 4080 Super en enero de 2024.

#4080 o 4080 Super: la diferencia real para el LLM

La Super añade un 5 % de núcleos CUDA (10 240 frente a 9 728) y un 2,7 % de ancho de banda (736 frente a 716,8 GB/s). En la generación de texto, solo el ancho de banda cuenta realmente: la mejora teórica es, por tanto, inferior al 3 % e imperceptible en el uso. Ambas tarjetas tienen la misma capacidad de 16 GB y el mismo consumo de 320 W, por lo que cargan los mismos modelos. Una 4080 Super solo justifica un sobreprecio si se vende al mismo precio o casi. Los precios de segunda mano cambian cada semana: consulta el seguimiento en lugar de una cifra fija.

RTX 4080 y 4080 Super: las dos fichas
CriterioRTX 4080RTX 4080 Super
Núcleos CUDA9 72810 240
Memoria16 GB GDDR6X, 256 bits16 GB GDDR6X, 256 bits
Ancho de banda716,8 GB/s736 GB/s
Potencia gráfica320 W320 W
Fuente de alimentación mínima750 W750 W
Diferencia de ancho de bandareferenciaaproximadamente un 2,7 % más

#Qué modelos caben en 16 GB

Modelos en RTX 4080 (tamaños en Ollama, solo los pesos)
ModeloTamañoMargen con 16 GBVeredicto
Granite 4.2 8B5,3 GB10,7 GBContexto muy largo posible
Gemma 4 12B7,7 a 8,0 GB8 GBCómodo
gpt-oss 20B14 GB2 GBCabe, con un contexto moderado
Mistral Small 24B14 GB2 GBCabe, con un contexto moderado
Qwen 3.5 27B17 GBNegativoNo cabe en la VRAM

Ollama utiliza por defecto un contexto de 4.096 tokens. Con 2 GB de margen, un modelo de 14 GB admite un contexto más largo siempre que se cuantice la caché K/V: Ollama ofrece el formato q8_0, que utiliza aproximadamente la mitad de la memoria del f16, con Flash Attention. Estos dos ajustes son clave para usar gpt-oss 20B o Mistral Small 24B con un contexto de 16.000 tokens.

Ajustes del servidor Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

#La única medición publicada: lo que dice de la 4080

Un repositorio público de GitHub compara GPU con llama.cpp usando LLaMA 3 (instantánea de mayo de 2024, sistema Ubuntu, RunPod). Para la RTX 4080 de 16 GB, registra 106,22 tokens/s al generar 1.024 tokens con un modelo de 8B en Q4_K_M, y 40,29 tokens/s con el mismo modelo en F16, que ocupa 14,96 GB, casi toda la memoria de la tarjeta. Son mediciones de un tercero, sobre un modelo más antiguo que los del sitio, con una versión anterior de llama.cpp: deben interpretarse como un orden de magnitud, no como una promesa.

RTX 4080 16 GB: mediciones del registro de un tercero (LLaMA 3 8B en Q4_K_M, llama.cpp)
Paso512 tokens1 024 tokens8 192 tokens
Generación (tokens/s)108,15106,2293,71
Lectura del prompt (tokens/s)5 389,745 064,992 882,03

Dos enseñanzas. En primer lugar, la generación se ralentiza con el contexto: pasar de 512 a 8.192 tokens de contexto supone una pérdida aproximada del 13 % en esta medición, porque la caché K/V se suma a los pesos leídos en cada token. En segundo lugar, se puede calcular la relación entre la medición y el límite máximo teórico: 716,8 GB/s divididos por los 4,58 GB del modelo de 8B en Q4 dan 156 tokens/s; el valor medido alcanza el 68 % de ese límite. En F16, el límite máximo es de 48 tokens/s y el valor medido alcanza el 84 % de ese límite. La relación varía, por tanto, entre el 68 % y el 84 % según el formato.

Límite teórico y estimación para RTX 4080 (716,8 GB/s)
Modelo (Q4)Tamaño del modeloLímite máximoEstimación al 70 %
Granite 4.2 8B5,3 GB135 tokens/saproximadamente 95 tokens/s
Gemma 4 12B7,7 GB93 tokens/segundoaproximadamente 65 tokens/s
Mistral Small 24B14 GB51 tokens/saproximadamente 36 tokens/s

Estas estimaciones son válidas para un contexto corto. El modelo gpt-oss 20B solo lee sus expertos activos en cada token: supera a un modelo denso de 14 GB, aunque aquí no se cita ningún valor medido fiable.

#Leer el prompt es mucho más rápido que generar

La misma medición también incluye el procesamiento del prompt, es decir, la lectura de tu pregunta y tus documentos antes de la primera respuesta: 5.065 tokens/s para 1.024 tokens y 2.882 tokens/s para 8.192 tokens. Un documento de aproximadamente 8.000 tokens, unas quince páginas, se lee por tanto en unos tres segundos antes de que comience la generación. Esta etapa está limitada por la capacidad de cálculo y no por el ancho de banda, y es aquí donde se nota la diferencia que marcan los núcleos adicionales de la 4080 frente a una tarjeta de 288 GB/s como la 4060 Ti.

#Usos que se benefician de una 4080: agentes, RAG, código

Una tarjeta de esta velocidad es adecuada para usos que encadenan numerosas generaciones: agentes, bucles de corrección de código, procesamiento por lotes de documentos. A 100 tokens/s con un 8B, un agente que produce 500 tokens por paso responde en unos pocos segundos. Los 16 GB limitan, en cambio, el tamaño del contexto y el número de modelos cargados: mantén un solo modelo de 12B que ocupe 14 GB, más un pequeño modelo de embeddings para un RAG. Un modelo de razonamiento como gpt-oss 20B produce largas reflexiones antes de su respuesta, lo que consume contexto.

Tres configuraciones típicas en RTX 4080
UsoConfiguraciónAspecto a tener en cuenta
Asistente de códigoModelo de 8B a 12B, contexto de 16.000 tokens, caché q8_0Modelos de código de 15 GB o más: contexto casi nulo
RAG sobre documentosGemma 4 12B y embeddings ligerosCargar solo un modelo de generación
Chat de calidadMistral Small 24B soloContexto moderado, 2 GB de margen

#El modelo se ralentiza: verificar que quepa en la VRAM

Con 16 GB, un modelo de 14 GB deja poco margen, y un contexto que crece puede hacer que parte del modelo se desplace a la RAM del sistema durante la conversación. El síntoma es una generación que se vuelve de repente más lenta: parte del modelo ha pasado a la RAM del sistema. Esta comprobación lleva un minuto y evita concluir erróneamente que la tarjeta es lenta, cuando la causa es la configuración del contexto.

  1. 01
    Observar la distribución
    Ejecuta ollama ps en un segundo terminal: la columna PROCESSOR debe mostrar 100 % GPU. Una distribución CPU/GPU indica un desbordamiento de la VRAM hacia la RAM del sistema.
  2. 02
    Reducir el contexto
    Reduce OLLAMA_CONTEXT_LENGTH a 8192, o a su valor predeterminado de 4096, y luego reinicia el servidor.
  3. 03
    Cuantizar la caché
    Activa Flash Attention y OLLAMA_KV_CACHE_TYPE=q8_0: la caché K/V utiliza aproximadamente la mitad de la memoria que en f16.
  4. 04
    Liberar la VRAM
    Cierra las aplicaciones que utilizan la tarjeta, como juegos y navegadores con aceleración por hardware, y compruébalo con nvidia-smi.
  5. 05
    Cambiar de modelo
    Si ninguna medida es suficiente, pasa a un modelo más ligero, por ejemplo Gemma 4 12B en lugar de Mistral Small 24B.

#4080 frente a la 4070 Ti Super, a la 5070 Ti y a la 5080

Tarjetas de 16 GB: la misma capacidad, distintos anchos de banda
TarjetaVRAMAncho de bandaDiferencia con la 4080
RTX 4070 Ti Super16 GB GDDR6X672 GB/saproximadamente un 6 % menos
RTX 408016 GB GDDR6X716,8 GB/sreferencia
RTX 4080 Super16 GB GDDR6X736 GB/saproximadamente un 3 % más
RTX 5070 Ti16 GB GDDR7896 GB/saproximadamente un 25 % más
RTX 508016 GB GDDR7960 GB/saproximadamente un 34 % más

Todas estas tarjetas cargan los mismos modelos, ya que la capacidad es idéntica. Solo cambia la velocidad, proporcionalmente al ancho de banda. La 4080 solo se diferencia de la 4070 Ti Super en un 6 %: si la diferencia de precio es importante, la Ti Super es una mejor compra. Frente a las tarjetas de la generación 50, la 4080 es entre un 20 y un 25 % más lenta, pero sigue sin competencia si su precio de segunda mano es bajo. Esta decisión se basa en el precio, no en la ficha técnica.

#Veredicto 2026: conservarla, comprarla o dejarla pasar

Mantén tu 4080 si
Tus modelos caben en 16 GB. Sigue siendo rápida y nada justifica reemplazarla antes de necesitar 24 GB.
Cómprala de segunda mano si
Su precio es claramente inferior al de una 5070 Ti nueva, cuyo ancho de banda es aproximadamente un 25 % mayor.
Busca 24 GB si
Quieres modelos de 27B o más: ningún ajuste permite que 17 GB quepan en 16 GB con contexto.

Una tarjeta de 2022 o 2023 puede haberse usado para minería o para jugar intensivamente: pide la factura original si existe y da prioridad a un vendedor que acepte devoluciones. Antes de comprar de segunda mano, comprueba con nvidia-smi que la tarjeta muestre 16 GB, ejecuta un modelo de 14 GB y vigila la temperatura durante una generación larga. La tarjeta consume hasta 320 W: comprueba la fuente de alimentación; NVIDIA recomienda una de al menos 750 W.

#Preguntas frecuentes

FAQ
¿Qué diferencia hay entre RTX 4080 y 4080 Super para un LLM?+
Casi ninguna. La Super tiene un 5 % más de núcleos CUDA y un 2,7 % más de ancho de banda (736 frente a 716,8 GB/s), con la misma memoria de 16 GB y la misma potencia de 320 W. Los modelos cargados son los mismos, y la diferencia de velocidad, inferior al 3 %, no se nota en uso.
¿Cuál es la velocidad de generación en una RTX 4080?+
Una medición pública de un tercero registra 106,22 tokens/s con LLaMA 3 8B en Q4_K_M usando llama.cpp, en mayo de 2024. No es una medición realizada aquí y el modelo es más antiguo que los del sitio. El límite teórico para un modelo de 5,3 GB es de aproximadamente 135 tokens/s.
¿Puede la RTX 4080 ejecutar Qwen 3.5 27B?+
No completamente en VRAM: el modelo pesa 17 GB según Ollama, la tarjeta tiene 16 GB. Una parte de los pesos permanecería en la RAM del sistema, lo que ralentiza significativamente la generación. Para este modelo, se necesitan 24 GB de VRAM. Con 16 GB, elige Mistral Small 24B o gpt-oss 20B, que pesan 14 GB.
¿RTX 4080 Super o RTX 4070 Ti Super para un LLM?+
Las dos tienen 16 GB, por lo que pueden ejecutar los mismos modelos. La 4080 Super lee su memoria a 736 GB/s frente a 672 GB/s, es decir, aproximadamente un 10 % más: esa es la mejora máxima de velocidad en generación. Elige la 4070 Ti Super si su precio de segunda mano es considerablemente más bajo.
¿Qué fuente de alimentación necesito para una RTX 4080?+
NVIDIA indica 320 W de potencia gráfica total y una fuente de alimentación de al menos 750 W para el ordenador completo. Comprueba los conectores de tu modelo de tarjeta. Una fuente de alimentación de calidad de 750 W es adecuada; una potencia superior deja margen si tienes un procesador potente.
¿Valdría la pena una RTX 4080 de segunda mano para un LLM?+
Sí, si su precio es claramente inferior al de una RTX 5070 Ti nueva, que tiene la misma capacidad y un ancho de banda aproximadamente un 25 % superior. Comprueba con nvidia-smi que la tarjeta muestre 16 GB, prueba una generación larga y controla la temperatura antes de comprar.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.