Intermedio 11 minRTX 50

¿Qué LLM en RTX 5080 (16 GB)? ?

Respuesta directa

Una RTX 5080 ofrece 16 GB de VRAM GDDR7 y 960 GB/s de ancho de banda: mantiene en VRAM modelos de hasta 14 mil millones de parámetros (Qwen3 14B, 9,3 GB) y gpt-oss 20B (14 GB), a 64 tokens por segundo en un 14B con 16k de contexto según Hardware Corner. Un 27B denso (17 GB) y un 70B no caben.

La RTX 5080 genera rápido, pero con 16 GB comparte el límite de memoria de tarjetas más baratas. Esta guía muestra los modelos que realmente caben en memoria, con su tamaño exacto, velocidades medidas por Hardware Corner, el presupuesto de contexto y la diferencia real con la 5070 Ti, la 4080 Super y la 3090. También sabrás cuándo pasar a una tarjeta de 24 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Para esta configuración: RTX 5080 16 GB.

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 5080 para un LLM local: lo que permiten 16 GB

Para un LLM local, una RTX 5080 destaca por sus 16 GB de GDDR7 y sus 960 GB/s de ancho de banda: genera rápido, pero su capacidad limita los modelos. Según la biblioteca de Ollama, Qwen3 14B (9,3 GB) y gpt-oss 20B (14 GB) caben completamente en VRAM, mientras que Qwen 3.5 27B (17 GB) y Qwen3 30B (19 GB) superan la capacidad de la tarjeta. Hardware Corner mide 64 tokens por segundo en Qwen3 14B con 16.000 tokens de contexto y 105,6 en gpt-oss 20B con 128.000 tokens. Por tanto, es muy adecuada para modelos de 8 a 20 mil millones de parámetros, pero no para un modelo denso de 27B.

Memoria
16 GB de GDDR7 en un bus de 256 bits, según NVIDIA; 960 GB/s de ancho de banda a 30 Gbit/s, según Hardware Corner.
Cálculo
10 752 núcleos CUDA y Tensor Cores de 5.ª generación, según NVIDIA.
Consumo
360 W de potencia gráfica, 850 W de alimentación del sistema requerida y 88 °C de temperatura máxima, según NVIDIA
i
Qué piensa Hardware Corner
El sitio considera en marzo de 2026 que la 5080 tiene una mala relación precio/capacidad para los LLM locales: los 16 GB limitan los modelos a unos 28 mil millones de parámetros con cuantización agresiva, y recomienda en su lugar la RTX 4080 para esa capacidad de memoria. Es una opinión basada en los precios de entonces: consulta el seguimiento de precios antes de decidir.

#Los modelos que caben en 16 GB

Los tamaños corresponden a los archivos de la biblioteca Ollama, consultados el 29 de septiembre de 2026. El margen es lo que queda de los 16 GB antes de tener en cuenta el contexto, la caché y los búferes del motor.

Modelos para RTX 5080 (archivos de Ollama, Q4 salvo que se indique lo contrario)
ModeloArchivo OllamaMargen brutoVeredicto
Granite 4.2 8B5,3 GB10,7 GBMuy cómodo
Qwen 3.5 9B6,6 GB9,4 GBMuy cómodo, texto e imagen
Gemma 4 12B7,6 GB8,4 GBCómodo
Qwen3 14B9,3 GB6,7 GBCómodo, contexto de 32k posible
gpt-oss 20B14 GB2 GBCabe; permite un contexto largo en MXFP4
Devstral Small 2 24B / Mistral Small 3.2 24B15 GB1 GBMargen demasiado bajo para un contexto útil
Qwen 3.5 27B17 GBFalta 1 GBNo cabe
Qwen3 30B19 GBFaltan 3 GBNo cabe

El modelo de 14 mil millones en Q4 es el modelo denso más grande que funciona con holgura: deja cerca de 7 GB para el contexto. Los modelos de 24 mil millones solo dejan un GB y exceden la memoria de la tarjeta en cuanto crece el contexto: la tarjeta es adecuada para un 24B mientras la conversación sea corta, pero no para un agente. El caso de gpt-oss 20B es distinto: según Ollama, los pesos de los expertos están cuantizados en MXFP4 con 4,25 bits por parámetro, lo que le permite ejecutarse con 16 GB de memoria, y Hardware Corner lo ha medido con hasta 128k de contexto en esta tarjeta.

Un RAG local agrega un modelo de embeddings: bge-m3 pesa 1,2 GB en Ollama, lo que suma 7,8 GB en total con Qwen 3.5 9B y 8,8 GB con Gemma 4 12B. Quedan más de 7 GB para el contexto y la base de fragmentos insertados. Un agente de código, por su parte, exige un contexto de al menos 64.000 tokens según la documentación de Ollama: con 16 GB, obliga a bajar a un modelo de entre 8 y 14 mil millones de parámetros y a cuantizar la caché, en lugar de optar por un 24B.

#Rendimiento medido: velocidad y límite del ancho de banda

Los números provienen de Hardware Corner, que realiza pruebas con llama.cpp usando contextos de 4k a 128k. No son mediciones de QuelLLM.

Generación en RTX 5080, tokens por segundo (Hardware Corner)
Modelo (Q4_K, o MXFP4 para gpt-oss)Contexto 4kContexto 32kContexto 128kLectura del prompt de 4k
Qwen3 8B129,172,5no medido6 410,1
Qwen3 14B80,651,9no medido3 820,5
gpt-oss 20B (MXFP4)172,4149,3105,69 146,1

La generación está limitada por el ancho de banda: el máximo teórico equivale aproximadamente al ancho de banda dividido por el tamaño del modelo. Para Qwen3 14B (9,3 GB), 960 ÷ 9,3 da 103 tokens por segundo y la medición a 4k, de 80,6, alcanza el 78 % de ese máximo. gpt-oss 20B supera su máximo aparente (960 ÷ 14 = 69) con 172 tokens por segundo, porque un modelo de expertos solo lee una parte de sus pesos en cada token: el máximo se calcula a partir de los pesos activos, no del archivo completo.

El contexto afecta la velocidad. Qwen3 14B pasa de 80,6 a 51,9 tokens por segundo entre 4k y 32k (-36 %), mientras que gpt-oss 20B solo pierde un 13 % entre los mismos límites (172,4 a 149,3). Si trabajas con documentos largos, la elección del modelo importa más que la tarjeta.

#Contexto y caché KV: el verdadero límite de los 16 GB

Ollama ajusta el contexto predeterminado según la memoria de vídeo: su documentación indica 4k tokens con menos de 24 GiB de VRAM y recomienda al menos 64 000 tokens para agentes, búsqueda web y herramientas de código. Una RTX 5080 recibe, por tanto, 4k de forma predeterminada: un agente iniciado con los ajustes predeterminados pierde su historial rápidamente. Aumentar el contexto consume VRAM en forma de caché KV, y ese consumo debe salir del margen disponible indicado en la tabla anterior.

La principal medida es la cuantización de la caché: según las preguntas frecuentes de Ollama, q8_0 utiliza aproximadamente la mitad de la memoria que f16, con una pérdida de precisión muy pequeña, y requiere Flash Attention, que Ollama activa automáticamente cuando la tarjeta y el modelo son compatibles con ella. Con 16 GB, el orden de prioridad es sencillo: elegir un modelo que deje al menos entre 5 y 6 GB de margen, después cuantizar la caché y, por último, aumentar el contexto por etapas comprobando ollama ps.

#Instalar Ollama en una RTX 5080

  1. 01
    Verificar el controlador
    Ejecuta nvidia-smi en un terminal: el controlador debe ser de la versión 550 o superior (551.61 en Windows) y la memoria total indicada debe ser de aproximadamente 16 GB.
  2. 02
    Instalar Ollama
    Instala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
  3. 03
    Ejecutar un modelo
    Ejecuta ollama run qwen3:14b: la descarga de 9,3 GB se realiza una vez. Para un modelo más rápido, prueba ollama run gpt-oss:20b (14 GB).
  4. 04
    Controlar la distribución
    En un segundo terminal, ejecuta ollama ps: la columna Procesador debe mostrar 100 % GPU. Un reparto entre CPU y GPU significa que el modelo o el contexto excede la memoria de la GPU.
  5. 05
    Ajustar el contexto
    Fija el contexto con OLLAMA_CONTEXT_LENGTH y luego vuelve a ejecutar ollama ps. Si no hay suficiente margen, establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar.
Comandos básicos
ollama run qwen3:14b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Blackwell: MXFP4, NVFP4 y límite de potencia

La 5080 acelera por hardware los formatos de punto flotante de 4 bits: Hardware Corner indica que admite MXFP4 y NVFP4, y la mejora se aprecia en gpt-oss 20B, cuyos pesos se distribuyen en MXFP4. NVIDIA describe NVFP4 como un formato de punto flotante de 4 bits introducido con Blackwell. La compatibilidad de las herramientas (llama.cpp, Ollama, vLLM) con NVFP4 evoluciona rápidamente: comprueba la versión instalada y la ficha del modelo, y mantén Q4_K_M como opción fiable.

Flash Attention 3 está reservado para Hopper (H100) según el repositorio oficial de Flash Attention: en una 5080, se usa la versión 2 o la implementación de Ollama y de llama.cpp, y Ollama la activa automáticamente cuando está disponible. Para reducir el consumo, nvidia-smi -pl fija un límite de potencia en vatios; como el LLM exige sobre todo recursos de memoria, la pérdida de velocidad es modesta, pero mídela en tu modelo.

Limitar la potencia (se requiere permiso de administrador)
sudo nvidia-smi -pl 300

#5080, 5070 Ti, 4080 Super, 3090: la diferencia medida

Generación relativa por tarjeta (Hardware Corner, 5080 = 100 %)
TarjetaMemoriaGeneración relativa
RTX 409024 GB123 %
RTX 508016 GB100 %
RTX 5070 Ti16 GB91 %
RTX 3090 Ti24 GB89 %
RTX 4080 Super16 GB82 %
RTX 309024 GB81 %

Esta tabla muestra tres cosas. La 5070 Ti, también con 16 GB, alcanza el 91 % de la velocidad de la 5080: en términos de rendimiento puro, la diferencia es pequeña. La 3090, con el 81 %, va casi igual de rápido y cuenta con 24 GB, lo que cambia el catálogo de modelos que puedes ejecutar (Qwen 3.5 27B cabe en ella, pero no en la 5080). Por último, la 4090 es un 23 % más rápida y también ofrece 24 GB. Para un uso exclusivamente con LLM, la cuestión es, por tanto, menos la velocidad que la capacidad.

#Veredicto: cuando la 5080 vale la pena

Qué decisión tomar según tu situación
SituaciónDecisiónRazón respaldada por cifras
Modelos de 8 a 20 mil millones, uso rápido5080 adecuada64 t/s en un 14B, 105,6 t/s en gpt-oss 20B a 128k
Quieres un 27B densoElegir una tarjeta de 24 GBQwen 3.5 27B pesa 17 GB, la 5080 tiene 16 GB
Presupuesto ajustado para 16 GBComparar 5070 Ti y 4080 Super91 % y 82 % de la velocidad de la 5080
Ya tienes una 4080 o 4080 SuperMantenerlaMisma capacidad de 16 GB
Ya tienes una 5070 TiMantenerla91 % de la velocidad de la 5080, misma capacidad

La 5080 es una buena tarjeta de 16 GB cuyo defecto, para los LLM, es no tener más memoria que otras tarjetas más baratas de su gama. Antes de comprar, hazte una sola pregunta: ¿cuál es el modelo denso más grande que quieres ejecutar? Hasta 14 mil millones de parámetros, 16 GB bastan y la velocidad de la 5080 se nota; por encima de ese tamaño, la capacidad prima sobre la velocidad, y una tarjeta de 24 GB de segunda mano permite ejecutar más modelos a una velocidad similar. Para consultar los precios del día, revisa nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana.

#Preguntas frecuentes

FAQ
¿Qué LLM instalar en una RTX 5080?+
Empieza con Qwen3 14B: su archivo Ollama de 9,3 GB deja cerca de 7 GB de margen y genera 80,6 tokens por segundo a 4k según Hardware Corner. Para mayor velocidad, gpt-oss 20B (14 GB) supera los 170 tokens por segundo a 4k. Para uso común, Qwen 3.5 9B (6,6 GB) es el más ligero.
¿Puede la RTX 5080 ejecutar un 70B?+
No. Llama 3.3 70B pesa 43 GB en Q4, casi tres veces los 16 GB de la tarjeta. Si se reparte entre la tarjeta y la memoria RAM, la velocidad de generación cae drásticamente, ya que un modelo denso vuelve a leer todos sus pesos en cada token. Para un 70B, se necesitan dos tarjetas de 24 GB, una 5090 con más memoria o una máquina con memoria unificada.
¿RTX 5080 o RTX 5070 Ti para un LLM local?+
Las dos tienen 16 GB, por lo que permiten usar los mismos modelos. Según Hardware Corner, la 5070 Ti alcanza el 91 % de la velocidad de generación de la 5080. Compara la diferencia de precio: a igual capacidad, una diferencia del 9 % de velocidad rara vez justifica un coste adicional importante. El seguimiento de precios indica los precios actuales.
¿16 GB son suficientes para un LLM en 2026?+
Sí para modelos de 8 a 14 mil millones de parámetros y para gpt-oss 20B, que cubren chat, código ligero y RAG. No para los de 27 a 32 mil millones en Q4, que pesan entre 17 y 20 GB. Los modelos de 24 mil millones (15 GB) caben, pero sin margen para un contexto largo.
¿Qué fuente de alimentación necesita una RTX 5080?+
NVIDIA indica que se requiere una fuente de alimentación de 850 W para el sistema, con una potencia gráfica de 360 W. Son los valores del fabricante para un PC completo. Un límite de potencia reduce el consumo de la tarjeta a costa de una pérdida de velocidad que debes medir con tu modelo, sin cambiar la fuente de alimentación recomendada.
¿La RTX 5080 soporta FP4?+
Sí: según Hardware Corner, admite MXFP4 y NVFP4 por hardware. La mejora se aprecia en gpt-oss 20B, distribuido en MXFP4 y medido a 172 tokens por segundo a 4k. Para los demás modelos, Q4_K_M sigue siendo el formato más común: el FP4 depende de la disponibilidad del archivo convertido.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.