¿Qué LLM en RTX 5080 (16 GB)? ?
Una RTX 5080 ofrece 16 GB de VRAM GDDR7 y 960 GB/s de ancho de banda: mantiene en VRAM modelos de hasta 14 mil millones de parámetros (Qwen3 14B, 9,3 GB) y gpt-oss 20B (14 GB), a 64 tokens por segundo en un 14B con 16k de contexto según Hardware Corner. Un 27B denso (17 GB) y un 70B no caben.
La RTX 5080 genera rápido, pero con 16 GB comparte el límite de memoria de tarjetas más baratas. Esta guía muestra los modelos que realmente caben en memoria, con su tamaño exacto, velocidades medidas por Hardware Corner, el presupuesto de contexto y la diferencia real con la 5070 Ti, la 4080 Super y la 3090. También sabrás cuándo pasar a una tarjeta de 24 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para esta configuración: RTX 5080 16 GB.
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 5080 para un LLM local: lo que permiten 16 GB
Para un LLM local, una RTX 5080 destaca por sus 16 GB de GDDR7 y sus 960 GB/s de ancho de banda: genera rápido, pero su capacidad limita los modelos. Según la biblioteca de Ollama, Qwen3 14B (9,3 GB) y gpt-oss 20B (14 GB) caben completamente en VRAM, mientras que Qwen 3.5 27B (17 GB) y Qwen3 30B (19 GB) superan la capacidad de la tarjeta. Hardware Corner mide 64 tokens por segundo en Qwen3 14B con 16.000 tokens de contexto y 105,6 en gpt-oss 20B con 128.000 tokens. Por tanto, es muy adecuada para modelos de 8 a 20 mil millones de parámetros, pero no para un modelo denso de 27B.
- Memoria
- 16 GB de GDDR7 en un bus de 256 bits, según NVIDIA; 960 GB/s de ancho de banda a 30 Gbit/s, según Hardware Corner.
- Cálculo
- 10 752 núcleos CUDA y Tensor Cores de 5.ª generación, según NVIDIA.
- Consumo
- 360 W de potencia gráfica, 850 W de alimentación del sistema requerida y 88 °C de temperatura máxima, según NVIDIA
#Los modelos que caben en 16 GB
Los tamaños corresponden a los archivos de la biblioteca Ollama, consultados el 29 de septiembre de 2026. El margen es lo que queda de los 16 GB antes de tener en cuenta el contexto, la caché y los búferes del motor.
| Modelo | Archivo Ollama | Margen bruto | Veredicto |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 10,7 GB | Muy cómodo |
| Qwen 3.5 9B | 6,6 GB | 9,4 GB | Muy cómodo, texto e imagen |
| Gemma 4 12B | 7,6 GB | 8,4 GB | Cómodo |
| Qwen3 14B | 9,3 GB | 6,7 GB | Cómodo, contexto de 32k posible |
| gpt-oss 20B | 14 GB | 2 GB | Cabe; permite un contexto largo en MXFP4 |
| Devstral Small 2 24B / Mistral Small 3.2 24B | 15 GB | 1 GB | Margen demasiado bajo para un contexto útil |
| Qwen 3.5 27B | 17 GB | Falta 1 GB | No cabe |
| Qwen3 30B | 19 GB | Faltan 3 GB | No cabe |
El modelo de 14 mil millones en Q4 es el modelo denso más grande que funciona con holgura: deja cerca de 7 GB para el contexto. Los modelos de 24 mil millones solo dejan un GB y exceden la memoria de la tarjeta en cuanto crece el contexto: la tarjeta es adecuada para un 24B mientras la conversación sea corta, pero no para un agente. El caso de gpt-oss 20B es distinto: según Ollama, los pesos de los expertos están cuantizados en MXFP4 con 4,25 bits por parámetro, lo que le permite ejecutarse con 16 GB de memoria, y Hardware Corner lo ha medido con hasta 128k de contexto en esta tarjeta.
Un RAG local agrega un modelo de embeddings: bge-m3 pesa 1,2 GB en Ollama, lo que suma 7,8 GB en total con Qwen 3.5 9B y 8,8 GB con Gemma 4 12B. Quedan más de 7 GB para el contexto y la base de fragmentos insertados. Un agente de código, por su parte, exige un contexto de al menos 64.000 tokens según la documentación de Ollama: con 16 GB, obliga a bajar a un modelo de entre 8 y 14 mil millones de parámetros y a cuantizar la caché, en lugar de optar por un 24B.
#Rendimiento medido: velocidad y límite del ancho de banda
Los números provienen de Hardware Corner, que realiza pruebas con llama.cpp usando contextos de 4k a 128k. No son mediciones de QuelLLM.
| Modelo (Q4_K, o MXFP4 para gpt-oss) | Contexto 4k | Contexto 32k | Contexto 128k | Lectura del prompt de 4k |
|---|---|---|---|---|
| Qwen3 8B | 129,1 | 72,5 | no medido | 6 410,1 |
| Qwen3 14B | 80,6 | 51,9 | no medido | 3 820,5 |
| gpt-oss 20B (MXFP4) | 172,4 | 149,3 | 105,6 | 9 146,1 |
La generación está limitada por el ancho de banda: el máximo teórico equivale aproximadamente al ancho de banda dividido por el tamaño del modelo. Para Qwen3 14B (9,3 GB), 960 ÷ 9,3 da 103 tokens por segundo y la medición a 4k, de 80,6, alcanza el 78 % de ese máximo. gpt-oss 20B supera su máximo aparente (960 ÷ 14 = 69) con 172 tokens por segundo, porque un modelo de expertos solo lee una parte de sus pesos en cada token: el máximo se calcula a partir de los pesos activos, no del archivo completo.
El contexto afecta la velocidad. Qwen3 14B pasa de 80,6 a 51,9 tokens por segundo entre 4k y 32k (-36 %), mientras que gpt-oss 20B solo pierde un 13 % entre los mismos límites (172,4 a 149,3). Si trabajas con documentos largos, la elección del modelo importa más que la tarjeta.
#Contexto y caché KV: el verdadero límite de los 16 GB
Ollama ajusta el contexto predeterminado según la memoria de vídeo: su documentación indica 4k tokens con menos de 24 GiB de VRAM y recomienda al menos 64 000 tokens para agentes, búsqueda web y herramientas de código. Una RTX 5080 recibe, por tanto, 4k de forma predeterminada: un agente iniciado con los ajustes predeterminados pierde su historial rápidamente. Aumentar el contexto consume VRAM en forma de caché KV, y ese consumo debe salir del margen disponible indicado en la tabla anterior.
La principal medida es la cuantización de la caché: según las preguntas frecuentes de Ollama, q8_0 utiliza aproximadamente la mitad de la memoria que f16, con una pérdida de precisión muy pequeña, y requiere Flash Attention, que Ollama activa automáticamente cuando la tarjeta y el modelo son compatibles con ella. Con 16 GB, el orden de prioridad es sencillo: elegir un modelo que deje al menos entre 5 y 6 GB de margen, después cuantizar la caché y, por último, aumentar el contexto por etapas comprobando ollama ps.
#Instalar Ollama en una RTX 5080
- 01Verificar el controladorEjecuta nvidia-smi en un terminal: el controlador debe ser de la versión 550 o superior (551.61 en Windows) y la memoria total indicada debe ser de aproximadamente 16 GB.
- 02Instalar OllamaInstala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
- 03Ejecutar un modeloEjecuta ollama run qwen3:14b: la descarga de 9,3 GB se realiza una vez. Para un modelo más rápido, prueba ollama run gpt-oss:20b (14 GB).
- 04Controlar la distribuciónEn un segundo terminal, ejecuta ollama ps: la columna Procesador debe mostrar 100 % GPU. Un reparto entre CPU y GPU significa que el modelo o el contexto excede la memoria de la GPU.
- 05Ajustar el contextoFija el contexto con OLLAMA_CONTEXT_LENGTH y luego vuelve a ejecutar ollama ps. Si no hay suficiente margen, establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar.
#Blackwell: MXFP4, NVFP4 y límite de potencia
La 5080 acelera por hardware los formatos de punto flotante de 4 bits: Hardware Corner indica que admite MXFP4 y NVFP4, y la mejora se aprecia en gpt-oss 20B, cuyos pesos se distribuyen en MXFP4. NVIDIA describe NVFP4 como un formato de punto flotante de 4 bits introducido con Blackwell. La compatibilidad de las herramientas (llama.cpp, Ollama, vLLM) con NVFP4 evoluciona rápidamente: comprueba la versión instalada y la ficha del modelo, y mantén Q4_K_M como opción fiable.
Flash Attention 3 está reservado para Hopper (H100) según el repositorio oficial de Flash Attention: en una 5080, se usa la versión 2 o la implementación de Ollama y de llama.cpp, y Ollama la activa automáticamente cuando está disponible. Para reducir el consumo, nvidia-smi -pl fija un límite de potencia en vatios; como el LLM exige sobre todo recursos de memoria, la pérdida de velocidad es modesta, pero mídela en tu modelo.
#5080, 5070 Ti, 4080 Super, 3090: la diferencia medida
| Tarjeta | Memoria | Generación relativa |
|---|---|---|
| RTX 4090 | 24 GB | 123 % |
| RTX 5080 | 16 GB | 100 % |
| RTX 5070 Ti | 16 GB | 91 % |
| RTX 3090 Ti | 24 GB | 89 % |
| RTX 4080 Super | 16 GB | 82 % |
| RTX 3090 | 24 GB | 81 % |
Esta tabla muestra tres cosas. La 5070 Ti, también con 16 GB, alcanza el 91 % de la velocidad de la 5080: en términos de rendimiento puro, la diferencia es pequeña. La 3090, con el 81 %, va casi igual de rápido y cuenta con 24 GB, lo que cambia el catálogo de modelos que puedes ejecutar (Qwen 3.5 27B cabe en ella, pero no en la 5080). Por último, la 4090 es un 23 % más rápida y también ofrece 24 GB. Para un uso exclusivamente con LLM, la cuestión es, por tanto, menos la velocidad que la capacidad.
#Veredicto: cuando la 5080 vale la pena
| Situación | Decisión | Razón respaldada por cifras |
|---|---|---|
| Modelos de 8 a 20 mil millones, uso rápido | 5080 adecuada | 64 t/s en un 14B, 105,6 t/s en gpt-oss 20B a 128k |
| Quieres un 27B denso | Elegir una tarjeta de 24 GB | Qwen 3.5 27B pesa 17 GB, la 5080 tiene 16 GB |
| Presupuesto ajustado para 16 GB | Comparar 5070 Ti y 4080 Super | 91 % y 82 % de la velocidad de la 5080 |
| Ya tienes una 4080 o 4080 Super | Mantenerla | Misma capacidad de 16 GB |
| Ya tienes una 5070 Ti | Mantenerla | 91 % de la velocidad de la 5080, misma capacidad |
La 5080 es una buena tarjeta de 16 GB cuyo defecto, para los LLM, es no tener más memoria que otras tarjetas más baratas de su gama. Antes de comprar, hazte una sola pregunta: ¿cuál es el modelo denso más grande que quieres ejecutar? Hasta 14 mil millones de parámetros, 16 GB bastan y la velocidad de la 5080 se nota; por encima de ese tamaño, la capacidad prima sobre la velocidad, y una tarjeta de 24 GB de segunda mano permite ejecutar más modelos a una velocidad similar. Para consultar los precios del día, revisa nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana.
- Fuente: NVIDIA, especificaciones de la RTX 5080
- Fuente: Hardware Corner, benchmarks de LLM en RTX 5080
- Fuente: Ollama, página del modelo gpt-oss
- Fuente: documentación de Ollama, longitud de contexto
- Fuente: repositorio oficial de Flash Attention
#Preguntas frecuentes
¿Qué LLM instalar en una RTX 5080?+
¿Puede la RTX 5080 ejecutar un 70B?+
¿RTX 5080 o RTX 5070 Ti para un LLM local?+
¿16 GB son suficientes para un LLM en 2026?+
¿Qué fuente de alimentación necesita una RTX 5080?+
¿La RTX 5080 soporta FP4?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.