¿Qué LLM en Radeon RX 7900 GRE (16 GB)? ?
La Radeon RX 7900 GRE (16 GB GDDR6, 576 GB/s, 260 W) ejecuta modelos de 20 a 24 mil millones de parámetros en Q4, como la RX 7800 XT, pero sin mejorar la velocidad de generación: las mediciones públicas en Llama 2 7B dan 116 tokens por segundo contra 118 para la 7800 XT bajo Vulkan. Su ventaja está en otro lugar, en la lectura del prompt bajo Vulkan, un poco más rápida (2 336 contra 2 017 tokens por segundo).
La 7900 GRE se parece a una 7800 XT más potente en cálculo pero limitada en memoria, y las mediciones lo demuestran. Esta guía explica lo que permiten sus 16 GB, en qué se diferencia de sus dos vecinas directas, la RX 7800 XT y la RX 9070, y para qué uso vale su precio.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.
¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Lo que hace una RX 7900 GRE en 2026
La RX 7900 GRE carga en Q4 todo lo que pese menos de 15 GB: Gemma 4 12B hasta Q8, gpt-oss 20B y Devstral Small 2 24B con un contexto corto. Su velocidad de generación, limitada por sus 576 GB/s, se sitúa alrededor de 116 tokens por segundo en el modelo de referencia de 7B de los scoreboards bajo Vulkan. Esto es lo que hay que recordar: su número de procesadores de flujo, 5.120 frente a 3.840 de la 7800 XT, acelera la lectura de prompts pero no la generación, ya que no tiene más memoria ni mayor ancho de banda que su vecina. AMD la incluye oficialmente en ROCm y Ollama la soporta bajo Linux y bajo Windows.
- Arquitectura
- RDNA 3, Navi 31 (el chip de la RX 7900 XTX, aquí en una versión reducida), 80 unidades de cómputo y 5 120 procesadores de flujo.
- Memoria
- 16 GB GDDR6 con un bus de 256 bits, es decir, 576 GB/s.
- Consumo
- 260 W de potencia de la tarjeta.
- Disponibilidad
- Reservada inicialmente a China (27 de julio de 2023), comercializada internacionalmente el 27 de febrero de 2024, con un precio de lanzamiento de 549 dólares.
- Precio actual
- Consulta /prix-gpu-ia: el precio cambia cada semana.
#7900 GRE contra 7800 XT: la memoria decide
Las dos tarjetas ofrecen 16 GB. La 7800 XT tiene 624 GB/s de ancho de banda y la 7900 GRE, 576 GB/s, un 8 % menos. Durante la generación, cada token vuelve a leer todos los pesos, por lo que el ancho de banda es el factor determinante: la 7800 XT supera ligeramente a la GRE en la discusión sobre Vulkan de llama.cpp, y de forma más clara con Flash Attention activada. La GRE recupera la ventaja en la lectura del prompt con Vulkan (un 16 % más), donde el cálculo tiene más peso. Con ROCm, las dos series públicas sitúan a la 7800 XT por delante en ambas mediciones.
| Medición | RX 7900 GRE | RX 7800 XT |
|---|---|---|
| Vulkan, lectura pp512, sin FA | 2 336,31 t/s | 2 017,33 t/s |
| Vulkan, generación tg128, sin FA | 116,11 t/s | 118,27 t/s |
| Vulkan, generación tg128, con FA | 110,50 t/s | 124,86 t/s |
| ROCm, lectura pp512, sin FA | 1 456,98 t/s | 2 151,81 t/s |
| ROCm, generación tg128, sin FA | 96,07 t/s | 100,94 t/s |
Estas series proceden de distintos colaboradores, con commits de llama.cpp diferentes: la diferencia da una idea del orden de magnitud, no constituye una comparación de laboratorio. Sin embargo, coinciden en que la GRE no genera más rápido que una 7800 XT. Si las encuentras al mismo precio, elige la 7800 XT para conversar y la GRE para trabajar con prompts largos.
#Lo que cabe en 16 GB de VRAM
Calcula unos 15 GB para el modelo y su caché KV cuando la tarjeta no se encarga de la salida de vídeo a la pantalla. Los pesos en Q4 proceden del catálogo QuelLLM; el contexto se añade a ellos.
| Modelo | Tamaño del modelo | Margen para el contexto | Veredicto |
|---|---|---|---|
| Gemma 4 12B en Q4 | ≈ 7 GB | ≈ 8 GB | Muy cómodo, contexto largo |
| Gemma 4 12B en Q8 | ≈ 13 GB | ≈ 2 GB | Cabe, contexto corto |
| gpt-oss 20B en Q4 | ≈ 13 GB | ≈ 2 GB | Cabe, con un contexto corto a medio |
| Devstral Small 2 24B en Q4 | ≈ 14 GB | ≈ 1 GB | Cabe con poco margen |
| Gemma 4 31B en Q4 | ≈ 18 GB | ninguna | No cabe, se necesitan entre 20 y 24 GB |
El límite de los 16 GB se sitúa, por tanto, entre el 24B, que cabe, y el 31B, que no cabe. Para superar este límite sin pasar a una tarjeta de 24 GB, la RX 7900 XT de 20 GB ofrece un margen intermedio; la guía dedicada detalla lo que aporta. Para todas las tarjetas de 16 GB, independientemente de la marca, la página organizada por VRAM compara los modelos.
- Radeon RX 7900 XT: 20 GB para superar los 24B
- ¿Qué LLM para 16 GB de VRAM, independientemente de la tarjeta gráfica?
#Velocidades medidas y límite de ancho de banda
Ninguna cifra de esta página procede de una medición realizada por el sitio. Los valores provienen de las discusiones públicas del repositorio llama.cpp, todas las cuales utilizan Llama 2 7B en Q4_0 (3,56 GiB) y llama-bench. La lectura del prompt (pp512) mide la velocidad de ingestión de 512 tokens; la generación (tg128) mide la velocidad de escritura. Para la RX 7900 GRE con Vulkan, la discusión indica 116,11 tokens por segundo en generación sin Flash Attention y 110,50 con ella. Con ROCm, indica 96,07.
El límite teórico de velocidad de generación, calculado dividiendo el ancho de banda por el tamaño de los pesos, es aquí de 576 GB/s para 3,82 GB, es decir, aproximadamente 151 tokens por segundo. La tarjeta alcanza el 77 % de ese límite con Vulkan sin Flash Attention. Aplicar este rendimiento a modelos más grandes da un orden de magnitud: no es una medición, y otro controlador u otra versión de llama.cpp lo hará variar.
| Modelo (Q4) | Tamaño del modelo | Límite teórico | Orden de magnitud |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 96 tokens/s | ≈ 72 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 82 tokens/s | ≈ 62 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 64 tokens/s | ≈ 48 tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 41 tokens/s | ≈ 31 tokens/s |
#Lo que cambia en la práctica la lectura del prompt
La lectura del prompt parece abstracta hasta que se convierte en segundos de espera. El cálculo es sencillo: número de tokens del prompt dividido por la velocidad pp512. Supone que la velocidad medida con 512 tokens se mantiene con un prompt más largo, lo cual solo es aproximadamente cierto, ya que la lectura se ralentiza cuando el contexto crece. Los tiempos que se indican a continuación son, por tanto, estimaciones orientativas para un documento de alrededor de 4.000 tokens, es decir, unas diez páginas.
| Tarjeta y backend | Velocidad pp512 | Espera antes de la primera palabra |
|---|---|---|
| RX 7900 GRE, Vulkan | 2 336 t/s | ≈ 1,7 s |
| RX 7800 XT, Vulkan | 2 017 t/s | ≈ 2,0 s |
| RX 7900 GRE, ROCm | 1 457 t/s | ≈ 2,7 s |
| RX 9070, Vulkan | 3 164 t/s | ≈ 1,3 s |
La diferencia entre estas tarjetas se mide, por tanto, en fracciones de segundo en un documento corto. Se vuelve perceptible cuando el prompt alcanza decenas de miles de tokens, como en un repositorio de código completo o un conjunto de PDF, o cuando cada solicitud de un agente relee grandes contextos. Para un uso de bajo volumen, elige la tarjeta según el costo por GB de VRAM, no según este criterio.
#Frente a la RX 9070: misma VRAM, RDNA 4
La RX 9070 es la otra tarjeta de 16 GB de la gama actual. Tiene 640 GB/s de ancho de banda frente a 576 GB/s, un TDP de 220 W frente a 260 W y 3.584 procesadores de flujo. Con Vulkan, genera a 119,71 tokens por segundo y procesa el prompt a 3.164 tokens por segundo: un 35 % más rápida en la lectura del prompt y prácticamente igual en generación. La diferencia práctica está en otros aspectos: ROCm, Ollama y Windows se comportan de forma diferente con estas dos generaciones, como detalla la página de la RX 9070. Un ejemplo concreto: la documentación de Ollama incluye la RX 9070 entre las tarjetas ROCm en Linux, pero no en Windows, donde utiliza Vulkan, mientras que la RX 7900 GRE aparece en las listas de ambos sistemas. Si trabajas en Windows y quieres mantener el uso de ROCm, esto favorece a la GRE; si aceptas Vulkan, la diferencia desaparece.
| Criterio | RX 7900 GRE | RX 9070 |
|---|---|---|
| Ancho de banda | 576 GB/s | 640 GB/s |
| Potencia de la tarjeta | 260 W | 220 W |
| Lectura pp512 | 2 336,31 t/s | 3 164,10 t/s |
| Generación tg128 | 116,11 t/s | 119,71 t/s |
#Puesta en marcha
- 01Elegir el sistemaAMD solo ofrece soporte para las Radeon RX 7000 en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7. En Windows, Ollama utiliza una pila ROCm v7 o HIP7.
- 02Instalar OllamaSe requiere el controlador ROCm v7 bajo Linux. Vulkan, activado por defecto, sirve como alternativa y da buenos resultados en esta tarjeta.
- 03Cargar un modelo que quepaPrueba primero un 12B o un 20B, luego un 24B, con un contexto corto. Verifica con ollama ps que el modelo esté completamente en el GPU.
- 04Comparar los dos backendsEjecuta llama-bench con Vulkan y luego con ROCm, con y sin Flash Attention. En esta tarjeta, Flash Attention ha ralentizado la generación con Vulkan en las mediciones públicas.
#Para qué uso elegir la 7900 GRE
El criterio que la distingue es la relación entre cálculo y memoria: mucha potencia de cálculo para 16 GB y 576 GB/s. Es adecuada cuando el tiempo hasta la primera palabra cuenta tanto como la velocidad de escritura, por ejemplo, un asistente que procesa documentos largos o un flujo RAG cuyo prompt tiene miles de tokens. Para un chat corto, la ventaja desaparece y la 7800 XT, con más ancho de banda, rinde igual o mejor.
| Uso | Tarjeta que conviene priorizar | Razón |
|---|---|---|
| Chat, generación de texto | RX 7800 XT o RX 9070 | Ancho de banda mayor, generación más rápida o igual |
| RAG, documentos largos | RX 9070, luego RX 7900 GRE | Lectura del prompt más rápida |
| Modelos de 30 a 32B | Ninguna de las tres | Se necesitan entre 20 y 24 GB de VRAM |
| Presupuesto ajustado para comprar de segunda mano | La más barata de las tres | El coste por GB de VRAM en /prix-gpu-ia es decisivo |
En resumen para las tres tarjetas de 16 GB: la 7800 XT es la opción sencilla para conversaciones, la 9070 la opción más rápida en lectura y más eficiente, con 220 W, y la 7900 GRE la opción oportunista cuando su precio baja por debajo del de las otras dos. Ninguna desbloquea los modelos de 30 mil millones de parámetros, que requieren más memoria.
#Veredicto 2026
- Una opción adecuada
- Si encuentras la GRE a precio de una 7800 XT o menos, y tus prompts son largos.
- Una opción menos pertinente
- Si cuesta más que una 7800 XT y la usas sobre todo para conversar: pagas por capacidad de cálculo que la generación no utiliza.
- Verificar antes de comprar
- Que el sistema detecte bien 16 GB de VRAM y el modelo correcto de tarjeta, con rocminfo bajo Linux o el gestor de tareas bajo Windows.
- Precios de las tarjetas gráficas para IA local, registrados dos veces por semana
- Documentación de Ollama: tarjetas AMD compatibles
- Compatibilidad de GPU con ROCm, documentación de AMD
- Tabla de puntuaciones Vulkan del repositorio llama.cpp
#Preguntas frecuentes
¿Es la RX 7900 GRE buena para LLM locales?+
¿RX 7900 GRE o RX 7800 XT para IA local?+
¿Qué modelos ejecutar en una RX 7900 GRE de 16 GB?+
¿Funciona la RX 7900 GRE con Ollama?+
¿Vulkan o ROCm en RX 7900 GRE?+
¿Cuándo la RX 7900 GRE se vuelve demasiado limitada?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.