Intermedio 11 minRadeon RX 7000

¿Qué LLM en Radeon RX 7900 GRE (16 GB)? ?

Respuesta directa

La Radeon RX 7900 GRE (16 GB GDDR6, 576 GB/s, 260 W) ejecuta modelos de 20 a 24 mil millones de parámetros en Q4, como la RX 7800 XT, pero sin mejorar la velocidad de generación: las mediciones públicas en Llama 2 7B dan 116 tokens por segundo contra 118 para la 7800 XT bajo Vulkan. Su ventaja está en otro lugar, en la lectura del prompt bajo Vulkan, un poco más rápida (2 336 contra 2 017 tokens por segundo).

La 7900 GRE se parece a una 7800 XT más potente en cálculo pero limitada en memoria, y las mediciones lo demuestran. Esta guía explica lo que permiten sus 16 GB, en qué se diferencia de sus dos vecinas directas, la RX 7800 XT y la RX 9070, y para qué uso vale su precio.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.

¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Lo que hace una RX 7900 GRE en 2026

La RX 7900 GRE carga en Q4 todo lo que pese menos de 15 GB: Gemma 4 12B hasta Q8, gpt-oss 20B y Devstral Small 2 24B con un contexto corto. Su velocidad de generación, limitada por sus 576 GB/s, se sitúa alrededor de 116 tokens por segundo en el modelo de referencia de 7B de los scoreboards bajo Vulkan. Esto es lo que hay que recordar: su número de procesadores de flujo, 5.120 frente a 3.840 de la 7800 XT, acelera la lectura de prompts pero no la generación, ya que no tiene más memoria ni mayor ancho de banda que su vecina. AMD la incluye oficialmente en ROCm y Ollama la soporta bajo Linux y bajo Windows.

Arquitectura
RDNA 3, Navi 31 (el chip de la RX 7900 XTX, aquí en una versión reducida), 80 unidades de cómputo y 5 120 procesadores de flujo.
Memoria
16 GB GDDR6 con un bus de 256 bits, es decir, 576 GB/s.
Consumo
260 W de potencia de la tarjeta.
Disponibilidad
Reservada inicialmente a China (27 de julio de 2023), comercializada internacionalmente el 27 de febrero de 2024, con un precio de lanzamiento de 549 dólares.
Precio actual
Consulta /prix-gpu-ia: el precio cambia cada semana.

#7900 GRE contra 7800 XT: la memoria decide

Las dos tarjetas ofrecen 16 GB. La 7800 XT tiene 624 GB/s de ancho de banda y la 7900 GRE, 576 GB/s, un 8 % menos. Durante la generación, cada token vuelve a leer todos los pesos, por lo que el ancho de banda es el factor determinante: la 7800 XT supera ligeramente a la GRE en la discusión sobre Vulkan de llama.cpp, y de forma más clara con Flash Attention activada. La GRE recupera la ventaja en la lectura del prompt con Vulkan (un 16 % más), donde el cálculo tiene más peso. Con ROCm, las dos series públicas sitúan a la 7800 XT por delante en ambas mediciones.

RX 7900 GRE y RX 7800 XT (Llama 2 7B Q4_0, mediciones públicas de llama.cpp)
MediciónRX 7900 GRERX 7800 XT
Vulkan, lectura pp512, sin FA2 336,31 t/s2 017,33 t/s
Vulkan, generación tg128, sin FA116,11 t/s118,27 t/s
Vulkan, generación tg128, con FA110,50 t/s124,86 t/s
ROCm, lectura pp512, sin FA1 456,98 t/s2 151,81 t/s
ROCm, generación tg128, sin FA96,07 t/s100,94 t/s

Estas series proceden de distintos colaboradores, con commits de llama.cpp diferentes: la diferencia da una idea del orden de magnitud, no constituye una comparación de laboratorio. Sin embargo, coinciden en que la GRE no genera más rápido que una 7800 XT. Si las encuentras al mismo precio, elige la 7800 XT para conversar y la GRE para trabajar con prompts largos.

#Lo que cabe en 16 GB de VRAM

Calcula unos 15 GB para el modelo y su caché KV cuando la tarjeta no se encarga de la salida de vídeo a la pantalla. Los pesos en Q4 proceden del catálogo QuelLLM; el contexto se añade a ellos.

Lo que admite una 7900 GRE (solo los pesos)
ModeloTamaño del modeloMargen para el contextoVeredicto
Gemma 4 12B en Q4≈ 7 GB≈ 8 GBMuy cómodo, contexto largo
Gemma 4 12B en Q8≈ 13 GB≈ 2 GBCabe, contexto corto
gpt-oss 20B en Q4≈ 13 GB≈ 2 GBCabe, con un contexto corto a medio
Devstral Small 2 24B en Q4≈ 14 GB≈ 1 GBCabe con poco margen
Gemma 4 31B en Q4≈ 18 GBningunaNo cabe, se necesitan entre 20 y 24 GB

El límite de los 16 GB se sitúa, por tanto, entre el 24B, que cabe, y el 31B, que no cabe. Para superar este límite sin pasar a una tarjeta de 24 GB, la RX 7900 XT de 20 GB ofrece un margen intermedio; la guía dedicada detalla lo que aporta. Para todas las tarjetas de 16 GB, independientemente de la marca, la página organizada por VRAM compara los modelos.

#Velocidades medidas y límite de ancho de banda

Ninguna cifra de esta página procede de una medición realizada por el sitio. Los valores provienen de las discusiones públicas del repositorio llama.cpp, todas las cuales utilizan Llama 2 7B en Q4_0 (3,56 GiB) y llama-bench. La lectura del prompt (pp512) mide la velocidad de ingestión de 512 tokens; la generación (tg128) mide la velocidad de escritura. Para la RX 7900 GRE con Vulkan, la discusión indica 116,11 tokens por segundo en generación sin Flash Attention y 110,50 con ella. Con ROCm, indica 96,07.

El límite teórico de velocidad de generación, calculado dividiendo el ancho de banda por el tamaño de los pesos, es aquí de 576 GB/s para 3,82 GB, es decir, aproximadamente 151 tokens por segundo. La tarjeta alcanza el 77 % de ese límite con Vulkan sin Flash Attention. Aplicar este rendimiento a modelos más grandes da un orden de magnitud: no es una medición, y otro controlador u otra versión de llama.cpp lo hará variar.

Estimación al 75 % del techo de 576 GB/s (cálculo, no medición)
Modelo (Q4)Tamaño del modeloLímite teóricoOrden de magnitud
Llama 3.1 8B≈ 6 GB≈ 96 tokens/s≈ 72 tokens/s
Gemma 4 12B≈ 7 GB≈ 82 tokens/s≈ 62 tokens/s
Phi-4 14B≈ 9 GB≈ 64 tokens/s≈ 48 tokens/s
Devstral Small 2 24B≈ 14 GB≈ 41 tokens/s≈ 31 tokens/s

#Lo que cambia en la práctica la lectura del prompt

La lectura del prompt parece abstracta hasta que se convierte en segundos de espera. El cálculo es sencillo: número de tokens del prompt dividido por la velocidad pp512. Supone que la velocidad medida con 512 tokens se mantiene con un prompt más largo, lo cual solo es aproximadamente cierto, ya que la lectura se ralentiza cuando el contexto crece. Los tiempos que se indican a continuación son, por tanto, estimaciones orientativas para un documento de alrededor de 4.000 tokens, es decir, unas diez páginas.

Tiempo de ingestión de un prompt de 4.000 tokens (cálculo a partir de las mediciones pp512)
Tarjeta y backendVelocidad pp512Espera antes de la primera palabra
RX 7900 GRE, Vulkan2 336 t/s≈ 1,7 s
RX 7800 XT, Vulkan2 017 t/s≈ 2,0 s
RX 7900 GRE, ROCm1 457 t/s≈ 2,7 s
RX 9070, Vulkan3 164 t/s≈ 1,3 s

La diferencia entre estas tarjetas se mide, por tanto, en fracciones de segundo en un documento corto. Se vuelve perceptible cuando el prompt alcanza decenas de miles de tokens, como en un repositorio de código completo o un conjunto de PDF, o cuando cada solicitud de un agente relee grandes contextos. Para un uso de bajo volumen, elige la tarjeta según el costo por GB de VRAM, no según este criterio.

#Frente a la RX 9070: misma VRAM, RDNA 4

La RX 9070 es la otra tarjeta de 16 GB de la gama actual. Tiene 640 GB/s de ancho de banda frente a 576 GB/s, un TDP de 220 W frente a 260 W y 3.584 procesadores de flujo. Con Vulkan, genera a 119,71 tokens por segundo y procesa el prompt a 3.164 tokens por segundo: un 35 % más rápida en la lectura del prompt y prácticamente igual en generación. La diferencia práctica está en otros aspectos: ROCm, Ollama y Windows se comportan de forma diferente con estas dos generaciones, como detalla la página de la RX 9070. Un ejemplo concreto: la documentación de Ollama incluye la RX 9070 entre las tarjetas ROCm en Linux, pero no en Windows, donde utiliza Vulkan, mientras que la RX 7900 GRE aparece en las listas de ambos sistemas. Si trabajas en Windows y quieres mantener el uso de ROCm, esto favorece a la GRE; si aceptas Vulkan, la diferencia desaparece.

RX 7900 GRE y RX 9070 bajo Vulkan (Llama 2 7B Q4_0, sin FA)
CriterioRX 7900 GRERX 9070
Ancho de banda576 GB/s640 GB/s
Potencia de la tarjeta260 W220 W
Lectura pp5122 336,31 t/s3 164,10 t/s
Generación tg128116,11 t/s119,71 t/s

#Puesta en marcha

  1. 01
    Elegir el sistema
    AMD solo ofrece soporte para las Radeon RX 7000 en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7. En Windows, Ollama utiliza una pila ROCm v7 o HIP7.
  2. 02
    Instalar Ollama
    Se requiere el controlador ROCm v7 bajo Linux. Vulkan, activado por defecto, sirve como alternativa y da buenos resultados en esta tarjeta.
  3. 03
    Cargar un modelo que quepa
    Prueba primero un 12B o un 20B, luego un 24B, con un contexto corto. Verifica con ollama ps que el modelo esté completamente en el GPU.
  4. 04
    Comparar los dos backends
    Ejecuta llama-bench con Vulkan y luego con ROCm, con y sin Flash Attention. En esta tarjeta, Flash Attention ha ralentizado la generación con Vulkan en las mediciones públicas.
Terminal
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Para qué uso elegir la 7900 GRE

El criterio que la distingue es la relación entre cálculo y memoria: mucha potencia de cálculo para 16 GB y 576 GB/s. Es adecuada cuando el tiempo hasta la primera palabra cuenta tanto como la velocidad de escritura, por ejemplo, un asistente que procesa documentos largos o un flujo RAG cuyo prompt tiene miles de tokens. Para un chat corto, la ventaja desaparece y la 7800 XT, con más ancho de banda, rinde igual o mejor.

¿Qué tarjeta AMD de 16 GB para qué uso?
UsoTarjeta que conviene priorizarRazón
Chat, generación de textoRX 7800 XT o RX 9070Ancho de banda mayor, generación más rápida o igual
RAG, documentos largosRX 9070, luego RX 7900 GRELectura del prompt más rápida
Modelos de 30 a 32BNinguna de las tresSe necesitan entre 20 y 24 GB de VRAM
Presupuesto ajustado para comprar de segunda manoLa más barata de las tresEl coste por GB de VRAM en /prix-gpu-ia es decisivo

En resumen para las tres tarjetas de 16 GB: la 7800 XT es la opción sencilla para conversaciones, la 9070 la opción más rápida en lectura y más eficiente, con 220 W, y la 7900 GRE la opción oportunista cuando su precio baja por debajo del de las otras dos. Ninguna desbloquea los modelos de 30 mil millones de parámetros, que requieren más memoria.

#Veredicto 2026

Una opción adecuada
Si encuentras la GRE a precio de una 7800 XT o menos, y tus prompts son largos.
Una opción menos pertinente
Si cuesta más que una 7800 XT y la usas sobre todo para conversar: pagas por capacidad de cálculo que la generación no utiliza.
Verificar antes de comprar
Que el sistema detecte bien 16 GB de VRAM y el modelo correcto de tarjeta, con rocminfo bajo Linux o el gestor de tareas bajo Windows.

#Preguntas frecuentes

FAQ
¿Es la RX 7900 GRE buena para LLM locales?+
Sí: sus 16 GB permiten cargar modelos de 20 a 24 mil millones de parámetros en Q4, y genera aproximadamente 116 tokens por segundo con un 7B en Q4_0 usando Vulkan, según una medición pública. Su ventaja sobre la RX 7800 XT se limita a la lectura del prompt.
¿RX 7900 GRE o RX 7800 XT para IA local?+
La 7800 XT para conversar: tiene 624 GB/s de ancho de banda frente a 576 GB/s y genera un poco más rápido en las mediciones públicas. La 7900 GRE lee el prompt aproximadamente un 16 % más rápido con Vulkan, lo que resulta útil para documentos largos. Al mismo precio, la elección depende de ese uso.
¿Qué modelos ejecutar en una RX 7900 GRE de 16 GB?+
Gemma 4 12B en Q4 o Q8, gpt-oss 20B en Q4 y Devstral Small 2 24B en Q4 caben, con un contexto corto para los dos últimos. Un modelo de 31B como Gemma 4 en Q4, aproximadamente 18 GB, supera los 16 GB de la tarjeta.
¿Funciona la RX 7900 GRE con Ollama?+
Sí, la documentación de Ollama la incluye en su lista para Linux, con el controlador ROCm v7, y para Windows. AMD también la incluye en ROCm, con el identificador de destino gfx1100, pero solo para Ubuntu 24.04.4, 22.04.5, RHEL 10.1 y RHEL 9.7. Vulkan, activado por defecto en Ollama, sigue siendo una alternativa si falla la detección.
¿Vulkan o ROCm en RX 7900 GRE?+
En las discusiones públicas del repositorio llama.cpp, Vulkan genera más rápido que ROCm en esta tarjeta (116 frente a 96 tokens por segundo sin Flash Attention) y también lee el prompt más rápido. Las configuraciones varían de una serie a otra: prueba ambos con tu modelo.
¿Cuándo la RX 7900 GRE se vuelve demasiado limitada?+
En cuanto quieras usar modelos de 30 mil millones de parámetros o más, o un contexto muy largo en un 24B, 16 GB ya no son suficientes. La RX 7900 XT con 20 GB o una tarjeta de 24 GB son entonces las siguientes opciones para dar el salto.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.