Intermedio 11 minRadeon RX 7000

Qué LLM usar en una Radeon RX 7900 XT (20 GB) ?

Respuesta directa

La Radeon RX 7900 XT (20 GB GDDR6, 800 GB/s, 315 W) carga modelos de 24 a 26 mil millones de parámetros en Q4 sin descargar parte del modelo a la RAM del sistema, con un contexto cómodo, y permite incluso ejecutar un 30B a costa de un contexto corto. Es la memoria, no la velocidad, la que la distingue: en Llama 2 7B, las mediciones públicas dan 123 tokens por segundo con Vulkan, apenas más que una RX 7800 XT de 16 GB, y lejos de la RX 7900 XTX.

Veinte gigabytes de VRAM constituyen una capacidad poco habitual en una tarjeta de consumo y cambian lo que se puede ejecutar: es la diferencia entre un 24B con poco margen y un 24B con espacio para el contexto. Esta guía distingue lo que realmente aportan esos 20 GB de lo que permite esperar el ancho de banda de 800 GB/s, con mediciones públicas citadas y correcciones de ideas erróneas sobre esta tarjeta.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.

¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.

#Lo que hace una RX 7900 XT en 2026

La RX 7900 XT sirve a quienes buscan modelos de entre 24 y 26 mil millones de parámetros sin restringir el contexto. Sus 20 GB permiten alojar Devstral Small 2 24B (aproximadamente 14 GB en Q4) con 6 GB de margen, frente a 1 GB en una tarjeta de 16 GB, y el MoE Gemma 4 26B-A4B (aproximadamente 16 GB) con 4 GB de margen. En velocidad, en cambio, decepciona a quienes cuentan con sus 800 GB/s: 123,18 tokens por segundo en el modelo de referencia de 7B bajo Vulkan, frente a 118,27 en una RX 7800 XT cuyo ancho de banda es un 22 % inferior. AMD la incluye oficialmente en ROCm y Ollama es compatible con ella en Linux y Windows.

Arquitectura
RDNA 3, Navi 31 con un GCD y cinco MCD, lanzada el 13 de diciembre de 2022.
Cálculo
5.376 procesadores de flujo, 84 unidades de cálculo.
Memoria
20 GB GDDR6, bus de 320 bits, 800 GB/s
Consumo
315 W de potencia de la tarjeta: comprueba la fuente de alimentación recomendada por el fabricante de tu modelo.
Precio
No se indica aquí: consulta /prix-gpu-ia.

#El presupuesto de memoria de 20 GB

Calcula unos 19 GB para el modelo y su caché KV cuando la tarjeta no se encarga de la pantalla. La tabla resta de este presupuesto el tamaño del modelo en Q4 indicado en el catálogo QuelLLM para mostrar el margen disponible para el contexto. Ese margen es el verdadero criterio: un modelo que «cabe» con 1 GB sobrante se limita a un contexto de unos miles de tokens.

Lo que cabe en una 7900 XT en Q4 (solo los pesos, presupuesto de 19 GB)
ModeloTamaño del modeloMargen para el contextoVeredicto
gpt-oss 20B≈ 13 GB≈ 6 GBMuy cómodo, contexto largo
Devstral Small 2 24B≈ 14 GB≈ 5 GBCómodo, contexto largo posible
Gemma 4 26B-A4B (MoE)≈ 16 GB≈ 3 GBCabe, contexto medio
Granite 4.1 30B≈ 17 GB≈ 2 GBCabe, contexto corto
Gemma 4 31B≈ 18 GB≈ 1 GBMuy justo de memoria, contexto muy corto

El caso de los modelos con expertos merece una observación. Solo una fracción de los parámetros de un MoE trabaja en cada token, lo que hace que la generación sea más rápida que con un modelo denso del mismo tamaño, pero todos los pesos deben caber en memoria. El 26B-A4B es el tipo de modelo en el que 20 GB marcan la diferencia: demasiado grande para 16 GB con contexto, pero cabe cómodamente en 20 GB. Para modelos aún más grandes, como la familia Qwen3.6 35B-A3B, consulta la guía específica en lugar de adivinar: el tamaño exacto depende de la cuantización elegida.

Para convertir el margen en un número de tokens de contexto, hace falta conocer el coste de la caché KV por token, que depende de la arquitectura del modelo: número de capas, cabezas de atención y precisión de la caché. Por tanto, no existe una regla universal en tokens por gigabyte. El método fiable es medir: carga el modelo con un contexto modesto, anota la VRAM ocupada con rocm-smi, aumenta la ventana y repite el proceso. La calculadora de VRAM del sitio automatiza esta estimación para los modelos del catálogo, y la cuantización de la caché KV a 8 bits reduce aproximadamente a la mitad la memoria correspondiente al contexto.

#Velocidades medidas: el ancho de banda no lo es todo

Los números provienen de las discusiones públicas del repositorio llama.cpp, que usan Llama 2 7B en Q4_0 y llama-bench; no son mediciones del sitio. Con Vulkan, la RX 7900 XT lee un prompt de 512 tokens a 2 941,58 tokens por segundo y genera a 123,18. Con Flash Attention, 2 701,13 y 120,62. Con ROCm, la discusión indica 3 098,38 en lectura y 116,15 en generación. Las dos series coinciden: la generación alcanza un máximo de alrededor de 120 tokens por segundo.

El límite teórico derivado del ancho de banda, 800 GB/s divididos entre 3,82 GB de pesos, es de aproximadamente 209 tokens por segundo; la tarjeta solo alcanza el 59 % de ese límite con Vulkan. Es la eficiencia más baja entre las tarjetas AMD de esta serie de mediciones (83 % para una RX 6700 XT, 77 % para una RX 7900 GRE, 72 % para una RX 7800 XT). La explicación probable es que un modelo de 7 mil millones de parámetros es demasiado pequeño para saturar la memoria de un chip grande; cabe esperar una mayor eficiencia con modelos más grandes, pero ninguna medición de estas series lo demuestra, y sería imprudente anunciar tasas de generación para un 24B.

RX 7900 XT con Llama 2 7B Q4_0 (mediciones públicas de llama.cpp)
BackendFlash AttentionLectura pp512Generación tg128
Vulkanno2 941,58 t/s123,18 t/s
Vulkansí2 701,13 t/s120,62 t/s
ROCmno3 098,38 t/s116,15 t/s

Para obtener un orden de magnitud con modelos grandes, una estimación prudente consiste en aplicar la eficiencia medida del 59 % al límite teórico: para un modelo de 24B en Q4 que ocupa 14 GB, dividir 800 entre 14 da un límite de aproximadamente 57 tokens por segundo y, por tanto, unos 34 tokens por segundo al aplicar esa eficiencia. Es un cálculo, no una medición; si la eficiencia es mejor con un modelo grande, la tasa de generación real será mayor.

#Frente a la RX 7900 XTX: la diferencia real es mucho mayor de lo que se dice

A menudo se lee que la 7900 XT es «entre un 10 y un 12 % más lenta» que la 7900 XTX. Las mediciones públicas cuentan otra cosa. Con el modelo de referencia de 7B en Vulkan, la XTX genera 182,63 tokens por segundo, frente a los 123,18 de la XT: un 48 % más. La relación entre el número de procesadores de flujo (6.144 frente a 5.376) no basta para explicarlo; son el ancho de banda y el chip los que amplían la brecha. Lo que la XT mantiene es el precio de entrada: con 20 GB, cubre la mayor parte de los requisitos de los modelos de 24 a 26B.

RX 7900 XT y RX 7900 XTX (Llama 2 7B Q4_0, mediciones públicas)
MediciónRX 7900 XTRX 7900 XTX
VRAM20 GB24 GB
Vulkan, generación tg128123,18 t/s182,63 t/s
Vulkan, lectura pp5122 941,58 t/s3 726,99 t/s

Esta corrección cambia el equilibrio: si la velocidad de generación es importante para ti, la diferencia del 48 % pesa más que los 4 GB adicionales de VRAM, mientras que si lo que buscas es principalmente capacidad para el contexto, la XT ofrece la mayor parte de lo que aporta la XTX para un modelo de 24B. En cambio, con un modelo de 30B o más, los 24 GB de la XTX eliminan la necesidad de hacer concesiones en cuanto al contexto, y ahí es donde se justifica su diferencia de precio.

#Contra la RTX 4070 Ti Super: más memoria, menos velocidad

La RTX 4070 Ti Super ofrece 16 GB, es decir, 4 GB menos. En el modelo de referencia de 7B bajo Vulkan, genera 129,45 tokens por segundo, un 5 % más que la RX 7900 XT, y lee el prompt a 6.099 tokens por segundo, el doble de rápido. Por tanto, la XT no es «más rápida», al contrario de lo que a veces se lee: tiene más memoria. Su argumento es la capacidad, que permite ejecutar modelos de 24 a 26B con contexto.

RX 7900 XT y RTX 4070 Ti Super bajo Vulkan (Llama 2 7B Q4_0, sin FA)
CriterioRX 7900 XTRTX 4070 Ti Super
VRAM20 GB16 GB
Lectura pp5122 941,58 t/s6 099,18 t/s
Generación tg128123,18 t/s129,45 t/s

#Cuando un modelo supera los 20 GB

Un modelo demasiado grande no provoca ningún error: Ollama y llama.cpp colocan el máximo de capas en la tarjeta y dejan el resto al procesador. En llama.cpp, la opción -ngl fija el número de capas enviadas a la GPU, y el valor 100 utilizado en las mediciones anteriores significa «todas». Reducir este valor libera VRAM, a costa de una generación más lenta, ya que cada token debe entonces pasar por la memoria del sistema, mucho más lenta que la GDDR6. La regla práctica: mientras ollama ps muestre 100 % GPU, estás en la zona rápida; en cuanto aparezca un porcentaje correspondiente al procesador, la velocidad disminuye por escalones.

#20 GB, 16 GB o 24 GB: cómo decidir

¿Qué capacidad para qué uso?
Uso previsto16 GB20 GB (RX 7900 XT)24 GB
Chat con un modelo de 8B a 14BSuficienteInútilInútil
Asistente de código 24B, contexto largoApenas tiene espacioCómodoCómodo
MoE de 26B con contexto medioDemasiado ajustadoSuficienteSuficiente
Modelo de 30 a 35B con contexto largoImposibleExactoNecesario

El principio: paga por la capacidad que exige tu modelo más grande, no por la que podrías usar algún día. Si tu objetivo es un 24B con contexto, 20 GB es el primer umbral a partir del cual puedes trabajar cómodamente; más allá, cada gigabyte adicional debe justificarse con un modelo específico.

#Puesta en marcha

  1. 01
    Elegir el sistema
    AMD solo ofrece soporte para las Radeon RX 7000 en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7. En Windows, Ollama utiliza una pila ROCm v7 o HIP7; Vulkan sirve como opción de respaldo.
  2. 02
    Instalar el controlador y Ollama
    En Linux, Ollama requiere el controlador ROCm v7. Instálalo con el utilitario amdgpu-install, luego instala Ollama.
  3. 03
    Cargar un modelo de 24B
    Elige un Devstral Small 2 24B en Q4_K_M, ejecútalo y verifica con ollama ps que ocupe la GPU al 100 %.
  4. 04
    Ajustar el contexto
    Aumenta la ventana de contexto por etapas mientras vigilas el uso de VRAM: el objetivo es mantenerse por debajo de 19 GB en total.
  5. 05
    Comparar Vulkan y ROCm
    Mide con llama-bench en tu modelo. Ambos backends son similares en esta tarjeta según las mediciones públicas.
Terminal
ollama ps
rocm-smi --showmeminfo vram
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Veredicto 2026

Una buena opción
Si quieres ejecutar modelos de 24 a 26B con contexto y el coste por GB de VRAM en /prix-gpu-ia es favorable.
Una opción mediocre
Si tu prioridad es la velocidad: la generación alcanza un límite cercano al de una tarjeta de 16 GB, y la RTX 4070 Ti Super lee los prompts dos veces más rápido.
Una opción insuficiente
Para modelos de 30 a 35B con contexto largo, donde 24 GB se vuelven necesarios.

#Preguntas frecuentes

FAQ
¿Es la RX 7900 XT buena para LLM locales?+
Sí, en cuanto a memoria: 20 GB permiten cargar un modelo de 24B en Q4 con un contexto cómodo, mientras que 16 GB apenas lo permiten. Su velocidad de generación, aproximadamente 123 tokens por segundo en un modelo de 7B en Q4_0 bajo Vulkan, sigue siendo similar a la de una RX 7800 XT.
¿RX 7900 XT o RX 7900 XTX para IA local?+
La XTX aporta 24 GB y una generación 48 % más rápida en el modelo de 7B de referencia bajo Vulkan (182,63 contra 123,18 tokens por segundo). La XT basta para modelos de 24 a 26B y cuesta menos. Compara los precios actuales en la página dedicada del sitio.
¿Son suficientes 20 GB de VRAM para un modelo de 30B?+
Un 30B como Granite 4.1 30B pesa aproximadamente 17 GB en Q4: cabe con un contexto corto y deja alrededor de 2 GB de margen. Para un contexto largo o para modelos de 35B, como Qwen3.6 35B-A3B, se necesitan 24 GB. Consulta la guía dedicada a este modelo.
¿Cuántos tokens por segundo da una RX 7900 XT?+
Con Llama 2 7B en Q4_0, las discusiones públicas del repositorio llama.cpp indican 123,18 tokens por segundo con Vulkan y 116,15 con ROCm durante la generación. Para un 24B en Q4, el cálculo da aproximadamente 34 tokens por segundo: una estimación que debes comprobar en tu equipo.
¿RX 7900 XT o RTX 4070 Ti Super para un LLM?+
La XT por su capacidad (20 GB frente a 16): permite cargar modelos de 24 a 26B con contexto. La RTX 4070 Ti Super genera un 5 % más rápido con el modelo de referencia de 7B y lee los prompts el doble de rápido, con el ecosistema CUDA. La elección depende del modelo que quieras usar.
¿Funciona la RX 7900 XT con Ollama bajo Windows?+
Sí: la documentación de Ollama la incluye en la lista para Windows, con una pila ROCm v7 o HIP7, y para Linux con el controlador ROCm v7. AMD la incluye en ROCm, con el identificador de destino gfx1100, para Ubuntu 24.04.4, 22.04.5, RHEL 10.1 y RHEL 9.7. Vulkan sigue disponible como alternativa.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.