Qué LLM usar en una Radeon RX 7900 XT (20 GB) ?
La Radeon RX 7900 XT (20 GB GDDR6, 800 GB/s, 315 W) carga modelos de 24 a 26 mil millones de parámetros en Q4 sin descargar parte del modelo a la RAM del sistema, con un contexto cómodo, y permite incluso ejecutar un 30B a costa de un contexto corto. Es la memoria, no la velocidad, la que la distingue: en Llama 2 7B, las mediciones públicas dan 123 tokens por segundo con Vulkan, apenas más que una RX 7800 XT de 16 GB, y lejos de la RX 7900 XTX.
Veinte gigabytes de VRAM constituyen una capacidad poco habitual en una tarjeta de consumo y cambian lo que se puede ejecutar: es la diferencia entre un 24B con poco margen y un 24B con espacio para el contexto. Esta guía distingue lo que realmente aportan esos 20 GB de lo que permite esperar el ancho de banda de 800 GB/s, con mediciones públicas citadas y correcciones de ideas erróneas sobre esta tarjeta.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.
¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.
#Lo que hace una RX 7900 XT en 2026
La RX 7900 XT sirve a quienes buscan modelos de entre 24 y 26 mil millones de parámetros sin restringir el contexto. Sus 20 GB permiten alojar Devstral Small 2 24B (aproximadamente 14 GB en Q4) con 6 GB de margen, frente a 1 GB en una tarjeta de 16 GB, y el MoE Gemma 4 26B-A4B (aproximadamente 16 GB) con 4 GB de margen. En velocidad, en cambio, decepciona a quienes cuentan con sus 800 GB/s: 123,18 tokens por segundo en el modelo de referencia de 7B bajo Vulkan, frente a 118,27 en una RX 7800 XT cuyo ancho de banda es un 22 % inferior. AMD la incluye oficialmente en ROCm y Ollama es compatible con ella en Linux y Windows.
- Arquitectura
- RDNA 3, Navi 31 con un GCD y cinco MCD, lanzada el 13 de diciembre de 2022.
- Cálculo
- 5.376 procesadores de flujo, 84 unidades de cálculo.
- Memoria
- 20 GB GDDR6, bus de 320 bits, 800 GB/s
- Consumo
- 315 W de potencia de la tarjeta: comprueba la fuente de alimentación recomendada por el fabricante de tu modelo.
- Precio
- No se indica aquí: consulta /prix-gpu-ia.
#El presupuesto de memoria de 20 GB
Calcula unos 19 GB para el modelo y su caché KV cuando la tarjeta no se encarga de la pantalla. La tabla resta de este presupuesto el tamaño del modelo en Q4 indicado en el catálogo QuelLLM para mostrar el margen disponible para el contexto. Ese margen es el verdadero criterio: un modelo que «cabe» con 1 GB sobrante se limita a un contexto de unos miles de tokens.
| Modelo | Tamaño del modelo | Margen para el contexto | Veredicto |
|---|---|---|---|
| gpt-oss 20B | ≈ 13 GB | ≈ 6 GB | Muy cómodo, contexto largo |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 5 GB | Cómodo, contexto largo posible |
| Gemma 4 26B-A4B (MoE) | ≈ 16 GB | ≈ 3 GB | Cabe, contexto medio |
| Granite 4.1 30B | ≈ 17 GB | ≈ 2 GB | Cabe, contexto corto |
| Gemma 4 31B | ≈ 18 GB | ≈ 1 GB | Muy justo de memoria, contexto muy corto |
El caso de los modelos con expertos merece una observación. Solo una fracción de los parámetros de un MoE trabaja en cada token, lo que hace que la generación sea más rápida que con un modelo denso del mismo tamaño, pero todos los pesos deben caber en memoria. El 26B-A4B es el tipo de modelo en el que 20 GB marcan la diferencia: demasiado grande para 16 GB con contexto, pero cabe cómodamente en 20 GB. Para modelos aún más grandes, como la familia Qwen3.6 35B-A3B, consulta la guía específica en lugar de adivinar: el tamaño exacto depende de la cuantización elegida.
Para convertir el margen en un número de tokens de contexto, hace falta conocer el coste de la caché KV por token, que depende de la arquitectura del modelo: número de capas, cabezas de atención y precisión de la caché. Por tanto, no existe una regla universal en tokens por gigabyte. El método fiable es medir: carga el modelo con un contexto modesto, anota la VRAM ocupada con rocm-smi, aumenta la ventana y repite el proceso. La calculadora de VRAM del sitio automatiza esta estimación para los modelos del catálogo, y la cuantización de la caché KV a 8 bits reduce aproximadamente a la mitad la memoria correspondiente al contexto.
- Qwen3.6 35B-A3B en local: prueba y necesidades de VRAM
- ¿Qué LLM usar con 24 GB de VRAM para modelos de más de 20 GB?
- Cuantizar la caché KV para ahorrar VRAM
#Velocidades medidas: el ancho de banda no lo es todo
Los números provienen de las discusiones públicas del repositorio llama.cpp, que usan Llama 2 7B en Q4_0 y llama-bench; no son mediciones del sitio. Con Vulkan, la RX 7900 XT lee un prompt de 512 tokens a 2 941,58 tokens por segundo y genera a 123,18. Con Flash Attention, 2 701,13 y 120,62. Con ROCm, la discusión indica 3 098,38 en lectura y 116,15 en generación. Las dos series coinciden: la generación alcanza un máximo de alrededor de 120 tokens por segundo.
El límite teórico derivado del ancho de banda, 800 GB/s divididos entre 3,82 GB de pesos, es de aproximadamente 209 tokens por segundo; la tarjeta solo alcanza el 59 % de ese límite con Vulkan. Es la eficiencia más baja entre las tarjetas AMD de esta serie de mediciones (83 % para una RX 6700 XT, 77 % para una RX 7900 GRE, 72 % para una RX 7800 XT). La explicación probable es que un modelo de 7 mil millones de parámetros es demasiado pequeño para saturar la memoria de un chip grande; cabe esperar una mayor eficiencia con modelos más grandes, pero ninguna medición de estas series lo demuestra, y sería imprudente anunciar tasas de generación para un 24B.
| Backend | Flash Attention | Lectura pp512 | Generación tg128 |
|---|---|---|---|
| Vulkan | no | 2 941,58 t/s | 123,18 t/s |
| Vulkan | sí | 2 701,13 t/s | 120,62 t/s |
| ROCm | no | 3 098,38 t/s | 116,15 t/s |
Para obtener un orden de magnitud con modelos grandes, una estimación prudente consiste en aplicar la eficiencia medida del 59 % al límite teórico: para un modelo de 24B en Q4 que ocupa 14 GB, dividir 800 entre 14 da un límite de aproximadamente 57 tokens por segundo y, por tanto, unos 34 tokens por segundo al aplicar esa eficiencia. Es un cálculo, no una medición; si la eficiencia es mejor con un modelo grande, la tasa de generación real será mayor.
#Frente a la RX 7900 XTX: la diferencia real es mucho mayor de lo que se dice
A menudo se lee que la 7900 XT es «entre un 10 y un 12 % más lenta» que la 7900 XTX. Las mediciones públicas cuentan otra cosa. Con el modelo de referencia de 7B en Vulkan, la XTX genera 182,63 tokens por segundo, frente a los 123,18 de la XT: un 48 % más. La relación entre el número de procesadores de flujo (6.144 frente a 5.376) no basta para explicarlo; son el ancho de banda y el chip los que amplían la brecha. Lo que la XT mantiene es el precio de entrada: con 20 GB, cubre la mayor parte de los requisitos de los modelos de 24 a 26B.
| Medición | RX 7900 XT | RX 7900 XTX |
|---|---|---|
| VRAM | 20 GB | 24 GB |
| Vulkan, generación tg128 | 123,18 t/s | 182,63 t/s |
| Vulkan, lectura pp512 | 2 941,58 t/s | 3 726,99 t/s |
Esta corrección cambia el equilibrio: si la velocidad de generación es importante para ti, la diferencia del 48 % pesa más que los 4 GB adicionales de VRAM, mientras que si lo que buscas es principalmente capacidad para el contexto, la XT ofrece la mayor parte de lo que aporta la XTX para un modelo de 24B. En cambio, con un modelo de 30B o más, los 24 GB de la XTX eliminan la necesidad de hacer concesiones en cuanto al contexto, y ahí es donde se justifica su diferencia de precio.
#Contra la RTX 4070 Ti Super: más memoria, menos velocidad
La RTX 4070 Ti Super ofrece 16 GB, es decir, 4 GB menos. En el modelo de referencia de 7B bajo Vulkan, genera 129,45 tokens por segundo, un 5 % más que la RX 7900 XT, y lee el prompt a 6.099 tokens por segundo, el doble de rápido. Por tanto, la XT no es «más rápida», al contrario de lo que a veces se lee: tiene más memoria. Su argumento es la capacidad, que permite ejecutar modelos de 24 a 26B con contexto.
| Criterio | RX 7900 XT | RTX 4070 Ti Super |
|---|---|---|
| VRAM | 20 GB | 16 GB |
| Lectura pp512 | 2 941,58 t/s | 6 099,18 t/s |
| Generación tg128 | 123,18 t/s | 129,45 t/s |
#Cuando un modelo supera los 20 GB
Un modelo demasiado grande no provoca ningún error: Ollama y llama.cpp colocan el máximo de capas en la tarjeta y dejan el resto al procesador. En llama.cpp, la opción -ngl fija el número de capas enviadas a la GPU, y el valor 100 utilizado en las mediciones anteriores significa «todas». Reducir este valor libera VRAM, a costa de una generación más lenta, ya que cada token debe entonces pasar por la memoria del sistema, mucho más lenta que la GDDR6. La regla práctica: mientras ollama ps muestre 100 % GPU, estás en la zona rápida; en cuanto aparezca un porcentaje correspondiente al procesador, la velocidad disminuye por escalones.
#20 GB, 16 GB o 24 GB: cómo decidir
| Uso previsto | 16 GB | 20 GB (RX 7900 XT) | 24 GB |
|---|---|---|---|
| Chat con un modelo de 8B a 14B | Suficiente | Inútil | Inútil |
| Asistente de código 24B, contexto largo | Apenas tiene espacio | Cómodo | Cómodo |
| MoE de 26B con contexto medio | Demasiado ajustado | Suficiente | Suficiente |
| Modelo de 30 a 35B con contexto largo | Imposible | Exacto | Necesario |
El principio: paga por la capacidad que exige tu modelo más grande, no por la que podrías usar algún día. Si tu objetivo es un 24B con contexto, 20 GB es el primer umbral a partir del cual puedes trabajar cómodamente; más allá, cada gigabyte adicional debe justificarse con un modelo específico.
#Puesta en marcha
- 01Elegir el sistemaAMD solo ofrece soporte para las Radeon RX 7000 en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7. En Windows, Ollama utiliza una pila ROCm v7 o HIP7; Vulkan sirve como opción de respaldo.
- 02Instalar el controlador y OllamaEn Linux, Ollama requiere el controlador ROCm v7. Instálalo con el utilitario amdgpu-install, luego instala Ollama.
- 03Cargar un modelo de 24BElige un Devstral Small 2 24B en Q4_K_M, ejecútalo y verifica con ollama ps que ocupe la GPU al 100 %.
- 04Ajustar el contextoAumenta la ventana de contexto por etapas mientras vigilas el uso de VRAM: el objetivo es mantenerse por debajo de 19 GB en total.
- 05Comparar Vulkan y ROCmMide con llama-bench en tu modelo. Ambos backends son similares en esta tarjeta según las mediciones públicas.
#Veredicto 2026
- Una buena opción
- Si quieres ejecutar modelos de 24 a 26B con contexto y el coste por GB de VRAM en /prix-gpu-ia es favorable.
- Una opción mediocre
- Si tu prioridad es la velocidad: la generación alcanza un límite cercano al de una tarjeta de 16 GB, y la RTX 4070 Ti Super lee los prompts dos veces más rápido.
- Una opción insuficiente
- Para modelos de 30 a 35B con contexto largo, donde 24 GB se vuelven necesarios.
- Precios de las tarjetas gráficas para IA local, registrados dos veces por semana
- Documentación de Ollama: tarjetas AMD compatibles
- Compatibilidad de GPU con ROCm, documentación de AMD
- Tabla de puntuaciones Vulkan del repositorio llama.cpp
#Preguntas frecuentes
¿Es la RX 7900 XT buena para LLM locales?+
¿RX 7900 XT o RX 7900 XTX para IA local?+
¿Son suficientes 20 GB de VRAM para un modelo de 30B?+
¿Cuántos tokens por segundo da una RX 7900 XT?+
¿RX 7900 XT o RTX 4070 Ti Super para un LLM?+
¿Funciona la RX 7900 XT con Ollama bajo Windows?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.