Qué LLM en Radeon RX 7900 XTX (24 GB) ?
La RX 7900 XTX (24 GB GDDR6, hasta 960 GB/s según AMD) es una muy buena tarjeta para ejecutar LLM en local con Ollama o llama.cpp: puede alojar cualquier modelo cuyos pesos ocupen menos de unos 20 GB en Q4, como un modelo denso de 27B o un MoE de 30-35B. Es compatible con ROCm 7; si el modelo supera los 24 GB, parte de él pasa a la RAM.
La 7900 XTX data de 2022, pero sus 24 GB siguen haciendo de ella una tarjeta de referencia entre las de AMD. Esta guía explica qué modelos puede ejecutar, con qué software, a qué velocidad según los benchmarks públicos y cuándo es preferible una RTX o una tarjeta más reciente.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.
¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RX 7900 XTX para los LLM: lo que cambia con 24 GB
La Radeon RX 7900 XTX ejecuta un LLM local sin problemas siempre que el modelo quepa en sus 24 GB de VRAM: un modelo de 7B a 9B en Q4 cabe con mucha holgura, un 27B en Q4 (unos 16 GB de pesos) deja espacio para el contexto, y un modelo MoE de 30 a 35 mil millones de parámetros, de los cuales 3 mil millones están activos, todavía cabe, aunque por muy poco. Hay dos condiciones: usar Ollama, LM Studio o llama.cpp, todos compatibles con sus controladores, y mantenerse por debajo de los 24 GB, porque, al superar ese límite, parte del modelo pasa a la RAM y la velocidad cae en picado. Es la tarjeta con más VRAM de la gama AMD RDNA 3 para el público general.
El fabricante proporciona las cifras que importan para la IA local: 24 GB de GDDR6 y un ancho de banda de memoria que puede alcanzar 960 GB/s. El ancho de banda es el dato más útil aquí, porque la generación de texto lee en cada token la mayor parte de los pesos del modelo: cuanto mayor es, más alto es el límite de tokens por segundo.
| Característica | Valor |
|---|---|
| Memoria | 24 GB GDDR6 |
| Ancho de banda | hasta 960 GB/s |
| Procesadores de flujo / unidades de cálculo | 6 144 / 96 |
| Aceleradores de IA | 192 |
| Potencia típica de la tarjeta | 355 W |
| Fuente de alimentación mínima recomendada | 800 W |
| Formatos matriciales listados | FP16 (123 TFLOPs), INT8, INT4; sin FP8 |
#Controladores y software: lo que es compatible en 2026
Para una tarjeta AMD, lo primero que hay que considerar es la pila de software. La 7900 XTX figura en la matriz de compatibilidad con ROCm de la documentación Radeon de AMD, en su versión 7.2.1, para Ubuntu 22.04, 24.04 y 25.10. Por su parte, Ollama indica que requiere el controlador AMD ROCm v7 en Linux e incluye la 7900 XTX en sus listas tanto para Linux como para Windows. Esto tiene dos consecuencias prácticas: en Linux, la instalación se realiza mediante la utilidad amdgpu-install; en Windows, la tarjeta se reconoce sin necesidad de realizar ajustes especiales.
Si ROCm te causa problemas, existe una segunda vía. Ollama especifica que la compatibilidad con GPU adicionales en Windows y Linux se ofrece a través de Vulkan, activado por defecto cuando el backend está instalado. Vulkan también es el backend alternativo de llama.cpp: la guía de llama.cpp con Vulkan explica la compilación. Para vLLM, la documentación actual enumera las Radeon RX 7900 (gfx1100 y gfx1101) con ROCm 6.3 o superior y ofrece paquetes precompilados para ROCm 7.0 y 7.2.1 con Python 3.12.
#Instalar Ollama en una 7900 XTX (Linux)
- 01Instalar el controlador ROCmSigue la documentación de ROCm de AMD y utiliza la herramienta amdgpu-install, como exige Ollama; después, añade tu usuario a los grupos render y video y reinicia.
- 02Verificar que la tarjeta sea detectadaEjecuta rocminfo y luego rocm-smi: la 7900 XTX debe aparecer con 24 GB. Si no aparece nada, Ollama recurrirá al procesador.
- 03Instalar OllamaUsa el script oficial o la guía de instalación de Ollama en Linux, luego descarga un modelo que quepa en 24 GB.
- 04Comprobar dónde se ejecuta el modeloDespués de una primera respuesta, ollama ps indica la parte del modelo cargada en la GPU. Debe mostrar 100 % GPU; de lo contrario, el modelo o el contexto es demasiado grande.
#¿Qué modelos caben en 24 GB y a qué velocidad?
La lista completa de modelos por nivel de memoria se encuentra en la guía «¿Qué LLM para 24 GB de VRAM?»; aquí tienes lo esencial para esta tarjeta. Los pesos que se indican a continuación provienen del catálogo QuelLLM, en Q4, sin incluir la memoria del contexto. El límite teórico es el ancho de banda dividido por los pesos leídos en cada token: no puede superarse y no se alcanza en la práctica.
| Modelo | Pesos Q4 | Margen disponible con 24 GB | Límite teórico |
|---|---|---|---|
| Qwen 3.5 9B | 6 GB | 18 GB | 160 tokens/s |
| gpt-oss 20B (MoE) | 13 GB | 11 GB | depende de los pesos activos |
| Devstral Small 2 24B | 14 GB | 10 GB | ≈ 68 tokens/s |
| Qwen 3.8 27B | 16 GB | 8 GB | 60 tokens/s |
| Granite 4.1 30B | 17 GB | 7 GB | ≈ 56 tokens/s |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 5 GB | depende de los pesos activos |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 3 GB | depende de los pesos activos |
Dos lecturas de esta tabla. En primer lugar, el margen: de los 24 GB, un modelo de 21 GB deja solo 3 GB para la caché KV y el sistema, lo que implica un contexto corto. El Qwen 3.8 27B, con 8 GB de margen, ofrece más holgura para un contexto largo. En segundo lugar, los MoE: un modelo 35B-A3B solo lee sus 3 mil millones de parámetros activos en cada token, por lo que genera mucho más rápido que un modelo denso de 27 mil millones, pero aun así debe caber íntegramente en la VRAM.
#Lo que miden los benchmarks públicos en esta tarjeta
La tabla de referencia de la comunidad llama.cpp mide, en ROCm y con el mismo modelo (Llama 2 7B en Q4_0), la velocidad de lectura del prompt (pp512) y la de generación (tg128). En la 7900 XTX, un participante registra 3552 tokens/s en procesamiento del prompt y 167 tokens/s en generación sin Flash Attention, y después 3874 y 170 con Flash Attention. El autor de la tabla advierte que los resultados varían según el controlador, el sistema y el fabricante de la tarjeta, incluso con el mismo chip.
| Tarjeta | Ancho de banda AMD | Prompt pp512 | Generación tg128 |
|---|---|---|---|
| RX 7900 XTX | 960 GB/s | 3 552 t/s | 167 t/s |
| RX 9070 XT | 640 GB/s | 5 055 t/s | 101 t/s |
| RX 9060 XT | 320 GB/s | 1 420 t/s | 68 t/s |
Esta tabla muestra dos cosas. La generación depende del ancho de banda: la 7900 XTX (960 GB/s) genera aproximadamente 1,65 veces más rápido que la 9070 XT (640 GB/s) y 2,5 veces más rápido que la 9060 XT (320 GB/s). En cambio, la lectura del prompt depende más de la potencia de cálculo matricial, y la 9070 XT, de una generación más reciente, supera a la 7900 XTX en este aspecto. Para un uso de chat con respuestas largas, el ancho de banda y los 24 GB tienen prioridad; para RAG con documentos grandes de entrada, la velocidad de lectura del prompt importa más.
#70B, 30B MoE y dos tarjetas: hasta dónde ir
Los pesos de un modelo denso de 70B en Q4 ocupan unos 40 GB según la referencia del sitio, casi el doble de la VRAM: habría que colocar más de 16 GB en la RAM, y la velocidad estaría entonces limitada por la RAM y el bus PCIe, no por la tarjeta. No damos una cifra de rendimiento para este caso porque no disponemos de una fuente verificable; quédate solo con que resulta poco cómodo. Los MoE de 30 a 35 mil millones de parámetros son, con la misma calidad general, la solución práctica a este límite de 24 GB.
Dos 7900 XTX cambian la situación en cuanto a capacidad. En llama.cpp, el modo de distribución predeterminado reparte las capas del modelo entre las tarjetas, con un funcionamiento en pipeline, y una opción permite elegir las proporciones por tarjeta. Así sumas 48 GB, suficientes para un 70B en Q4 con algo de contexto. La ventaja está en lo que cabe en memoria, no en la velocidad por token: cada token pasa por las dos tarjetas una tras otra. En cuanto al hardware, dos tarjetas de 355 W suman 710 W sin contar el resto del PC, lo que exige una fuente de alimentación con capacidad suficiente, dos ranuras PCIe adecuadas y una caja ventilada.
#Contexto y caché KV: la verdadera limitación de los 24 GB
El peso de un modelo es solo una parte de la memoria utilizada: la caché KV crece con la longitud del contexto. Ollama utiliza por defecto una ventana de contexto de 4.096 tokens según su documentación, modificable con la variable OLLAMA_CONTEXT_LENGTH; los modelos recientes anuncian entre 128.000 y 262.000 tokens, pero utilizar esas ventanas de contexto requiere memoria adicional. Dos ajustes: activar Flash Attention, que Ollama emplea automáticamente cuando el backend y la tarjeta lo permiten, y cuantizar la caché KV con OLLAMA_KV_CACHE_TYPE (f16 por defecto, q8_0 para reducir la memoria). La guía sobre la cuantización de la caché KV detalla estos ajustes.
#7900 XTX, RTX 3090 o 4090: cómo decidir
Sobre el papel, la RTX 3090 también ofrece 24 GB de memoria GDDR6X según NVIDIA. Por tanto, la elección depende de la pila de software, el entorno y el precio del momento, que no fijamos aquí: consulta el seguimiento de precios de tarjetas para IA local antes de comprar.
| Tu situación | Tarjeta que conviene priorizar | Por qué |
|---|---|---|
| Linux, Ollama o llama.cpp, presupuesto ajustado | RX 7900 XTX | Soporte de 24 GB con ROCm 7 y Vulkan |
| Windows, herramientas que requieren CUDA (algunos proyectos de fine-tuning) | RTX 3090 o 4090 | CUDA sigue siendo el objetivo predeterminado de la mayoría de los proyectos |
| Quieres vLLM en producción | Verifica tu modelo | vLLM lista los 7900 con ROCm; el soporte depende de la versión |
| Contexto largo y grandes MoE | Todas las tarjetas de 24 GB | La VRAM tiene prioridad sobre la marca |
| Se necesitan más de 24 GB | RTX 5090 (32 GB) o dos tarjetas | Ninguna tarjeta de 24 GB puede alojar un 70B en Q4 |
Si dudas entre tarjeta nueva y usada, recuerda que la 7900 XTX data de diciembre de 2022: a menudo la garantía del fabricante ya ha expirado en tarjetas usadas, y una tarjeta que haya minado o estado en uso continuo merece un control de temperaturas antes de comprarla.
- ¿Qué LLM para 24 GB de VRAM? La lista completa de modelos
- Ollama con GPU AMD (ROCm): configuración detallada
- LLM en RX 7900 XT (20 GB)
- LLM en RTX 3090 (24 GB)
- Cuantizar la caché KV para ahorrar VRAM
- Precios de las tarjetas gráficas para IA local
- Fuente: ficha de AMD de la Radeon RX 7900 XTX
- Fuente: documentación GPU de Ollama
- Fuente: tabla de rendimiento de llama.cpp en ROCm
- Fuente: instalación de vLLM en GPU
#Preguntas frecuentes
¿La RX 7900 XTX es adecuada para LLM en local?+
¿Qué modelo elegir en una RX 7900 XTX?+
¿Se pueden usar dos RX 7900 XTX juntas?+
¿La RX 7900 XTX maneja el FP8?+
¿ROCm o Vulkan en una RX 7900 XTX?+
¿Funciona la 7900 XTX con vLLM?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.