Intermedio 11 minRadeon RX 7000

Qué LLM en Radeon RX 7900 XTX (24 GB) ?

Respuesta directa

La RX 7900 XTX (24 GB GDDR6, hasta 960 GB/s según AMD) es una muy buena tarjeta para ejecutar LLM en local con Ollama o llama.cpp: puede alojar cualquier modelo cuyos pesos ocupen menos de unos 20 GB en Q4, como un modelo denso de 27B o un MoE de 30-35B. Es compatible con ROCm 7; si el modelo supera los 24 GB, parte de él pasa a la RAM.

La 7900 XTX data de 2022, pero sus 24 GB siguen haciendo de ella una tarjeta de referencia entre las de AMD. Esta guía explica qué modelos puede ejecutar, con qué software, a qué velocidad según los benchmarks públicos y cuándo es preferible una RTX o una tarjeta más reciente.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.

¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RX 7900 XTX para los LLM: lo que cambia con 24 GB

La Radeon RX 7900 XTX ejecuta un LLM local sin problemas siempre que el modelo quepa en sus 24 GB de VRAM: un modelo de 7B a 9B en Q4 cabe con mucha holgura, un 27B en Q4 (unos 16 GB de pesos) deja espacio para el contexto, y un modelo MoE de 30 a 35 mil millones de parámetros, de los cuales 3 mil millones están activos, todavía cabe, aunque por muy poco. Hay dos condiciones: usar Ollama, LM Studio o llama.cpp, todos compatibles con sus controladores, y mantenerse por debajo de los 24 GB, porque, al superar ese límite, parte del modelo pasa a la RAM y la velocidad cae en picado. Es la tarjeta con más VRAM de la gama AMD RDNA 3 para el público general.

El fabricante proporciona las cifras que importan para la IA local: 24 GB de GDDR6 y un ancho de banda de memoria que puede alcanzar 960 GB/s. El ancho de banda es el dato más útil aquí, porque la generación de texto lee en cada token la mayor parte de los pesos del modelo: cuanto mayor es, más alto es el límite de tokens por segundo.

Ficha técnica de la RX 7900 XTX (fuente: AMD)
CaracterísticaValor
Memoria24 GB GDDR6
Ancho de bandahasta 960 GB/s
Procesadores de flujo / unidades de cálculo6 144 / 96
Aceleradores de IA192
Potencia típica de la tarjeta355 W
Fuente de alimentación mínima recomendada800 W
Formatos matriciales listadosFP16 (123 TFLOPs), INT8, INT4; sin FP8
i
Alimentación: 800 W, no 850 W
AMD indica 800 W como potencia mínima recomendada de la fuente de alimentación para esta tarjeta. Algunos fabricantes de tarjetas asociados recomiendan más: sigue la ficha del modelo exacto que compres y deja un margen si el procesador consume mucha energía.

#Controladores y software: lo que es compatible en 2026

Para una tarjeta AMD, lo primero que hay que considerar es la pila de software. La 7900 XTX figura en la matriz de compatibilidad con ROCm de la documentación Radeon de AMD, en su versión 7.2.1, para Ubuntu 22.04, 24.04 y 25.10. Por su parte, Ollama indica que requiere el controlador AMD ROCm v7 en Linux e incluye la 7900 XTX en sus listas tanto para Linux como para Windows. Esto tiene dos consecuencias prácticas: en Linux, la instalación se realiza mediante la utilidad amdgpu-install; en Windows, la tarjeta se reconoce sin necesidad de realizar ajustes especiales.

Si ROCm te causa problemas, existe una segunda vía. Ollama especifica que la compatibilidad con GPU adicionales en Windows y Linux se ofrece a través de Vulkan, activado por defecto cuando el backend está instalado. Vulkan también es el backend alternativo de llama.cpp: la guía de llama.cpp con Vulkan explica la compilación. Para vLLM, la documentación actual enumera las Radeon RX 7900 (gfx1100 y gfx1101) con ROCm 6.3 o superior y ofrece paquetes precompilados para ROCm 7.0 y 7.2.1 con Python 3.12.

#Instalar Ollama en una 7900 XTX (Linux)

  1. 01
    Instalar el controlador ROCm
    Sigue la documentación de ROCm de AMD y utiliza la herramienta amdgpu-install, como exige Ollama; después, añade tu usuario a los grupos render y video y reinicia.
  2. 02
    Verificar que la tarjeta sea detectada
    Ejecuta rocminfo y luego rocm-smi: la 7900 XTX debe aparecer con 24 GB. Si no aparece nada, Ollama recurrirá al procesador.
  3. 03
    Instalar Ollama
    Usa el script oficial o la guía de instalación de Ollama en Linux, luego descarga un modelo que quepa en 24 GB.
  4. 04
    Comprobar dónde se ejecuta el modelo
    Después de una primera respuesta, ollama ps indica la parte del modelo cargada en la GPU. Debe mostrar 100 % GPU; de lo contrario, el modelo o el contexto es demasiado grande.
Verificaciones
rocminfo | head -30
rocm-smi
ollama run gpt-oss:20b
ollama ps

#¿Qué modelos caben en 24 GB y a qué velocidad?

La lista completa de modelos por nivel de memoria se encuentra en la guía «¿Qué LLM para 24 GB de VRAM?»; aquí tienes lo esencial para esta tarjeta. Los pesos que se indican a continuación provienen del catálogo QuelLLM, en Q4, sin incluir la memoria del contexto. El límite teórico es el ancho de banda dividido por los pesos leídos en cada token: no puede superarse y no se alcanza en la práctica.

Tamaño en Q4 (catálogo QuelLLM) y límite teórico calculado con 960 GB/s
ModeloPesos Q4Margen disponible con 24 GBLímite teórico
Qwen 3.5 9B6 GB18 GB160 tokens/s
gpt-oss 20B (MoE)13 GB11 GBdepende de los pesos activos
Devstral Small 2 24B14 GB10 GB≈ 68 tokens/s
Qwen 3.8 27B16 GB8 GB60 tokens/s
Granite 4.1 30B17 GB7 GB≈ 56 tokens/s
Qwen3-Coder 30B-A3B (MoE)19 GB5 GBdepende de los pesos activos
Qwen 3.6 35B-A3B (MoE)21 GB3 GBdepende de los pesos activos

Dos lecturas de esta tabla. En primer lugar, el margen: de los 24 GB, un modelo de 21 GB deja solo 3 GB para la caché KV y el sistema, lo que implica un contexto corto. El Qwen 3.8 27B, con 8 GB de margen, ofrece más holgura para un contexto largo. En segundo lugar, los MoE: un modelo 35B-A3B solo lee sus 3 mil millones de parámetros activos en cada token, por lo que genera mucho más rápido que un modelo denso de 27 mil millones, pero aun así debe caber íntegramente en la VRAM.

!
Sin tokens/s inventados
Las velocidades que se encuentran en línea dependen del modelo, de la cuantización, del contexto y de la versión del software. La única referencia pública comparable que citamos es la tabla de la comunidad llama.cpp que aparece a continuación, con un modelo pequeño. Para tus modelos, mide con llama-bench o con las estadísticas que devuelve Ollama.

#Lo que miden los benchmarks públicos en esta tarjeta

La tabla de referencia de la comunidad llama.cpp mide, en ROCm y con el mismo modelo (Llama 2 7B en Q4_0), la velocidad de lectura del prompt (pp512) y la de generación (tg128). En la 7900 XTX, un participante registra 3552 tokens/s en procesamiento del prompt y 167 tokens/s en generación sin Flash Attention, y después 3874 y 170 con Flash Attention. El autor de la tabla advierte que los resultados varían según el controlador, el sistema y el fabricante de la tarjeta, incluso con el mismo chip.

Llama 2 7B Q4_0, llama.cpp ROCm (tabla comunitaria, sin Flash Attention)
TarjetaAncho de banda AMDPrompt pp512Generación tg128
RX 7900 XTX960 GB/s3 552 t/s167 t/s
RX 9070 XT640 GB/s5 055 t/s101 t/s
RX 9060 XT320 GB/s1 420 t/s68 t/s

Esta tabla muestra dos cosas. La generación depende del ancho de banda: la 7900 XTX (960 GB/s) genera aproximadamente 1,65 veces más rápido que la 9070 XT (640 GB/s) y 2,5 veces más rápido que la 9060 XT (320 GB/s). En cambio, la lectura del prompt depende más de la potencia de cálculo matricial, y la 9070 XT, de una generación más reciente, supera a la 7900 XTX en este aspecto. Para un uso de chat con respuestas largas, el ancho de banda y los 24 GB tienen prioridad; para RAG con documentos grandes de entrada, la velocidad de lectura del prompt importa más.

i
Pequeño modelo, gran desviación respecto a la realidad
Un 7B en Q4_0 pesa mucho menos que los modelos de 24 GB de la sección anterior. No deduzcas de estas cifras la velocidad de un 27B: con el mismo ancho de banda, será varias veces menor.

#70B, 30B MoE y dos tarjetas: hasta dónde ir

Los pesos de un modelo denso de 70B en Q4 ocupan unos 40 GB según la referencia del sitio, casi el doble de la VRAM: habría que colocar más de 16 GB en la RAM, y la velocidad estaría entonces limitada por la RAM y el bus PCIe, no por la tarjeta. No damos una cifra de rendimiento para este caso porque no disponemos de una fuente verificable; quédate solo con que resulta poco cómodo. Los MoE de 30 a 35 mil millones de parámetros son, con la misma calidad general, la solución práctica a este límite de 24 GB.

Dos 7900 XTX cambian la situación en cuanto a capacidad. En llama.cpp, el modo de distribución predeterminado reparte las capas del modelo entre las tarjetas, con un funcionamiento en pipeline, y una opción permite elegir las proporciones por tarjeta. Así sumas 48 GB, suficientes para un 70B en Q4 con algo de contexto. La ventaja está en lo que cabe en memoria, no en la velocidad por token: cada token pasa por las dos tarjetas una tras otra. En cuanto al hardware, dos tarjetas de 355 W suman 710 W sin contar el resto del PC, lo que exige una fuente de alimentación con capacidad suficiente, dos ranuras PCIe adecuadas y una caja ventilada.

#Contexto y caché KV: la verdadera limitación de los 24 GB

El peso de un modelo es solo una parte de la memoria utilizada: la caché KV crece con la longitud del contexto. Ollama utiliza por defecto una ventana de contexto de 4.096 tokens según su documentación, modificable con la variable OLLAMA_CONTEXT_LENGTH; los modelos recientes anuncian entre 128.000 y 262.000 tokens, pero utilizar esas ventanas de contexto requiere memoria adicional. Dos ajustes: activar Flash Attention, que Ollama emplea automáticamente cuando el backend y la tarjeta lo permiten, y cuantizar la caché KV con OLLAMA_KV_CACHE_TYPE (f16 por defecto, q8_0 para reducir la memoria). La guía sobre la cuantización de la caché KV detalla estos ajustes.

Contexto y caché KV reducidos
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#7900 XTX, RTX 3090 o 4090: cómo decidir

Sobre el papel, la RTX 3090 también ofrece 24 GB de memoria GDDR6X según NVIDIA. Por tanto, la elección depende de la pila de software, el entorno y el precio del momento, que no fijamos aquí: consulta el seguimiento de precios de tarjetas para IA local antes de comprar.

Criterios de decisión para 24 GB
Tu situaciónTarjeta que conviene priorizarPor qué
Linux, Ollama o llama.cpp, presupuesto ajustadoRX 7900 XTXSoporte de 24 GB con ROCm 7 y Vulkan
Windows, herramientas que requieren CUDA (algunos proyectos de fine-tuning)RTX 3090 o 4090CUDA sigue siendo el objetivo predeterminado de la mayoría de los proyectos
Quieres vLLM en producciónVerifica tu modelovLLM lista los 7900 con ROCm; el soporte depende de la versión
Contexto largo y grandes MoETodas las tarjetas de 24 GBLa VRAM tiene prioridad sobre la marca
Se necesitan más de 24 GBRTX 5090 (32 GB) o dos tarjetasNinguna tarjeta de 24 GB puede alojar un 70B en Q4

Si dudas entre tarjeta nueva y usada, recuerda que la 7900 XTX data de diciembre de 2022: a menudo la garantía del fabricante ya ha expirado en tarjetas usadas, y una tarjeta que haya minado o estado en uso continuo merece un control de temperaturas antes de comprarla.

→
Las alternativas con 20 GB y 16 GB
Si 24 GB superan tu presupuesto, la RX 7900 XT (20 GB) y la RX 9070 XT (16 GB) tienen cada una su guía. La 9070 XT es más reciente, con FP8 listado por AMD, pero 8 GB menos.

#Preguntas frecuentes

Preguntas frecuentes
¿La RX 7900 XTX es adecuada para LLM en local?+
Sí, principalmente gracias a sus 24 GB de VRAM y a su ancho de banda de 960 GB/s según AMD. Ejecuta sin desbordamiento a la memoria RAM modelos de hasta aproximadamente 27 mil millones de parámetros en Q4, así como los MoE de 30 a 35 mil millones. Es compatible con Ollama, llama.cpp y LM Studio, con ROCm 7 o Vulkan.
¿Qué modelo elegir en una RX 7900 XTX?+
Para un uso general, un modelo denso de 27 mil millones de parámetros como Qwen 3.8 27B en Q4, con unos 16 GB de pesos, deja 8 GB para el contexto. Para la velocidad, un MoE como gpt-oss 20B o Qwen 3.6 35B-A3B. Para programar, Devstral Small 2 24B o Qwen3-Coder 30B-A3B. Comprueba siempre con ollama ps que todo esté en la GPU.
¿Se pueden usar dos RX 7900 XTX juntas?+
Sí, con llama.cpp, cuyo modo predeterminado distribuye las capas y la caché KV entre las tarjetas. Obtienes 48 GB, suficientes para un 70B en Q4, pero no más velocidad por token, ya que las tarjetas trabajan en pipeline. Prevé más de 710 W para las dos tarjetas, lo que requiere una fuente de alimentación de bastante más de 1 000 W.
¿La RX 7900 XTX maneja el FP8?+
No según la ficha de AMD, que enumera para esta tarjeta FP16, INT8 e INT4 para el cálculo matricial, pero no FP8. Las Radeon RX 9000, de generación RDNA 4, incluyen FP8 en sus especificaciones. Para la mayoría de los usos con modelos GGUF cuantizados en Q4 o Q5, este punto no tiene consecuencias directas.
¿ROCm o Vulkan en una RX 7900 XTX?+
Comienza con ROCm, la vía oficial de Ollama en Linux con el controlador ROCm v7. Si la instalación se atasca, Vulkan, activado por defecto en Ollama, permite arrancar sin ROCm, generalmente con un rendimiento que varía según el controlador. Compara ambos con llama-bench usando tu propio modelo antes de decidir.
¿Funciona la 7900 XTX con vLLM?+
Sí, según la documentación de vLLM, que enumera las Radeon RX 7900 (gfx1100 y gfx1101) con ROCm 6.3 o superior y ofrece paquetes precompilados para ROCm 7.0 y 7.2.1. Sin embargo, su instalación es más exigente que la de Ollama y resulta especialmente útil si atiendes a varios usuarios al mismo tiempo.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.