Intermedio 11 minRadeon RX 7000

Qué LLM en Radeon RX 7800 XT (16 GB) ?

Respuesta directa

La Radeon RX 7800 XT es una opción interesante para la IA local, sobre todo por sus 16 GB de VRAM y su ancho de banda de 624 GB/s: permite cargar modelos de 20 a 24 mil millones de parámetros en Q4, algo que las tarjetas de 12 GB no pueden hacer. Una medición pública con Llama 2 7B en Q4_0 registra 118 tokens por segundo en generación con Vulkan. Más que su precio total, importa el coste por GB de VRAM, que puedes comparar en /prix-gpu-ia.

Una buena oferta de una tarjeta gráfica se valora por si el modelo que quieres usar cabe en ella, no por el precio anunciado. La RX 7800 XT es una de las pocas tarjetas de 16 GB de la generación RDNA 3 que figuran oficialmente entre las compatibles con ROCm y Ollama. Esta guía muestra qué ejecuta, a qué velocidad según mediciones publicadas y cómo evaluar una oferta sin depender de un precio que cambia cada semana.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.

¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#¿Por qué la RX 7800 XT es una buena opción para un LLM local?

La RX 7800 XT reúne tres ventajas poco habituales en esta gama. Sus 16 GB de GDDR6 sobre un bus de 256 bits le dan 624 GB/s de ancho de banda, el factor que limita la velocidad de generación de un LLM. AMD la incluye oficialmente en ROCm (RDNA 3, objetivo gfx1101), y Ollama la menciona tanto para Linux como para Windows. Por último, las mediciones públicas la sitúan en 118,27 tokens por segundo durante la generación con un 7B en Q4_0 bajo Vulkan, por encima de una RX 7900 GRE en la misma serie de mediciones. Su desventaja frente a NVIDIA no es la velocidad de generación, sino la lectura del prompt, tres veces más lenta que en una RTX 4070 Ti Super.

Arquitectura
RDNA 3, Navi 32 en chiplets: un GCD y cuatro MCD, lanzada el 6 de septiembre de 2023. Por lo tanto, no es monolítica.
Cálculo
3 840 procesadores de flujo, 60 unidades de cálculo.
Memoria
16 GB GDDR6, bus de 256 bits, 624 GB/s.
Consumo
263 W de potencia de la tarjeta.
Precio
No se fija aquí: consulta /prix-gpu-ia, donde se registra el precio más bajo cada lunes y cada jueves.

#Evaluar una oferta sin precio fijo

La expresión «buena compra» implica un precio, y el precio de una tarjeta cambia de una semana a otra. En lugar de citar uno que sería incorrecto dentro de diez días, aquí tienes el método. Calcula el coste por GB de VRAM: el precio dividido por 16 para la 7800 XT, por 12 para una tarjeta de 12 GB. El seguimiento del sitio publica esta cifra para cada tarjeta. Después, hazte la única pregunta que importa: ¿la capacidad adicional te permite utilizar un modelo que realmente quieres usar? Pasar de 12 a 16 GB permite utilizar modelos de 20 a 24B; pasar de 16 a 24 GB permite utilizar los de 30B y más.

Referencias para evaluar una oferta (ejemplo de cálculo, no de precios)
SituaciónCálculo por realizarConclusión
Oferta en una 7800 XTPrecio ÷ 16 GBCompara el coste por GB de las tarjetas de 12 y 24 GB en /prix-gpu-ia.
Diferencia de precio con una tarjeta de 12 GBDiferencia ÷ 4 GB adicionalesPor debajo del coste medio por GB, la tarjeta de 16 GB es una buena compra
Diferencia respecto a una RTX de 16 GBQué valor tiene CUDA para tiPágalo solo si una herramienta lo exige o si el procesamiento del prompt es importante
Tarjeta de ocasiónProbar con un modelo de 12 a 14 GB antes de comprarNo aceptes sin una prueba real de carga

Un ejemplo de razonamiento, sin indicar un precio concreto: si la diferencia de precio entre una tarjeta de 12 GB y la 7800 XT equivale a una cantidad que habrías gastado de todas formas para un modelo de 24B, la cuestión está resuelta. Por el contrario, si solo usas modelos de 8 a 12B, esos 4 GB no te sirven y la RX 7700 XT o la RX 6700 XT son suficientes.

#Lo que cabe en 16 GB de VRAM

De los 16 GB, calcula unos 15 GB disponibles para el modelo y su caché KV cuando la tarjeta no se encarga de la salida de pantalla. El catálogo QuelLLM indica a continuación el tamaño de los pesos en Q4; a eso se suma el contexto, y el margen disponible se convierte rápidamente en el factor limitante con los modelos grandes.

Lo que cabe en una 7800 XT (solo los pesos)
ModeloTamaño del modeloMargen para el contextoVeredicto
Gemma 4 12B en Q8≈ 13 GB≈ 2 GBCabe, contexto corto
gpt-oss 20B en Q4≈ 13 GB≈ 2 GBCabe, con un contexto corto a medio
Devstral Small 2 24B en Q4≈ 14 GB≈ 1 GBCabe muy justo, con un contexto muy corto
Gemma 4 26B-A4B en Q4≈ 16 GBningunaDemasiado ajustado
Granite 4.1 30B en Q4≈ 17 GBningunaNo cabe

La palabra clave de la tabla es el margen: un 24B en Q4 cabe, pero solo con un contexto de unos pocos miles de tokens. Para trabajar con código y archivos largos, la cuantización de la caché KV libera entre uno y dos gigabytes, y una tarjeta de 20 GB como la RX 7900 XT resuelve el problema. La tabla del sitio sobre modelos para 16 GB, independiente de la marca de la tarjeta, detalla los compromisos de la cuantización.

Un dato sobre los modelos con expertos (MoE) como gpt-oss 20B: solo una parte de los parámetros trabaja en cada token, lo que acelera la generación, pero todos los pesos deben residir en memoria. Es el tamaño total, no el activo, el que decide si el modelo cabe en 16 GB. Esto explica que un MoE de 20B coexista con un denso de 12B en la tabla anterior, con el mismo peso de aproximadamente 13 GB.

#Velocidades medidas: Vulkan o ROCm

Las cifras que aparecen a continuación no son mediciones del sitio: proceden de dos debates públicos del repositorio llama.cpp, uno sobre Vulkan y otro sobre ROCm, en los que se prueba Llama 2 7B en Q4_0 con llama-bench. Los commits de llama.cpp, los sistemas y los controladores difieren de una serie a otra, por lo que la diferencia entre ambas series es orientativa, no una clasificación definitiva.

RX 7800 XT con Llama 2 7B Q4_0 (mediciones públicas de llama.cpp)
BackendFlash AttentionLectura pp512Generación tg128
Vulkanno2 017,33 t/s118,27 t/s
Vulkansí2 197,05 t/s124,86 t/s
ROCmno2 151,81 t/s100,94 t/s
ROCmsí2 304,63 t/s95,99 t/s

Se desprenden dos conclusiones. En primer lugar, en estas series, Vulkan genera más rápido que ROCm en esta tarjeta (118 frente a 101 tokens por segundo sin Flash Attention), mientras que ROCm lee el prompt un poco más rápido. En segundo lugar, Flash Attention acelera Vulkan, pero ralentiza ligeramente la generación con ROCm. Si tu prioridad es la velocidad de respuesta en una conversación, prueba ambos backends con tu modelo en lugar de dar por hecho que ROCm gana.

La eficiencia respecto al límite teórico ayuda a no preocuparse: 624 GB/s divididos por 3,82 GB de pesos dan 163 tokens por segundo; la tarjeta alcanza el 72 % de ese límite con Vulkan. Aplicada a modelos más grandes, esta relación permite estimar órdenes de magnitud, que deberás confirmar en tu equipo.

Estimación basada en el 72 % del límite de 624 GB/s (cálculo, no medición)
Modelo (Q4)Tamaño del modeloLímite teóricoOrden de magnitud
Llama 3.1 8B≈ 6 GB≈ 104 tokens/s≈ 75 tokens/s
Gemma 4 12B≈ 7 GB≈ 89 tokens/s≈ 64 tokens/s
Phi-4 14B≈ 9 GB≈ 69 tokens/s≈ 50 tokens/s
Devstral Small 2 24B≈ 14 GB≈ 45 tokens/s≈ 32 tokens/s

#Frente a las tarjetas NVIDIA de 16 GB: la lectura del prompt marca la diferencia

La comparación con las RTX de 16 GB se basa en dos medidas. En generación, la RX 7800 XT se mantiene en un rango similar al de las tarjetas NVIDIA medidas con Vulkan. En el procesamiento del prompt, la diferencia es muy grande: funciona a un tercio de la velocidad de una RTX 4070 Ti Super. Esta segunda cifra pesa en los usos con documentos largos o historiales de conversación largos, en los que hay que esperar a que aparezca la primera palabra. Para un chat corto o un asistente de código con un contexto modesto, pesa poco.

RX 7800 XT y RTX de 16 GB bajo Vulkan (Llama 2 7B Q4_0, sin Flash Attention)
TarjetaVRAMLectura pp512Generación tg128
RX 7800 XT16 GB2 017,33 t/s118,27 t/s
RTX 4070 Ti Super16 GB6 099,18 t/s129,45 t/s
RTX 5070 Ti16 GB6 213,63 t/s135,63 t/s

#Hacer que un 24B quepa en 16 GB: los ajustes útiles

Un modelo de 24 mil millones de parámetros en Q4 pesa aproximadamente 14 GB, lo que deja apenas un gigabyte para la caché KV y el sistema. Cuatro medidas evitan que parte del procesamiento pase a la CPU, lo que haría caer la velocidad. La primera es limitar la ventana de contexto a lo que realmente necesitas, ya que la caché crece con cada token. La segunda es cuantizar la caché KV, lo que libera entre uno y dos gigabytes. La tercera es cerrar las aplicaciones que reservan VRAM, como un navegador con aceleración por hardware o un juego. La cuarta es conectar la pantalla a la tarjeta gráfica integrada del procesador cuando exista, lo que devuelve a la tarjeta AMD la memoria que ocupaba la visualización.

Contexto
Establece la ventana según la necesidad real: de 4.000 a 8.000 tokens bastan para la mayoría de las conversaciones.
Caché KV
Cuantízalo a 8 bits para liberar VRAM, vigilando la calidad en tus tareas.
Visualización
Utiliza la salida de vídeo de la tarjeta integrada cuando exista.
Verificación
Tras la carga, ollama ps debe mostrar 100 % GPU; cualquier otra proporción indica que parte del modelo se ha descargado a la RAM del sistema.

La guía sobre la ventana de contexto explica por qué un historial largo consume tanta memoria como el modelo mismo en tarjetas pequeñas.

#Puesta en marcha

  1. 01
    Elegir el sistema
    En Linux, AMD solo ofrece soporte para las Radeon RX 7000 en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7. En Windows, Ollama se basa en una pila ROCm v7 o HIP7.
  2. 02
    Instalar Ollama
    Sigue la documentación de Ollama: se requiere el controlador ROCm v7 en Linux. Vulkan está activado por defecto y sirve como alternativa.
  3. 03
    Cargar un modelo que quepa
    Elige un 12B en Q8 o un 20B en Q4 antes de probar un 24B. Comprueba con ollama ps que esté completamente en la GPU.
  4. 04
    Comparar Vulkan y ROCm
    Ejecuta llama-bench con los dos backends en tu modelo, con y sin Flash Attention, y elige el más rápido para tu uso.
Terminal
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Veredicto 2026

Una buena opción si
Si buscas modelos de 20 a 24B y el precio por GB de VRAM en /prix-gpu-ia es inferior al de las tarjetas de 12 GB comparables.
No es una buena opción si
Si te quedas con modelos de 8 a 12B, una tarjeta de 12 GB basta y pagas por gigabytes que no utilizas.
Evitar
Comprar una tarjeta de segunda mano sin probar la carga de un modelo de 12 a 14 GB.

#Preguntas frecuentes

FAQ
RX 7800 XT: ¿es una buena opción para ejecutar LLM?+
Sí, si buscas modelos de 20 a 24 mil millones de parámetros: sus 16 GB permiten alojarlos en Q4, mientras que las tarjetas de 12 GB no pueden. Evalúa la oferta según el coste por GB de VRAM, publicado en la página de precios del sitio, en vez de fijarte únicamente en el precio indicado.
¿Es la RX 7800 XT buena para LLM en 2026?+
Genera 118 tokens por segundo con un 7B en Q4_0 bajo Vulkan según una medición pública, y sus 16 GB permiten cargar un 24B en Q4. Su punto débil frente a NVIDIA es la lectura del prompt, aproximadamente tres veces más lenta que en una RTX 4070 Ti Super según estas mediciones.
¿Vulkan o ROCm en una RX 7800 XT?+
En las dos discusiones públicas del repositorio llama.cpp, Vulkan genera más rápido (118 contra 101 tokens por segundo sin Flash Attention) y ROCm lee el prompt un poco más rápido. Las configuraciones son diferentes, así que prueba ambos con tu modelo y elige el más rápido.
¿RX 7800 XT o RX 7700 XT para la IA local?+
La 7800 XT aporta 4 GB de VRAM adicionales, lo que permite acceder a modelos de 20 a 24B, y 624 GB/s de ancho de banda frente a 432. Si sigues usando modelos de 8 a 14B, la 7700 XT basta; de lo contrario, la diferencia de precio suele estar justificada.
¿Qué modelos caben en una RX 7800 XT de 16 GB?+
Gemma 4 12B en Q8 y gpt-oss 20B en Q4 pesan aproximadamente 13 GB, Devstral Small 2 24B en Q4 alrededor de 14 GB, con un contexto corto. Un modelo de 26 a 30B en Q4 supera los 16 GB de peso y no cabe completamente.
¿Ollama admite la RX 7800 XT?+
Sí, tanto en Linux como en Windows según la documentación de Ollama, con el controlador ROCm v7 en Linux. AMD también la incluye en ROCm, con el identificador de destino gfx1101, pero solo en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 o RHEL 9.7. Vulkan, activado por defecto en Ollama, sirve como alternativa de respaldo.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.