Qué LLM en Radeon RX 7800 XT (16 GB) ?
La Radeon RX 7800 XT es una opción interesante para la IA local, sobre todo por sus 16 GB de VRAM y su ancho de banda de 624 GB/s: permite cargar modelos de 20 a 24 mil millones de parámetros en Q4, algo que las tarjetas de 12 GB no pueden hacer. Una medición pública con Llama 2 7B en Q4_0 registra 118 tokens por segundo en generación con Vulkan. Más que su precio total, importa el coste por GB de VRAM, que puedes comparar en /prix-gpu-ia.
Una buena oferta de una tarjeta gráfica se valora por si el modelo que quieres usar cabe en ella, no por el precio anunciado. La RX 7800 XT es una de las pocas tarjetas de 16 GB de la generación RDNA 3 que figuran oficialmente entre las compatibles con ROCm y Ollama. Esta guía muestra qué ejecuta, a qué velocidad según mediciones publicadas y cómo evaluar una oferta sin depender de un precio que cambia cada semana.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.
¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#¿Por qué la RX 7800 XT es una buena opción para un LLM local?
La RX 7800 XT reúne tres ventajas poco habituales en esta gama. Sus 16 GB de GDDR6 sobre un bus de 256 bits le dan 624 GB/s de ancho de banda, el factor que limita la velocidad de generación de un LLM. AMD la incluye oficialmente en ROCm (RDNA 3, objetivo gfx1101), y Ollama la menciona tanto para Linux como para Windows. Por último, las mediciones públicas la sitúan en 118,27 tokens por segundo durante la generación con un 7B en Q4_0 bajo Vulkan, por encima de una RX 7900 GRE en la misma serie de mediciones. Su desventaja frente a NVIDIA no es la velocidad de generación, sino la lectura del prompt, tres veces más lenta que en una RTX 4070 Ti Super.
- Arquitectura
- RDNA 3, Navi 32 en chiplets: un GCD y cuatro MCD, lanzada el 6 de septiembre de 2023. Por lo tanto, no es monolítica.
- Cálculo
- 3 840 procesadores de flujo, 60 unidades de cálculo.
- Memoria
- 16 GB GDDR6, bus de 256 bits, 624 GB/s.
- Consumo
- 263 W de potencia de la tarjeta.
- Precio
- No se fija aquí: consulta /prix-gpu-ia, donde se registra el precio más bajo cada lunes y cada jueves.
#Evaluar una oferta sin precio fijo
La expresión «buena compra» implica un precio, y el precio de una tarjeta cambia de una semana a otra. En lugar de citar uno que sería incorrecto dentro de diez días, aquí tienes el método. Calcula el coste por GB de VRAM: el precio dividido por 16 para la 7800 XT, por 12 para una tarjeta de 12 GB. El seguimiento del sitio publica esta cifra para cada tarjeta. Después, hazte la única pregunta que importa: ¿la capacidad adicional te permite utilizar un modelo que realmente quieres usar? Pasar de 12 a 16 GB permite utilizar modelos de 20 a 24B; pasar de 16 a 24 GB permite utilizar los de 30B y más.
| Situación | Cálculo por realizar | Conclusión |
|---|---|---|
| Oferta en una 7800 XT | Precio ÷ 16 GB | Compara el coste por GB de las tarjetas de 12 y 24 GB en /prix-gpu-ia. |
| Diferencia de precio con una tarjeta de 12 GB | Diferencia ÷ 4 GB adicionales | Por debajo del coste medio por GB, la tarjeta de 16 GB es una buena compra |
| Diferencia respecto a una RTX de 16 GB | Qué valor tiene CUDA para ti | Págalo solo si una herramienta lo exige o si el procesamiento del prompt es importante |
| Tarjeta de ocasión | Probar con un modelo de 12 a 14 GB antes de comprar | No aceptes sin una prueba real de carga |
Un ejemplo de razonamiento, sin indicar un precio concreto: si la diferencia de precio entre una tarjeta de 12 GB y la 7800 XT equivale a una cantidad que habrías gastado de todas formas para un modelo de 24B, la cuestión está resuelta. Por el contrario, si solo usas modelos de 8 a 12B, esos 4 GB no te sirven y la RX 7700 XT o la RX 6700 XT son suficientes.
- Precios de las tarjetas gráficas para IA local, registrados dos veces por semana
- ¿Qué LLM para 16 GB de VRAM, independientemente de la tarjeta gráfica?
#Lo que cabe en 16 GB de VRAM
De los 16 GB, calcula unos 15 GB disponibles para el modelo y su caché KV cuando la tarjeta no se encarga de la salida de pantalla. El catálogo QuelLLM indica a continuación el tamaño de los pesos en Q4; a eso se suma el contexto, y el margen disponible se convierte rápidamente en el factor limitante con los modelos grandes.
| Modelo | Tamaño del modelo | Margen para el contexto | Veredicto |
|---|---|---|---|
| Gemma 4 12B en Q8 | ≈ 13 GB | ≈ 2 GB | Cabe, contexto corto |
| gpt-oss 20B en Q4 | ≈ 13 GB | ≈ 2 GB | Cabe, con un contexto corto a medio |
| Devstral Small 2 24B en Q4 | ≈ 14 GB | ≈ 1 GB | Cabe muy justo, con un contexto muy corto |
| Gemma 4 26B-A4B en Q4 | ≈ 16 GB | ninguna | Demasiado ajustado |
| Granite 4.1 30B en Q4 | ≈ 17 GB | ninguna | No cabe |
La palabra clave de la tabla es el margen: un 24B en Q4 cabe, pero solo con un contexto de unos pocos miles de tokens. Para trabajar con código y archivos largos, la cuantización de la caché KV libera entre uno y dos gigabytes, y una tarjeta de 20 GB como la RX 7900 XT resuelve el problema. La tabla del sitio sobre modelos para 16 GB, independiente de la marca de la tarjeta, detalla los compromisos de la cuantización.
Un dato sobre los modelos con expertos (MoE) como gpt-oss 20B: solo una parte de los parámetros trabaja en cada token, lo que acelera la generación, pero todos los pesos deben residir en memoria. Es el tamaño total, no el activo, el que decide si el modelo cabe en 16 GB. Esto explica que un MoE de 20B coexista con un denso de 12B en la tabla anterior, con el mismo peso de aproximadamente 13 GB.
#Velocidades medidas: Vulkan o ROCm
Las cifras que aparecen a continuación no son mediciones del sitio: proceden de dos debates públicos del repositorio llama.cpp, uno sobre Vulkan y otro sobre ROCm, en los que se prueba Llama 2 7B en Q4_0 con llama-bench. Los commits de llama.cpp, los sistemas y los controladores difieren de una serie a otra, por lo que la diferencia entre ambas series es orientativa, no una clasificación definitiva.
| Backend | Flash Attention | Lectura pp512 | Generación tg128 |
|---|---|---|---|
| Vulkan | no | 2 017,33 t/s | 118,27 t/s |
| Vulkan | sí | 2 197,05 t/s | 124,86 t/s |
| ROCm | no | 2 151,81 t/s | 100,94 t/s |
| ROCm | sí | 2 304,63 t/s | 95,99 t/s |
Se desprenden dos conclusiones. En primer lugar, en estas series, Vulkan genera más rápido que ROCm en esta tarjeta (118 frente a 101 tokens por segundo sin Flash Attention), mientras que ROCm lee el prompt un poco más rápido. En segundo lugar, Flash Attention acelera Vulkan, pero ralentiza ligeramente la generación con ROCm. Si tu prioridad es la velocidad de respuesta en una conversación, prueba ambos backends con tu modelo en lugar de dar por hecho que ROCm gana.
La eficiencia respecto al límite teórico ayuda a no preocuparse: 624 GB/s divididos por 3,82 GB de pesos dan 163 tokens por segundo; la tarjeta alcanza el 72 % de ese límite con Vulkan. Aplicada a modelos más grandes, esta relación permite estimar órdenes de magnitud, que deberás confirmar en tu equipo.
| Modelo (Q4) | Tamaño del modelo | Límite teórico | Orden de magnitud |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 104 tokens/s | ≈ 75 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 89 tokens/s | ≈ 64 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 69 tokens/s | ≈ 50 tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 45 tokens/s | ≈ 32 tokens/s |
#Frente a las tarjetas NVIDIA de 16 GB: la lectura del prompt marca la diferencia
La comparación con las RTX de 16 GB se basa en dos medidas. En generación, la RX 7800 XT se mantiene en un rango similar al de las tarjetas NVIDIA medidas con Vulkan. En el procesamiento del prompt, la diferencia es muy grande: funciona a un tercio de la velocidad de una RTX 4070 Ti Super. Esta segunda cifra pesa en los usos con documentos largos o historiales de conversación largos, en los que hay que esperar a que aparezca la primera palabra. Para un chat corto o un asistente de código con un contexto modesto, pesa poco.
| Tarjeta | VRAM | Lectura pp512 | Generación tg128 |
|---|---|---|---|
| RX 7800 XT | 16 GB | 2 017,33 t/s | 118,27 t/s |
| RTX 4070 Ti Super | 16 GB | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 16 GB | 6 213,63 t/s | 135,63 t/s |
- RTX 4070 Ti Super, la alternativa de NVIDIA con 16 GB
- Radeon RX 7900 GRE, otra tarjeta de 16 GB de la misma generación
#Hacer que un 24B quepa en 16 GB: los ajustes útiles
Un modelo de 24 mil millones de parámetros en Q4 pesa aproximadamente 14 GB, lo que deja apenas un gigabyte para la caché KV y el sistema. Cuatro medidas evitan que parte del procesamiento pase a la CPU, lo que haría caer la velocidad. La primera es limitar la ventana de contexto a lo que realmente necesitas, ya que la caché crece con cada token. La segunda es cuantizar la caché KV, lo que libera entre uno y dos gigabytes. La tercera es cerrar las aplicaciones que reservan VRAM, como un navegador con aceleración por hardware o un juego. La cuarta es conectar la pantalla a la tarjeta gráfica integrada del procesador cuando exista, lo que devuelve a la tarjeta AMD la memoria que ocupaba la visualización.
- Contexto
- Establece la ventana según la necesidad real: de 4.000 a 8.000 tokens bastan para la mayoría de las conversaciones.
- Caché KV
- Cuantízalo a 8 bits para liberar VRAM, vigilando la calidad en tus tareas.
- Visualización
- Utiliza la salida de vídeo de la tarjeta integrada cuando exista.
- Verificación
- Tras la carga, ollama ps debe mostrar 100 % GPU; cualquier otra proporción indica que parte del modelo se ha descargado a la RAM del sistema.
La guía sobre la ventana de contexto explica por qué un historial largo consume tanta memoria como el modelo mismo en tarjetas pequeñas.
#Puesta en marcha
- 01Elegir el sistemaEn Linux, AMD solo ofrece soporte para las Radeon RX 7000 en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7. En Windows, Ollama se basa en una pila ROCm v7 o HIP7.
- 02Instalar OllamaSigue la documentación de Ollama: se requiere el controlador ROCm v7 en Linux. Vulkan está activado por defecto y sirve como alternativa.
- 03Cargar un modelo que quepaElige un 12B en Q8 o un 20B en Q4 antes de probar un 24B. Comprueba con ollama ps que esté completamente en la GPU.
- 04Comparar Vulkan y ROCmEjecuta llama-bench con los dos backends en tu modelo, con y sin Flash Attention, y elige el más rápido para tu uso.
#Veredicto 2026
- Una buena opción si
- Si buscas modelos de 20 a 24B y el precio por GB de VRAM en /prix-gpu-ia es inferior al de las tarjetas de 12 GB comparables.
- No es una buena opción si
- Si te quedas con modelos de 8 a 12B, una tarjeta de 12 GB basta y pagas por gigabytes que no utilizas.
- Evitar
- Comprar una tarjeta de segunda mano sin probar la carga de un modelo de 12 a 14 GB.
- Documentación de Ollama: tarjetas AMD compatibles
- Compatibilidad de GPU con ROCm, documentación de AMD
- Tabla de puntuaciones Vulkan del repositorio llama.cpp
- Tabla de resultados de ROCm del repositorio llama.cpp
#Preguntas frecuentes
RX 7800 XT: ¿es una buena opción para ejecutar LLM?+
¿Es la RX 7800 XT buena para LLM en 2026?+
¿Vulkan o ROCm en una RX 7800 XT?+
¿RX 7800 XT o RX 7700 XT para la IA local?+
¿Qué modelos caben en una RX 7800 XT de 16 GB?+
¿Ollama admite la RX 7800 XT?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.