¿Qué LLM en Radeon RX 9070 (16 GB)? ?
La Radeon RX 9070 (RDNA 4, 16 GB GDDR6, 640 GB/s, 220 W) ejecuta modelos de 20 a 24 mil millones de parámetros en Q4 y genera aproximadamente 120 tokens por segundo en Llama 2 7B en Q4_0 bajo Vulkan según una medición pública. Bajo Linux, Ollama la soporta con ROCm v7; bajo Windows, no está en la lista de ROCm de Ollama y pasa por Vulkan, que ya tiene buenos resultados.
La RX 9070 es la más reciente de las tarjetas de 16 GB de AMD en este rango de precios, con un consumo significativamente más bajo que sus predecesoras de la serie RX 7000. Esta guía explica qué puede ejecutar, qué se sabe de su velocidad según mediciones públicas, qué cambia entre Linux y Windows y cómo se compara con la RX 9070 XT y las RTX de 16 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para esta configuración: Radeon RX 9070 XT 16 GB.
¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Lo que hace una RX 9070 en 2026
La RX 9070 carga sin dificultad los modelos de 8 a 14 mil millones de parámetros en Q4 y admite los de 20 a 24 mil millones, con un contexto corto para los más grandes. Su memoria de 16 GB GDDR6 a 20,1 Gb/s sobre un bus de 256 bits le proporciona 640 GB/s de ancho de banda, cifra que corrige la indicada en la versión anterior de esta página (644). Con Llama 2 7B en Q4_0, la discusión pública del repositorio llama.cpp indica 119,71 tokens por segundo en generación con Vulkan y 114,48 con ROCm, con una lectura del prompt de 3 164 tokens por segundo con Vulkan, más rápida que en las RX 7800 XT y 7900 GRE. Otro de sus puntos fuertes es su TDP de 220 W, entre 40 y 50 W inferior al de sus predecesoras de 16 GB.
- Arquitectura
- RDNA 4, chip de la serie RX 9000, con el mismo bus de 256 bits que la 9070 XT
- Cálculo
- 3.584 procesadores de flujo (4.096 para la 9070 XT).
- Memoria
- 16 GB GDDR6, 20,1 Gb/s, bus de 256 bits, 640 GB/s.
- Consumo
- TDP de 220 W (304 W para la 9070 XT).
- Precio
- No se indica: cambia cada semana. Consulta /prix-gpu-ia.
#Linux, Windows: ROCm o Vulkan
Es la particularidad de la generación RDNA 4: la compatibilidad varía según el sistema. AMD incluye la RX 9070 en ROCm (arquitectura de destino gfx1201) y la documentación de Ollama la menciona para Linux, con el controlador ROCm v7. Para Windows, en cambio, la lista de compatibilidad con ROCm de Ollama termina en la RX 7900 XTX; la RX 9070 no aparece en ella. Sigue siendo utilizable mediante Vulkan, activado por defecto, que además ofrece buenas velocidades. Por último, la documentación de AMD especifica que las Radeon RX 9000 solo son compatibles con Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7.
| Entorno | Estado | Consecuencia práctica |
|---|---|---|
| Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | ROCm oficial, destino gfx1201 | Ollama con controlador ROCm v7 |
| Windows | Ausente de la lista ROCm de Ollama | Usar Vulkan, activado por defecto |
| Vulkan, todos los sistemas | Ruta general | Velocidades comparables a ROCm en las mediciones públicas |
#Lo que cabe en 16 GB de VRAM
Calcula unos 15 GB para el modelo y su caché KV cuando la tarjeta no esté conectada a la pantalla. El catálogo QuelLLM muestra a continuación los pesos en Q4; a esa cantidad se añade la memoria del contexto.
| Modelo | Tamaño del modelo | Margen para el contexto | Veredicto |
|---|---|---|---|
| Llama 3.1 8B en Q4 | ≈ 6 GB | ≈ 9 GB | Muy cómodo, contexto muy largo |
| Gemma 4 12B en Q8 | ≈ 13 GB | ≈ 2 GB | Cabe, contexto corto |
| gpt-oss 20B en Q4 | ≈ 13 GB | ≈ 2 GB | Cabe, con un contexto corto a medio |
| Devstral Small 2 24B en Q4 | ≈ 14 GB | ≈ 1 GB | Cabe con poco margen |
| Gemma 4 26B-A4B en Q4 | ≈ 16 GB | ninguna | Demasiado ajustado |
Estos 16 GB marcan la frontera entre un modelo de 24B, que cabe, y uno de 26 a 30B, que ya no cabe. En lo que respecta a esta frontera concreta, las tarjetas de 16 GB de todas las marcas son equivalentes: la página por capacidad de VRAM las compara. Lo que distingue a la RX 9070 es lo que ofrece además de esa capacidad: una lectura del prompt más rápida y un consumo más bajo.
#Velocidades medidas: Vulkan supera a ROCm
Las cifras proceden de las discusiones públicas del repositorio llama.cpp, en todas las cuales se utilizan Llama 2 7B en Q4_0 (3,56 GiB) y llama-bench; no son mediciones del sitio. En la RX 9070, Vulkan alcanza 3 164,10 tokens por segundo en lectura y 119,71 en generación; con Flash Attention, 2 859,98 y 119,51. ROCm alcanza 2 381,77 y 114,48. Ambos backends ofrecen resultados similares en generación, con Vulkan ligeramente por delante, y la diferencia es más marcada en la lectura del prompt. Las configuraciones, los controladores y los commits varían de una serie a otra: interpreta estas diferencias como órdenes de magnitud.
| Backend | Flash Attention | Lectura pp512 | Generación tg128 |
|---|---|---|---|
| Vulkan | no | 3 164,10 t/s | 119,71 t/s |
| Vulkan | sí | 2 859,98 t/s | 119,51 t/s |
| ROCm | no | 2 381,77 t/s | 114,48 t/s |
El límite teórico de generación es de 640 GB/s divididos entre 3,82 GB, es decir, aproximadamente 167 tokens por segundo; la tarjeta alcanza el 71 % de ese límite con Vulkan. Aplicar este rendimiento a modelos más grandes permite estimar órdenes de magnitud. Son cálculos, no mediciones, y suponen que un modelo más grande se comporta como el modelo de referencia de 7B.
| Modelo (Q4) | Tamaño del modelo | Límite teórico | Orden de magnitud |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 107 tokens/s | ≈ 76 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 91 tokens/s | ≈ 65 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 71 tokens/s | ≈ 50 tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 46 tokens/s | ≈ 32 tokens/s |
#Lo que cambia RDNA 4 para un LLM local
RDNA 4 añade hardware dedicado a la IA: la RX 9070 incluye 112 aceleradores de IA según la ficha de la serie, frente a 128 en la 9070 XT. Se podrían esperar tasas de generación muy superiores a las de RDNA 3. Las mediciones públicas no lo demuestran: 119,71 tokens por segundo para la RX 9070 con Vulkan, frente a 118,27 para la RX 7800 XT en la misma discusión. La generación de un LLM está limitada por el ancho de banda de la memoria, y 640 GB/s no están muy lejos de los 624 GB/s de la 7800 XT. Los aceleradores de IA benefician más a la lectura del prompt, donde la RX 9070 supera a la 7800 XT en un 57 %.
La consecuencia para el comprador: no pagues por RDNA 4 por la velocidad de conversación; paga por la lectura de los prompts, el menor consumo y la mayor duración del soporte de software, que se mantendrá para las tarjetas recientes durante más tiempo que para las antiguas. Si lo usas para chatear con un modelo de 8 a 14B, una RX 7800 XT de segunda mano ofrece resultados de generación similares.
#Frente a la RX 9070 XT: la diferencia es mayor que «10 %»
La versión anterior de esta página anunciaba que la RX 9070 era entre un 10 y un 12 % más lenta que la 9070 XT. En el modelo de referencia de 7B con Vulkan, la 9070 XT genera a 137,11 tokens por segundo frente a 119,71, es decir, un 15 % más, y lee los prompts a 5.036 tokens por segundo frente a 3.164, es decir, un 59 % más. Sin embargo, ambas tarjetas tienen la misma memoria, 16 GB, y el mismo ancho de banda según sus fichas técnicas. La diferencia proviene, por tanto, de la capacidad de cálculo (4.096 procesadores de flujo frente a 3.584), que influye poco en la generación y mucho en la lectura de prompts.
| Criterio | RX 9070 | RX 9070 XT |
|---|---|---|
| Procesadores de flujo | 3 584 | 4 096 |
| TDP | 220 W | 304 W |
| Lectura pp512 | 3 164,10 t/s | 5 036,04 t/s |
| Generación tg128 | 119,71 t/s | 137,11 t/s |
En resumen: para el chat, la 9070 pierde un 15 % de velocidad a cambio de consumir 84 W menos, una compensación razonable. Para el RAG y los documentos largos, la 9070 XT lee aproximadamente 1,6 veces más rápido.
#Frente a las RTX de 16 GB: el prompt sigue siendo el punto débil
Frente a las tarjetas NVIDIA de 16 GB evaluadas con Vulkan, la RX 9070 genera algo más despacio: un 8 % por debajo de la RTX 4070 Ti Super y un 12 % por debajo de la RTX 5070 Ti, y lee el prompt aproximadamente a la mitad de velocidad. La RTX 5070 de 12 GB, a menudo citada como competidora directa, no aparece en la discusión de referencia sobre Vulkan: por tanto, no existe una comparación numérica fiable con ella, solo la diferencia de capacidad, 16 GB frente a 12 GB.
| Tarjeta | Lectura pp512 | Generación tg128 |
|---|---|---|
| RX 9070 | 3 164,10 t/s | 119,71 t/s |
| RTX 4070 Ti Super | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 6 213,63 t/s | 135,63 t/s |
#Puesta en marcha
- 01Elegir el sistemaEn Linux, utiliza Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 o RHEL 9.7 para mantenerte dentro del ámbito de soporte de AMD. En Windows, cuenta con Vulkan.
- 02Instalar OllamaEn Linux, instala el controlador ROCm v7 con amdgpu-install y después Ollama. En Windows, instala Ollama: Vulkan está activado por defecto.
- 03Cargar un modeloToma un 12B o un 20B antes de un 24B, luego verifica con ollama ps que el modelo esté al 100 % en la GPU.
- 04Comparar los backendsEjecuta llama-bench con Vulkan y luego con ROCm en tu modelo: en las mediciones públicas, Vulkan obtiene resultados ligeramente mejores.
¿Hay que esperar a una generación posterior? Nada en las mediciones citadas justifica esperar para usar modelos de 8 a 24B: el límite es la capacidad de 16 GB, que solo una tarjeta de 20 a 24 GB permite superar. Si ya sabes que quieres modelos de 30B o más, descarta esta tarjeta; de lo contrario, comprar una de 16 GB se justifica por lo que ejecutas hoy, no por lo que saldrá mañana.
#Veredicto 2026
- Una buena opción
- Si quieres 16 GB en una tarjeta de consumo moderado (220 W) y aceptas Vulkan en Windows.
- Prefiere la 9070 XT
- Si tus prompts son largos: la lectura es 59 % más rápida, con 84 W adicionales.
- Prefiere una RTX de 16 GB
- Si necesitas CUDA o una lectura de prompt dos veces más rápida.
Los precios cambian rápidamente: el seguimiento del sitio revisa cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para la IA local, con el precio por GB de VRAM. Es este último dato el que debe guiar la comparación con la RTX 5070 o la RX 9070 XT.
- Precios de tarjetas gráficas para la IA local, actualizados dos veces por semana
- Documentación de Ollama: tarjetas AMD compatibles
- Compatibilidad de GPU con ROCm, documentación de AMD
- Tabla de puntuaciones Vulkan del repositorio llama.cpp
#Preguntas frecuentes
¿RX 9070 o RX 9070 XT para un LLM local?+
¿RX 9070 o RTX 5070 para un LLM local?+
¿Ollama es compatible con la RX 9070?+
¿Cuántos tokens por segundo da una RX 9070?+
¿Qué modelos se pueden ejecutar en una RX 9070 de 16 GB?+
¿Vulkan o ROCm en RX 9070?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.