Intermedio 11 minRadeon RX 9000

¿Qué LLM en Radeon RX 9070 (16 GB)? ?

Respuesta directa

La Radeon RX 9070 (RDNA 4, 16 GB GDDR6, 640 GB/s, 220 W) ejecuta modelos de 20 a 24 mil millones de parámetros en Q4 y genera aproximadamente 120 tokens por segundo en Llama 2 7B en Q4_0 bajo Vulkan según una medición pública. Bajo Linux, Ollama la soporta con ROCm v7; bajo Windows, no está en la lista de ROCm de Ollama y pasa por Vulkan, que ya tiene buenos resultados.

La RX 9070 es la más reciente de las tarjetas de 16 GB de AMD en este rango de precios, con un consumo significativamente más bajo que sus predecesoras de la serie RX 7000. Esta guía explica qué puede ejecutar, qué se sabe de su velocidad según mediciones públicas, qué cambia entre Linux y Windows y cómo se compara con la RX 9070 XT y las RTX de 16 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Para esta configuración: Radeon RX 9070 XT 16 GB.

¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Lo que hace una RX 9070 en 2026

La RX 9070 carga sin dificultad los modelos de 8 a 14 mil millones de parámetros en Q4 y admite los de 20 a 24 mil millones, con un contexto corto para los más grandes. Su memoria de 16 GB GDDR6 a 20,1 Gb/s sobre un bus de 256 bits le proporciona 640 GB/s de ancho de banda, cifra que corrige la indicada en la versión anterior de esta página (644). Con Llama 2 7B en Q4_0, la discusión pública del repositorio llama.cpp indica 119,71 tokens por segundo en generación con Vulkan y 114,48 con ROCm, con una lectura del prompt de 3 164 tokens por segundo con Vulkan, más rápida que en las RX 7800 XT y 7900 GRE. Otro de sus puntos fuertes es su TDP de 220 W, entre 40 y 50 W inferior al de sus predecesoras de 16 GB.

Arquitectura
RDNA 4, chip de la serie RX 9000, con el mismo bus de 256 bits que la 9070 XT
Cálculo
3.584 procesadores de flujo (4.096 para la 9070 XT).
Memoria
16 GB GDDR6, 20,1 Gb/s, bus de 256 bits, 640 GB/s.
Consumo
TDP de 220 W (304 W para la 9070 XT).
Precio
No se indica: cambia cada semana. Consulta /prix-gpu-ia.

#Linux, Windows: ROCm o Vulkan

Es la particularidad de la generación RDNA 4: la compatibilidad varía según el sistema. AMD incluye la RX 9070 en ROCm (arquitectura de destino gfx1201) y la documentación de Ollama la menciona para Linux, con el controlador ROCm v7. Para Windows, en cambio, la lista de compatibilidad con ROCm de Ollama termina en la RX 7900 XTX; la RX 9070 no aparece en ella. Sigue siendo utilizable mediante Vulkan, activado por defecto, que además ofrece buenas velocidades. Por último, la documentación de AMD especifica que las Radeon RX 9000 solo son compatibles con Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7.

Soporte para RX 9070
EntornoEstadoConsecuencia práctica
Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)ROCm oficial, destino gfx1201Ollama con controlador ROCm v7
WindowsAusente de la lista ROCm de OllamaUsar Vulkan, activado por defecto
Vulkan, todos los sistemasRuta generalVelocidades comparables a ROCm en las mediciones públicas
i
Una divergencia que debes conocer
La tabla de objetivos de la documentación Ollama muestra gfx1200 para la RX 9070 y gfx1201 para la 9070 XT como ejemplo, mientras que la tabla de AMD asocia la RX 9070 con gfx1201. Confía en el comando rocminfo en tu máquina, no en un ejemplo de documentación.

#Lo que cabe en 16 GB de VRAM

Calcula unos 15 GB para el modelo y su caché KV cuando la tarjeta no esté conectada a la pantalla. El catálogo QuelLLM muestra a continuación los pesos en Q4; a esa cantidad se añade la memoria del contexto.

Lo que cabe en una RX 9070 (solo los pesos)
ModeloTamaño del modeloMargen para el contextoVeredicto
Llama 3.1 8B en Q4≈ 6 GB≈ 9 GBMuy cómodo, contexto muy largo
Gemma 4 12B en Q8≈ 13 GB≈ 2 GBCabe, contexto corto
gpt-oss 20B en Q4≈ 13 GB≈ 2 GBCabe, con un contexto corto a medio
Devstral Small 2 24B en Q4≈ 14 GB≈ 1 GBCabe con poco margen
Gemma 4 26B-A4B en Q4≈ 16 GBningunaDemasiado ajustado

Estos 16 GB marcan la frontera entre un modelo de 24B, que cabe, y uno de 26 a 30B, que ya no cabe. En lo que respecta a esta frontera concreta, las tarjetas de 16 GB de todas las marcas son equivalentes: la página por capacidad de VRAM las compara. Lo que distingue a la RX 9070 es lo que ofrece además de esa capacidad: una lectura del prompt más rápida y un consumo más bajo.

#Velocidades medidas: Vulkan supera a ROCm

Las cifras proceden de las discusiones públicas del repositorio llama.cpp, en todas las cuales se utilizan Llama 2 7B en Q4_0 (3,56 GiB) y llama-bench; no son mediciones del sitio. En la RX 9070, Vulkan alcanza 3 164,10 tokens por segundo en lectura y 119,71 en generación; con Flash Attention, 2 859,98 y 119,51. ROCm alcanza 2 381,77 y 114,48. Ambos backends ofrecen resultados similares en generación, con Vulkan ligeramente por delante, y la diferencia es más marcada en la lectura del prompt. Las configuraciones, los controladores y los commits varían de una serie a otra: interpreta estas diferencias como órdenes de magnitud.

RX 9070 con Llama 2 7B Q4_0 (mediciones públicas de llama.cpp)
BackendFlash AttentionLectura pp512Generación tg128
Vulkanno3 164,10 t/s119,71 t/s
Vulkansí2 859,98 t/s119,51 t/s
ROCmno2 381,77 t/s114,48 t/s

El límite teórico de generación es de 640 GB/s divididos entre 3,82 GB, es decir, aproximadamente 167 tokens por segundo; la tarjeta alcanza el 71 % de ese límite con Vulkan. Aplicar este rendimiento a modelos más grandes permite estimar órdenes de magnitud. Son cálculos, no mediciones, y suponen que un modelo más grande se comporta como el modelo de referencia de 7B.

Estimación del 71 % del límite de 640 GB/s (cálculo, no medición)
Modelo (Q4)Tamaño del modeloLímite teóricoOrden de magnitud
Llama 3.1 8B≈ 6 GB≈ 107 tokens/s≈ 76 tokens/s
Gemma 4 12B≈ 7 GB≈ 91 tokens/s≈ 65 tokens/s
Phi-4 14B≈ 9 GB≈ 71 tokens/s≈ 50 tokens/s
Devstral Small 2 24B≈ 14 GB≈ 46 tokens/s≈ 32 tokens/s

#Lo que cambia RDNA 4 para un LLM local

RDNA 4 añade hardware dedicado a la IA: la RX 9070 incluye 112 aceleradores de IA según la ficha de la serie, frente a 128 en la 9070 XT. Se podrían esperar tasas de generación muy superiores a las de RDNA 3. Las mediciones públicas no lo demuestran: 119,71 tokens por segundo para la RX 9070 con Vulkan, frente a 118,27 para la RX 7800 XT en la misma discusión. La generación de un LLM está limitada por el ancho de banda de la memoria, y 640 GB/s no están muy lejos de los 624 GB/s de la 7800 XT. Los aceleradores de IA benefician más a la lectura del prompt, donde la RX 9070 supera a la 7800 XT en un 57 %.

La consecuencia para el comprador: no pagues por RDNA 4 por la velocidad de conversación; paga por la lectura de los prompts, el menor consumo y la mayor duración del soporte de software, que se mantendrá para las tarjetas recientes durante más tiempo que para las antiguas. Si lo usas para chatear con un modelo de 8 a 14B, una RX 7800 XT de segunda mano ofrece resultados de generación similares.

#Frente a la RX 9070 XT: la diferencia es mayor que «10 %»

La versión anterior de esta página anunciaba que la RX 9070 era entre un 10 y un 12 % más lenta que la 9070 XT. En el modelo de referencia de 7B con Vulkan, la 9070 XT genera a 137,11 tokens por segundo frente a 119,71, es decir, un 15 % más, y lee los prompts a 5.036 tokens por segundo frente a 3.164, es decir, un 59 % más. Sin embargo, ambas tarjetas tienen la misma memoria, 16 GB, y el mismo ancho de banda según sus fichas técnicas. La diferencia proviene, por tanto, de la capacidad de cálculo (4.096 procesadores de flujo frente a 3.584), que influye poco en la generación y mucho en la lectura de prompts.

RX 9070 y RX 9070 XT bajo Vulkan (Llama 2 7B Q4_0, sin FA)
CriterioRX 9070RX 9070 XT
Procesadores de flujo3 5844 096
TDP220 W304 W
Lectura pp5123 164,10 t/s5 036,04 t/s
Generación tg128119,71 t/s137,11 t/s

En resumen: para el chat, la 9070 pierde un 15 % de velocidad a cambio de consumir 84 W menos, una compensación razonable. Para el RAG y los documentos largos, la 9070 XT lee aproximadamente 1,6 veces más rápido.

#Frente a las RTX de 16 GB: el prompt sigue siendo el punto débil

Frente a las tarjetas NVIDIA de 16 GB evaluadas con Vulkan, la RX 9070 genera algo más despacio: un 8 % por debajo de la RTX 4070 Ti Super y un 12 % por debajo de la RTX 5070 Ti, y lee el prompt aproximadamente a la mitad de velocidad. La RTX 5070 de 12 GB, a menudo citada como competidora directa, no aparece en la discusión de referencia sobre Vulkan: por tanto, no existe una comparación numérica fiable con ella, solo la diferencia de capacidad, 16 GB frente a 12 GB.

RX 9070 y RTX de 16 GB bajo Vulkan (Llama 2 7B Q4_0, sin FA)
TarjetaLectura pp512Generación tg128
RX 90703 164,10 t/s119,71 t/s
RTX 4070 Ti Super6 099,18 t/s129,45 t/s
RTX 5070 Ti6 213,63 t/s135,63 t/s

#Puesta en marcha

  1. 01
    Elegir el sistema
    En Linux, utiliza Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 o RHEL 9.7 para mantenerte dentro del ámbito de soporte de AMD. En Windows, cuenta con Vulkan.
  2. 02
    Instalar Ollama
    En Linux, instala el controlador ROCm v7 con amdgpu-install y después Ollama. En Windows, instala Ollama: Vulkan está activado por defecto.
  3. 03
    Cargar un modelo
    Toma un 12B o un 20B antes de un 24B, luego verifica con ollama ps que el modelo esté al 100 % en la GPU.
  4. 04
    Comparar los backends
    Ejecuta llama-bench con Vulkan y luego con ROCm en tu modelo: en las mediciones públicas, Vulkan obtiene resultados ligeramente mejores.
Terminal
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

¿Hay que esperar a una generación posterior? Nada en las mediciones citadas justifica esperar para usar modelos de 8 a 24B: el límite es la capacidad de 16 GB, que solo una tarjeta de 20 a 24 GB permite superar. Si ya sabes que quieres modelos de 30B o más, descarta esta tarjeta; de lo contrario, comprar una de 16 GB se justifica por lo que ejecutas hoy, no por lo que saldrá mañana.

#Veredicto 2026

Una buena opción
Si quieres 16 GB en una tarjeta de consumo moderado (220 W) y aceptas Vulkan en Windows.
Prefiere la 9070 XT
Si tus prompts son largos: la lectura es 59 % más rápida, con 84 W adicionales.
Prefiere una RTX de 16 GB
Si necesitas CUDA o una lectura de prompt dos veces más rápida.

Los precios cambian rápidamente: el seguimiento del sitio revisa cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para la IA local, con el precio por GB de VRAM. Es este último dato el que debe guiar la comparación con la RTX 5070 o la RX 9070 XT.

#Preguntas frecuentes

FAQ
¿RX 9070 o RX 9070 XT para un LLM local?+
La 9070 XT genera un 15 % más rápido y lee los prompts un 59 % más rápido con el modelo 7B de referencia bajo Vulkan, a costa de un TDP de 304 W frente a 220 W. Para el chat, la 9070 es suficiente; para RAG y documentos largos, la XT se justifica. Compara los precios actuales.
¿RX 9070 o RTX 5070 para un LLM local?+
La RX 9070 ofrece 16 GB frente a 12 GB, lo que permite ejecutar modelos de 20 a 24 mil millones de parámetros. La RTX 5070 mantiene el ecosistema CUDA y un procesamiento del prompt más rápido. No se han encontrado mediciones públicas de la RTX 5070 con Vulkan: por tanto, la comparación numérica sigue pendiente.
¿Ollama es compatible con la RX 9070?+
Sí, en Linux, con el controlador ROCm v7: aparece en la lista de Ollama. En Windows, no está en la lista ROCm de Ollama, que termina en la RX 7900 XTX, pero Vulkan, activado por defecto, permite su uso. Verifica con ollama ps que el modelo esté cargado en el GPU.
¿Cuántos tokens por segundo da una RX 9070?+
Con Llama 2 7B en Q4_0, las discusiones públicas del repositorio llama.cpp indican 119,71 tokens por segundo con Vulkan y 114,48 con ROCm durante la generación. Para un modelo de 24B en Q4, el cálculo da aproximadamente 32 tokens por segundo: una estimación que debes comprobar con mediciones en tu equipo.
¿Qué modelos se pueden ejecutar en una RX 9070 de 16 GB?+
Llama 3.1 8B, Gemma 4 12B hasta Q8, gpt-oss 20B y Devstral Small 2 24B en Q4, estos dos últimos con un contexto corto. Un modelo de 26 a 30B en Q4 supera los 16 GB de VRAM y pasa a ejecutarse parcialmente en el procesador, con una reducción importante de velocidad.
¿Vulkan o ROCm en RX 9070?+
En las mediciones públicas del repositorio llama.cpp, Vulkan genera un poco más rápido (119,71 frente a 114,48 tokens por segundo) y lee el prompt más rápido (3 164 frente a 2 382). En Windows, Vulkan es, en cualquier caso, la opción predeterminada. Prueba ambos con tu modelo antes de decidir.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.