Intermedio 11 minRadeon RX 9000

¿Qué LLM usar con una Radeon RX 9070 XT (16 GB)? ?

Respuesta directa

La RX 9070 XT (16 GB GDDR6, hasta 640 GB/s según AMD) es una buena tarjeta para ejecutar LLM en local en Linux con ROCm 7 o mediante Vulkan en Windows. Carga modelos con hasta 13-14 GB de pesos en Q4 sin recurrir a la RAM del sistema, como gpt-oss 20B o Mistral Small 24B. Los modelos densos de 27 mil millones de parámetros están fuera de su alcance.

La RX 9070 XT es la Radeon RDNA 4 de gama alta de AMD. Esta guía explica lo que permiten sus 16 GB, cómo instalarla en Linux o Windows, qué muestran las mediciones públicas y cuándo es preferible una RTX 5070 Ti o una tarjeta de 24 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Para esta configuración: Radeon RX 9070 XT 16 GB.

¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RX 9070 XT para los LLM: 16 GB, 640 GB/s y una buena capacidad de cálculo

La Radeon RX 9070 XT es la Radeon de consumo más capaz para los LLM entre las RX 9000: 16 GB de GDDR6 en un bus de 256 bits, un ancho de banda que puede alcanzar 640 GB/s según AMD y una capacidad de cálculo matricial claramente superior a la de la RX 7900 XTX en FP16 y FP8. Ejecuta sin desbordar la VRAM los modelos cuyos pesos se mantienen por debajo de unos 13 a 14 GB en Q4: un 9B o un 12B con un contexto largo, gpt-oss 20B, Mistral Small 24B con un contexto corto. Su límite es la capacidad: los modelos densos de 27 mil millones de parámetros en Q4 (aproximadamente 16 GB) no caben.

Hoja técnica RX 9070 XT (fuente: AMD)
CaracterísticaValor
Memoria16 GB GDDR6, bus de 256 bits
Ancho de bandahasta 640 GB/s
Procesadores de flujo / unidades de cálculo4 096 / 64
Aceleradores de IA128
Cálculo matricial FP16 / FP8195 / 389 TFLOPs
Potencia típica de la tarjeta304 W
Fuente de alimentación mínima recomendada750 W
Conectores de alimentación2 x 8 pines
i
Ancho de banda: 640 GB/s, no 644
Algunas fichas en línea, incluida una versión anterior de esta guía, indican 644 GB/s. La ficha oficial de AMD indica «hasta 640 GB/s»; esa es la cifra que debes usar en tus cálculos.

#Software: ROCm, Vulkan, LM Studio, vLLM

La RX 9070 XT figura en la matriz ROCm 7.2.1 de la documentación Radeon de AMD (Ubuntu 22.04, 24.04 y 25.10). Ollama la incluye entre las tarjetas compatibles con Linux con el controlador ROCm v7 y asocia el objetivo gfx1201 a la 9070 XT en su tabla de objetivos LLVM. LM Studio anunció en su versión 0.3.19, en julio de 2025, la compatibilidad con las GPU AMD de la serie 9000 en Linux con ROCm. vLLM incluye las Radeon RX 9000 (gfx1200 y gfx1201) entre su hardware AMD.

En Windows, la lista ROCm de Ollama llega solo hasta las RX 7000: las RX 9000 no figuran en ella. Sin embargo, Ollama especifica que Vulkan ofrece compatibilidad adicional en Windows y Linux, activada por defecto. Por tanto, una 9070 XT en Windows utiliza Vulkan en la práctica; comprueba con ollama ps que el modelo se esté ejecutando realmente en la GPU y consulta la guía de llama.cpp con Vulkan si compilas por tu cuenta.

#Puesta en marcha en Linux con Ollama

  1. 01
    Instalar el controlador ROCm
    Sigue la documentación ROCm de AMD con la herramienta amdgpu-install, como pide Ollama, añade tu usuario a los grupos render y video y luego reinicia.
  2. 02
    Confirmar la detección
    rocminfo debe listar un agente GPU y rocm-smi debe mostrar los 16 GB. De lo contrario, Ollama utilizará el procesador.
  3. 03
    Iniciar un primer modelo
    Instala Ollama con su script oficial y arranca un modelo que quepa en 16 GB, por ejemplo un 9B en Q4.
  4. 04
    Comprobar dónde se ejecuta
    Después de la primera respuesta, ollama ps debe indicar 100 % GPU. Un reparto entre GPU y procesador indica que el modelo o el contexto es demasiado grande.
Verificaciones
rocminfo | grep -i gfx
rocm-smi --showmeminfo vram
ollama ps

#Qué modelos caben en 16 GB

Los tamaños de los modelos proceden del catálogo QuelLLM y corresponden a Q4 salvo que se indique lo contrario. Añade la caché KV y aproximadamente un gigabyte de margen. La lista exhaustiva por niveles está en la guía de los 16 GB de VRAM.

Peso (catálogo QuelLLM) y límite teórico con un ancho de banda de 640 GB/s
ModeloTamaño del modelo¿Cabe en 16 GB?Límite teórico
Qwen 3.5 9B Q46 GBSí, con mucho margen≈ 107 tokens/s
Qwen 3.5 9B Q810 GBSí64 tokens/s
Gemma 4 12B Q47 GBSí, contexto largo≈ 91 tokens/s
Gemma 4 12B Q813 GBSí, contexto corto≈ 49 tokens/s
gpt-oss 20B (MoE)13 GBSí, contexto moderadodepende de los pesos activos
Mistral Small 24B Q414 GBAjustado≈ 46 tokens/s
Qwen 3.8 27B Q416 GBNo-

El límite máximo es el ancho de banda dividido entre los pesos leídos en cada token; ninguna tarjeta lo alcanza exactamente. Los modelos MoE como gpt-oss 20B leen menos pesos por token que los correspondientes a su tamaño total y, por tanto, son más rápidos que un modelo denso del mismo tamaño, siempre que quepan íntegramente en la VRAM.

!
Lo que «16 GB» no permite
Los modelos de 27 a 35 mil millones de parámetros en Q4 pesan entre 16 y 21 GB según el catálogo: parte del modelo se carga en la RAM y la velocidad cae drásticamente. Para esta categoría, consulta la guía de los 24 GB o la RX 7900 XTX.

#Lo que dicen las mediciones públicas

La tabla de la comunidad llama.cpp sobre ROCm mide el mismo modelo, Llama 2 7B en Q4_0, en varias tarjetas. Para la RX 9070 XT, un participante obtiene 5 055 tokens por segundo en lectura del prompt (pp512) y 101 en generación (tg128), sin Flash Attention. En la 7900 XTX, la tabla muestra 3 552 y 167; en la 9060 XT, 1 420 y 68.

Llama 2 7B Q4_0, llama.cpp ROCm (tabla comunitaria, sin Flash Attention)
TarjetaAncho de banda AMDLectura del promptGeneración
RX 7900 XTX960 GB/s3 552 t/s167 t/s
RX 9070 XT640 GB/s5 055 t/s101 t/s
RX 9060 XT320 GB/s1 420 t/s68 t/s

Dos enseñanzas. Primero, la 9070 XT lee un prompt largo aproximadamente un 40 % más rápido que la 7900 XTX, a pesar de tener un ancho de banda inferior: es la ventaja de un cálculo matricial más potente, útil para el RAG, los documentos largos y los agentes de código que devuelven mucho contexto. Segundo, en generación, la 7900 XTX sigue por delante, como cabría esperar por su ancho de banda un 50 % superior.

i
Una tabla comunitaria no es un banco de pruebas
En esta misma tabla, la RX 9070 (no XT) muestra 114 tokens/s en generación, más que la 9070 XT a 101, aunque se espera que sea más lenta. Las filas provienen de versiones diferentes de llama.cpp y de controladores. Lee estos números como aproximaciones, nunca como clasificación precisa.

#¿Qué modelo elegir según el uso?

Con 16 GB, la elección adecuada depende menos del tamaño máximo que del margen que quede para el contexto. Una regla sencilla: deja al menos 2 GB libres además de lo que ocupan los pesos para la caché KV y los búferes, y más si trabajas con documentos largos. La tabla propone un punto de partida según el uso, a partir de los pesos del catálogo QuelLLM.

Punto de partida según el uso con 16 GB
UsoModelo de partidaPesos Q4Margen con 16 GB
Chat general y redacciónGemma 4 12B7 GB9 GB, contexto largo posible
Código, agente de desarrolloDevstral Small 2 24B14 GB2 GB, contexto corto
Razonamiento rápido (MoE)gpt-oss 20B13 GB3 GB
RAG con prompts largosQwen 3.5 9B6 GB10 GB para el contexto
Tareas ligeras continuasGranite 4.2 8B4,6 GB11 GB

Para el RAG, el cálculo matricial de la 9070 XT es una gran ventaja: un prompt de varios miles de tokens se lee rápidamente, y un 9B en Q4 deja 10 GB para la caché KV y, por tanto, para un contexto largo. Para el código, un modelo de 14 GB cabe, pero con un contexto corto; en ese caso, hay que cuantizar la caché KV o reducir la ventana.

#Contexto y caché KV: los dos ajustes que cuentan

La documentación de Ollama indica una ventana de contexto predeterminada de 4.096 tokens, que modifica la variable OLLAMA_CONTEXT_LENGTH. La caché KV se cuantiza con OLLAMA_KV_CACHE_TYPE, cuyo valor predeterminado es f16, cuando Flash Attention está activada; Ollama la utiliza automáticamente cuando el backend y la tarjeta lo permiten. Aumenta el contexto progresivamente vigilando ollama ps: en cuanto una parte del modelo pase al procesador, retrocede un nivel.

Contexto de 32k con caché KV en q8_0
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#FP8 en RX 9070 XT: lo que realmente cambia

AMD indica para la 9070 XT una capacidad de cálculo matricial FP8 de 389 TFLOPs, un dato que no aparece en la ficha de la RX 7900 XTX. En la práctica, con Ollama y los modelos GGUF en Q4 o Q5, no utilizas FP8: los pesos son enteros cuantizados. FP8 sirve sobre todo para los motores que cargan pesos FP8, como vLLM, que incluye las RX 9000 en su lista. Considéralo un margen para más adelante, no una mejora inmediata, y no compres la tarjeta por ese motivo: la capacidad de 16 GB y el ancho de banda siguen siendo los dos criterios que determinan qué puedes ejecutar hoy.

#RX 9070 XT o RTX 5070 Ti

NVIDIA describe la RTX 5070 Ti con 16 GB de GDDR7 en un bus de 256 bits: la misma capacidad que la tarjeta AMD, con memoria de otra generación. A igual capacidad, caben los mismos modelos; la diferencia está en la velocidad de generación, en el ecosistema CUDA y en el precio, para el que no damos una cifra fija aquí. Consulta el seguimiento de precios de las tarjetas para IA local: suele ser lo que permite decidir entre ellas.

Cómo decidir con 16 GB
Tu situaciónTarjeta que conviene priorizarRazón
Linux, Ollama o LM Studio, presupuesto ajustadoRX 9070 XTCompatibilidad con ROCm 7, 16 GB, cálculo FP8 incluido en la lista
Windows y ninguna gana de depurarRTX 5070 TiEcosistema CUDA, controladores más universales
Proyectos que requieren CUDA (algunas cadenas de fine-tuning)RTX 5070 TiCUDA sigue siendo el objetivo predeterminado de muchos proyectos
RAG con prompts largosRX 9070 XT o RTX 5070 TiLa capacidad de cálculo importa tanto como el ancho de banda
Modelos de 27 mil millones y másTarjeta de 24 GBNinguna tarjeta de 16 GB basta para eso

#Alimentación y carcasa

AMD recomienda una fuente de alimentación de 750 W como mínimo e indica 304 W de potencia típica para la tarjeta, con dos conectores de 8 pines. Añade el consumo del procesador, los discos y los ventiladores para dimensionar el conjunto, y verifica la longitud y el grosor del modelo de tu fabricante: estas tarjetas suelen ser grandes. Una caja bien ventilada reduce el ruido y las caídas de frecuencia bajo carga prolongada, lo cual cuenta cuando la tarjeta genera texto durante horas. Para un servidor de IA que permanece encendido, el consumo en reposo y bajo carga cuenta tanto como el precio de compra a lo largo del tiempo.

#Preguntas frecuentes

Preguntas frecuentes
¿La RX 9070 XT es adecuada para LLM en local?+
Sí para modelos que caben en sus 16 GB: un 9B o un 12B con contexto largo, gpt-oss 20B, Mistral Small 24B con contexto corto. Sus 640 GB/s y su cálculo matricial la hacen rápida, especialmente en lectura de prompt. No es adecuada para modelos densos de 27 mil millones de parámetros.
¿Cómo usar LM Studio con una RX 9070 XT?+
LM Studio anuncia, desde la versión 0.3.19, soporte para GPUs AMD serie 9000 en Linux con ROCm. En Windows, el motor Vulkan de llama.cpp es la alternativa. En ambos casos, carga un modelo de menos de 14 GB y verifica en la interfaz que todas las capas estén en el GPU.
¿Se necesita ROCm o Vulkan en la RX 9070 XT?+
En Linux, ROCm 7 es la vía oficial de Ollama, con gfx1201 como arquitectura de destino para esta tarjeta. En Windows, la lista de ROCm de Ollama no menciona las RX 9000, así que Vulkan, activado por defecto, es la opción práctica. Compara ambos con llama-bench usando tu modelo antes de decidir.
¿Cuántos tokens por segundo da una RX 9070 XT?+
Depende del modelo. Para un Llama 2 7B en Q4_0, la tabla de la comunidad de llama.cpp registra 101 tokens/s de generación con ROCm. Para otro modelo, el límite teórico es de 640 GB/s dividido entre el tamaño de los pesos: unos 46 tokens/s para un 24B de 14 GB, antes de cualquier pérdida de rendimiento.
¿Puede la RX 9070 XT manejar FP8?+
En teoría sí: AMD lista 389 TFLOPs de cálculo matricial FP8. Con Ollama y modelos GGUF en Q4, no los aprovechas directamente, porque los pesos son enteros cuantizados. El FP8 sirve a los motores que cargan pesos FP8, como vLLM, que lista las RX 9000.
¿Qué fuente de alimentación elegir para una RX 9070 XT?+
AMD indica un mínimo de 750 W y una potencia típica de 304 W, con dos conectores de alimentación de 8 pines. Añade el consumo del resto del PC y mantén un margen, especialmente si el procesador es potente. También verifica la ficha del modelo de tu fabricante, que puede recomendar más.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.