¿Qué LLM usar con una Radeon RX 9070 XT (16 GB)? ?
La RX 9070 XT (16 GB GDDR6, hasta 640 GB/s según AMD) es una buena tarjeta para ejecutar LLM en local en Linux con ROCm 7 o mediante Vulkan en Windows. Carga modelos con hasta 13-14 GB de pesos en Q4 sin recurrir a la RAM del sistema, como gpt-oss 20B o Mistral Small 24B. Los modelos densos de 27 mil millones de parámetros están fuera de su alcance.
La RX 9070 XT es la Radeon RDNA 4 de gama alta de AMD. Esta guía explica lo que permiten sus 16 GB, cómo instalarla en Linux o Windows, qué muestran las mediciones públicas y cuándo es preferible una RTX 5070 Ti o una tarjeta de 24 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para esta configuración: Radeon RX 9070 XT 16 GB.
¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RX 9070 XT para los LLM: 16 GB, 640 GB/s y una buena capacidad de cálculo
La Radeon RX 9070 XT es la Radeon de consumo más capaz para los LLM entre las RX 9000: 16 GB de GDDR6 en un bus de 256 bits, un ancho de banda que puede alcanzar 640 GB/s según AMD y una capacidad de cálculo matricial claramente superior a la de la RX 7900 XTX en FP16 y FP8. Ejecuta sin desbordar la VRAM los modelos cuyos pesos se mantienen por debajo de unos 13 a 14 GB en Q4: un 9B o un 12B con un contexto largo, gpt-oss 20B, Mistral Small 24B con un contexto corto. Su límite es la capacidad: los modelos densos de 27 mil millones de parámetros en Q4 (aproximadamente 16 GB) no caben.
| Característica | Valor |
|---|---|
| Memoria | 16 GB GDDR6, bus de 256 bits |
| Ancho de banda | hasta 640 GB/s |
| Procesadores de flujo / unidades de cálculo | 4 096 / 64 |
| Aceleradores de IA | 128 |
| Cálculo matricial FP16 / FP8 | 195 / 389 TFLOPs |
| Potencia típica de la tarjeta | 304 W |
| Fuente de alimentación mínima recomendada | 750 W |
| Conectores de alimentación | 2 x 8 pines |
#Software: ROCm, Vulkan, LM Studio, vLLM
La RX 9070 XT figura en la matriz ROCm 7.2.1 de la documentación Radeon de AMD (Ubuntu 22.04, 24.04 y 25.10). Ollama la incluye entre las tarjetas compatibles con Linux con el controlador ROCm v7 y asocia el objetivo gfx1201 a la 9070 XT en su tabla de objetivos LLVM. LM Studio anunció en su versión 0.3.19, en julio de 2025, la compatibilidad con las GPU AMD de la serie 9000 en Linux con ROCm. vLLM incluye las Radeon RX 9000 (gfx1200 y gfx1201) entre su hardware AMD.
En Windows, la lista ROCm de Ollama llega solo hasta las RX 7000: las RX 9000 no figuran en ella. Sin embargo, Ollama especifica que Vulkan ofrece compatibilidad adicional en Windows y Linux, activada por defecto. Por tanto, una 9070 XT en Windows utiliza Vulkan en la práctica; comprueba con ollama ps que el modelo se esté ejecutando realmente en la GPU y consulta la guía de llama.cpp con Vulkan si compilas por tu cuenta.
#Puesta en marcha en Linux con Ollama
- 01Instalar el controlador ROCmSigue la documentación ROCm de AMD con la herramienta amdgpu-install, como pide Ollama, añade tu usuario a los grupos render y video y luego reinicia.
- 02Confirmar la detecciónrocminfo debe listar un agente GPU y rocm-smi debe mostrar los 16 GB. De lo contrario, Ollama utilizará el procesador.
- 03Iniciar un primer modeloInstala Ollama con su script oficial y arranca un modelo que quepa en 16 GB, por ejemplo un 9B en Q4.
- 04Comprobar dónde se ejecutaDespués de la primera respuesta, ollama ps debe indicar 100 % GPU. Un reparto entre GPU y procesador indica que el modelo o el contexto es demasiado grande.
#Qué modelos caben en 16 GB
Los tamaños de los modelos proceden del catálogo QuelLLM y corresponden a Q4 salvo que se indique lo contrario. Añade la caché KV y aproximadamente un gigabyte de margen. La lista exhaustiva por niveles está en la guía de los 16 GB de VRAM.
| Modelo | Tamaño del modelo | ¿Cabe en 16 GB? | Límite teórico |
|---|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | Sí, con mucho margen | ≈ 107 tokens/s |
| Qwen 3.5 9B Q8 | 10 GB | Sí | 64 tokens/s |
| Gemma 4 12B Q4 | 7 GB | Sí, contexto largo | ≈ 91 tokens/s |
| Gemma 4 12B Q8 | 13 GB | Sí, contexto corto | ≈ 49 tokens/s |
| gpt-oss 20B (MoE) | 13 GB | Sí, contexto moderado | depende de los pesos activos |
| Mistral Small 24B Q4 | 14 GB | Ajustado | ≈ 46 tokens/s |
| Qwen 3.8 27B Q4 | 16 GB | No | - |
El límite máximo es el ancho de banda dividido entre los pesos leídos en cada token; ninguna tarjeta lo alcanza exactamente. Los modelos MoE como gpt-oss 20B leen menos pesos por token que los correspondientes a su tamaño total y, por tanto, son más rápidos que un modelo denso del mismo tamaño, siempre que quepan íntegramente en la VRAM.
#Lo que dicen las mediciones públicas
La tabla de la comunidad llama.cpp sobre ROCm mide el mismo modelo, Llama 2 7B en Q4_0, en varias tarjetas. Para la RX 9070 XT, un participante obtiene 5 055 tokens por segundo en lectura del prompt (pp512) y 101 en generación (tg128), sin Flash Attention. En la 7900 XTX, la tabla muestra 3 552 y 167; en la 9060 XT, 1 420 y 68.
| Tarjeta | Ancho de banda AMD | Lectura del prompt | Generación |
|---|---|---|---|
| RX 7900 XTX | 960 GB/s | 3 552 t/s | 167 t/s |
| RX 9070 XT | 640 GB/s | 5 055 t/s | 101 t/s |
| RX 9060 XT | 320 GB/s | 1 420 t/s | 68 t/s |
Dos enseñanzas. Primero, la 9070 XT lee un prompt largo aproximadamente un 40 % más rápido que la 7900 XTX, a pesar de tener un ancho de banda inferior: es la ventaja de un cálculo matricial más potente, útil para el RAG, los documentos largos y los agentes de código que devuelven mucho contexto. Segundo, en generación, la 7900 XTX sigue por delante, como cabría esperar por su ancho de banda un 50 % superior.
#¿Qué modelo elegir según el uso?
Con 16 GB, la elección adecuada depende menos del tamaño máximo que del margen que quede para el contexto. Una regla sencilla: deja al menos 2 GB libres además de lo que ocupan los pesos para la caché KV y los búferes, y más si trabajas con documentos largos. La tabla propone un punto de partida según el uso, a partir de los pesos del catálogo QuelLLM.
| Uso | Modelo de partida | Pesos Q4 | Margen con 16 GB |
|---|---|---|---|
| Chat general y redacción | Gemma 4 12B | 7 GB | 9 GB, contexto largo posible |
| Código, agente de desarrollo | Devstral Small 2 24B | 14 GB | 2 GB, contexto corto |
| Razonamiento rápido (MoE) | gpt-oss 20B | 13 GB | 3 GB |
| RAG con prompts largos | Qwen 3.5 9B | 6 GB | 10 GB para el contexto |
| Tareas ligeras continuas | Granite 4.2 8B | 4,6 GB | 11 GB |
Para el RAG, el cálculo matricial de la 9070 XT es una gran ventaja: un prompt de varios miles de tokens se lee rápidamente, y un 9B en Q4 deja 10 GB para la caché KV y, por tanto, para un contexto largo. Para el código, un modelo de 14 GB cabe, pero con un contexto corto; en ese caso, hay que cuantizar la caché KV o reducir la ventana.
#Contexto y caché KV: los dos ajustes que cuentan
La documentación de Ollama indica una ventana de contexto predeterminada de 4.096 tokens, que modifica la variable OLLAMA_CONTEXT_LENGTH. La caché KV se cuantiza con OLLAMA_KV_CACHE_TYPE, cuyo valor predeterminado es f16, cuando Flash Attention está activada; Ollama la utiliza automáticamente cuando el backend y la tarjeta lo permiten. Aumenta el contexto progresivamente vigilando ollama ps: en cuanto una parte del modelo pase al procesador, retrocede un nivel.
#FP8 en RX 9070 XT: lo que realmente cambia
AMD indica para la 9070 XT una capacidad de cálculo matricial FP8 de 389 TFLOPs, un dato que no aparece en la ficha de la RX 7900 XTX. En la práctica, con Ollama y los modelos GGUF en Q4 o Q5, no utilizas FP8: los pesos son enteros cuantizados. FP8 sirve sobre todo para los motores que cargan pesos FP8, como vLLM, que incluye las RX 9000 en su lista. Considéralo un margen para más adelante, no una mejora inmediata, y no compres la tarjeta por ese motivo: la capacidad de 16 GB y el ancho de banda siguen siendo los dos criterios que determinan qué puedes ejecutar hoy.
#RX 9070 XT o RTX 5070 Ti
NVIDIA describe la RTX 5070 Ti con 16 GB de GDDR7 en un bus de 256 bits: la misma capacidad que la tarjeta AMD, con memoria de otra generación. A igual capacidad, caben los mismos modelos; la diferencia está en la velocidad de generación, en el ecosistema CUDA y en el precio, para el que no damos una cifra fija aquí. Consulta el seguimiento de precios de las tarjetas para IA local: suele ser lo que permite decidir entre ellas.
| Tu situación | Tarjeta que conviene priorizar | Razón |
|---|---|---|
| Linux, Ollama o LM Studio, presupuesto ajustado | RX 9070 XT | Compatibilidad con ROCm 7, 16 GB, cálculo FP8 incluido en la lista |
| Windows y ninguna gana de depurar | RTX 5070 Ti | Ecosistema CUDA, controladores más universales |
| Proyectos que requieren CUDA (algunas cadenas de fine-tuning) | RTX 5070 Ti | CUDA sigue siendo el objetivo predeterminado de muchos proyectos |
| RAG con prompts largos | RX 9070 XT o RTX 5070 Ti | La capacidad de cálculo importa tanto como el ancho de banda |
| Modelos de 27 mil millones y más | Tarjeta de 24 GB | Ninguna tarjeta de 16 GB basta para eso |
#Alimentación y carcasa
AMD recomienda una fuente de alimentación de 750 W como mínimo e indica 304 W de potencia típica para la tarjeta, con dos conectores de 8 pines. Añade el consumo del procesador, los discos y los ventiladores para dimensionar el conjunto, y verifica la longitud y el grosor del modelo de tu fabricante: estas tarjetas suelen ser grandes. Una caja bien ventilada reduce el ruido y las caídas de frecuencia bajo carga prolongada, lo cual cuenta cuando la tarjeta genera texto durante horas. Para un servidor de IA que permanece encendido, el consumo en reposo y bajo carga cuenta tanto como el precio de compra a lo largo del tiempo.
- ¿Qué LLM para 16 GB de VRAM? La lista completa
- Ollama con GPU AMD (ROCm): instalación
- LLM en RX 7900 XTX (24 GB)
- LLM en RX 9060 XT (8 / 16 GB)
- Hoja de especificaciones de hardware RX 9070 XT
- Precios de las tarjetas gráficas para IA local
- Fuente: hoja técnica de AMD para la Radeon RX 9070 XT
- Fuente: documentación GPU de Ollama
- Fuente: LM Studio 0.3.19, soporte para AMD serie 9000
- Fuente: tabla de rendimiento de llama.cpp en ROCm
#Preguntas frecuentes
¿La RX 9070 XT es adecuada para LLM en local?+
¿Cómo usar LM Studio con una RX 9070 XT?+
¿Se necesita ROCm o Vulkan en la RX 9070 XT?+
¿Cuántos tokens por segundo da una RX 9070 XT?+
¿Puede la RX 9070 XT manejar FP8?+
¿Qué fuente de alimentación elegir para una RX 9070 XT?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.