Rendimiento de LLM en GPU AMD Radeon 9070XT
La consulta «9070xt llm» aparece a menudo entre los propietarios de la Radeon RX 9070 XT que quieren ejecutar un modelo en local sin una tarjeta NVIDIA. Buena noticia: con 16 GB de GDDR6 y el soporte de ROCm para la arquitectura RDNA 4, una configuración 9070xt llm es viable para la mayoría de los usos personales, siempre que se comprendan sus limitaciones de memoria. Esta página detalla las especificaciones de la tarjeta relevantes para la inferencia, la VRAM consumida según la cuantización (Q4, Q5, Q8, FP16), las velocidades en tokens/segundo que cabe esperar, los modelos del catálogo quelllm.fr que se pueden utilizar descargando parte del procesamiento a la CPU, la interpretación de los benchmarks y, después, los casos de uso y las herramientas (llama.cpp, Ollama, vLLM) que realmente funcionan en AMD.
Hoja técnica de la RX 9070 XT para inferencia
Lo que importa para un LLM no es la potencia de cálculo bruta, sino el ancho de banda de la memoria y la cantidad de VRAM. En estos dos aspectos, la tarjeta se sitúa así:
- Arquitectura : RDNA 4, identificador ROCm gfx1201
- VRAM : 16 GB GDDR6, bus de 256 bits
- Ancho de banda : aproximadamente 640 GB/s (valor indicado por el fabricante)
- Unidades de cálculo : 64 CU, 4096 procesadores de flujo
- Consumo típico : 304 W bajo carga
- Soporte de software : ROCm 6.4 y versiones posteriores, backend Vulkan de llama.cpp como alternativa
Para situarnos: el ancho de banda es similar al de una RX 7900 XT, pero la VRAM sigue siendo de 16 GB frente a los 20 o 24 GB de la generación anterior. Esta es la contrapartida que debes tener en cuenta antes de comprar. La página de la RX 9070 XT lista los modelos clasificados por compatibilidad, y el guía de instalación dedicada explica la instalación paso a paso.
VRAM: lo que cabe en 16 GB según la cuantización
Regla práctica para estimar la memoria de un modelo denso: aproximadamente 0,55 a 0,6 GB por millardo de parámetros en Q4, 0,7 en Q5, 1,05 en Q8 y 2 en FP16, más la caché KV que crece con el contexto. En 16 GB, reservando 1 a 1,5 GB para el sistema y la caché KV:
- Q4 (Q4_K_M) : modelos densos de hasta unos 20 a 24 mil millones de parámetros, contexto de 8k a 16k
- Q5 : hasta aproximadamente 16 a 18 mil millones de parámetros
- Q8 : hasta alrededor de 12 a 13 mil millones de parámetros
- FP16 : hasta alrededor de 7 mil millones de parámetros, raramente útil en inferencia local
Los modelos del catálogo de referencia citado en esta página son todos mucho más grandes que eso. Tomemos tres ejemplos de la gama de 118 a 128 mil millones de parámetros, donde solo los expertos activos trabajan en cada token:
- Qwen 3.5 122B-A10B : Q4 ~73 GB, Q5 ~88 GB (estimado), Q8 ~130 GB (estimado), FP16 ~245 GB (estimado). Hoja de datos: Qwen 3.5 122B-A10B
- Mistral Small 4 (119B): Q4 ~72 GB, Q8 ~128 GB (estimado). Ficha: Mistral Small 4
- Qwen3.8 Flash Next 125B-A6B : Q4 ~72 GB, solo 6 mil millones de parámetros activos. Ficha: Qwen3.8 Flash Next
Ninguno de estos modelos cabe en 16 GB de VRAM. Sin embargo, siguen siendo interesantes para una 9070 XT gracias a la transferencia de los expertos a la RAM del sistema, explicada más abajo.
Velocidad en tokens/segundo: órdenes de magnitud estimados
Durante la generación, la tasa de procesamiento de un modelo que cabe completamente en la VRAM está limitada por el ancho de banda: cada token requiere leer todos los pesos. Con 640 GB/s, el límite teórico para un modelo de 8 GB en Q4 es de aproximadamente 80 tokens/segundo; en la práctica, se observa entre el 55 % y el 70 % de ese máximo. Órdenes de magnitud, todos estimadas y por confirmar con tu propia configuración:
- Modelo denso de 7 a 9 mil millones de parámetros, Q4, 100 % en VRAM : 45 a 60 tokens/segundo
- modelo denso de 12 a 14 mil millones, Q4 : 28 a 38 tokens/segundo
- Modelo denso de 22 a 24 mil millones, Q4, contexto corto : 15 a 22 tokens/segundo
- Modelo denso de 30 mil millones o más, Q4 : ejecución parcial en la CPU, a menudo de 3 a 6 tokens/sec, incómoda para el uso diario
En los modelos con expertos del catálogo, el rendimiento en tokens por segundo depende principalmente de la RAM del sistema. Con 64 a 96 GB de DDR5 en doble canal, las capas de atención en VRAM y los expertos en RAM, se puede aspirar a entre 8 y 15 tokens/segundo (estimación) en un modelo con 10 mil millones de parámetros activos como Qwen 3.5 122B-A10B, y a entre 12 y 20 tokens/segundo (estimación) en Qwen3.8 Flash Next 125B-A6B. El procesamiento del prompt sigue siendo considerablemente más lento que cuando todo está en VRAM. El método está documentado en el GitHub de llama.cpp a través de las opciones de colocación de tensores en CPU. El comparador de benchmarks locales proporciona cifras obtenidas en otras tarjetas para calibrar tus expectativas.
Modelos de expertos que pueden ejecutarse con offload a la CPU y sus licencias
Para un uso serio en una 9070 XT con mucha RAM, estos son los candidatos del catálogo quelllm.fr en el rango de 118 a 142 mil millones de parámetros; hay que verificar su licencia antes de cualquier uso comercial:
- Qwen 3.5 122B-A10B (Alibaba): Apache 2.0, contexto 262k, VRAM Q4 ~73 GB. Pesos publicados en la página de Hugging Face de Alibaba
- Qwen3.8 Flash Next 125B-A6B (Qwen) : licencia «otra, pesos abiertos», que debe leerse atentamente
- Mistral Small 4 (Mistral): Apache 2.0, contexto 256k. Pesos en la página de Hugging Face de Mistral
- Mistral Medium 3.5 128B : Modified MIT, VRAM Q4 ~74 GB. Ficha: Mistral Medium 3.5
- Nemotron 3 Super 120B (NVIDIA): NVIDIA Open Model License, VRAM Q4 ~72 GB. Pesos en la página de Hugging Face de NVIDIA
- Laguna S 2.1 (Poolside) : OpenMDW 1.1, orientado al código, VRAM Q4 ~68 GB, el más ligero de la lista
- dots.llm1 Instruct (Rednote) : MIT, VRAM Q4 ~85 GB, contexto limitado a 32k
- Mixtral 8x22B Instruct (Mistral): Apache 2.0, VRAM Q4 ~82 GB, arquitectura más antigua
Apache 2.0 y MIT permiten el uso comercial sin condiciones especiales. Las licencias «Modified MIT», «NVIDIA Open Model License» y «OpenMDW» añaden condiciones que hay que leer en el repositorio del modelo antes de crear un producto basado en él. Si dudas entre varios candidatos, el comparador coloca dos fichas una junto a la otra.
Pruebas de rendimiento: cómo interpretar los resultados para esta GPU
Las puntuaciones publicadas (MMLU para el conocimiento general, HumanEval y LiveCodeBench para el código, GPQA para el razonamiento científico) miden el modelo en precisión completa, no tu configuración. Son necesarias tres precauciones en una 9070 XT :
- La cuantización reduce ligeramente las puntuaciones : en Q4_K_M, la pérdida suele mantenerse por debajo de 2 puntos en MMLU para los modelos de más de 12 mil millones de parámetros y es mayor en los modelos pequeños. Esta cifra debe confirmarse modelo por modelo.
- Las puntuaciones del catálogo deben verificarse con elOpen LLM Leaderboard, que evalúa los pesos abiertos bajo condiciones homogéneas.
- El contexto truncado cambia los resultados : un modelo anunciado con 256k de contexto pero ejecutado con 8k en 16 GB de VRAM no se comportará como en las pruebas con contextos largos.
Lo recomendable es comparar dos modelos en tus propias tareas, con tus prompts, en lugar de confiar en una clasificación agregada.
Casos de uso concretos y herramientas compatibles con AMD
En una 9070 XT, los usos que funcionan bien en el día a día son el asistente de código en el editor, el resumen y la reformulación de documentos, la traducción, el análisis de archivos privados mediante RAG local y los agentes con herramientas para tareas cortas. Los usos con un contexto muy largo, como el análisis de contratos de varios cientos de páginas, requieren un modelo pequeño con una caché KV cuantizada o una segunda tarjeta.
En cuanto al software:
- Ollama es compatible con ROCm en RDNA 4 desde las versiones de 2025; el procedimiento está en la guía para usar Ollama en GPU AMD, y el proyecto se sigue en el GitHub de Ollama
- llama.cpp ofrece dos backends: ROCm (HIP) para la mayor velocidad de procesamiento y Vulkan para la sencillez de instalación, útil si ROCm no reconoce la tarjeta
- vLLM se orienta principalmente al servicio multiusuario; su soporte de ROCm está documentado en el sitio de vLLM pero está orientado principalmente a las tarjetas profesionales; hay que probarlo antes de confiar en él
En caso de error al cargar, GPU no detectado o cambio silencioso al CPU, el guía de solución de problemas de Ollama con la GPU reúne las causas comunes. Si piensas en añadir una segunda tarjeta para superar 16 GB, el guía multi-GPU llama.cpp explica la distribución de las capas.
FAQ
P: ¿Es la RX 9070 XT una buena opción para una primera configuración de LLM local?
Sí, para modelos de hasta 24 mil millones de parámetros en Q4, con velocidades cómodas y un precio inferior al de las tarjetas NVIDIA con la misma cantidad de VRAM. El punto débil siguen siendo los 16 GB: compara con una RX 7900 XTX de segunda mano con 24 GB si buscas modelos más grandes. El guía para elegir un GPU detalla estas decisiones de compromiso.
P: ¿Qué diferencia hay con la RX 9060 XT 16 GB para los LLM?
Misma cantidad de VRAM, por lo tanto, se pueden cargar los mismos modelos, pero la 9060 XT tiene un bus de 128 bits y aproximadamente la mitad del ancho de banda. La velocidad en tokens por segundo sigue aproximadamente esa proporción. El benchmark de la 9060 XT 16 GB ofrece mediciones concretas para compararlas con las estimaciones de esta página.
P: ¿Se puede ejecutar Qwen 3.5 122B-A10B en una 9070 XT?
No solo en VRAM: la versión Q4 ocupa aproximadamente 73 GB. Con 96 GB o más de RAM del sistema, llama.cpp permite mantener las capas compartidas en la GPU y enviar los expertos a la RAM. La velocidad cae entonces a unos 8 a 15 tokens/s (estimación), aceptable para un uso conversacional, pero lenta para prompts largos.
P: ¿ROCm o Vulkan en esta tarjeta?
ROCm suele ofrecer una velocidad de procesamiento entre un 10 y un 25 % mayor (estimación) y un mejor procesamiento del prompt. Vulkan se instala sin dependencias específicas de AMD y funciona en casi todas las distribuciones de Linux y en Windows. Comienza por Vulkan para verificar el hardware y luego pasa a ROCm si te interesa esa mejora y la versión instalada reconoce gfx1201.
P: ¿Cuánta RAM del sistema se debe prever como complemento?
Para seguir usando modelos que caben en la VRAM, 32 GB son suficientes. Para aprovechar los modelos con expertos del catálogo transfiriendo parte del modelo a la RAM del sistema, apunta a un mínimo de 64 GB e idealmente a entre 96 y 128 GB de DDR5 de doble canal. La velocidad de la RAM influye directamente en los tokens/segundo en este modo, más que el propio procesador.
P: ¿Qué modelos funcionan sin GPU si la tarjeta está ocupada?
Los modelos con pocos parámetros activos siguen siendo utilizables únicamente con el procesador, a velocidades reducidas. La página dedicada a la inferencia sin GPU explica los ajustes de hilos y de cuantización que minimizan la pérdida de rendimiento, y la clasificación Solo con CPU lista los candidatos.
Conclusión
Una configuración con una 9070xt para LLM es adecuada para quien busque un LLM local rápido con modelos de 7 a 24 mil millones de parámetros, y sigue siendo viable con los modelos de expertos del catálogo siempre que se invierta en la RAM del sistema. Las cifras de velocidad de generación indicadas aquí son estimaciones que deben confirmarse en tu máquina. Para encontrar el modelo adecuado para tus 16 GB de VRAM, tu RAM y tu uso, utiliza el configurador o explora el catálogo completo filtrado por VRAM.
El hardware para ejecutar un LLM localmente
Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:
Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.