Rendimiento de LLM en GPU AMD Radeon 9070XT

La consulta «9070xt llm» aparece a menudo entre los propietarios de la Radeon RX 9070 XT que quieren ejecutar un modelo en local sin una tarjeta NVIDIA. Buena noticia: con 16 GB de GDDR6 y el soporte de ROCm para la arquitectura RDNA 4, una configuración 9070xt llm es viable para la mayoría de los usos personales, siempre que se comprendan sus limitaciones de memoria. Esta página detalla las especificaciones de la tarjeta relevantes para la inferencia, la VRAM consumida según la cuantización (Q4, Q5, Q8, FP16), las velocidades en tokens/segundo que cabe esperar, los modelos del catálogo quelllm.fr que se pueden utilizar descargando parte del procesamiento a la CPU, la interpretación de los benchmarks y, después, los casos de uso y las herramientas (llama.cpp, Ollama, vLLM) que realmente funcionan en AMD.

Hoja técnica de la RX 9070 XT para inferencia

Lo que importa para un LLM no es la potencia de cálculo bruta, sino el ancho de banda de la memoria y la cantidad de VRAM. En estos dos aspectos, la tarjeta se sitúa así:

Para situarnos: el ancho de banda es similar al de una RX 7900 XT, pero la VRAM sigue siendo de 16 GB frente a los 20 o 24 GB de la generación anterior. Esta es la contrapartida que debes tener en cuenta antes de comprar. La página de la RX 9070 XT lista los modelos clasificados por compatibilidad, y el guía de instalación dedicada explica la instalación paso a paso.

VRAM: lo que cabe en 16 GB según la cuantización

Regla práctica para estimar la memoria de un modelo denso: aproximadamente 0,55 a 0,6 GB por millardo de parámetros en Q4, 0,7 en Q5, 1,05 en Q8 y 2 en FP16, más la caché KV que crece con el contexto. En 16 GB, reservando 1 a 1,5 GB para el sistema y la caché KV:

Los modelos del catálogo de referencia citado en esta página son todos mucho más grandes que eso. Tomemos tres ejemplos de la gama de 118 a 128 mil millones de parámetros, donde solo los expertos activos trabajan en cada token:

Ninguno de estos modelos cabe en 16 GB de VRAM. Sin embargo, siguen siendo interesantes para una 9070 XT gracias a la transferencia de los expertos a la RAM del sistema, explicada más abajo.

Velocidad en tokens/segundo: órdenes de magnitud estimados

Durante la generación, la tasa de procesamiento de un modelo que cabe completamente en la VRAM está limitada por el ancho de banda: cada token requiere leer todos los pesos. Con 640 GB/s, el límite teórico para un modelo de 8 GB en Q4 es de aproximadamente 80 tokens/segundo; en la práctica, se observa entre el 55 % y el 70 % de ese máximo. Órdenes de magnitud, todos estimadas y por confirmar con tu propia configuración:

En los modelos con expertos del catálogo, el rendimiento en tokens por segundo depende principalmente de la RAM del sistema. Con 64 a 96 GB de DDR5 en doble canal, las capas de atención en VRAM y los expertos en RAM, se puede aspirar a entre 8 y 15 tokens/segundo (estimación) en un modelo con 10 mil millones de parámetros activos como Qwen 3.5 122B-A10B, y a entre 12 y 20 tokens/segundo (estimación) en Qwen3.8 Flash Next 125B-A6B. El procesamiento del prompt sigue siendo considerablemente más lento que cuando todo está en VRAM. El método está documentado en el GitHub de llama.cpp a través de las opciones de colocación de tensores en CPU. El comparador de benchmarks locales proporciona cifras obtenidas en otras tarjetas para calibrar tus expectativas.

Modelos de expertos que pueden ejecutarse con offload a la CPU y sus licencias

Para un uso serio en una 9070 XT con mucha RAM, estos son los candidatos del catálogo quelllm.fr en el rango de 118 a 142 mil millones de parámetros; hay que verificar su licencia antes de cualquier uso comercial:

Apache 2.0 y MIT permiten el uso comercial sin condiciones especiales. Las licencias «Modified MIT», «NVIDIA Open Model License» y «OpenMDW» añaden condiciones que hay que leer en el repositorio del modelo antes de crear un producto basado en él. Si dudas entre varios candidatos, el comparador coloca dos fichas una junto a la otra.

Pruebas de rendimiento: cómo interpretar los resultados para esta GPU

Las puntuaciones publicadas (MMLU para el conocimiento general, HumanEval y LiveCodeBench para el código, GPQA para el razonamiento científico) miden el modelo en precisión completa, no tu configuración. Son necesarias tres precauciones en una 9070 XT :

Lo recomendable es comparar dos modelos en tus propias tareas, con tus prompts, en lugar de confiar en una clasificación agregada.

Casos de uso concretos y herramientas compatibles con AMD

En una 9070 XT, los usos que funcionan bien en el día a día son el asistente de código en el editor, el resumen y la reformulación de documentos, la traducción, el análisis de archivos privados mediante RAG local y los agentes con herramientas para tareas cortas. Los usos con un contexto muy largo, como el análisis de contratos de varios cientos de páginas, requieren un modelo pequeño con una caché KV cuantizada o una segunda tarjeta.

En cuanto al software:

En caso de error al cargar, GPU no detectado o cambio silencioso al CPU, el guía de solución de problemas de Ollama con la GPU reúne las causas comunes. Si piensas en añadir una segunda tarjeta para superar 16 GB, el guía multi-GPU llama.cpp explica la distribución de las capas.

FAQ

P: ¿Es la RX 9070 XT una buena opción para una primera configuración de LLM local?

Sí, para modelos de hasta 24 mil millones de parámetros en Q4, con velocidades cómodas y un precio inferior al de las tarjetas NVIDIA con la misma cantidad de VRAM. El punto débil siguen siendo los 16 GB: compara con una RX 7900 XTX de segunda mano con 24 GB si buscas modelos más grandes. El guía para elegir un GPU detalla estas decisiones de compromiso.

P: ¿Qué diferencia hay con la RX 9060 XT 16 GB para los LLM?

Misma cantidad de VRAM, por lo tanto, se pueden cargar los mismos modelos, pero la 9060 XT tiene un bus de 128 bits y aproximadamente la mitad del ancho de banda. La velocidad en tokens por segundo sigue aproximadamente esa proporción. El benchmark de la 9060 XT 16 GB ofrece mediciones concretas para compararlas con las estimaciones de esta página.

P: ¿Se puede ejecutar Qwen 3.5 122B-A10B en una 9070 XT?

No solo en VRAM: la versión Q4 ocupa aproximadamente 73 GB. Con 96 GB o más de RAM del sistema, llama.cpp permite mantener las capas compartidas en la GPU y enviar los expertos a la RAM. La velocidad cae entonces a unos 8 a 15 tokens/s (estimación), aceptable para un uso conversacional, pero lenta para prompts largos.

P: ¿ROCm o Vulkan en esta tarjeta?

ROCm suele ofrecer una velocidad de procesamiento entre un 10 y un 25 % mayor (estimación) y un mejor procesamiento del prompt. Vulkan se instala sin dependencias específicas de AMD y funciona en casi todas las distribuciones de Linux y en Windows. Comienza por Vulkan para verificar el hardware y luego pasa a ROCm si te interesa esa mejora y la versión instalada reconoce gfx1201.

P: ¿Cuánta RAM del sistema se debe prever como complemento?

Para seguir usando modelos que caben en la VRAM, 32 GB son suficientes. Para aprovechar los modelos con expertos del catálogo transfiriendo parte del modelo a la RAM del sistema, apunta a un mínimo de 64 GB e idealmente a entre 96 y 128 GB de DDR5 de doble canal. La velocidad de la RAM influye directamente en los tokens/segundo en este modo, más que el propio procesador.

P: ¿Qué modelos funcionan sin GPU si la tarjeta está ocupada?

Los modelos con pocos parámetros activos siguen siendo utilizables únicamente con el procesador, a velocidades reducidas. La página dedicada a la inferencia sin GPU explica los ajustes de hilos y de cuantización que minimizan la pérdida de rendimiento, y la clasificación Solo con CPU lista los candidatos.

Conclusión

Una configuración con una 9070xt para LLM es adecuada para quien busque un LLM local rápido con modelos de 7 a 24 mil millones de parámetros, y sigue siendo viable con los modelos de expertos del catálogo siempre que se invierta en la RAM del sistema. Las cifras de velocidad de generación indicadas aquí son estimaciones que deben confirmarse en tu máquina. Para encontrar el modelo adecuado para tus 16 GB de VRAM, tu RAM y tu uso, utiliza el configurador o explora el catálogo completo filtrado por VRAM.

El hardware para ejecutar un LLM localmente

Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

Artículo publicado y actualizado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.