Ryzen AI 9 HX: ¿el NPU de 50 TOPS realmente sirve para los LLM? ?
El Ryzen AI 9 HX 370 presume de 50 TOPS en su NPU XDNA 2, una cifra que el equipo de marketing de AMD adora destacar frente a Intel y Apple. La verdadera pregunta para quien quiera ejecutar un LLM local es: ¿sirve esta NPU para algo o hay que seguir dependiendo de la GPU integrada Radeon 890M? Esta guía prueba con honestidad la pila de software Ryzen AI para LLM (LM Studio Ryzen AI, Lemonade SDK), la compara con la ejecución exclusivamente en CPU y con la iGPU, y da el veredicto, sin adornos.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#¿Por qué una NPU para un LLM local?
Una NPU (Neural Processing Unit, unidad de procesamiento neuronal) es un acelerador dedicado a las operaciones matriciales INT8 e INT4 típicas de la inferencia. En el Ryzen AI 9 HX 370, el bloque XDNA 2 ofrece hasta 50 TOPS INT8 con un consumo de aproximadamente 2 W. A primera vista, esta combinación resulta imbatible para un uso portátil: un LLM que funciona sin activar los ventiladores y sin agotar la batería en 40 minutos.
La palabra clave Ryzen AI 9 HX LLM NPU aparece en todas las demostraciones de AMD, pero en realidad el ecosistema de software es joven. La mayoría de los stacks LLM (llama.cpp, Ollama, vLLM) ignoran completamente el NPU y ejecutan todo en una CPU con AVX-512 o en la GPU integrada a través de Vulkan / ROCm. Para aprovechar XDNA 2, es necesario usar runtimes específicos compilados por AMD o por la comunidad.
#XDNA 2 en la práctica: lo que dice el silicio
La arquitectura XDNA 2 integrada en Strix Point (generación Ryzen AI 300) duplica los TOPS en comparación con XDNA 1 (16 → 50 TOPS) e introduce soporte nativo para los formatos de coma flotante por bloques FP8 y FP16. Es la primera NPU de AMD que puede manejar un LLM de forma decente, pero con dos limitaciones importantes.
- Ancho de banda de memoria
- La NPU comparte la memoria del sistema (LPDDR5X-7500 o 8000 en las máquinas Strix Point). Esto equivale a unos 120-128 GB/s, compartidos con la CPU, la GPU y el sistema operativo. La NPU nunca podrá alcanzar su rendimiento de cálculo teórico máximo.
- Cuantización obligatoria
- El flujo de procesamiento oficial de AMD requiere modelos cuantizados en INT4 o INT8 mediante el formato ONNX optimizado. Los GGUF Q4_K_M clásicos no funcionan tal cual: hace falta una conversión.
- Compilación previa en ONNX
- Cada modelo debe compilarse para XDNA 2 (subgrafos asignados a la NPU, el resto a la CPU). Es la etapa que desanima al 95 % de los usuarios.
- Sin soporte multiusuario
- La NPU solo puede atender a un proceso a la vez. Si un LLM la ocupa, ninguna otra IA de Windows (Studio Effects, Recall si lo usas) puede utilizarla en paralelo.
#Requisitos de hardware y software
- CPU
- Ryzen AI 9 HX 370, HX 365 o HX PRO 370 (Strix Point, nombre en clave Krackan). Los Ryzen AI 7/5 funcionan con un NPU más modesto pero la misma pila de software.
- RAM
- 32 GB de LPDDR5X como mínimo para un uso cómodo. 64 GB si quieres probar un modelo de 14B en la iGPU en paralelo.
- OS
- Windows 11 24H2 o posterior. Existen controladores para la NPU XDNA en Linux (el controlador está integrado en el kernel principal desde la versión 6.11), pero las herramientas para el usuario van muy por detrás.
- Controladores de NPU
- AMD Ryzen AI Software 1.3 o superior (descarga por separado en amd.com, no incluido en el controlador Adrenalin).
- Almacenamiento
- ~20 GB libres para modelos ONNX precompilados (más voluminosos que los equivalentes GGUF).
#1. LM Studio Ryzen AI: la vía más sencilla
AMD distribuye un fork oficial de LM Studio preconfigurado para XDNA 2. Es la vía recomendada para quienes quieren probar sin tocar Python ni ONNX Runtime.
- 01Descargar el binarioVe a amd.com/lmstudio (página oficial «LM Studio for Ryzen AI»). El binario de Windows está firmado por AMD.
- 02Instalación clásicaEl instalador coloca LM Studio en Program Files y configura automáticamente el runtime ONNX RyzenAI Execution Provider.
- 03Seleccionar un modelo optimizado para NPUEn la pestaña Discover, filtra por la etiqueta «Ryzen AI». Encontrarás Qwen 3.5 9B, Granite 4.2 3B y Granite 4.2 8B precompilados para XDNA 2 (sufijo -hybrid).
- 04Cargar y probarAl cargar, LM Studio muestra un selector de entorno de ejecución: GPU, CPU o «Ryzen AI Hybrid» (NPU + iGPU). Elige Hybrid para aprovechar el NPU.
- 05Verificar que la NPU esté trabajandoAbre el Administrador de tareas → pestaña Rendimiento → NPU. La curva debe subir al 60-95 % durante la generación. Si se mantiene en 0, el entorno de ejecución ha pasado a usar la CPU.
#2. Lemonade SDK: para ir más allá de LM Studio
Lemonade SDK es la herramienta oficial de AMD para desarrolladores. Tiene dos objetivos: (1) compilar tus propios modelos GGUF/HF al formato ONNX híbrido, (2) exponer una API compatible con OpenAI que se puede usar desde Open WebUI, Continue.dev, etc.
#3. Recurrir a la Radeon 890M: a menudo la mejor opción
El Ryzen AI 9 HX 370 incluye también una iGPU Radeon 890M (RDNA 3.5, 16 CU). En LM Studio estándar o Ollama, esta iGPU es utilizable a través de Vulkan y a veces supera al NPU en rendimiento puro. Aquí te explico cómo usarla.
- Asignación dinámica de VRAM
- La Radeon 890M comparte la RAM del sistema. En la BIOS UEFI, busca «UMA Frame Buffer Size» y establece al menos 8 GB (16 GB si es posible) antes de probar un LLM.
- Controlador
- Adrenalin 24.10 o superior para beneficiarte de la ruta de ejecución de Vulkan optimizada para cómputo. Los controladores OEM de Lenovo/Asus suelen ir 2 versiones por detrás.
- ROCm bajo Linux
- ROCm 6.3+ es oficialmente compatible con Strix Point desde abril de 2026. En Ubuntu 24.04, es viable, pero la iGPU sigue limitada por el ancho de banda de su memoria compartida.
#Pruebas de rendimiento: NPU vs iGPU vs CPU
Valores aproximados registrados en un Asus Zenbook S 14 (Ryzen AI 9 HX 370, 32 GB LPDDR5X-7500, Windows 11 24H2, AMD Ryzen AI Software 1.3, Adrenalin 24.10.1). Prompt corto (~50 tokens), generación de 256 tokens, temperatura 0.7. Promedio de 5 ejecuciones.
- Qwen 3.5 9B — CPU AVX-512
- 4,1 tok/s · 28 W en el encapsulado · ventilador audible
- Qwen 3.5 9B — Radeon 890M (Vulkan)
- 9,8 tok/s · 35 W del encapsulado · ventilador funcionando de forma sostenida
- Qwen 3.5 9B híbrido — NPU + iGPU (LM Studio Ryzen AI)
- 11,2 tok/s · 18 W del encapsulado · ventilador silencioso
- Granite 4.2 3B — NPU puro
- 24 tok/s · 9 W del encapsulado del procesador · ventilador apagado
- Granite 4.2 8B — NPU + iGPU
- 13,5 tok/s · 19 W package · ventilador silencioso
- Gemma 4 12B — Radeon 890M (Vulkan)
- 4,2 tok/s · 38 W · demasiado grande para el NPU solo
#Casos de uso en los que la NPU destaca
- Chatbot de asistencia permanente
- Un Granite 4.2 3B o Qwen 3.5 4B en una NPU consume ~5 W y permanece disponible las 24 horas del día sin un impacto notable en la batería. Ideal para integrarlo en una app de productividad.
- Resumen automático de correos / documentos
- Tarea corta por lotes, contexto de 4 a 8k tokens, modelos de 3B a 8B. Ideal para la NPU: ventilador apagado, procesamiento silencioso en segundo plano mientras trabajas.
- Transcripción de voz en tiempo real + resumen
- Whisper (en la iGPU) + Granite 4.2 8B (en la NPU) en un pipeline: posible precisamente porque ambos módulos son independientes.
- Modo avión prolongado
- Con batería, el uso combinado de NPU + iGPU permite entre 4 y 5 horas de uso activo de LLM, frente a 1 hora y 30 minutos con una configuración basada únicamente en CPU/iGPU.
#Errores que evitar y limitaciones que conviene conocer
- Contexto limitado
- La mayoría de los modelos precompilados de AMD tienen un límite de 4096 tokens de contexto. Para 32k o más, debes recompilar, y eso consume mucha más memoria.
- Nada de modelos de más de 8B usando solo la NPU
- Por encima de 8B, incluso en INT4, la NPU no tiene suficiente ancho de banda. Por encima de 13B, la iGPU toma necesariamente el relevo.
- Modelos no disponibles
- Qwen 3.5, DeepSeek, Gemma 4 no están todos oficialmente precompilados. Revisa el hub Ryzen AI antes de comprar una configuración pensando en ejecutar un modelo específico.
- Actualización de Windows que rompe el funcionamiento
- Algunas actualizaciones acumulativas 24H2 han desactivado temporalmente la enumeración del NPU. Mantén el paquete AMD Ryzen AI Software actualizado y revisa el Administrador de dispositivos después de cada actualización acumulativa.
- Sin fine-tuning
- XDNA 2 solo realiza inferencia. Para entrenar o realizar un ajuste fino con LoRA, se necesita una GPU dedicada, y punto.
#Para ir más allá
Tres vías para profundizar, según tu siguiente paso:
- Comprender las cuantizaciones
- La NPU XDNA 2 solo procesa INT4/INT8. La guía «Elegir tu cuantización (Q4, Q5, Q8, FP16)» explica por qué Q4_K_M sigue siendo el estándar para CPU/GPU y qué cambia con INT4 en una NPU.
- Comparar con una configuración real de GPU
- Si estás considerando un ordenador de sobremesa, la guía «Elegir tu GPU para la IA local» compara RTX 4070, 4090 y M-Max y ofrece los umbrales de compra según el uso.
- Configuración más clásica de Ollama
- Para seguir usando el conjunto de software estándar con tu Radeon 890M, la guía de instalación de Ollama en Windows cubre la configuración de Vulkan y la gestión de VRAM/RAM compartida.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.