Intermedio 13 minNPU

Ryzen AI 9 HX: ¿el NPU de 50 TOPS realmente sirve para los LLM? ?

El Ryzen AI 9 HX 370 presume de 50 TOPS en su NPU XDNA 2, una cifra que el equipo de marketing de AMD adora destacar frente a Intel y Apple. La verdadera pregunta para quien quiera ejecutar un LLM local es: ¿sirve esta NPU para algo o hay que seguir dependiendo de la GPU integrada Radeon 890M? Esta guía prueba con honestidad la pila de software Ryzen AI para LLM (LM Studio Ryzen AI, Lemonade SDK), la compara con la ejecución exclusivamente en CPU y con la iGPU, y da el veredicto, sin adornos.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#¿Por qué una NPU para un LLM local?

Una NPU (Neural Processing Unit, unidad de procesamiento neuronal) es un acelerador dedicado a las operaciones matriciales INT8 e INT4 típicas de la inferencia. En el Ryzen AI 9 HX 370, el bloque XDNA 2 ofrece hasta 50 TOPS INT8 con un consumo de aproximadamente 2 W. A primera vista, esta combinación resulta imbatible para un uso portátil: un LLM que funciona sin activar los ventiladores y sin agotar la batería en 40 minutos.

La palabra clave Ryzen AI 9 HX LLM NPU aparece en todas las demostraciones de AMD, pero en realidad el ecosistema de software es joven. La mayoría de los stacks LLM (llama.cpp, Ollama, vLLM) ignoran completamente el NPU y ejecutan todo en una CPU con AVX-512 o en la GPU integrada a través de Vulkan / ROCm. Para aprovechar XDNA 2, es necesario usar runtimes específicos compilados por AMD o por la comunidad.

i
Lo que realmente sabe hacer XDNA 2
La NPU está diseñada para la inferencia INT8/INT4 en modelos pequeños con contexto corto. No sustituye a la GPU para entrenar, realizar un ajuste fino o ejecutar un modelo de 32B. Piensa en un «asistente ligero de 3B-8B que responde en segundo plano», no en una «estación de trabajo de IA».

#XDNA 2 en la práctica: lo que dice el silicio

La arquitectura XDNA 2 integrada en Strix Point (generación Ryzen AI 300) duplica los TOPS en comparación con XDNA 1 (16 → 50 TOPS) e introduce soporte nativo para los formatos de coma flotante por bloques FP8 y FP16. Es la primera NPU de AMD que puede manejar un LLM de forma decente, pero con dos limitaciones importantes.

Ancho de banda de memoria
La NPU comparte la memoria del sistema (LPDDR5X-7500 o 8000 en las máquinas Strix Point). Esto equivale a unos 120-128 GB/s, compartidos con la CPU, la GPU y el sistema operativo. La NPU nunca podrá alcanzar su rendimiento de cálculo teórico máximo.
Cuantización obligatoria
El flujo de procesamiento oficial de AMD requiere modelos cuantizados en INT4 o INT8 mediante el formato ONNX optimizado. Los GGUF Q4_K_M clásicos no funcionan tal cual: hace falta una conversión.
Compilación previa en ONNX
Cada modelo debe compilarse para XDNA 2 (subgrafos asignados a la NPU, el resto a la CPU). Es la etapa que desanima al 95 % de los usuarios.
Sin soporte multiusuario
La NPU solo puede atender a un proceso a la vez. Si un LLM la ocupa, ninguna otra IA de Windows (Studio Effects, Recall si lo usas) puede utilizarla en paralelo.

#Requisitos de hardware y software

CPU
Ryzen AI 9 HX 370, HX 365 o HX PRO 370 (Strix Point, nombre en clave Krackan). Los Ryzen AI 7/5 funcionan con un NPU más modesto pero la misma pila de software.
RAM
32 GB de LPDDR5X como mínimo para un uso cómodo. 64 GB si quieres probar un modelo de 14B en la iGPU en paralelo.
OS
Windows 11 24H2 o posterior. Existen controladores para la NPU XDNA en Linux (el controlador está integrado en el kernel principal desde la versión 6.11), pero las herramientas para el usuario van muy por detrás.
Controladores de NPU
AMD Ryzen AI Software 1.3 o superior (descarga por separado en amd.com, no incluido en el controlador Adrenalin).
Almacenamiento
~20 GB libres para modelos ONNX precompilados (más voluminosos que los equivalentes GGUF).
!
Comprueba primero la NPU
En Administrador de dispositivos → Procesadores neuronales, "AMD Ryzen AI NPU" debe aparecer sin un triángulo amarillo. Si no es así, tienes un controlador genérico del chipset: instala el paquete específico AMD Ryzen AI Software.

#1. LM Studio Ryzen AI: la vía más sencilla

AMD distribuye un fork oficial de LM Studio preconfigurado para XDNA 2. Es la vía recomendada para quienes quieren probar sin tocar Python ni ONNX Runtime.

  1. 01
    Descargar el binario
    Ve a amd.com/lmstudio (página oficial «LM Studio for Ryzen AI»). El binario de Windows está firmado por AMD.
  2. 02
    Instalación clásica
    El instalador coloca LM Studio en Program Files y configura automáticamente el runtime ONNX RyzenAI Execution Provider.
  3. 03
    Seleccionar un modelo optimizado para NPU
    En la pestaña Discover, filtra por la etiqueta «Ryzen AI». Encontrarás Qwen 3.5 9B, Granite 4.2 3B y Granite 4.2 8B precompilados para XDNA 2 (sufijo -hybrid).
  4. 04
    Cargar y probar
    Al cargar, LM Studio muestra un selector de entorno de ejecución: GPU, CPU o «Ryzen AI Hybrid» (NPU + iGPU). Elige Hybrid para aprovechar el NPU.
  5. 05
    Verificar que la NPU esté trabajando
    Abre el Administrador de tareas → pestaña Rendimiento → NPU. La curva debe subir al 60-95 % durante la generación. Si se mantiene en 0, el entorno de ejecución ha pasado a usar la CPU.
Verificar el NPU en la línea de comandos
# Lister les périphériques de calcul disponibles
Get-PnpDevice -Class "ComputeAccelerator" | Format-Table FriendlyName, Status

# Doit afficher : AMD Ryzen AI NPU - OK

#2. Lemonade SDK: para ir más allá de LM Studio

Lemonade SDK es la herramienta oficial de AMD para desarrolladores. Tiene dos objetivos: (1) compilar tus propios modelos GGUF/HF al formato ONNX híbrido, (2) exponer una API compatible con OpenAI que se puede usar desde Open WebUI, Continue.dev, etc.

Instalación del SDK Lemonade
# Python 3.11 recommandé
python -m venv .venv
.\.venv\Scripts\Activate.ps1

# Installation du SDK
pip install lemonade-sdk[npu]

# Test : lister les modèles déjà disponibles
lemonade list
Iniciar un servidor compatible con OpenAI
# Charge Qwen 3.5 9B précompilé en mode hybride NPU+iGPU
lemonade serve --model qwen3.5-9b-instruct-hybrid --port 8000

# L'endpoint http://localhost:8000/v1/chat/completions est désormais utilisable
# par toute app qui parle OpenAI (Open WebUI, Continue, etc.)
→
Compilar un modelo personalizado
Para tus propios modelos, el comando `lemonade onnx-export --source granite-4.2-8b-instruct --target hybrid` genera una carpeta ONNX precompilada. Calcula entre 15 y 30 minutos de compilación la primera vez y aproximadamente entre 8 y 12 GB en disco para un modelo de 8B en INT4.

#3. Recurrir a la Radeon 890M: a menudo la mejor opción

El Ryzen AI 9 HX 370 incluye también una iGPU Radeon 890M (RDNA 3.5, 16 CU). En LM Studio estándar o Ollama, esta iGPU es utilizable a través de Vulkan y a veces supera al NPU en rendimiento puro. Aquí te explico cómo usarla.

Ollama en Radeon 890M (Vulkan)
# Installation Ollama Windows (build avec Vulkan)
winget install Ollama.Ollama

# Forcer le backend Vulkan
$env:OLLAMA_VULKAN = "1"

# Lancer un Qwen 3.5 9B
ollama serve
ollama run qwen3.5:9b
Asignación dinámica de VRAM
La Radeon 890M comparte la RAM del sistema. En la BIOS UEFI, busca «UMA Frame Buffer Size» y establece al menos 8 GB (16 GB si es posible) antes de probar un LLM.
Controlador
Adrenalin 24.10 o superior para beneficiarte de la ruta de ejecución de Vulkan optimizada para cómputo. Los controladores OEM de Lenovo/Asus suelen ir 2 versiones por detrás.
ROCm bajo Linux
ROCm 6.3+ es oficialmente compatible con Strix Point desde abril de 2026. En Ubuntu 24.04, es viable, pero la iGPU sigue limitada por el ancho de banda de su memoria compartida.

#Pruebas de rendimiento: NPU vs iGPU vs CPU

Valores aproximados registrados en un Asus Zenbook S 14 (Ryzen AI 9 HX 370, 32 GB LPDDR5X-7500, Windows 11 24H2, AMD Ryzen AI Software 1.3, Adrenalin 24.10.1). Prompt corto (~50 tokens), generación de 256 tokens, temperatura 0.7. Promedio de 5 ejecuciones.

Qwen 3.5 9B — CPU AVX-512
4,1 tok/s · 28 W en el encapsulado · ventilador audible
Qwen 3.5 9B — Radeon 890M (Vulkan)
9,8 tok/s · 35 W del encapsulado · ventilador funcionando de forma sostenida
Qwen 3.5 9B híbrido — NPU + iGPU (LM Studio Ryzen AI)
11,2 tok/s · 18 W del encapsulado · ventilador silencioso
Granite 4.2 3B — NPU puro
24 tok/s · 9 W del encapsulado del procesador · ventilador apagado
Granite 4.2 8B — NPU + iGPU
13,5 tok/s · 19 W package · ventilador silencioso
Gemma 4 12B — Radeon 890M (Vulkan)
4,2 tok/s · 38 W · demasiado grande para el NPU solo
i
Lo que muestran estos números
El NPU no es el más rápido en absoluto: la iGPU puede igualarlo en 7B-8B. Pero a caudal comparable, el NPU consume 2× menos y se calienta 2× menos. Ese es su verdadero valor: mantener una sesión LLM de 3 horas con batería sin degradación térmica.

#Casos de uso en los que la NPU destaca

Chatbot de asistencia permanente
Un Granite 4.2 3B o Qwen 3.5 4B en una NPU consume ~5 W y permanece disponible las 24 horas del día sin un impacto notable en la batería. Ideal para integrarlo en una app de productividad.
Resumen automático de correos / documentos
Tarea corta por lotes, contexto de 4 a 8k tokens, modelos de 3B a 8B. Ideal para la NPU: ventilador apagado, procesamiento silencioso en segundo plano mientras trabajas.
Transcripción de voz en tiempo real + resumen
Whisper (en la iGPU) + Granite 4.2 8B (en la NPU) en un pipeline: posible precisamente porque ambos módulos son independientes.
Modo avión prolongado
Con batería, el uso combinado de NPU + iGPU permite entre 4 y 5 horas de uso activo de LLM, frente a 1 hora y 30 minutos con una configuración basada únicamente en CPU/iGPU.
→
Combina la NPU y la iGPU de forma inteligente
El modo «Hybrid» de LM Studio Ryzen AI distribuye automáticamente las capas: los bloques Attention en NPU (INT4 denso), los FFN en iGPU (donde el ancho de banda de memoria se explota mejor). Es este modo el que ofrece el mejor equilibrio entre rendimiento y consumo, no el NPU solo.

#Errores que evitar y limitaciones que conviene conocer

Contexto limitado
La mayoría de los modelos precompilados de AMD tienen un límite de 4096 tokens de contexto. Para 32k o más, debes recompilar, y eso consume mucha más memoria.
Nada de modelos de más de 8B usando solo la NPU
Por encima de 8B, incluso en INT4, la NPU no tiene suficiente ancho de banda. Por encima de 13B, la iGPU toma necesariamente el relevo.
Modelos no disponibles
Qwen 3.5, DeepSeek, Gemma 4 no están todos oficialmente precompilados. Revisa el hub Ryzen AI antes de comprar una configuración pensando en ejecutar un modelo específico.
Actualización de Windows que rompe el funcionamiento
Algunas actualizaciones acumulativas 24H2 han desactivado temporalmente la enumeración del NPU. Mantén el paquete AMD Ryzen AI Software actualizado y revisa el Administrador de dispositivos después de cada actualización acumulativa.
Sin fine-tuning
XDNA 2 solo realiza inferencia. Para entrenar o realizar un ajuste fino con LoRA, se necesita una GPU dedicada, y punto.
!
El NPU no reemplaza un GPU dedicado
Si tu objetivo es ejecutar Qwen 3.6 35B, un modelo de 70B o realizar un ajuste fino, el Ryzen AI 9 HX 370 no es el equipo adecuado. Un PC de sobremesa con RTX 4070 / 4080 / 4090 sigue siendo imbatible. La NPU es una solución para la movilidad, no un sustituto de la GPU.

#Para ir más allá

Tres vías para profundizar, según tu siguiente paso:

Comprender las cuantizaciones
La NPU XDNA 2 solo procesa INT4/INT8. La guía «Elegir tu cuantización (Q4, Q5, Q8, FP16)» explica por qué Q4_K_M sigue siendo el estándar para CPU/GPU y qué cambia con INT4 en una NPU.
Comparar con una configuración real de GPU
Si estás considerando un ordenador de sobremesa, la guía «Elegir tu GPU para la IA local» compara RTX 4070, 4090 y M-Max y ofrece los umbrales de compra según el uso.
Configuración más clásica de Ollama
Para seguir usando el conjunto de software estándar con tu Radeon 890M, la guía de instalación de Ollama en Windows cubre la configuración de Vulkan y la gestión de VRAM/RAM compartida.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.