NPU: ¿qué es y es útil para un LLM local? ?
Una NPU (Neural Processing Unit, unidad de procesamiento neuronal) es un procesador de bajo consumo, integrado en el chip de la mayoría de los portátiles vendidos desde 2024, dedicado a pequeñas tareas de IA continuas: desenfoque del fondo, subtítulos en directo, búsqueda de fotos. Su cifra estrella, los TOPS, dice muy poco sobre su capacidad para ejecutar un LLM local: la velocidad de generación depende del ancho de banda de la memoria, y la NPU comparte la misma RAM lenta que el procesador.
Una NPU, siglas de Neural Processing Unit, es un procesador especializado en cálculos de redes neuronales, integrado en el chip de la mayoría de los portátiles vendidos desde 2024. Ejecuta pequeñas tareas de IA de forma continua, como el desenfoque de fondo o los subtítulos en directo, consumiendo unos pocos vatios. Su cifra estrella, los TOPS, sirve de argumento en todas las etiquetas de «PC con IA». A 20 de septiembre de 2026, sin embargo, casi no dice nada sobre la capacidad de una máquina para ejecutar un LLM localmente. A continuación explicamos por qué y en qué debes fijarte en su lugar.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#¿Qué es una NPU?
Una red neuronal, desde el punto de vista del cálculo, se reduce a enormes secuencias de multiplicaciones de matrices con números de baja precisión, repetidas miles de millones de veces. Un procesador clásico puede hacerlo, lentamente, con unas pocas operaciones a la vez. Una tarjeta gráfica lo hace rápidamente, en paralelo sobre miles de unidades, consumiendo entre decenas y cientos de vatios. Una NPU es una porción de silicio diseñada para hacer solo eso, y nada más: unidades de cálculo fijas para enteros de 8 y 4 bits, pequeñas memorias colocadas justo a su lado para evitar costosos movimientos de ida y vuelta, y un planificador que minimiza el desplazamiento de datos. El resultado de esta especialización extrema: una velocidad máxima modesta en comparación con una GPU, pero una eficiencia por vatio mucho mayor, lo que importa enormemente cuando se funciona con batería.
La idea es más antigua que la etiqueta de marketing que la acompaña hoy. Apple incluye un Neural Engine en sus iPhone desde 2017 y en todos sus Mac con Apple Silicon desde su lanzamiento; los chips Pixel de Google incorporan un bloque TPU desde hace varias generaciones. Lo que realmente cambió en 2024 es que Intel, AMD y Qualcomm incorporaron simultáneamente una NPU de capacidad considerable en sus procesadores para portátiles de consumo, y que Microsoft supeditó de inmediato toda una gama de funciones de Windows a la presencia de esa NPU, bajo el nombre comercial Copilot+ PC. Es esta convergencia, más que la tecnología en sí, lo que explica la avalancha de etiquetas «PC con IA» en las estanterías desde hace dos años.
#CPU, GPU, NPU: las diferencias
| CPU | GPU | NPU | |
|---|---|---|---|
| Diseñado para | La lógica general, la baja latencia | Cálculo masivamente paralelo, gráficos | Inferencia de redes neuronales, únicamente |
| Consumo bajo carga de IA | 15 à 125 W | 30 W (integrado) a 575 W (RTX 5090) | 1 à 10 W |
| Memoria utilizada | La RAM del sistema | Su propia VRAM, o la RAM si está integrado | La RAM del sistema |
| Soporte de software | Universal | Muy amplio: CUDA, ROCm, Metal, Vulkan | Limitado, propio de cada fabricante |
| Terreno de juego | La orquestación y los modelos pequeños como recurso de emergencia | Los LLM, la generación de imágenes, el entrenamiento | La IA ligera y siempre activa, funcionando con batería |
Los tres chips son complementarios, no compiten entre sí: cada uno existe porque ofrece un equilibrio diferente entre velocidad, consumo y versatilidad. En un «PC con IA», la NPU gestiona los efectos de la cámara web durante cuatro horas de videoconferencia mientras la GPU permanece inactiva, conservando buena parte de la autonomía de la batería que habría consumido un uso continuo de la GPU. Pídele a la misma máquina que ejecute un asistente de 14 mil millones de parámetros y todo el trabajo pasa a la GPU, porque ahí se encuentran tanto el ancho de banda de memoria necesario como un soporte de software maduro: ningún entorno de ejecución para el público general puede ejecutar hoy un LLM de este tamaño en una NPU.
#Los TOPS: lo que miden, lo que ocultan
TOPS significa «un billón de operaciones por segundo» (Tera Operations Per Second), casi siempre medidas con enteros de 8 bits para que sean comparables entre fichas técnicas. Es una capacidad máxima de cálculo, medida en laboratorio en condiciones favorables. No indica la velocidad a la que los datos llegan desde la memoria a estas unidades de cálculo, y eso es precisamente lo que limita a un modelo de lenguaje en la práctica: una NPU que no recibe suficientes datos pasa la mayor parte del tiempo esperando, tenga o no un valor alto de TOPS.
| Familia de chips | NPU anunciado | Cumple los requisitos de Copilot+ (40 TOPS o más) |
|---|---|---|
| Intel Core Ultra serie 1 (Meteor Lake) | ≈ 11 TOPS | No |
| Apple M4 (Neural Engine) | 38 TOPS | No aplica (macOS) |
| Qualcomm Snapdragon X Elite y X Plus | 45 TOPS | Sí |
| Intel Core Ultra 200V (Lunar Lake) | 48 TOPS | Sí |
| AMD Ryzen AI 300 | 50 TOPS | Sí |
| AMD Ryzen AI Max+ 395 (Strix Halo) | 50 TOPS | Sí |
| Intel Core Ultra 300 (Panther Lake, CES de enero de 2026) | Hasta 50 TOPS (NPU 5) | Sí |
| AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES enero 2026) | Hasta 60 TOPS | Sí |
| Qualcomm Snapdragon X2 Elite (CES en enero de 2026) | 80 TOPS | Sí |
Esta nueva generación, presentada en el CES en enero de 2026 y ya disponible en portátiles comercializados a fecha del 28 de septiembre de 2026, eleva la cifra anunciada muy por encima del umbral mínimo de Copilot+: el Snapdragon X2 Elite casi duplica la puntuación de su predecesor, con 80 TOPS frente a los 45 anteriores. Nada de esto cambia la conclusión de esta página: el argumento que sigue, sobre el ancho de banda de la memoria compartida, se aplica de la misma manera a estos nuevos chips, por impresionante que parezca su cifra de TOPS en la etiqueta.
#Por qué un NPU no acelera tus LLM
Para producir un solo token, un modelo debe volver a leer la mayor parte de sus pesos en memoria, desde el primer hasta el último parámetro activo. Un modelo de 14 mil millones de parámetros en Q4 pesa aproximadamente 9 GB: generar 20 tokens por segundo equivale, por tanto, a transferir 180 GB por segundo entre la memoria y las unidades de cálculo. El cálculo aritmético en sí, la multiplicación propiamente dicha, tiene un coste bajo en comparación con esta transferencia constante. La velocidad de generación depende, por tanto, del ancho de banda de memoria disponible, no de la potencia de cálculo en TOPS o TFLOPS anunciada en la ficha técnica, lo que explica por qué dos chips con TOPS muy diferentes pueden escribir texto exactamente a la misma velocidad.
| ¿Dónde está el modelo? | Ancho de banda | Límite para un modelo de 9 GB |
|---|---|---|
| LPDDR5X de portátil (lo que comparten la NPU y la GPU integrada) | ≈ 70 a 135 GB/s | ≈ 8 a 15 tok/s |
| Memoria unificada del Ryzen AI Max+ 395 | 256 GB/s | ≈ 28 tok/s |
| RTX 4070 (GDDR6X) | 504 GB/s | ≈ 56 tok/s |
| RTX 5070 Ti (GDDR7) | 896 GB/s | ≈ 100 tok/s |
| RTX 5090 (GDDR7) | 1 792 GB/s | ≈ 200 tok/s |
Una NPU de 50 TOPS, al igual que una NPU de 80 TOPS en los chips más recientes, se encuentra en la primera fila de la tabla. Utiliza la misma memoria LPDDR5X compartida con el procesador: independientemente del número de TOPS anunciado, físicamente no puede ir más rápido de lo que permite esa memoria. Un portátil de 45 TOPS y otro de 80 TOPS escribirán, por tanto, texto exactamente a la misma velocidad si su memoria sigue siendo idéntica en capacidad y ancho de banda.
Una NPU puede ayudar realmente en la lectura del prompt, una fase que requiere sobre todo capacidad de cálculo más que ancho de banda, ya que el modelo procesa de una sola vez todo el texto ya presente en lugar de producirlo palabra por palabra. Las configuraciones híbridas que encargan esta lectura a la NPU y la generación a la GPU integrada reducen la espera hasta que aparece la primera palabra y el consumo total, con modelos pequeños bien compatibles con este funcionamiento. Es una mejora de la autonomía y de la capacidad de respuesta percibida, medible en términos de latencia, no una forma de ejecutar modelos más grandes ni de aumentar la velocidad de generación continua de texto.
#El verdadero freno: el software
- Ollama, llama.cpp, LM Studio
- Se ejecutan en la GPU o en la CPU. En un portátil Copilot+, utilizan la GPU integrada o el procesador y no utilizan la NPU.
- Windows
- Los modelos integrados de Microsoft y su entorno Foundry Local están orientados a la NPU mediante ONNX Runtime, con una selección de modelos pequeños.
- AMD
- Ryzen AI Software y el servidor Lemonade ejecutan algunos modelos ONNX en modo híbrido, con la NPU y la GPU integrada.
- Intel
- OpenVINO puede utilizar la NPU para los modelos compatibles.
- Qualcomm
- La cadena de herramientas QNN y AI Hub proporcionan modelos ya convertidos para el NPU Hexagon.
- Apple
- Core ML utiliza el Neural Engine, pero las herramientas de LLM realmente utilizadas en Mac (MLX, llama.cpp, Ollama) pasan por el GPU, a través de Metal.
El punto en común de todas estas herramientas: usar la NPU significa elegir entre una lista corta de modelos ya convertidos y validados por el fabricante, generalmente de entre 1 y 8 mil millones de parámetros, y no descargar cualquier GGUF encontrado en Hugging Face para ejecutarlo directamente. Esta conversión requiere un formato y una cadena de herramientas distintos para cada fabricante, lo que explica por qué ningún proyecto comunitario ha unificado todavía el soporte para NPU como llama.cpp lo ha hecho para las GPU.
#Qué evaluar en su lugar antes de comprar
- 01La memoria que el GPU puede usarLa VRAM de una tarjeta dedicada o la memoria unificada de un Mac o de una máquina Strix Halo. Esa memoria determina qué modelos se pueden cargar.
- 02El ancho de banda de esta memoriaEs lo que determina directamente el número de tokens generados por segundo.
- 03La vía del softwareNVIDIA sin complicaciones, Apple Silicon casi igual de bien, AMD con un soporte adecuado en Linux.
- 04Los TOPS de la NPUÚtiles si quieres las funciones Copilot+ de Windows y una larga autonomía en videollamadas. Sin efecto sobre los LLM de pesos abiertos hoy en día.
- Hardware para IA local: nuestras fichas de equipos
- Mini-PC Ryzen AI Max+ 395: el caso en el que la memoria unificada cambia las reglas del juego
- ¿Qué GPU para un LLM local?
- Microsoft: los dispositivos Copilot+ y su NPU
- Fuente: Wikipedia, historia y arquitectura de los NPU
- Fuente: comunicado de AMD, Ryzen AI 400 (CES 2026)
#FAQ
¿Qué significa NPU?+
¿Un NPU es mejor que un GPU para la IA?+
¿Ollama o LM Studio utilizan el NPU?+
¿Se necesita un NPU para ejecutar IA localmente?+
¿Cuántos TOPS se necesitan?+
¿Las nuevas unidades NPU de 2026 cambian algo para la IA local?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.