Principiante 11 minNPU

NPU: ¿qué es y es útil para un LLM local? ?

Respuesta directa

Una NPU (Neural Processing Unit, unidad de procesamiento neuronal) es un procesador de bajo consumo, integrado en el chip de la mayoría de los portátiles vendidos desde 2024, dedicado a pequeñas tareas de IA continuas: desenfoque del fondo, subtítulos en directo, búsqueda de fotos. Su cifra estrella, los TOPS, dice muy poco sobre su capacidad para ejecutar un LLM local: la velocidad de generación depende del ancho de banda de la memoria, y la NPU comparte la misma RAM lenta que el procesador.

Una NPU, siglas de Neural Processing Unit, es un procesador especializado en cálculos de redes neuronales, integrado en el chip de la mayoría de los portátiles vendidos desde 2024. Ejecuta pequeñas tareas de IA de forma continua, como el desenfoque de fondo o los subtítulos en directo, consumiendo unos pocos vatios. Su cifra estrella, los TOPS, sirve de argumento en todas las etiquetas de «PC con IA». A 20 de septiembre de 2026, sin embargo, casi no dice nada sobre la capacidad de una máquina para ejecutar un LLM localmente. A continuación explicamos por qué y en qué debes fijarte en su lugar.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-28·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#¿Qué es una NPU?

Una red neuronal, desde el punto de vista del cálculo, se reduce a enormes secuencias de multiplicaciones de matrices con números de baja precisión, repetidas miles de millones de veces. Un procesador clásico puede hacerlo, lentamente, con unas pocas operaciones a la vez. Una tarjeta gráfica lo hace rápidamente, en paralelo sobre miles de unidades, consumiendo entre decenas y cientos de vatios. Una NPU es una porción de silicio diseñada para hacer solo eso, y nada más: unidades de cálculo fijas para enteros de 8 y 4 bits, pequeñas memorias colocadas justo a su lado para evitar costosos movimientos de ida y vuelta, y un planificador que minimiza el desplazamiento de datos. El resultado de esta especialización extrema: una velocidad máxima modesta en comparación con una GPU, pero una eficiencia por vatio mucho mayor, lo que importa enormemente cuando se funciona con batería.

La idea es más antigua que la etiqueta de marketing que la acompaña hoy. Apple incluye un Neural Engine en sus iPhone desde 2017 y en todos sus Mac con Apple Silicon desde su lanzamiento; los chips Pixel de Google incorporan un bloque TPU desde hace varias generaciones. Lo que realmente cambió en 2024 es que Intel, AMD y Qualcomm incorporaron simultáneamente una NPU de capacidad considerable en sus procesadores para portátiles de consumo, y que Microsoft supeditó de inmediato toda una gama de funciones de Windows a la presencia de esa NPU, bajo el nombre comercial Copilot+ PC. Es esta convergencia, más que la tecnología en sí, lo que explica la avalancha de etiquetas «PC con IA» en las estanterías desde hace dos años.

#CPU, GPU, NPU: las diferencias

CPUGPUNPU
Diseñado paraLa lógica general, la baja latenciaCálculo masivamente paralelo, gráficosInferencia de redes neuronales, únicamente
Consumo bajo carga de IA15 à 125 W30 W (integrado) a 575 W (RTX 5090)1 à 10 W
Memoria utilizadaLa RAM del sistemaSu propia VRAM, o la RAM si está integradoLa RAM del sistema
Soporte de softwareUniversalMuy amplio: CUDA, ROCm, Metal, VulkanLimitado, propio de cada fabricante
Terreno de juegoLa orquestación y los modelos pequeños como recurso de emergenciaLos LLM, la generación de imágenes, el entrenamientoLa IA ligera y siempre activa, funcionando con batería

Los tres chips son complementarios, no compiten entre sí: cada uno existe porque ofrece un equilibrio diferente entre velocidad, consumo y versatilidad. En un «PC con IA», la NPU gestiona los efectos de la cámara web durante cuatro horas de videoconferencia mientras la GPU permanece inactiva, conservando buena parte de la autonomía de la batería que habría consumido un uso continuo de la GPU. Pídele a la misma máquina que ejecute un asistente de 14 mil millones de parámetros y todo el trabajo pasa a la GPU, porque ahí se encuentran tanto el ancho de banda de memoria necesario como un soporte de software maduro: ningún entorno de ejecución para el público general puede ejecutar hoy un LLM de este tamaño en una NPU.

#Los TOPS: lo que miden, lo que ocultan

TOPS significa «un billón de operaciones por segundo» (Tera Operations Per Second), casi siempre medidas con enteros de 8 bits para que sean comparables entre fichas técnicas. Es una capacidad máxima de cálculo, medida en laboratorio en condiciones favorables. No indica la velocidad a la que los datos llegan desde la memoria a estas unidades de cálculo, y eso es precisamente lo que limita a un modelo de lenguaje en la práctica: una NPU que no recibe suficientes datos pasa la mayor parte del tiempo esperando, tenga o no un valor alto de TOPS.

Datos de los fabricantes · los métodos de medición difieren, una diferencia de algunos puntos no es significativa
Familia de chipsNPU anunciadoCumple los requisitos de Copilot+ (40 TOPS o más)
Intel Core Ultra serie 1 (Meteor Lake)≈ 11 TOPSNo
Apple M4 (Neural Engine)38 TOPSNo aplica (macOS)
Qualcomm Snapdragon X Elite y X Plus45 TOPSSí
Intel Core Ultra 200V (Lunar Lake)48 TOPSSí
AMD Ryzen AI 30050 TOPSSí
AMD Ryzen AI Max+ 395 (Strix Halo)50 TOPSSí
Intel Core Ultra 300 (Panther Lake, CES de enero de 2026)Hasta 50 TOPS (NPU 5)Sí
AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES enero 2026)Hasta 60 TOPSSí
Qualcomm Snapdragon X2 Elite (CES en enero de 2026)80 TOPSSí

Esta nueva generación, presentada en el CES en enero de 2026 y ya disponible en portátiles comercializados a fecha del 28 de septiembre de 2026, eleva la cifra anunciada muy por encima del umbral mínimo de Copilot+: el Snapdragon X2 Elite casi duplica la puntuación de su predecesor, con 80 TOPS frente a los 45 anteriores. Nada de esto cambia la conclusión de esta página: el argumento que sigue, sobre el ancho de banda de la memoria compartida, se aplica de la misma manera a estos nuevos chips, por impresionante que parezca su cifra de TOPS en la etiqueta.

#Por qué un NPU no acelera tus LLM

Para producir un solo token, un modelo debe volver a leer la mayor parte de sus pesos en memoria, desde el primer hasta el último parámetro activo. Un modelo de 14 mil millones de parámetros en Q4 pesa aproximadamente 9 GB: generar 20 tokens por segundo equivale, por tanto, a transferir 180 GB por segundo entre la memoria y las unidades de cálculo. El cálculo aritmético en sí, la multiplicación propiamente dicha, tiene un coste bajo en comparación con esta transferencia constante. La velocidad de generación depende, por tanto, del ancho de banda de memoria disponible, no de la potencia de cálculo en TOPS o TFLOPS anunciada en la ficha técnica, lo que explica por qué dos chips con TOPS muy diferentes pueden escribir texto exactamente a la misma velocidad.

Límite teórico = ancho de banda ÷ tamaño del modelo (Qwen 3 14B en Q4, 9 GB en el catálogo QuelLLM). Los sistemas reales se acercan a él sin alcanzarlo.
¿Dónde está el modelo?Ancho de bandaLímite para un modelo de 9 GB
LPDDR5X de portátil (lo que comparten la NPU y la GPU integrada)≈ 70 a 135 GB/s≈ 8 a 15 tok/s
Memoria unificada del Ryzen AI Max+ 395256 GB/s≈ 28 tok/s
RTX 4070 (GDDR6X)504 GB/s≈ 56 tok/s
RTX 5070 Ti (GDDR7)896 GB/s≈ 100 tok/s
RTX 5090 (GDDR7)1 792 GB/s≈ 200 tok/s

Una NPU de 50 TOPS, al igual que una NPU de 80 TOPS en los chips más recientes, se encuentra en la primera fila de la tabla. Utiliza la misma memoria LPDDR5X compartida con el procesador: independientemente del número de TOPS anunciado, físicamente no puede ir más rápido de lo que permite esa memoria. Un portátil de 45 TOPS y otro de 80 TOPS escribirán, por tanto, texto exactamente a la misma velocidad si su memoria sigue siendo idéntica en capacidad y ancho de banda.

Una NPU puede ayudar realmente en la lectura del prompt, una fase que requiere sobre todo capacidad de cálculo más que ancho de banda, ya que el modelo procesa de una sola vez todo el texto ya presente en lugar de producirlo palabra por palabra. Las configuraciones híbridas que encargan esta lectura a la NPU y la generación a la GPU integrada reducen la espera hasta que aparece la primera palabra y el consumo total, con modelos pequeños bien compatibles con este funcionamiento. Es una mejora de la autonomía y de la capacidad de respuesta percibida, medible en términos de latencia, no una forma de ejecutar modelos más grandes ni de aumentar la velocidad de generación continua de texto.

#El verdadero freno: el software

Ollama, llama.cpp, LM Studio
Se ejecutan en la GPU o en la CPU. En un portátil Copilot+, utilizan la GPU integrada o el procesador y no utilizan la NPU.
Windows
Los modelos integrados de Microsoft y su entorno Foundry Local están orientados a la NPU mediante ONNX Runtime, con una selección de modelos pequeños.
AMD
Ryzen AI Software y el servidor Lemonade ejecutan algunos modelos ONNX en modo híbrido, con la NPU y la GPU integrada.
Intel
OpenVINO puede utilizar la NPU para los modelos compatibles.
Qualcomm
La cadena de herramientas QNN y AI Hub proporcionan modelos ya convertidos para el NPU Hexagon.
Apple
Core ML utiliza el Neural Engine, pero las herramientas de LLM realmente utilizadas en Mac (MLX, llama.cpp, Ollama) pasan por el GPU, a través de Metal.

El punto en común de todas estas herramientas: usar la NPU significa elegir entre una lista corta de modelos ya convertidos y validados por el fabricante, generalmente de entre 1 y 8 mil millones de parámetros, y no descargar cualquier GGUF encontrado en Hugging Face para ejecutarlo directamente. Esta conversión requiere un formato y una cadena de herramientas distintos para cada fabricante, lo que explica por qué ningún proyecto comunitario ha unificado todavía el soporte para NPU como llama.cpp lo ha hecho para las GPU.

#Qué evaluar en su lugar antes de comprar

  1. 01
    La memoria que el GPU puede usar
    La VRAM de una tarjeta dedicada o la memoria unificada de un Mac o de una máquina Strix Halo. Esa memoria determina qué modelos se pueden cargar.
  2. 02
    El ancho de banda de esta memoria
    Es lo que determina directamente el número de tokens generados por segundo.
  3. 03
    La vía del software
    NVIDIA sin complicaciones, Apple Silicon casi igual de bien, AMD con un soporte adecuado en Linux.
  4. 04
    Los TOPS de la NPU
    Útiles si quieres las funciones Copilot+ de Windows y una larga autonomía en videollamadas. Sin efecto sobre los LLM de pesos abiertos hoy en día.

#FAQ

¿Qué significa NPU?+
Neural Processing Unit, o unidad de procesamiento neuronal. Es un bloque del procesador dedicado a la ejecución eficiente de redes neuronales, presente en la mayoría de los chips recientes de portátiles y teléfonos, junto a la CPU y la GPU. Gestiona continuamente pequeñas tareas de IA, como el desenfoque del fondo en videollamadas, sin calentar la batería ni agotar rápidamente su carga.
¿Un NPU es mejor que un GPU para la IA?+
Consume claramente menos energía para tareas pequeñas y continuas, del orden de 1 a 10 W frente a 30 W o más para una GPU. Una GPU sigue siendo mucho más rápida y cuenta con un soporte mucho mejor por parte del software para modelos grandes, LLM y generadores de imágenes. No son competidores: simplemente no realizan el mismo trabajo ni con modelos de los mismos tamaños.
¿Ollama o LM Studio utilizan el NPU?+
No, a fecha del 28 de septiembre de 2026. Se ejecutan en la GPU, a través de CUDA, ROCm, Metal o Vulkan según el hardware, o en el procesador como último recurso. Usar la NPU requiere las herramientas propias de cada fabricante: ONNX Runtime para Windows, Ryzen AI Software para AMD, OpenVINO para Intel, cada una con su lista limitada de modelos ya convertidos.
¿Se necesita un NPU para ejecutar IA localmente?+
No, en absoluto. Cualquier máquina con una GPU adecuada o suficiente memoria unificada ejecuta modelos locales sin ninguna NPU, como ya ocurría antes de 2024. La NPU solo es necesaria para activar las funciones Copilot+ propias de Windows, no para Ollama, LM Studio ni cualquier otra herramienta de inferencia habitual.
¿Cuántos TOPS se necesitan?+
40 TOPS es el umbral del distintivo Copilot+ PC de Microsoft. Los chips lanzados en el CES de enero de 2026, Panther Lake, Ryzen AI 400 y Snapdragon X2 Elite, alcanzan ahora 50, 60 y hasta 80 TOPS. Por encima del umbral Copilot+, la diferencia apenas tiene efectos prácticos perceptibles, y no tiene absolutamente ninguno sobre la velocidad de generación de un LLM en local.
¿Las nuevas unidades NPU de 2026 cambian algo para la IA local?+
No, no para los LLM. Panther Lake, Ryzen AI 400 y Snapdragon X2 Elite aumentan los TOPS anunciados, pero la NPU sigue utilizando la misma memoria del sistema que el procesador, sin un aumento asociado del ancho de banda. El cuello de botella que limita la velocidad de generación de un modelo de lenguaje sigue siendo exactamente el mismo que con la generación anterior de chips.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.