Intermedio 11 minNPU

Snapdragon X Elite: ejecutar un LLM local en PC ARM

Los ordenadores Copilot+ basados en Snapdragon X Elite han vuelto a situar la arquitectura ARM en el centro del mundo Windows, con un argumento atractivo para la IA: una NPU integrada y una autonomía de varias horas. Pero ejecutar un LLM en local en un Snapdragon X Elite no ofrece la misma experiencia que hacerlo en un ordenador x86 con GPU NVIDIA. Esta guía distingue entre lo que realmente funciona hoy y lo que todavía es una promesa de marketing, y explica cómo obtener un asistente local utilizable en estas máquinas ARM.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Thomas P.·Actualización 2026-08-27·Probado en Windows 11
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#Por qué el Snapdragon X Elite interesa para un LLM local

El Snapdragon X Elite es un SoC ARM de Qualcomm: hasta 12 núcleos Oryon, un GPU Adreno integrado, un NPU Hexagon anunciado a 45 TOPS y, sobre todo, una memoria LPDDR5X unificada compartida entre CPU, GPU y NPU. Esta memoria unificada recuerda el enfoque de Apple Silicon: el modelo cargado es accesible para todos los motores de cálculo sin copia, y no estás limitado por una VRAM separada de 8 o 12 GB.

El otro punto fuerte es el perfil térmico. Estos chips se diseñaron para ultraportátiles sin ventilador o casi silenciosos, con una autonomía que se cuenta en decenas de horas de uso ofimático. Para un LLM local que funciona en segundo plano —resumen de correos, reformulación, pequeños scripts—, esto abre posibilidades inéditas: ningún ventilador que se ponga a girar a toda velocidad ni una batería que se agote en veinte minutos.

i
Lo que busca esta guía
Un asistente conversacional local cómodo (3B a 24B) en un PC ARM con Windows, no un reemplazo de una RTX 4090. Se busca el mejor equilibrio entre calidad, velocidad y autonomía en este hardware específico.

#El verdadero reto: Windows en ARM

El primer obstáculo no es la potencia, sino la compatibilidad del software. Windows 11 en ARM ejecuta aplicaciones x86/x64 a través de una capa de emulación (Prism), pero esta emulación reduce el rendimiento y, para la IA, suele impedir aprovechar la aceleración del hardware. Un binario compilado para x86 con instrucciones AVX no verá ni la GPU Adreno ni la NPU Hexagon.

La buena noticia: las principales herramientas de IA local ya disponen de compilaciones nativas para ARM64. Esta es la distinción crucial que debes tener presente a lo largo de esta guía: una herramienta «que se instala» no es necesariamente una herramienta «nativa para ARM». Con la emulación, pierdes gran parte de las ventajas de la máquina.

Ollama
Proporciona un build nativo para Windows ARM64. Inferencia en CPU Oryon, escucha por defecto en http://localhost:11434 como en cualquier otra plataforma.
LM Studio
Ofrece una versión ARM64 nativa para Windows en Snapdragon, con un entorno de ejecución de llama.cpp compilado para ARM.
llama.cpp
Se compila nativamente para ARM64 y aprovecha las instrucciones vectoriales; es el motor subyacente más optimizado para estos chips.
Evitar
Toda versión x64 lanzada en emulación Prism: funciona, pero lentamente y sin acceso al hardware especializado.
!
Revisa siempre la arquitectura
En la página de descarga, busca explícitamente «ARM64» o «Windows on ARM». Si la única opción es «Windows x64», la aplicación se ejecutará mediante emulación y perderás la principal ventaja de la máquina.

#La NPU Hexagon: mito y realidad

Este es el origen del malentendido. El marketing de Copilot+ destaca los 45 TOPS de la NPU Hexagon como si cualquier LLM local fuera a beneficiarse automáticamente de ellos. En la práctica, en 2026, casi todos los LLM que ejecutas a través de Ollama o LM Studio funcionan en los núcleos de la CPU, no en la NPU.

¿Por qué? Porque aprovechar la NPU exige modelos convertidos y cuantizados específicamente para el entorno de ejecución de Qualcomm (mediante QNN —Qualcomm AI Engine Direct— y el formato ONNX, generalmente a través de ONNX Runtime con el proveedor de ejecución QNN). No son los mismos archivos GGUF que utiliza llama.cpp. La NPU destaca en cargas de trabajo de ritmo regular y previsible; la generación de texto autorregresiva, dominada por el ancho de banda de memoria, se adapta peor a ella de lo que se cree.

Lo que utiliza la NPU
Demostraciones y aplicaciones empaquetadas mediante el SDK de Qualcomm / AI Hub con modelos ONNX previamente convertidos (a menudo modelos pequeños o tareas de visión/audio).
Lo que no utiliza el NPU
Ollama, LM Studio y llama.cpp en uso estándar: utilizan la CPU (y a veces la GPU Adreno mediante backends experimentales).
El rendimiento real
En estas máquinas, lo que determina principalmente tu velocidad de generación son los núcleos Oryon y el ancho de banda de la memoria LPDDR5X, no los TOPS anunciados del NPU.
→
No elijas esta máquina por su NPU
Si tu objetivo es un chatbot local rápido, aplica los mismos criterios que para cualquier buen procesador ARM con memoria rápida. La NPU es un extra para aplicaciones específicas, no el motor de tu Ollama en el día a día.

#Requisitos y verificaciones

Antes de instalar cualquier cosa, confirma que estás en una máquina ARM y comprueba cuánta RAM tienes: esa cantidad determinará el tamaño de los modelos que podrás ejecutar, ya que la memoria es unificada.

PowerShell — verificar arquitectura y RAM
# Architecture du processeur (doit renvoyer ARM64)
$env:PROCESSOR_ARCHITECTURE

# Mémoire physique totale, en Go
(Get-CimInstance Win32_ComputerSystem).TotalPhysicalMemory / 1GB
OS
Windows 11 24H2 o más reciente, actualizado (las versiones recientes mejoran significativamente la emulación con Prism y el soporte de ARM).
RAM
16 GB como mínimo para usar cómodamente modelos de 3B–9B; 32 GB para optar por modelos de 20 a 27B y conservar margen para el sistema.
Almacenamiento
Reserva entre 10 y 30 GB libres según la cantidad de modelos descargados (un 7B Q4_K_M pesa ~5 GB).
Expectativa realista
Puedes esperar una experiencia fluida con un modelo pequeño, aceptable con modelos de 8–9B y que requiera paciencia con modelos mayores. No se alcanzan las tasas de generación de una GPU dedicada.

#Instalar un LLM local paso a paso

La opción más sencilla y fiable hoy es Ollama en su versión nativa para ARM64, que puedes complementar con una interfaz gráfica. Estos son los pasos que debes seguir.

  1. 01
    Descargar Ollama ARM64
    Ve a ollama.com/download y descarga el instalador de Windows. Desde las versiones recientes, el instalador detecta la arquitectura ARM64 e instala el binario nativo. Comprueba después que el servicio esté funcionando correctamente.
  2. 02
    Verificar el servicio
    Abre un terminal y ejecuta «ollama --version». El demonio escucha en http://localhost:11434; una solicitud a esta URL debe responder «Ollama is running».
  3. 03
    Descargar un primer modelo
    Empieza con un modelo pequeño para validar la cadena completa antes de cargar uno más pesado. Un modelo de 3B en Q4_K_M es ideal para probar la capacidad de respuesta.
  4. 04
    Conversar desde la línea de comandos
    Inicia el modelo y comprueba la velocidad de generación. Si la generación es fluida, aumenta progresivamente el tamaño (7B y luego 14B) mientras la RAM lo permita.
  5. 05
    Añadir una interfaz (opcional)
    Instala LM Studio en versión ARM64 para una interfaz completa, o conecta Open WebUI al endpoint de Ollama si prefieres una interfaz web.
Terminal — primer modelo
# Modèle léger pour valider la chaîne
ollama pull granite4.2:3b
ollama run granite4.2:3b

# Une fois validé, monter en gamme
ollama pull qwen3.5:9b
→
Medir la velocidad real
En Ollama, ejecuta « ollama run <modèle> --verbose » para ver los tokens/segundo al final de la respuesta. Es la métrica honesta para comparar modelos en tu máquina en lugar de confiar en los anuncios.

#Modelos recomendados para 16–32 GB de RAM

Como la memoria es unificada y compartida con el sistema, no pienses como si toda la RAM estuviera disponible para el modelo. Reserva siempre de 4 a 6 GB para Windows y tus aplicaciones. Las cifras orientativas de consumo de memoria en Q4_K_M siguen siendo las mismas que en GPU: un 3B ≈ 2 GB, un 9B ≈ 6-7 GB, un 24B ≈ 14 GB.

16 GB de RAM
Zona de confort: modelos de 3B a 9B en Q4_K_M. Granite 4.2 3B para la agilidad, Qwen 3.5 9B o Granite 4.2 8B para la calidad. Un gpt-oss 20B (~14 GB) sigue siendo viable, pero deja poco margen.
32 GB de RAM
Puedes cargar cómodamente modelos de entre 20 y 27B —desde gpt-oss 20B o Mistral Small 24B (~14 GB, este último se desenvuelve muy bien en francés) hasta Qwen 3.8 27B (~18 GB, 262k de contexto)— en Q4_K_M, dejando un amplio margen para el sistema. Un modelo denso de 32B o más se puede cargar, pero es lento en esta CPU; un MoE como Qwen 3.6 35B-A3B (~23 GB, 3B activos) sigue siendo claramente más rápido.
Cuantización
Q4_K_M es aquí el mejor equilibrio entre calidad, tamaño y velocidad. Sube a Q5_K_M solo si la calidad es prioritaria y la RAM lo permite; evita FP16, innecesariamente pesado en este tipo de máquina.
Casos de uso ideales
Reformulación, resumen, traducción, ayuda con código sencillo, preguntas y respuestas sin conexión: tareas para las que un buen modelo de 9B–24B basta de sobra.
i
La buena práctica al cuantizar
En una máquina donde la velocidad depende de la CPU y del ancho de banda de la memoria, un modelo más pequeño en Q4_K_M suele ofrecer una experiencia mejor que un modelo más grande que va lento. Prioriza la fluidez.

#Autonomía y silencio: los verdaderos puntos fuertes

Aquí es donde el Snapdragon X Elite destaca realmente. Mientras que un portátil gaming x86 con RTX agota su batería en unos pocos minutos bajo carga de IA y pone sus ventiladores a rugir, estas máquinas ARM generan texto sin calentarse ni hacer ruido, estén conectadas a la corriente o no. Para trabajar en movilidad —en un tren, una cafetería o una sala de reuniones—, es un cambio de naturaleza, no de grado.

En cuanto a velocidad bruta, puedes esperar tasas de generación aceptables pero modestas: del orden de varias decenas de tokens por segundo con un 3B, que bajan a unos pocos tokens por segundo con un 24B denso. Suficiente para conversar con fluidez con un modelo pequeño, pero más lento y trabajoso para generar textos largos con un modelo grande. La latencia del primer token sigue siendo razonable gracias a los rápidos núcleos Oryon.

Silencio
Es posible generar sin que los ventiladores se aceleren excesivamente, a menudo casi sin que funcionen en los modelos de bajo TDP.
Autonomía
La inferencia es viable con batería, mientras que una GPU dedicada prácticamente obliga a conectar el equipo a la red eléctrica. Ideal para un asistente local que puedas llevar contigo.
Térmico
No hay una reducción agresiva del rendimiento durante el uso ligero y prolongado de LLM, a diferencia de los ultraportátiles x86 llevados al límite.
Desventaja
Un rendimiento en tokens por segundo que alcanza su límite muy por debajo del de una GPU dedicada: la comodidad se paga en tokens por segundo con los modelos grandes.

#Limitaciones frente a x86 y GPUs dedicados

Seamos claros para evitar decepciones. Un Snapdragon X Elite no rivaliza con un PC equipado con una tarjeta NVIDIA reciente. Una RTX 3060 de 12 GB de gama de entrada ejecutará un modelo de 14B mucho más rápido, y una RTX 4090 de 24 GB juega en una categoría totalmente distinta. El punto fuerte del Snapdragon no es el rendimiento bruto, sino el rendimiento por vatio y la movilidad.

Ecosistema aún joven
El soporte de ARM64 avanza rápidamente, pero sigue siendo menos maduro que el de x86. Algunas herramientas, extensiones o backends de GPU van con retraso o son experimentales.
Sin aceleración GPU para el público general
El backend Adreno para llama.cpp sigue estando en sus primeras etapas; en la práctica, la inferencia depende principalmente de la CPU.
NPU subutilizado
Como se vio más arriba, los 45 TOPS aún no benefician a los runtimes LLM comunes.
Límite de tamaño
Por encima de unos veinte mil millones de parámetros en modelos densos, la experiencia empeora notablemente; los modelos muy grandes siguen siendo terreno de las GPU dedicadas (un MoE con pocos parámetros activos sigue siendo la excepción que funciona mejor).
!
Ajustar bien las expectativas
Compra (o utiliza) un Snapdragon X Elite por su autonomía y su funcionamiento silencioso con LLM de 3B a 24B. Si tu prioridad es ejecutar rápidamente modelos densos grandes de 32B o 70B, necesitas una GPU dedicada, no un PC ARM.

#Para ir más allá

El Snapdragon X Elite se entiende mejor al compararlo con otros enfoques basados en NPU y dominar los fundamentos de la instalación local. Estas guías permiten profundizar en la reflexión:

Ryzen AI 9 HX: ¿sirve de verdad el NPU de 50 TOPS para los LLM?
El equivalente x86 de este debate sobre las NPU, con pruebas honestas cuyos resultados coinciden con las conclusiones de esta guía.
Instalar Ollama: Windows, macOS y Linux
Para dominar a fondo el daemon de Ollama y sus comandos; también se aplica a la compilación ARM64.
Elegir tu cuantización (Q4, Q5, Q8)
Para afinar el equilibrio calidad/velocidad, decisivo en una máquina donde la CPU realiza la mayor parte del trabajo.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.