Snapdragon X Elite: ejecutar un LLM local en PC ARM
Los ordenadores Copilot+ basados en Snapdragon X Elite han vuelto a situar la arquitectura ARM en el centro del mundo Windows, con un argumento atractivo para la IA: una NPU integrada y una autonomía de varias horas. Pero ejecutar un LLM en local en un Snapdragon X Elite no ofrece la misma experiencia que hacerlo en un ordenador x86 con GPU NVIDIA. Esta guía distingue entre lo que realmente funciona hoy y lo que todavía es una promesa de marketing, y explica cómo obtener un asistente local utilizable en estas máquinas ARM.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#Por qué el Snapdragon X Elite interesa para un LLM local
El Snapdragon X Elite es un SoC ARM de Qualcomm: hasta 12 núcleos Oryon, un GPU Adreno integrado, un NPU Hexagon anunciado a 45 TOPS y, sobre todo, una memoria LPDDR5X unificada compartida entre CPU, GPU y NPU. Esta memoria unificada recuerda el enfoque de Apple Silicon: el modelo cargado es accesible para todos los motores de cálculo sin copia, y no estás limitado por una VRAM separada de 8 o 12 GB.
El otro punto fuerte es el perfil térmico. Estos chips se diseñaron para ultraportátiles sin ventilador o casi silenciosos, con una autonomía que se cuenta en decenas de horas de uso ofimático. Para un LLM local que funciona en segundo plano —resumen de correos, reformulación, pequeños scripts—, esto abre posibilidades inéditas: ningún ventilador que se ponga a girar a toda velocidad ni una batería que se agote en veinte minutos.
#El verdadero reto: Windows en ARM
El primer obstáculo no es la potencia, sino la compatibilidad del software. Windows 11 en ARM ejecuta aplicaciones x86/x64 a través de una capa de emulación (Prism), pero esta emulación reduce el rendimiento y, para la IA, suele impedir aprovechar la aceleración del hardware. Un binario compilado para x86 con instrucciones AVX no verá ni la GPU Adreno ni la NPU Hexagon.
La buena noticia: las principales herramientas de IA local ya disponen de compilaciones nativas para ARM64. Esta es la distinción crucial que debes tener presente a lo largo de esta guía: una herramienta «que se instala» no es necesariamente una herramienta «nativa para ARM». Con la emulación, pierdes gran parte de las ventajas de la máquina.
- Ollama
- Proporciona un build nativo para Windows ARM64. Inferencia en CPU Oryon, escucha por defecto en http://localhost:11434 como en cualquier otra plataforma.
- LM Studio
- Ofrece una versión ARM64 nativa para Windows en Snapdragon, con un entorno de ejecución de llama.cpp compilado para ARM.
- llama.cpp
- Se compila nativamente para ARM64 y aprovecha las instrucciones vectoriales; es el motor subyacente más optimizado para estos chips.
- Evitar
- Toda versión x64 lanzada en emulación Prism: funciona, pero lentamente y sin acceso al hardware especializado.
#La NPU Hexagon: mito y realidad
Este es el origen del malentendido. El marketing de Copilot+ destaca los 45 TOPS de la NPU Hexagon como si cualquier LLM local fuera a beneficiarse automáticamente de ellos. En la práctica, en 2026, casi todos los LLM que ejecutas a través de Ollama o LM Studio funcionan en los núcleos de la CPU, no en la NPU.
¿Por qué? Porque aprovechar la NPU exige modelos convertidos y cuantizados específicamente para el entorno de ejecución de Qualcomm (mediante QNN —Qualcomm AI Engine Direct— y el formato ONNX, generalmente a través de ONNX Runtime con el proveedor de ejecución QNN). No son los mismos archivos GGUF que utiliza llama.cpp. La NPU destaca en cargas de trabajo de ritmo regular y previsible; la generación de texto autorregresiva, dominada por el ancho de banda de memoria, se adapta peor a ella de lo que se cree.
- Lo que utiliza la NPU
- Demostraciones y aplicaciones empaquetadas mediante el SDK de Qualcomm / AI Hub con modelos ONNX previamente convertidos (a menudo modelos pequeños o tareas de visión/audio).
- Lo que no utiliza el NPU
- Ollama, LM Studio y llama.cpp en uso estándar: utilizan la CPU (y a veces la GPU Adreno mediante backends experimentales).
- El rendimiento real
- En estas máquinas, lo que determina principalmente tu velocidad de generación son los núcleos Oryon y el ancho de banda de la memoria LPDDR5X, no los TOPS anunciados del NPU.
#Requisitos y verificaciones
Antes de instalar cualquier cosa, confirma que estás en una máquina ARM y comprueba cuánta RAM tienes: esa cantidad determinará el tamaño de los modelos que podrás ejecutar, ya que la memoria es unificada.
- OS
- Windows 11 24H2 o más reciente, actualizado (las versiones recientes mejoran significativamente la emulación con Prism y el soporte de ARM).
- RAM
- 16 GB como mínimo para usar cómodamente modelos de 3B–9B; 32 GB para optar por modelos de 20 a 27B y conservar margen para el sistema.
- Almacenamiento
- Reserva entre 10 y 30 GB libres según la cantidad de modelos descargados (un 7B Q4_K_M pesa ~5 GB).
- Expectativa realista
- Puedes esperar una experiencia fluida con un modelo pequeño, aceptable con modelos de 8–9B y que requiera paciencia con modelos mayores. No se alcanzan las tasas de generación de una GPU dedicada.
#Instalar un LLM local paso a paso
La opción más sencilla y fiable hoy es Ollama en su versión nativa para ARM64, que puedes complementar con una interfaz gráfica. Estos son los pasos que debes seguir.
- 01Descargar Ollama ARM64Ve a ollama.com/download y descarga el instalador de Windows. Desde las versiones recientes, el instalador detecta la arquitectura ARM64 e instala el binario nativo. Comprueba después que el servicio esté funcionando correctamente.
- 02Verificar el servicioAbre un terminal y ejecuta «ollama --version». El demonio escucha en http://localhost:11434; una solicitud a esta URL debe responder «Ollama is running».
- 03Descargar un primer modeloEmpieza con un modelo pequeño para validar la cadena completa antes de cargar uno más pesado. Un modelo de 3B en Q4_K_M es ideal para probar la capacidad de respuesta.
- 04Conversar desde la línea de comandosInicia el modelo y comprueba la velocidad de generación. Si la generación es fluida, aumenta progresivamente el tamaño (7B y luego 14B) mientras la RAM lo permita.
- 05Añadir una interfaz (opcional)Instala LM Studio en versión ARM64 para una interfaz completa, o conecta Open WebUI al endpoint de Ollama si prefieres una interfaz web.
#Modelos recomendados para 16–32 GB de RAM
Como la memoria es unificada y compartida con el sistema, no pienses como si toda la RAM estuviera disponible para el modelo. Reserva siempre de 4 a 6 GB para Windows y tus aplicaciones. Las cifras orientativas de consumo de memoria en Q4_K_M siguen siendo las mismas que en GPU: un 3B ≈ 2 GB, un 9B ≈ 6-7 GB, un 24B ≈ 14 GB.
- 16 GB de RAM
- Zona de confort: modelos de 3B a 9B en Q4_K_M. Granite 4.2 3B para la agilidad, Qwen 3.5 9B o Granite 4.2 8B para la calidad. Un gpt-oss 20B (~14 GB) sigue siendo viable, pero deja poco margen.
- 32 GB de RAM
- Puedes cargar cómodamente modelos de entre 20 y 27B —desde gpt-oss 20B o Mistral Small 24B (~14 GB, este último se desenvuelve muy bien en francés) hasta Qwen 3.8 27B (~18 GB, 262k de contexto)— en Q4_K_M, dejando un amplio margen para el sistema. Un modelo denso de 32B o más se puede cargar, pero es lento en esta CPU; un MoE como Qwen 3.6 35B-A3B (~23 GB, 3B activos) sigue siendo claramente más rápido.
- Cuantización
- Q4_K_M es aquí el mejor equilibrio entre calidad, tamaño y velocidad. Sube a Q5_K_M solo si la calidad es prioritaria y la RAM lo permite; evita FP16, innecesariamente pesado en este tipo de máquina.
- Casos de uso ideales
- Reformulación, resumen, traducción, ayuda con código sencillo, preguntas y respuestas sin conexión: tareas para las que un buen modelo de 9B–24B basta de sobra.
#Autonomía y silencio: los verdaderos puntos fuertes
Aquí es donde el Snapdragon X Elite destaca realmente. Mientras que un portátil gaming x86 con RTX agota su batería en unos pocos minutos bajo carga de IA y pone sus ventiladores a rugir, estas máquinas ARM generan texto sin calentarse ni hacer ruido, estén conectadas a la corriente o no. Para trabajar en movilidad —en un tren, una cafetería o una sala de reuniones—, es un cambio de naturaleza, no de grado.
En cuanto a velocidad bruta, puedes esperar tasas de generación aceptables pero modestas: del orden de varias decenas de tokens por segundo con un 3B, que bajan a unos pocos tokens por segundo con un 24B denso. Suficiente para conversar con fluidez con un modelo pequeño, pero más lento y trabajoso para generar textos largos con un modelo grande. La latencia del primer token sigue siendo razonable gracias a los rápidos núcleos Oryon.
- Silencio
- Es posible generar sin que los ventiladores se aceleren excesivamente, a menudo casi sin que funcionen en los modelos de bajo TDP.
- Autonomía
- La inferencia es viable con batería, mientras que una GPU dedicada prácticamente obliga a conectar el equipo a la red eléctrica. Ideal para un asistente local que puedas llevar contigo.
- Térmico
- No hay una reducción agresiva del rendimiento durante el uso ligero y prolongado de LLM, a diferencia de los ultraportátiles x86 llevados al límite.
- Desventaja
- Un rendimiento en tokens por segundo que alcanza su límite muy por debajo del de una GPU dedicada: la comodidad se paga en tokens por segundo con los modelos grandes.
#Limitaciones frente a x86 y GPUs dedicados
Seamos claros para evitar decepciones. Un Snapdragon X Elite no rivaliza con un PC equipado con una tarjeta NVIDIA reciente. Una RTX 3060 de 12 GB de gama de entrada ejecutará un modelo de 14B mucho más rápido, y una RTX 4090 de 24 GB juega en una categoría totalmente distinta. El punto fuerte del Snapdragon no es el rendimiento bruto, sino el rendimiento por vatio y la movilidad.
- Ecosistema aún joven
- El soporte de ARM64 avanza rápidamente, pero sigue siendo menos maduro que el de x86. Algunas herramientas, extensiones o backends de GPU van con retraso o son experimentales.
- Sin aceleración GPU para el público general
- El backend Adreno para llama.cpp sigue estando en sus primeras etapas; en la práctica, la inferencia depende principalmente de la CPU.
- NPU subutilizado
- Como se vio más arriba, los 45 TOPS aún no benefician a los runtimes LLM comunes.
- Límite de tamaño
- Por encima de unos veinte mil millones de parámetros en modelos densos, la experiencia empeora notablemente; los modelos muy grandes siguen siendo terreno de las GPU dedicadas (un MoE con pocos parámetros activos sigue siendo la excepción que funciona mejor).
#Para ir más allá
El Snapdragon X Elite se entiende mejor al compararlo con otros enfoques basados en NPU y dominar los fundamentos de la instalación local. Estas guías permiten profundizar en la reflexión:
- Ryzen AI 9 HX: ¿sirve de verdad el NPU de 50 TOPS para los LLM?
- El equivalente x86 de este debate sobre las NPU, con pruebas honestas cuyos resultados coinciden con las conclusiones de esta guía.
- Instalar Ollama: Windows, macOS y Linux
- Para dominar a fondo el daemon de Ollama y sus comandos; también se aplica a la compilación ARM64.
- Elegir tu cuantización (Q4, Q5, Q8)
- Para afinar el equilibrio calidad/velocidad, decisivo en una máquina donde la CPU realiza la mayor parte del trabajo.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.