Strix Halo vs DGX Spark : el duelo de las máquinas 128 GB
En 2026, dos máquinas con 128 GB de memoria unificada compiten por ocupar el escritorio de los aficionados a los LLM locales: el Ryzen AI Max+ 395 de AMD (nombre en clave Strix Halo) y el DGX Spark de NVIDIA. Sobre el papel, la misma capacidad de memoria y la misma promesa: cargar modelos de 70B y grandes MoE sin recurrir a varias GPU. En la práctica, el duelo Strix Halo vs DGX Spark se decide menos por la generación de tokens que por el procesamiento de prompts, donde la diferencia alcanza un factor de 5. Esta comparativa presenta las cifras y el precio, y determina qué opción elegir según tu uso real.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto → · Nuestra ficha NVIDIA DGX Spark →
Alternativa de compra para esta guía: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#Dos máquinas de 128 GB, dos filosofías
El Ryzen AI Max+ 395 es un APU x86: CPU Zen 5 (16 núcleos), iGPU Radeon 8060S (RDNA 3.5, 40 CU) y NPU XDNA 2, que comparten hasta 128 GB de LPDDR5X a través de un bus de 256 bits. Se encuentra en mini-PC (Framework Desktop, GMKtec EVO-X2, Beelink GTR9) y algunos portátiles. Es una plataforma de consumo, con Windows o Linux, que ejecuta Ollama y LM Studio como cualquier ordenador.
El DGX Spark es otra clase de máquina: un chip GB10 (arquitectura Grace Blackwell) con una CPU ARM de 20 núcleos y una GPU Blackwell con Tensor Cores, también conectadas a 128 GB de memoria LPDDR5X unificada. Es un dispositivo centrado ante todo en NVIDIA, que viene con DGX OS (un Ubuntu personalizado) y toda la pila CUDA. Precio oficial anunciado: 4.699 dólares.
#1. Especificaciones frente a frente
Lo que más sorprende a primera vista: el ancho de banda de memoria es casi idéntico. Es precisamente este el que determina la velocidad de generación de tokens. Esto explica por qué, al conversar, las dos máquinas ofrecen un rendimiento muy similar.
- Memoria
- 128 GB de memoria unificada LPDDR5X en ambos equipos. Suficiente para un 70B Q4 (~40 GB) más el contexto, o un MoE como Qwen3-235B con cuantización agresiva.
- Ancho de banda
- Strix Halo: ~256 GB/s teóricos (256 bits, LPDDR5X-8000). DGX Spark: ~273 GB/s. Diferencia real despreciable para la generación.
- Cálculo en GPU
- Radeon 8060S RDNA 3.5, 40 CU, sin núcleos Tensor dedicados. En Spark: GPU Blackwell con núcleos Tensor y soporte nativo de FP4, un orden de magnitud por encima en capacidad de cálculo bruta.
- CPU
- AMD: Zen 5, 16 núcleos x86. NVIDIA: ARM Grace, 20 núcleos. x86 sigue siendo más sencillo para el software destinado al público general.
- OS
- Strix Halo: Windows 11 o Linux a elección. DGX Spark: DGX OS (Ubuntu) con controladores y CUDA preinstalados.
- Consumo
- Strix Halo: presupuesto de potencia de 55-120 W según el chasis. DGX Spark: ~240 W medidos en la toma de corriente bajo carga, fuente de alimentación dedicada.
#2. Tokens/segundo: una comparación muy reñida
En la generación pura (decode), las dos máquinas están limitadas por el ancho de banda de la memoria, no por el cálculo. Resultado: cifras similares, con una ligera ventaja para Spark gracias a su ancho de banda ligeramente superior y a unos kernels CUDA muy optimizados. Aquí tienes mediciones representativas publicadas por la comunidad en 2026, con cuantización Q4 equivalente y un prompt corto.
- Qwen3-30B-A3B (MoE) — Strix Halo
- ~100 tok/s en generación. El MoE activa solo 3B de parámetros, por lo que la velocidad es alta a pesar del tamaño.
- Qwen3-30B-A3B (MoE) — DGX Spark
- ~100-115 tok/s. Poca diferencia: ambos están limitados por la memoria con este MoE ligero.
- Modelo denso 70B Q4 — Strix Halo
- ~4-5 tok/s. Un 70B denso satura el ancho de banda; la experiencia sigue siendo utilizable, pero lenta.
- Modelo denso 70B Q4 — DGX Spark
- ~5-6 tok/s. También limitado por la memoria. La diferencia se mide en fracciones de token/s.
- Modelo 8B Q4 — los dos
- 50-70 tok/s, más que suficiente para un chat interactivo cómodo.
La conclusión de esta sección es contraintuitiva: si solo miras los tokens/segundo en chat, las dos máquinas son casi equivalentes, y el Strix Halo —mucho más barato— parece ganar. Pero este número solo cuenta la mitad de la historia.
#3. Procesamiento de prompts: la verdadera diferencia
El procesamiento del prompt (o prefill) es la fase en la que el modelo lee y codifica tu prompt de entrada antes de generar el primer token. A diferencia de la generación, esta fase está limitada por el cálculo, no por la memoria. Es en esta fase donde los Tensor Cores del DGX Spark resultan decisivos.
- Strix Halo — prefill
- ~340 tok/s de procesamiento del prompt en un modelo típico de 30B. La iGPU RDNA 3.5 no tiene unidades matriciales dedicadas y alcanza rápidamente su límite.
- DGX Spark — prefill
- aproximadamente 5 veces más rápido con los mismos modelos, gracias a los Tensor Cores Blackwell y al soporte FP4. En contextos grandes, la diferencia puede aumentar aún más.
¿Por qué importa? Porque, en cuanto pasas de conversaciones breves, el prefill domina el tiempo de respuesta percibido. Un sistema RAG que inyecta 8.000 tokens de contexto, un agente que vuelve a leer todo su historial en cada turno, el análisis de un documento largo, el procesamiento por lotes: en todos estos casos, tienes que esperar a que termine el prefill antes de ver nada.
Ejemplo concreto: un prompt de 4.000 tokens. A 340 tok/s, el Strix Halo tarda aproximadamente 12 segundos solo en el prefill antes de comenzar a responder. El DGX Spark, aproximadamente 5 veces más rápido, completa esta misma fase en 2-3 segundos. En una sesión intensiva de RAG con decenas de consultas, esta diferencia pasa a dominar la experiencia de uso.
#4. Precio y disponibilidad
Es el área en la que Strix Halo recupera la ventaja, y por mucho. La relación precio/memoria es su principal baza.
- DGX Spark
- 4 699 dólares, precio oficial de NVIDIA. Disponibilidad a través de NVIDIA y sus socios (Dell, Asus, HP, Lenovo). Orientado a profesionales y desarrolladores.
- Strix Halo — mini-PC
- Framework Desktop, GMKtec EVO-X2, Beelink GTR9: según la configuración de 128 GB, el precio suele estar entre ~1.700 y ~2.500 dólares/euros. Aproximadamente la mitad del precio del Spark para la misma cantidad de memoria.
- Strix Halo — portátil
- Algunos portátiles (por ejemplo, HP ZBook Ultra, Asus ROG Flow Z13) incorporan la APU, una ventaja poco común para ejecutar LLM con 128 GB de memoria en movilidad.
- Disponibilidad
- Strix Halo está disponible para su compra a través de varios ensambladores desde mediados de 2026. El DGX Spark sigue un calendario de NVIDIA más limitado según la región.
#5. Ecosistema de software
Más allá del hardware, la pila de software influye mucho en la comodidad de uso diario, y ahí es donde NVIDIA aprovecha los años de ventaja que lleva con CUDA.
- DGX Spark — CUDA
- Todo el ecosistema NVIDIA funciona de forma nativa: vLLM, TensorRT-LLM, PyTorch y los contenedores NGC. Para fine-tuning, inferencia por lotes o investigación, es el entorno mejor establecido.
- Strix Halo — ROCm / Vulkan
- La inferencia funciona bien mediante Ollama y llama.cpp (backend Vulkan o ROCm). El fine-tuning y los frameworks avanzados siguen siendo más artesanales en RDNA 3.5 que en CUDA.
- Sencillez para el público general
- Ventaja de Strix Halo para el usuario común: Windows, Ollama en un solo comando, LM Studio con un clic. Spark requiere estar cómodo con Linux/Ubuntu.
- Atender múltiples clientes
- Ventaja del DGX Spark: vLLM y TensorRT-LLM ofrecen procesamiento por lotes y una tasa de procesamiento agregada muy superiores para dar servicio a un equipo o a una aplicación.
#6. ¿Qué perfil para qué máquina?
- 01Usas principalmente el chat local y modelos MoEStrix Halo. Las tasas de tokens por segundo en generación están al nivel de Spark, el precio es la mitad y Windows + Ollama hace que sea muy fácil de usar. Un Qwen3-30B-A3B a ~100 t/s es un excelente modelo para el uso diario.
- 02Estás montando un RAG o agentes de contexto largoDGX Spark. El procesamiento de prompts 5 veces más rápido transforma la experiencia en cuanto introduces contextos grandes de forma repetida. Es el escenario en el que se justifica el coste adicional.
- 03Quieres hacer ajuste fino o investigaciónDGX Spark. La pila CUDA (PyTorch, TensorRT-LLM, contenedores NGC) está incomparablemente mejor equipada que ROCm en APU para el entrenamiento.
- 04Buscas el mejor ratio memoria/euroStrix Halo, sin dudarlo. 128 GB unificados (precio muy variable, verificar), generalmente más barato que el Spark, con la versatilidad x86 de un verdadero PC de escritorio.
- 05Quieres disponer de 128 GB mientras te desplazasStrix Halo, mediante un portátil equipado con APU — una categoría que el DGX Spark, dispositivo de escritorio, no cubre.
#Veredicto
Veredicto claro: empate. Este duelo no tiene un único ganador, y no es una evasiva: es el resultado de las mediciones. Ambos chips ofrecen 128 GB de memoria unificada y una velocidad de generación comparable; cada uno gana la mitad del duelo. El Strix Halo gana en relación precio/memoria, versatilidad (también es un excelente PC) y chat interactivo; el GB10 gana en procesamiento de prompts, fine-tuning, clustering y ecosistema CUDA. Dos filosofías, dos ganadores: la única perdedora es la GPU clásica con VRAM limitada.
- El número que engaña
- ~100 tok/s de generación en ambos casos con Qwen3-30B → parece un empate, con ventaja de precio para Strix Halo.
- El número que decide
- Procesamiento del prompt: ~340 tok/s (Strix Halo) frente a unas 5 veces más (DGX Spark). Este dato es determinante en cuanto se pasa de las conversaciones breves a otros usos.
- La regla simple
- Contexto corto + presupuesto ajustado → Strix Halo. Contexto largo, agentes, RAG, fine-tuning → DGX Spark.
#Preguntas frecuentes
Strix Halo o DGX Spark: ¿cuál elegir en 2026?+
¿Por qué un veredicto ex aequo y no un ganador?+
¿Por qué la generación de texto es similar en ambas?+
¿Cuál es la diferencia real de precio?+
#Para ir más allá
Para profundizar en cada máquina y en el contexto de hardware de esta comparativa:
- Ryzen AI Max+ 395 (Strix Halo)
- Guía dedicada a la APU AMD: mini-PC y laptops disponibles, modelos 70B+ accesibles y rendimiento real frente a GPUs dedicadas y a Macs.
- NVIDIA DGX Spark
- El mini-PC de IA con 128 GB, analizado en detalle frente a las GPU clásicas: referencias de rendimiento, casos de uso y límites.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para entender por qué un 70B cabe en 40 GB en Q4 y qué pérdida de calidad implica cada nivel de cuantización en estas máquinas con memoria unificada.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.