Intermedio 14 minComparativa

Strix Halo vs DGX Spark : el duelo de las máquinas 128 GB

En 2026, dos máquinas con 128 GB de memoria unificada compiten por ocupar el escritorio de los aficionados a los LLM locales: el Ryzen AI Max+ 395 de AMD (nombre en clave Strix Halo) y el DGX Spark de NVIDIA. Sobre el papel, la misma capacidad de memoria y la misma promesa: cargar modelos de 70B y grandes MoE sin recurrir a varias GPU. En la práctica, el duelo Strix Halo vs DGX Spark se decide menos por la generación de tokens que por el procesamiento de prompts, donde la diferencia alcanza un factor de 5. Esta comparativa presenta las cifras y el precio, y determina qué opción elegir según tu uso real.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto → · Nuestra ficha NVIDIA DGX Spark →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#Dos máquinas de 128 GB, dos filosofías

El Ryzen AI Max+ 395 es un APU x86: CPU Zen 5 (16 núcleos), iGPU Radeon 8060S (RDNA 3.5, 40 CU) y NPU XDNA 2, que comparten hasta 128 GB de LPDDR5X a través de un bus de 256 bits. Se encuentra en mini-PC (Framework Desktop, GMKtec EVO-X2, Beelink GTR9) y algunos portátiles. Es una plataforma de consumo, con Windows o Linux, que ejecuta Ollama y LM Studio como cualquier ordenador.

El DGX Spark es otra clase de máquina: un chip GB10 (arquitectura Grace Blackwell) con una CPU ARM de 20 núcleos y una GPU Blackwell con Tensor Cores, también conectadas a 128 GB de memoria LPDDR5X unificada. Es un dispositivo centrado ante todo en NVIDIA, que viene con DGX OS (un Ubuntu personalizado) y toda la pila CUDA. Precio oficial anunciado: 4.699 dólares.

i
Misma memoria, objetivos opuestos
Strix Halo apuesta por el precio y la versatilidad x86; el DGX Spark apuesta por el rendimiento de cálculo y el ecosistema CUDA. Ambos cargan los mismos modelos grandes, pero no los ejecutan a la misma velocidad ni con el mismo presupuesto.

#1. Especificaciones frente a frente

Lo que más sorprende a primera vista: el ancho de banda de memoria es casi idéntico. Es precisamente este el que determina la velocidad de generación de tokens. Esto explica por qué, al conversar, las dos máquinas ofrecen un rendimiento muy similar.

Memoria
128 GB de memoria unificada LPDDR5X en ambos equipos. Suficiente para un 70B Q4 (~40 GB) más el contexto, o un MoE como Qwen3-235B con cuantización agresiva.
Ancho de banda
Strix Halo: ~256 GB/s teóricos (256 bits, LPDDR5X-8000). DGX Spark: ~273 GB/s. Diferencia real despreciable para la generación.
Cálculo en GPU
Radeon 8060S RDNA 3.5, 40 CU, sin núcleos Tensor dedicados. En Spark: GPU Blackwell con núcleos Tensor y soporte nativo de FP4, un orden de magnitud por encima en capacidad de cálculo bruta.
CPU
AMD: Zen 5, 16 núcleos x86. NVIDIA: ARM Grace, 20 núcleos. x86 sigue siendo más sencillo para el software destinado al público general.
OS
Strix Halo: Windows 11 o Linux a elección. DGX Spark: DGX OS (Ubuntu) con controladores y CUDA preinstalados.
Consumo
Strix Halo: presupuesto de potencia de 55-120 W según el chasis. DGX Spark: ~240 W medidos en la toma de corriente bajo carga, fuente de alimentación dedicada.

#2. Tokens/segundo: una comparación muy reñida

En la generación pura (decode), las dos máquinas están limitadas por el ancho de banda de la memoria, no por el cálculo. Resultado: cifras similares, con una ligera ventaja para Spark gracias a su ancho de banda ligeramente superior y a unos kernels CUDA muy optimizados. Aquí tienes mediciones representativas publicadas por la comunidad en 2026, con cuantización Q4 equivalente y un prompt corto.

Qwen3-30B-A3B (MoE) — Strix Halo
~100 tok/s en generación. El MoE activa solo 3B de parámetros, por lo que la velocidad es alta a pesar del tamaño.
Qwen3-30B-A3B (MoE) — DGX Spark
~100-115 tok/s. Poca diferencia: ambos están limitados por la memoria con este MoE ligero.
Modelo denso 70B Q4 — Strix Halo
~4-5 tok/s. Un 70B denso satura el ancho de banda; la experiencia sigue siendo utilizable, pero lenta.
Modelo denso 70B Q4 — DGX Spark
~5-6 tok/s. También limitado por la memoria. La diferencia se mide en fracciones de token/s.
Modelo 8B Q4 — los dos
50-70 tok/s, más que suficiente para un chat interactivo cómodo.
→
El MoE es el aliado de los 128 GB
Un modelo Mixture-of-Experts como Qwen3-30B-A3B solo calcula sus expertos activos por cada token. En estas dos máquinas, es el punto ideal: modelo grande cargado en memoria, pero velocidad similar a un modelo pequeño. Prefiere los MoE si quieres calidad y velocidad al mismo tiempo.

La conclusión de esta sección es contraintuitiva: si solo miras los tokens/segundo en chat, las dos máquinas son casi equivalentes, y el Strix Halo —mucho más barato— parece ganar. Pero este número solo cuenta la mitad de la historia.

#3. Procesamiento de prompts: la verdadera diferencia

El procesamiento del prompt (o prefill) es la fase en la que el modelo lee y codifica tu prompt de entrada antes de generar el primer token. A diferencia de la generación, esta fase está limitada por el cálculo, no por la memoria. Es en esta fase donde los Tensor Cores del DGX Spark resultan decisivos.

Strix Halo — prefill
~340 tok/s de procesamiento del prompt en un modelo típico de 30B. La iGPU RDNA 3.5 no tiene unidades matriciales dedicadas y alcanza rápidamente su límite.
DGX Spark — prefill
aproximadamente 5 veces más rápido con los mismos modelos, gracias a los Tensor Cores Blackwell y al soporte FP4. En contextos grandes, la diferencia puede aumentar aún más.

¿Por qué importa? Porque, en cuanto pasas de conversaciones breves, el prefill domina el tiempo de respuesta percibido. Un sistema RAG que inyecta 8.000 tokens de contexto, un agente que vuelve a leer todo su historial en cada turno, el análisis de un documento largo, el procesamiento por lotes: en todos estos casos, tienes que esperar a que termine el prefill antes de ver nada.

!
La trampa del benchmark con un prompt corto
Muchas pruebas solo publican los tokens/segundo de generación con un prompt de 20 tokens y concluyen que Strix Halo está a la altura. Eso es cierto en chat, pero no en RAG ni en agentes. Si tu uso implica enviar contextos largos, el procesamiento del prompt en el DGX Spark cambia radicalmente la experiencia: mide esta fase por separado antes de comprar.

Ejemplo concreto: un prompt de 4.000 tokens. A 340 tok/s, el Strix Halo tarda aproximadamente 12 segundos solo en el prefill antes de comenzar a responder. El DGX Spark, aproximadamente 5 veces más rápido, completa esta misma fase en 2-3 segundos. En una sesión intensiva de RAG con decenas de consultas, esta diferencia pasa a dominar la experiencia de uso.

#4. Precio y disponibilidad

Es el área en la que Strix Halo recupera la ventaja, y por mucho. La relación precio/memoria es su principal baza.

DGX Spark
4 699 dólares, precio oficial de NVIDIA. Disponibilidad a través de NVIDIA y sus socios (Dell, Asus, HP, Lenovo). Orientado a profesionales y desarrolladores.
Strix Halo — mini-PC
Framework Desktop, GMKtec EVO-X2, Beelink GTR9: según la configuración de 128 GB, el precio suele estar entre ~1.700 y ~2.500 dólares/euros. Aproximadamente la mitad del precio del Spark para la misma cantidad de memoria.
Strix Halo — portátil
Algunos portátiles (por ejemplo, HP ZBook Ultra, Asus ROG Flow Z13) incorporan la APU, una ventaja poco común para ejecutar LLM con 128 GB de memoria en movilidad.
Disponibilidad
Strix Halo está disponible para su compra a través de varios ensambladores desde mediados de 2026. El DGX Spark sigue un calendario de NVIDIA más limitado según la región.
i
La verdadera disyuntiva en cuanto al precio
Por aproximadamente el precio de un DGX Spark, puedes comprar un mini-PC Strix Halo de 128 GB Y, además, una RTX 4090 de 24 GB. Si necesitas sobre todo chat y modelos que caben en 24 GB, esta combinación puede superar al Spark en casi todos los aspectos, salvo en el procesamiento de prompts con modelos muy grandes.

#5. Ecosistema de software

Más allá del hardware, la pila de software influye mucho en la comodidad de uso diario, y ahí es donde NVIDIA aprovecha los años de ventaja que lleva con CUDA.

DGX Spark — CUDA
Todo el ecosistema NVIDIA funciona de forma nativa: vLLM, TensorRT-LLM, PyTorch y los contenedores NGC. Para fine-tuning, inferencia por lotes o investigación, es el entorno mejor establecido.
Strix Halo — ROCm / Vulkan
La inferencia funciona bien mediante Ollama y llama.cpp (backend Vulkan o ROCm). El fine-tuning y los frameworks avanzados siguen siendo más artesanales en RDNA 3.5 que en CUDA.
Sencillez para el público general
Ventaja de Strix Halo para el usuario común: Windows, Ollama en un solo comando, LM Studio con un clic. Spark requiere estar cómodo con Linux/Ubuntu.
Atender múltiples clientes
Ventaja del DGX Spark: vLLM y TensorRT-LLM ofrecen procesamiento por lotes y una tasa de procesamiento agregada muy superiores para dar servicio a un equipo o a una aplicación.

#6. ¿Qué perfil para qué máquina?

  1. 01
    Usas principalmente el chat local y modelos MoE
    Strix Halo. Las tasas de tokens por segundo en generación están al nivel de Spark, el precio es la mitad y Windows + Ollama hace que sea muy fácil de usar. Un Qwen3-30B-A3B a ~100 t/s es un excelente modelo para el uso diario.
  2. 02
    Estás montando un RAG o agentes de contexto largo
    DGX Spark. El procesamiento de prompts 5 veces más rápido transforma la experiencia en cuanto introduces contextos grandes de forma repetida. Es el escenario en el que se justifica el coste adicional.
  3. 03
    Quieres hacer ajuste fino o investigación
    DGX Spark. La pila CUDA (PyTorch, TensorRT-LLM, contenedores NGC) está incomparablemente mejor equipada que ROCm en APU para el entrenamiento.
  4. 04
    Buscas el mejor ratio memoria/euro
    Strix Halo, sin dudarlo. 128 GB unificados (precio muy variable, verificar), generalmente más barato que el Spark, con la versatilidad x86 de un verdadero PC de escritorio.
  5. 05
    Quieres disponer de 128 GB mientras te desplazas
    Strix Halo, mediante un portátil equipado con APU — una categoría que el DGX Spark, dispositivo de escritorio, no cubre.

i
Dos chips, una misma revolución
Toma un momento para reflexionar: en 2024, ejecutar un 70B en casa exigía montajes caseros de entusiastas con varias GPU. En 2026, AMD y NVIDIA venden cada uno un chip con 128 GB de memoria unificada que lo ejecuta en silencio bajo tu escritorio. Elijas el bando que elijas, la IA local es la que ha ganado.

#Veredicto

Veredicto claro: empate. Este duelo no tiene un único ganador, y no es una evasiva: es el resultado de las mediciones. Ambos chips ofrecen 128 GB de memoria unificada y una velocidad de generación comparable; cada uno gana la mitad del duelo. El Strix Halo gana en relación precio/memoria, versatilidad (también es un excelente PC) y chat interactivo; el GB10 gana en procesamiento de prompts, fine-tuning, clustering y ecosistema CUDA. Dos filosofías, dos ganadores: la única perdedora es la GPU clásica con VRAM limitada.

El número que engaña
~100 tok/s de generación en ambos casos con Qwen3-30B → parece un empate, con ventaja de precio para Strix Halo.
El número que decide
Procesamiento del prompt: ~340 tok/s (Strix Halo) frente a unas 5 veces más (DGX Spark). Este dato es determinante en cuanto se pasa de las conversaciones breves a otros usos.
La regla simple
Contexto corto + presupuesto ajustado → Strix Halo. Contexto largo, agentes, RAG, fine-tuning → DGX Spark.
→
Prueba tu carga real, no un benchmark genérico
Antes de comprar, cronometra el procesamiento de tu prompt típico: longitud de entrada, frecuencia de solicitudes, tamaño del modelo objetivo. Si tus prompts superan regularmente unos pocos miles de tokens, el procesamiento de prompts del Spark justifica su precio. De lo contrario, el Strix Halo es la opción racional.

#Preguntas frecuentes

Strix Halo o DGX Spark: ¿cuál elegir en 2026?+
Empate: la elección depende de tu perfil, no de una clasificación. Prompts cortos, chat, asistencia con el código, presupuesto ajustado, necesidad de un PC versátil: Strix Halo. Prompts largos, fine-tuning, flujo de trabajo CUDA, intención de crear un clúster: GB10/DGX Spark. A igualdad de uso, elijas el que elijas, no echarás de menos el otro.
¿Por qué un veredicto ex aequo y no un ganador?+
Porque ambas plataformas comparten la misma limitación estructural —un ancho de banda de memoria de alrededor de 256-273 GB/s que limita la velocidad de generación— y se diferencian en criterios opuestos (precio y versatilidad frente a capacidad de cálculo y ecosistema). Designar un ganador único equivaldría a decidir por ti qué uso le vas a dar.
¿Por qué la generación de texto es similar en ambas?+
La generación token por token está limitada por el ancho de banda de la memoria, no por la potencia de cálculo. Con ~256 GB/s (Strix Halo) frente a ~273 GB/s (GB10), ambos leen el modelo a una velocidad similar, de ahí que alcancen tasas de tokens/s comparables con el mismo modelo cuantizado. En cambio, la diferencia aumenta enormemente en el procesamiento del prompt, donde domina la GPU Blackwell.
¿Cuál es la diferencia real de precio?+
A igualdad de memoria, el precio puede llegar aproximadamente al doble: los equipos Strix Halo de 128 GB parten de unos 1 700-2 000 $ (Bosgame, Beelink, Framework), mientras que los sistemas GB10 van de ~2 999 $ (Asus Ascent GX10) a ~3 999 $ (DGX Spark Founders). Ese es el argumento central de Strix Halo, y lo que pagas con el GB10 es CUDA y la capacidad de cálculo.

#Para ir más allá

Para profundizar en cada máquina y en el contexto de hardware de esta comparativa:

Ryzen AI Max+ 395 (Strix Halo)
Guía dedicada a la APU AMD: mini-PC y laptops disponibles, modelos 70B+ accesibles y rendimiento real frente a GPUs dedicadas y a Macs.
NVIDIA DGX Spark
El mini-PC de IA con 128 GB, analizado en detalle frente a las GPU clásicas: referencias de rendimiento, casos de uso y límites.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para entender por qué un 70B cabe en 40 GB en Q4 y qué pérdida de calidad implica cada nivel de cuantización en estas máquinas con memoria unificada.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.