Intermedio 14 minMini-PC

NVIDIA DGX Spark: el mini-PC IA de 128 GB frente a GPU

El DGX Spark es la apuesta de NVIDIA por la IA local de escritorio: un chip Grace Blackwell, 128 GB de memoria unificada y un formato que cabe en una esquina de la mesa. Sobre el papel, ejecuta modelos que ninguna tarjeta de consumo puede cargar por sí sola. Esta guía analiza el dgx spark llm en la práctica: qué cabe en memoria, las velocidades reales de inferencia y la comparación con una RTX 5090 y un Mac Studio para saber si este mini-PC merece un lugar en tu casa.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto → · Nuestra ficha NVIDIA DGX Spark →

Por Samir K.·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Para esta configuración: NVIDIA DGX Spark.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#¿Qué es el DGX Spark?

El DGX Spark es un ordenador compacto construido en torno al superchip NVIDIA GB10 Grace Blackwell. Combina en un mismo chip una GPU Blackwell y una CPU ARM Grace (20 núcleos), conectadas a un único conjunto de 128 GB de memoria LPDDR5X compartida entre ambas. Esta arquitectura de memoria unificada —la misma filosofía que Apple Silicon— es lo que hace que la máquina resulte tan interesante para la IA local.

Mientras que una tarjeta gráfica convencional mantiene su VRAM separada (24 o 32 GB como máximo en el segmento de consumo), el DGX Spark permite que la GPU acceda directamente a los 128 GB. En concreto, la limitación que frena a todos al usar una GPU —«¿cabe el modelo en la VRAM?»— desaparece casi por completo. El factor limitante pasa a ser el ancho de banda de la memoria, no la capacidad.

Chip
NVIDIA GB10 Grace Blackwell (GPU Blackwell + CPU ARM de 20 núcleos)
Memoria
128 GB LPDDR5X unificada, compartida entre CPU y GPU
Ancho de banda
~273 GB/s (LPDDR5X), el verdadero cuello de botella
Red
ConnectX (200 GbE) para interconectar dos Spark y ejecutar modelos muy grandes
Formato
Mini-PC de escritorio, ~150 W, silencioso en comparación con una torre con varias GPU
i
No sustituye a un centro de datos
El DGX Spark está orientado al prototipado, al fine-tuning ligero y a la inferencia local de modelos grandes, no al entrenamiento a gran escala ni al servicio bajo una carga elevada. NVIDIA lo posiciona como una estación personal de desarrollo de IA.

#128 GB de memoria unificada: qué permiten hacer

Para ponerlo en perspectiva, esta es la VRAM aproximada que necesita un modelo con cuantización Q4_K_M, la más habitual para la inferencia local: un 7B cabe en ~5 GB, un 14B en ~9 GB, un 32B en ~19 GB y un 70B en ~40 GB. Por tanto, en una RTX 5090 con sus 32 GB, un 70B Q4 no cabe por completo: hay que trasladar parte de la carga a la CPU, lo que desploma la velocidad.

Con 128 GB de memoria unificada, el DGX Spark carga sin esfuerzo un 70B en Q4, Q5 o incluso Q8, conserva margen para un contexto largo (32k tokens o más) y deja abierta la puerta a modelos de 100B+ parámetros con cuantización agresiva. Es la clase de modelos que, hasta ahora, exigía un Mac Studio de gama alta o un equipo con varias GPU, caro y con un elevado consumo energético.

70B Q4 (~40 GB)
Cómodo, con un amplio margen para el contexto
70B Q8 (~75 GB)
Posible — calidad casi FP16 en un modelo grande
MoE de tipo 120B en Q4
Cabe en memoria; el ancho de banda determina la velocidad
Varios modelos cargados
Un 32B + un 14B en paralelo para enrutamiento o sistemas multiagente
→
La memoria no equivale a velocidad
Cargar un modelo y hacer que funcione rápido son dos cosas distintas. Los 128 GB garantizan que el modelo quepa; son los ~273 GB/s de ancho de banda los que determinan los tokens/segundo. Con los modelos muy grandes, espera una inferencia con un ritmo de lectura fluido, no ráfagas de generación.

#¿Qué modelos ejecuta?

El punto fuerte del DGX Spark es el rango de 30B–120B, justo donde las GPU de consumo se quedan cortas por falta de VRAM. Estos son los usos típicos por familia de modelos.

Qwen 3.8 27B
El modelo generalista de referencia de 2026 (visión, 262k ctx); en esta máquina funciona en Q8 con calidad plena y un amplio margen de contexto
Qwen 3.6 35B-A3B / Qwen3-Coder 30B
MoE rápidos para razonamiento y código, enteros en memoria incluso en Q8
GLM 4.7 Flash (MoE 30B-A3B, MIT)
Excelente para agentes, cargado con toda su calidad sin hacer malabarismos
Gran MoE de 100B+ cuantizado
Las arquitecturas Mixture-of-Experts aprovechan plenamente la gran memoria unificada
Modelos multimodales
Gemma 4 y Qwen 3.8 (visión + texto), que consumen mucha memoria, caben sin concesiones

Para los modelos pequeños (7B–14B), el DGX Spark funciona, evidentemente, pero es un desperdicio: una RTX 4070 o un Mac mini M4 los ejecuta más rápido y por mucho menos dinero. La máquina solo se justifica si prevés utilizar modelos grandes con regularidad.

i
GB10: un superchip de datacenter en casa
El corazón del Spark es el GB10 Grace Blackwell: 20 núcleos ARM (10 Cortex-X925 + 10 A725) soldados a una GPU Blackwell mediante un enlace NVLink-C2C, ~1 petaFLOP en FP4 y 128 GB de memoria unificada. Es literalmente la arquitectura de los servidores GB200 reducida al formato de un libro de bolsillo, con el ecosistema CUDA completo, lo que lo convierte en el único puente directo entre «experimentar en casa» y «desplegar como en producción».

#Rendimiento real en inferencia

Dos cifras importan en la inferencia local: la velocidad de generación (tokens/segundo, lo que va apareciendo en pantalla) y el tiempo de prellenado (la espera antes del primer token, que depende de la longitud del prompt). El ancho de banda de memoria determina sobre todo la generación.

En el DGX Spark, un modelo de 70B en Q4 suele generar del orden de diez tokens por segundo: suficiente para usarlo cómodamente como asistente y leer las respuestas a medida que se generan, pero menos adecuado para cargas de trabajo por lotes que requieren un alto caudal de procesamiento. Los modelos más pequeños (14B–32B) alcanzan velocidades considerablemente mayores. Este perfil es coherente con un ancho de banda de ~273 GB/s: es la barrera que separa al DGX Spark de las tarjetas GDDR7, mucho más rápidas en este aspecto.

!
No compares cifras de tokens/segundo fuera de contexto
Una cifra de tokens por segundo solo tiene sentido si se especifican el modelo exacto, la cuantización, el tamaño del contexto y el motor de inferencia. Los valores anteriores son órdenes de magnitud para orientarte, no garantías. Mide el rendimiento con tu propia carga de trabajo antes de decidir una compra.

#DGX Spark vs RTX 5090

Es la comparativa más ilustrativa y enfrenta dos filosofías. La RTX 5090 ofrece 32 GB de VRAM GDDR7 con un ancho de banda de ~1792 GB/s: aproximadamente de seis a siete veces más rápida que el DGX Spark en cuanto a memoria. Con todo lo que cabe en sus 32 GB, la 5090 pulveriza al Spark en tokens/segundo.

Pero la 5090 se topa con un límite claro: por encima de ~32 GB, debe trasladar parte del modelo a la RAM del sistema para ejecutarla en la CPU, y su rendimiento se desploma. Un 70B Q4 (~40 GB) no cabe por completo en ella. El DGX Spark, en cambio, ejecuta ese mismo 70B sin problemas: más lentamente, pero sin dividirlo. La elección se reduce a una pregunta: ¿tu carga de trabajo cabe en menos de 32 GB?

Te mantienes en ≤ 32 GB (hasta ~32B Q4)
RTX 5090: mucho más rápida y versátil (juegos, renderizado, CUDA)
Buscas modelos de 70B o más
DGX Spark: el modelo cabe donde la 5090 se queda corta
Consumo / ruido
DGX Spark: ~150 W y silencioso, frente a una torre con 5090 que genera mucho calor y ruido
Ecosistema CUDA completo
Los dos; el Spark agrega el stack DGX/NVIDIA de punta a punta

#DGX Spark vs Mac Studio

El verdadero rival del DGX Spark no es una tarjeta gráfica, es el Mac Studio. Ambos comparten la misma idea: una gran cantidad de memoria unificada en una caja compacta y sobria, y se dirigen al mismo público: desarrolladores que quieren modelos grandes en local sin montar un equipo por piezas.

El Mac Studio (M-Ultra) puede alcanzar hasta 512 GB de memoria unificada con un ancho de banda a menudo superior en configuraciones de gama alta, lo que lo hace muy potente para modelos muy grandes. Su ventaja: macOS, Metal y un ecosistema maduro (Ollama, LM Studio, MLX). La ventaja del DGX Spark: soporte nativo de CUDA. Si tu pipeline depende de bibliotecas de CUDA, de TensorRT o de herramientas NVIDIA, el Spark habla nativamente el mismo idioma que tus servidores de producción.

Memoria máxima
Mac Studio hasta 512 GB; DGX Spark 128 GB (extensible al conectar 2 unidades)
Ecosistema de software
Mac: Metal/MLX maduro; Spark: CUDA nativo, continuidad con los servidores NVIDIA
Portabilidad del código de IA
Spark ejecuta sin dificultades el código escrito para GPU NVIDIA en la nube o en centros de datos
Uso ofimático
El Mac Studio es un equipo de trabajo completo; el Spark es una estación de IA dedicada
i
El criterio que suele inclinar la balanza
Si estás creando un prototipo de código destinado a ejecutarse en GPU NVIDIA en producción, el DGX Spark elimina las sorpresas al portar el código. Si lo que buscas principalmente es una inferencia local cómoda y una máquina versátil, el Mac Studio es más flexible. El resto depende del ancho de banda y del presupuesto.

#Instalar Ollama en él

El DGX Spark funciona sobre una base Linux (DGX OS, derivado de Ubuntu) con la pila CUDA preinstalada. Ollama funciona allí como en cualquier máquina Linux con GPU NVIDIA: el demonio detecta la GPU y sirve los modelos en su puerto habitual.

  1. 01
    Instalar Ollama
    Script oficial en una sola orden. Configura el servicio systemd y detecta automáticamente el GPU Blackwell a través de CUDA.
  2. 02
    Verificar la detección de GPU
    Confirma que la GPU se detecta correctamente antes de ejecutar un modelo grande; de lo contrario, la inferencia se ejecutaría en la CPU.
  3. 03
    Descargar un modelo grande
    Descarga un gran modelo MoE de 2026 a plena calidad (un Qwen3-Coder 30B en Q8, o el modelo insignia Qwen 3.8 27B y su contexto de 262k) para aprovechar la memoria: este es precisamente el caso de uso de la máquina.
  4. 04
    Iniciar y conectar una interfaz
    El demonio escucha por defecto en http://localhost:11434; configura Open WebUI o LM Studio para que se conecten a esa dirección.
Terminal — instalación
# Installer Ollama (Linux / DGX OS)
curl -fsSL https://ollama.com/install.sh | sh

# Vérifier que le GPU Blackwell est détecté
nvidia-smi

# Tirer et lancer un gros MoE 2026 en pleine qualité (exploite la mémoire unifiée)
ollama run qwen3-coder:30b-a3b-q8_0

El daemon de Ollama expone una API compatible en el puerto 11434. Para aprovechar la memoria, prioriza modelos que las GPU convencionales no puedan cargar por sí solas y aumenta la ventana de contexto, ya que tienes espacio para ello. Ten en cuenta que Qwen 3.8 27B tiende a razonar en exceso con su ajuste de razonamiento predeterminado: cámbialo al modo bajo (low) para obtener respuestas más directas.

Terminal — contexto ampliado
# Servir Qwen 3.8 27B avec un grand contexte depuis un Modelfile
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 131072
EOF

ollama create qwen38-128k -f Modelfile
ollama run qwen38-128k
→
Enlazar dos Spark
El puerto de red ConnectX 200 GbE permite conectar dos DGX Spark para sumar su memoria y ejecutar modelos que requieren más de 128 GB. Esta es la vía de ampliación prevista por NVIDIA si un solo equipo ya no basta.

#Un chip, ocho máquinas: los clones certificados

NVIDIA ha convertido el GB10 en una plataforma: además de su DGX Spark Founders Edition, siete fabricantes venden la misma base certificada bajo su propia marca. El mismo chip, los mismos 128 GB: las diferencias están en el almacenamiento, el chasis, el precio y el canal de venta.

8 sistemas GB10 certificados (agosto 2026)
MáquinaFabricantePuntos clave
DGX Spark Founders EditionNVIDIALa referencia, ~3 999 $
Ascent GX10AsusEl más competitivo en precio (~2 999 $)
Veriton GN100AcerSKU único con 4 TB de almacenamiento
AI TOP ATOMGigabyteIncluido con la suite de software AI TOP
EdgeXpert MS-C931MSICanal industrial/edge
Pro Max GB10DellCanal empresarial
ThinkStation PGXLenovoCanal de estaciones de trabajo
ZGX NanoHPCanal de estaciones de trabajo

Un detalle que lo cambia todo para los modelos grandes: el puerto ConnectX integrado permite conectar dos unidades y ejecutar modelos de la clase 400B en local. Ningún otro equipo de consumo ofrece eso.

#Preguntas frecuentes

¿Qué es exactamente el GB10 del DGX Spark?+
Un «superchip»: un procesador ARM Grace de 20 núcleos y una GPU Blackwell fabricados para trabajar juntos, conectados mediante NVLink-C2C (mucho más rápido que un bus PCIe) y que comparten 128 GB de memoria unificada LPDDR5X. Ofrece aproximadamente 1 petaFLOP en FP4: la arquitectura de los servidores de IA de NVIDIA, a escala de un mini-PC.
¿Qué diferencia hay entre el DGX Spark y sus clones Asus, Acer o Gigabyte?+
Ninguna en el chip: los 8 sistemas incorporan el mismo GB10 y los mismos 128 GB. Las diferencias son el almacenamiento (hasta 4 TB en Acer), el chasis, el software proporcionado, el soporte y sobre todo el precio: el Asus Ascent GX10 cuesta aproximadamente 1.000 $ menos que la Founders Edition.
¿Se puede realmente ejecutar un modelo de 400B con dos máquinas?+
Sí, es un caso de uso oficial: dos unidades conectadas mediante su puerto ConnectX de 200 Gb/s comparten su memoria para servir modelos de clase 400B (modelos MoE de muy gran tamaño de clase 400B+ cuantizados). Es único en el mercado de consumo: el siguiente escalón es un servidor que cuesta varias decenas de miles de euros.
¿DGX Spark o máquina Strix Halo?+
Ambos ofrecen 128 GB de memoria unificada y una generación de texto comparable (sus anchos de banda de memoria son similares). GB10 gana en procesamiento de prompts, fine-tuning y ecosistema CUDA; Strix Halo gana en precio (a menudo cuesta la mitad), Windows y versatilidad. Nuestro comparativo específico determina cuál conviene según el perfil; veredicto: empate.
¿A quién va dirigida una máquina GB10?+
A los desarrolladores de IA que quieren crear prototipos en local de lo que desplegarán en hardware NVIDIA en producción, a los equipos que hacen fine-tuning y a quienes buscan modelos muy grandes mediante clustering. Para el chat y la asistencia de programación en el día a día, una máquina Strix Halo ofrece un servicio similar por la mitad de precio.

#Para quién tiene sentido este formato

El DGX Spark no es una máquina para el público en general. Resulta especialmente interesante para perfiles concretos para los que la limitación de VRAM es el verdadero problema cotidiano.

Desarrolladores de IA que trabajan con CUDA
Prototipar localmente código destinado a GPUs NVIDIA de producción, sin sorpresas de portabilidad
Investigadores y equipos de I+D
Fine-tuning ligero e inferencia de modelos grandes sin reservar tiempo en GPU en la nube
Usuarios avanzados de modelos 70B+
Quienes chocan constantemente con el límite de 24–32 GB de una tarjeta gráfica de consumo
Oficinas sensibles al ruido y al consumo
Una estación silenciosa y de bajo consumo en lugar de un equipo con varias GPU

Por el contrario, si juegas, si ejecutas principalmente modelos ≤ 32B o si tu presupuesto es ajustado, una RTX 5090 (o incluso una 4070/4080) o un Mac mini M4 ofrecerá una relación rendimiento/precio mucho mejor. El DGX Spark se justifica cuando la necesidad de una gran capacidad de memoria tiene prioridad sobre la velocidad bruta.

!
La trampa del número mágico
«128 GB» impresiona, pero no los alquiles para ejecutar un 8B. Compra esta máquina por lo que realmente permite ejecutar —modelos de entre 70B y 120B en local— o pagarás caro por una capacidad que nunca utilizarás.

#Para ir más allá

El DGX Spark se puede valorar mejor al compararlo con las alternativas ya cubiertas en el sitio. Estas guías permiten profundizar en la reflexión:

¿Qué LLM usar con una RTX 5090 (32 GB)?
La comparativa detallada de la tarjeta de consumo más rápida, para decidir entre tasa de procesamiento y capacidad.
¿Qué LLM en Mac Studio?
Otra gran máquina con memoria unificada, hasta 512 GB — el verdadero rival del DGX Spark.
Elegir tu GPU para IA local
Para definir tus necesidades de VRAM antes de gastar y ver dónde se sitúa cada opción.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.