NVIDIA DGX Spark: el mini-PC IA de 128 GB frente a GPU
El DGX Spark es la apuesta de NVIDIA por la IA local de escritorio: un chip Grace Blackwell, 128 GB de memoria unificada y un formato que cabe en una esquina de la mesa. Sobre el papel, ejecuta modelos que ninguna tarjeta de consumo puede cargar por sí sola. Esta guía analiza el dgx spark llm en la práctica: qué cabe en memoria, las velocidades reales de inferencia y la comparación con una RTX 5090 y un Mac Studio para saber si este mini-PC merece un lugar en tu casa.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto → · Nuestra ficha NVIDIA DGX Spark →
Para esta configuración: NVIDIA DGX Spark.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#¿Qué es el DGX Spark?
El DGX Spark es un ordenador compacto construido en torno al superchip NVIDIA GB10 Grace Blackwell. Combina en un mismo chip una GPU Blackwell y una CPU ARM Grace (20 núcleos), conectadas a un único conjunto de 128 GB de memoria LPDDR5X compartida entre ambas. Esta arquitectura de memoria unificada —la misma filosofía que Apple Silicon— es lo que hace que la máquina resulte tan interesante para la IA local.
Mientras que una tarjeta gráfica convencional mantiene su VRAM separada (24 o 32 GB como máximo en el segmento de consumo), el DGX Spark permite que la GPU acceda directamente a los 128 GB. En concreto, la limitación que frena a todos al usar una GPU —«¿cabe el modelo en la VRAM?»— desaparece casi por completo. El factor limitante pasa a ser el ancho de banda de la memoria, no la capacidad.
- Chip
- NVIDIA GB10 Grace Blackwell (GPU Blackwell + CPU ARM de 20 núcleos)
- Memoria
- 128 GB LPDDR5X unificada, compartida entre CPU y GPU
- Ancho de banda
- ~273 GB/s (LPDDR5X), el verdadero cuello de botella
- Red
- ConnectX (200 GbE) para interconectar dos Spark y ejecutar modelos muy grandes
- Formato
- Mini-PC de escritorio, ~150 W, silencioso en comparación con una torre con varias GPU
#128 GB de memoria unificada: qué permiten hacer
Para ponerlo en perspectiva, esta es la VRAM aproximada que necesita un modelo con cuantización Q4_K_M, la más habitual para la inferencia local: un 7B cabe en ~5 GB, un 14B en ~9 GB, un 32B en ~19 GB y un 70B en ~40 GB. Por tanto, en una RTX 5090 con sus 32 GB, un 70B Q4 no cabe por completo: hay que trasladar parte de la carga a la CPU, lo que desploma la velocidad.
Con 128 GB de memoria unificada, el DGX Spark carga sin esfuerzo un 70B en Q4, Q5 o incluso Q8, conserva margen para un contexto largo (32k tokens o más) y deja abierta la puerta a modelos de 100B+ parámetros con cuantización agresiva. Es la clase de modelos que, hasta ahora, exigía un Mac Studio de gama alta o un equipo con varias GPU, caro y con un elevado consumo energético.
- 70B Q4 (~40 GB)
- Cómodo, con un amplio margen para el contexto
- 70B Q8 (~75 GB)
- Posible — calidad casi FP16 en un modelo grande
- MoE de tipo 120B en Q4
- Cabe en memoria; el ancho de banda determina la velocidad
- Varios modelos cargados
- Un 32B + un 14B en paralelo para enrutamiento o sistemas multiagente
#¿Qué modelos ejecuta?
El punto fuerte del DGX Spark es el rango de 30B–120B, justo donde las GPU de consumo se quedan cortas por falta de VRAM. Estos son los usos típicos por familia de modelos.
- Qwen 3.8 27B
- El modelo generalista de referencia de 2026 (visión, 262k ctx); en esta máquina funciona en Q8 con calidad plena y un amplio margen de contexto
- Qwen 3.6 35B-A3B / Qwen3-Coder 30B
- MoE rápidos para razonamiento y código, enteros en memoria incluso en Q8
- GLM 4.7 Flash (MoE 30B-A3B, MIT)
- Excelente para agentes, cargado con toda su calidad sin hacer malabarismos
- Gran MoE de 100B+ cuantizado
- Las arquitecturas Mixture-of-Experts aprovechan plenamente la gran memoria unificada
- Modelos multimodales
- Gemma 4 y Qwen 3.8 (visión + texto), que consumen mucha memoria, caben sin concesiones
Para los modelos pequeños (7B–14B), el DGX Spark funciona, evidentemente, pero es un desperdicio: una RTX 4070 o un Mac mini M4 los ejecuta más rápido y por mucho menos dinero. La máquina solo se justifica si prevés utilizar modelos grandes con regularidad.
#Rendimiento real en inferencia
Dos cifras importan en la inferencia local: la velocidad de generación (tokens/segundo, lo que va apareciendo en pantalla) y el tiempo de prellenado (la espera antes del primer token, que depende de la longitud del prompt). El ancho de banda de memoria determina sobre todo la generación.
En el DGX Spark, un modelo de 70B en Q4 suele generar del orden de diez tokens por segundo: suficiente para usarlo cómodamente como asistente y leer las respuestas a medida que se generan, pero menos adecuado para cargas de trabajo por lotes que requieren un alto caudal de procesamiento. Los modelos más pequeños (14B–32B) alcanzan velocidades considerablemente mayores. Este perfil es coherente con un ancho de banda de ~273 GB/s: es la barrera que separa al DGX Spark de las tarjetas GDDR7, mucho más rápidas en este aspecto.
#DGX Spark vs RTX 5090
Es la comparativa más ilustrativa y enfrenta dos filosofías. La RTX 5090 ofrece 32 GB de VRAM GDDR7 con un ancho de banda de ~1792 GB/s: aproximadamente de seis a siete veces más rápida que el DGX Spark en cuanto a memoria. Con todo lo que cabe en sus 32 GB, la 5090 pulveriza al Spark en tokens/segundo.
Pero la 5090 se topa con un límite claro: por encima de ~32 GB, debe trasladar parte del modelo a la RAM del sistema para ejecutarla en la CPU, y su rendimiento se desploma. Un 70B Q4 (~40 GB) no cabe por completo en ella. El DGX Spark, en cambio, ejecuta ese mismo 70B sin problemas: más lentamente, pero sin dividirlo. La elección se reduce a una pregunta: ¿tu carga de trabajo cabe en menos de 32 GB?
- Te mantienes en ≤ 32 GB (hasta ~32B Q4)
- RTX 5090: mucho más rápida y versátil (juegos, renderizado, CUDA)
- Buscas modelos de 70B o más
- DGX Spark: el modelo cabe donde la 5090 se queda corta
- Consumo / ruido
- DGX Spark: ~150 W y silencioso, frente a una torre con 5090 que genera mucho calor y ruido
- Ecosistema CUDA completo
- Los dos; el Spark agrega el stack DGX/NVIDIA de punta a punta
#DGX Spark vs Mac Studio
El verdadero rival del DGX Spark no es una tarjeta gráfica, es el Mac Studio. Ambos comparten la misma idea: una gran cantidad de memoria unificada en una caja compacta y sobria, y se dirigen al mismo público: desarrolladores que quieren modelos grandes en local sin montar un equipo por piezas.
El Mac Studio (M-Ultra) puede alcanzar hasta 512 GB de memoria unificada con un ancho de banda a menudo superior en configuraciones de gama alta, lo que lo hace muy potente para modelos muy grandes. Su ventaja: macOS, Metal y un ecosistema maduro (Ollama, LM Studio, MLX). La ventaja del DGX Spark: soporte nativo de CUDA. Si tu pipeline depende de bibliotecas de CUDA, de TensorRT o de herramientas NVIDIA, el Spark habla nativamente el mismo idioma que tus servidores de producción.
- Memoria máxima
- Mac Studio hasta 512 GB; DGX Spark 128 GB (extensible al conectar 2 unidades)
- Ecosistema de software
- Mac: Metal/MLX maduro; Spark: CUDA nativo, continuidad con los servidores NVIDIA
- Portabilidad del código de IA
- Spark ejecuta sin dificultades el código escrito para GPU NVIDIA en la nube o en centros de datos
- Uso ofimático
- El Mac Studio es un equipo de trabajo completo; el Spark es una estación de IA dedicada
#Instalar Ollama en él
El DGX Spark funciona sobre una base Linux (DGX OS, derivado de Ubuntu) con la pila CUDA preinstalada. Ollama funciona allí como en cualquier máquina Linux con GPU NVIDIA: el demonio detecta la GPU y sirve los modelos en su puerto habitual.
- 01Instalar OllamaScript oficial en una sola orden. Configura el servicio systemd y detecta automáticamente el GPU Blackwell a través de CUDA.
- 02Verificar la detección de GPUConfirma que la GPU se detecta correctamente antes de ejecutar un modelo grande; de lo contrario, la inferencia se ejecutaría en la CPU.
- 03Descargar un modelo grandeDescarga un gran modelo MoE de 2026 a plena calidad (un Qwen3-Coder 30B en Q8, o el modelo insignia Qwen 3.8 27B y su contexto de 262k) para aprovechar la memoria: este es precisamente el caso de uso de la máquina.
- 04Iniciar y conectar una interfazEl demonio escucha por defecto en http://localhost:11434; configura Open WebUI o LM Studio para que se conecten a esa dirección.
El daemon de Ollama expone una API compatible en el puerto 11434. Para aprovechar la memoria, prioriza modelos que las GPU convencionales no puedan cargar por sí solas y aumenta la ventana de contexto, ya que tienes espacio para ello. Ten en cuenta que Qwen 3.8 27B tiende a razonar en exceso con su ajuste de razonamiento predeterminado: cámbialo al modo bajo (low) para obtener respuestas más directas.
#Un chip, ocho máquinas: los clones certificados
NVIDIA ha convertido el GB10 en una plataforma: además de su DGX Spark Founders Edition, siete fabricantes venden la misma base certificada bajo su propia marca. El mismo chip, los mismos 128 GB: las diferencias están en el almacenamiento, el chasis, el precio y el canal de venta.
| Máquina | Fabricante | Puntos clave |
|---|---|---|
| DGX Spark Founders Edition | NVIDIA | La referencia, ~3 999 $ |
| Ascent GX10 | Asus | El más competitivo en precio (~2 999 $) |
| Veriton GN100 | Acer | SKU único con 4 TB de almacenamiento |
| AI TOP ATOM | Gigabyte | Incluido con la suite de software AI TOP |
| EdgeXpert MS-C931 | MSI | Canal industrial/edge |
| Pro Max GB10 | Dell | Canal empresarial |
| ThinkStation PGX | Lenovo | Canal de estaciones de trabajo |
| ZGX Nano | HP | Canal de estaciones de trabajo |
Un detalle que lo cambia todo para los modelos grandes: el puerto ConnectX integrado permite conectar dos unidades y ejecutar modelos de la clase 400B en local. Ningún otro equipo de consumo ofrece eso.
#Preguntas frecuentes
¿Qué es exactamente el GB10 del DGX Spark?+
¿Qué diferencia hay entre el DGX Spark y sus clones Asus, Acer o Gigabyte?+
¿Se puede realmente ejecutar un modelo de 400B con dos máquinas?+
¿DGX Spark o máquina Strix Halo?+
¿A quién va dirigida una máquina GB10?+
#Para quién tiene sentido este formato
El DGX Spark no es una máquina para el público en general. Resulta especialmente interesante para perfiles concretos para los que la limitación de VRAM es el verdadero problema cotidiano.
- Desarrolladores de IA que trabajan con CUDA
- Prototipar localmente código destinado a GPUs NVIDIA de producción, sin sorpresas de portabilidad
- Investigadores y equipos de I+D
- Fine-tuning ligero e inferencia de modelos grandes sin reservar tiempo en GPU en la nube
- Usuarios avanzados de modelos 70B+
- Quienes chocan constantemente con el límite de 24–32 GB de una tarjeta gráfica de consumo
- Oficinas sensibles al ruido y al consumo
- Una estación silenciosa y de bajo consumo en lugar de un equipo con varias GPU
Por el contrario, si juegas, si ejecutas principalmente modelos ≤ 32B o si tu presupuesto es ajustado, una RTX 5090 (o incluso una 4070/4080) o un Mac mini M4 ofrecerá una relación rendimiento/precio mucho mejor. El DGX Spark se justifica cuando la necesidad de una gran capacidad de memoria tiene prioridad sobre la velocidad bruta.
#Para ir más allá
El DGX Spark se puede valorar mejor al compararlo con las alternativas ya cubiertas en el sitio. Estas guías permiten profundizar en la reflexión:
- ¿Qué LLM usar con una RTX 5090 (32 GB)?
- La comparativa detallada de la tarjeta de consumo más rápida, para decidir entre tasa de procesamiento y capacidad.
- ¿Qué LLM en Mac Studio?
- Otra gran máquina con memoria unificada, hasta 512 GB — el verdadero rival del DGX Spark.
- Elegir tu GPU para IA local
- Para definir tus necesidades de VRAM antes de gastar y ver dónde se sitúa cada opción.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.