DeepSeek V4 Pro vs Flash: ¿cuál versión en local? ?
DeepSeek V4 Pro y DeepSeek V4 Flash se lanzaron el mismo día, bajo la misma licencia MIT, con la misma arquitectura MoE. Y sin embargo: 1,6T de parámetros frente a 284B, 960 GB de VRAM en Q4 frente a 170 GB, un clúster H200 frente a un Mac Studio. La elección entre los dos no es una cuestión de calidad: es una cuestión de hardware y uso. Esta comparativa para elegir entre DeepSeek V4 Pro y Flash en local te ayuda a decidir antes de descargar 960 GB para nada.
#Pro y Flash: lo que realmente los diferencia
Los dos modelos comparten lo esencial: arquitectura MoE con atención híbrida CSA+HCA, contexto nativo de 1M tokens, tres modos de razonamiento (Non / High / Max), licencia MIT permisiva, preentrenamiento Muon+FP4. La diferencia radica en un solo número: el tamaño del conjunto de expertos.
- V4 Pro
- 1,6 billones de parámetros totales, 49 mil millones activos por token, 256 expertos top-8. El modelo de frontera completo.
- V4 Flash
- 284B parámetros totales, 13B activos por token, 64 expertos top-8. La misma arquitectura, condensada.
- Lo que es idéntico
- Vocabulario, tokenizer, plantilla de chat, modos de pensamiento, longitud de contexto (1M), licencia MIT, scripts de instalación llama.cpp / vLLM.
- Lo que realmente cambia
- VRAM total, velocidad en tokens/segundo, puntuación en benchmarks de razonamiento extremo (AIME, GPQA Max). En tareas del día a día, la diferencia es menor de lo esperado.
#1. Los umbrales de VRAM, versión por versión
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Es el criterio que decide casi todo. Estos son los umbrales medidos en VRAM total, con el modelo cargado + caché KV de 32k tokens (no 1M):
#DeepSeek V4 Pro 1.6T
- Q8_0
- ≈ 1 800 GB. Clúster de 8× H200 141GB obligatorio. No hay opción de ejecución local en una sola máquina.
- Q5_K_M
- ≈ 1 230 GB. 3 Mac Studio de 512 GB en un swarm RPC, o 4× H200.
- Q4_K_M (recomendado)
- ≈ 1 040 GB. 8× A100 80GB en paralelismo tensorial, o 2× Mac Studio de 512 GB en un swarm en red de llama.cpp.
- IQ3_M
- ≈ 800 GB. Un solo Mac Studio de 512 GB + transferencia parcial al SSD (offload). Muy lento (~2-4 tok/s), calidad degradada.
- IQ2_XS
- ≈ 560 GB. Un solo Mac Studio de 512 GB. Calidad muy degradada: no recomendado.
#DeepSeek V4 Flash 284B
- FP16
- ≈ 570 GB. Clúster H100/H200 o Mac Studio 512 + estación de trabajo NVIDIA en swarm.
- Q8_0
- ≈ 305 GB. Un solo Mac Studio M3 Ultra de 512 GB, o 4× RTX 6000 Ada de 48 GB.
- Q5_K_M
- ≈ 210 GB. Mac Studio Ultra de 256 GB (al límite), o 3× RTX 4090 24GB + offload.
- Q4_K_M (recomendado)
- ≈ 170 GB. Un solo Mac Studio M2 Ultra de 192 GB, 2× A6000 de 48 GB o 4× RTX 4090 de 24 GB.
- IQ3_M
- ≈ 130 GB. 2× RTX 4090 24GB + descarga a la RAM, o Mac Studio 128 GB.
#2. Costo real de la GPU por versión
Los números a continuación son presupuestos de compra de hardware, excluyendo electricidad, basados en los precios de mayo de 2026.
#Para ejecutar V4 Pro (Q4 ~1 040 GB)
- Cluster 8× H200 141GB
- ≈ 280 000 € hardware + servidor ≈ 320 000 € instalado. El setup vLLM "limpio" con FP8 nativo.
- Cluster 8× A100 80GB de ocasión
- ≈ 90 000 € en hardware; con el chasis, ≈ 110 000 €. Paralelismo tensorial con 640 GB de VRAM. Más asequible, pero más lento.
- Swarm 2× Mac Studio M3 Ultra 512 GB
- ≈ 28 000 € a precios de mayo de 2026 (el M3 Ultra ya no se vende nuevo; M5 Ultra de 512 GB anunciado a finales de octubre de 2026). La opción local más barata para Pro Q4. Tasa de generación modesta (5-8 tok/s), pero real, mediante llama.cpp RPC sobre 10 GbE.
- Alquiler equivalente en la nube
- ≈ 60 €/h en Lambda/Crusoe para 8× H200. Resulta rentable frente a la compra por encima de unas 5 500 h acumuladas.
#Para ejecutar V4 Flash (Q4 ~170 GB)
- Mac Studio M2 Ultra 192 GB
- ≈ 4 200 € reacondicionado (ya no se vende nuevo). Camino más corto solo.
- Mac Studio M3 Ultra 256 GB
- Apple ya no lo vende nuevo (sustituido por el M5 Ultra, disponible con 256 GB); buscarlo de segunda mano, con precio variable. Un margen más holgado para contextos largos y el modo thinking Max.
- Estación de trabajo con 4× RTX 4090 de 24 GB
- GPU de segunda mano (RTX 4090, precio variable) + ≈ 4.500 € (chasis/fuente de alimentación/CPU). CUDA puro, vLLM posible.
- 2× RTX 6000 Ada 48GB
- Precio por verificar (tarjeta profesional cuyo precio no se monitoriza). Una configuración más ordenada que 4× 4090 y menos ruidosa.
- Alquiler equivalente en la nube
- ≈ 4 €/h en Hyperstack/Lambda para 4× A100 80GB. Rentable frente al Mac Studio a partir de ~1 600 horas acumuladas.
#3. Comparación de latencia y velocidad de generación
Aquí los números medidos en modo thinking, no, contexto 8k, prompt 500 tokens, generación 1000 tokens. Medidas provenientes del paper DeepSeek + benchmarks comunitarios de mayo 2026.
#V4 Pro Q4_K_M
- Clúster 8× H200 (vLLM FP8)
- TTFT ~0,8s · tasa 38 tok/s · 1000 tokens en ~27s.
- Cluster 8× A100 80GB (vLLM Q4)
- TTFT ~1,4s · velocidad 22 tok/s · 1000 tokens en ~47s.
- Swarm 2× Mac Studio M3 Ultra 512 (llama.cpp RPC)
- TTFT ~6 s · tasa de generación de 6 tok/s · 1000 tokens en ~3 min. La penalización de la red RPC es el factor dominante.
#V4 Flash Q4_K_M
- Mac Studio M3 Ultra 256 GB (MLX)
- TTFT ~0,4 s · velocidad de generación de 28 tok/s · 1000 tokens en ~36 s. El punto óptimo para un solo usuario.
- Mac Studio M2 Ultra 192 GB (llama.cpp)
- TTFT ~0,6s · velocidad 14 tok/s · 1000 tokens en ~72s.
- 4× RTX 4090 24GB (vLLM)
- TTFT ~0,3 s · velocidad de generación de 52 tok/s · 1000 tokens en ~19 s. El más rápido en local.
- 2× A6000 48GB (vLLM)
- TTFT ~0,4s · tasa 38 tok/s · 1000 tokens en ~26s.
#4. Árbol de decisión según tu hardware
Cinco preguntas, un veredicto. Lee de arriba a abajo, detente en la primera respuesta.
- 01¿Tienes un presupuesto para GPU > 200 000 € y necesitas modelos de vanguardia sin concesiones?→ DeepSeek V4 Pro Q4 en un clúster de 8× H200 o 8× A100. Eres un banco, un laboratorio o una administración soberana. Este es el único escenario en el que Pro es razonable.
- 02¿Tienes o piensas adquirir 2× Mac Studio M3 Ultra de 512 GB (precio variable, por verificar) y aceptas 5-8 tok/s?→ V4 Pro Q4 mediante llama.cpp RPC es posible. Reserva esta opción para el procesamiento nocturno por lotes, nunca para un uso interactivo. De lo contrario, pasa al siguiente paso.
- 03¿Tienes un Mac Studio Ultra de gama alta (niveles de memoria diferentes hoy en día, precios por verificar)?→ V4 Flash Q4 en MLX o llama.cpp. 12-28 tok/s según la generación. Mejor experiencia individual en 2026.
- 04¿Tienes entre 2 y 4 GPU NVIDIA que sumen más de 80 GB de VRAM?→ V4 Flash Q4 con vLLM (preferible) o llama.cpp. Mayor velocidad de generación que el Mac Studio, pero más ruido, mayor consumo eléctrico y más espacio ocupado.
- 05¿Tienes menos de 80 GB de VRAM (una sola RTX 4090, etc.)?→ Ni Pro ni Flash en Q4. Consulta las destilaciones Flash→32B previstas, o recurre a DeepSeek V3.5 32B / Qwen3.6 35B-A3B mientras tanto.
#5. Para qué uso elegir uno u otro
Los benchmarks públicos no dicen todo. Aquí está la evaluación honesta por categoría de uso.
- Asistente de chat general, traducción, resumen
- Flash es más que suficiente. Para estos usos, la diferencia con Pro es de 2-4 puntos y no se aprecia en la práctica. Prioriza la velocidad de generación.
- Código (generación, refactor, depuración)
- Flash en modo High está muy cerca de Pro Non. Para depuración compleja, Pro Max mantiene la ventaja, pero hay que esperar 10 minutos por respuesta.
- Matemáticas, demostración, AIME/GPQA
- Pro Max supera a Flash Max por un margen de 8 a 15 puntos según la dificultad. Es el uso en el que Pro se justifica realmente.
- Análisis de documentos largos (>200k tokens)
- Igualdad técnica (ambos manejan 1M de tokens). Diferencia dominada por la atención CSA, idéntica en ambos. Elegir según la VRAM disponible para el caché KV.
- Agentes con llamada a herramientas
- Flash basta. Las llamadas a herramientas se rigen por la plantilla de chat y el ajuste fino Instruct, no por el tamaño del modelo.
- Fine-tuning local (LoRA)
- Flash es viable en 2× H100. Pro está fuera de alcance para entrenamiento local con LoRA: se necesita un clúster de entrenamiento.
#Consejos y posibles problemas
- Cuantización de la caché KV
- En los dos modelos, --cache-type-k q8_0 --cache-type-v q8_0 (llama.cpp) o --kv-cache-dtype fp8 (vLLM) divide por 2 la memoria KV con una pérdida de calidad casi nula. Esencial para más de 64k de contexto.
- Flash Attention obligatoria
- Activa -fa (llama.cpp) o --enable-flash-attn (vLLM). Sin ello, la tasa de generación cae un 30 % y el consumo de memoria se dispara por encima de 32k.
- Modo thinking por defecto
- En ambos modelos, nunca dejes el modo Max activado por defecto: un agente que entre en bucle puede generar horas de reflexión. Cambia el modo explícitamente mediante /think o /think_max.
- Multi-GPU en Pro: evitar el paralelismo de pipeline
- En un clúster H200, paralelismo tensorial en 8 GPU. El paralelismo de pipeline añade una latencia entre capas que predomina en MoE 1.6T. vLLM lo gestiona automáticamente con --tensor-parallel-size 8.
- Swarm Mac Studio: 10 GbE mínimo
- El RPC de llama.cpp transmite muchos tensores intermedios. Con 1 GbE, la velocidad de Pro cae por debajo de 1 tok/s. Prevé un conmutador de 10 GbE y cables SFP+.
- Plantillas de chat estrictamente idénticas
- Pro y Flash comparten el mismo formato. Un script que funciona para uno también funciona para el otro: útil para realizar pruebas A/B sin reescribir el código de tu aplicación.
#Para ir más allá
Una vez elegida la versión, aquí tienes las guías para su implementación:
- DeepSeek V4 Pro 1.6T: arquitectura, instalación, benchmarks
- La guía de instalación en clúster para quienes han decidido optar por Pro.
- DeepSeek V4 Flash 284B: el primer modelo frontier que cabe en Mac Studio
- Instalación paso a paso en Mac Studio Ultra y benchmarks detallados.
- ¿Qué LLM en Mac Studio (M2/M3/M4 Ultra, 64–512 GB)?
- Para calibrar la configuración del Mac Studio que corresponda a tu presupuesto.
- Configuración multi-GPU con llama.cpp
- Referencia para conectar 2 a 4 GPU NVIDIA localmente sin perder tokens/sec.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.