Avanzado 12 minDeepSeek

DeepSeek V4 Pro vs Flash: ¿cuál versión en local? ?

DeepSeek V4 Pro y DeepSeek V4 Flash se lanzaron el mismo día, bajo la misma licencia MIT, con la misma arquitectura MoE. Y sin embargo: 1,6T de parámetros frente a 284B, 960 GB de VRAM en Q4 frente a 170 GB, un clúster H200 frente a un Mac Studio. La elección entre los dos no es una cuestión de calidad: es una cuestión de hardware y uso. Esta comparativa para elegir entre DeepSeek V4 Pro y Flash en local te ayuda a decidir antes de descargar 960 GB para nada.

Por Mohamed Meguedmi·Actualización 2026-06-03·Probado en Windows, macOS y Linux

#Pro y Flash: lo que realmente los diferencia

Los dos modelos comparten lo esencial: arquitectura MoE con atención híbrida CSA+HCA, contexto nativo de 1M tokens, tres modos de razonamiento (Non / High / Max), licencia MIT permisiva, preentrenamiento Muon+FP4. La diferencia radica en un solo número: el tamaño del conjunto de expertos.

V4 Pro
1,6 billones de parámetros totales, 49 mil millones activos por token, 256 expertos top-8. El modelo de frontera completo.
V4 Flash
284B parámetros totales, 13B activos por token, 64 expertos top-8. La misma arquitectura, condensada.
Lo que es idéntico
Vocabulario, tokenizer, plantilla de chat, modos de pensamiento, longitud de contexto (1M), licencia MIT, scripts de instalación llama.cpp / vLLM.
Lo que realmente cambia
VRAM total, velocidad en tokens/segundo, puntuación en benchmarks de razonamiento extremo (AIME, GPQA Max). En tareas del día a día, la diferencia es menor de lo esperado.
i
La regla práctica rápida
Flash ≈ 6 veces menos de parámetros totales, 4 veces menos de parámetros activos, pero pierde solo 5 a 12 puntos en los benchmarks públicos (según la categoría). Para la mayoría de los usos locales, Flash es la opción por defecto — Pro es un caso particular de cluster.

#1. Los umbrales de VRAM, versión por versión

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Es el criterio que decide casi todo. Estos son los umbrales medidos en VRAM total, con el modelo cargado + caché KV de 32k tokens (no 1M):

#DeepSeek V4 Pro 1.6T

Q8_0
≈ 1 800 GB. Clúster de 8× H200 141GB obligatorio. No hay opción de ejecución local en una sola máquina.
Q5_K_M
≈ 1 230 GB. 3 Mac Studio de 512 GB en un swarm RPC, o 4× H200.
Q4_K_M (recomendado)
≈ 1 040 GB. 8× A100 80GB en paralelismo tensorial, o 2× Mac Studio de 512 GB en un swarm en red de llama.cpp.
IQ3_M
≈ 800 GB. Un solo Mac Studio de 512 GB + transferencia parcial al SSD (offload). Muy lento (~2-4 tok/s), calidad degradada.
IQ2_XS
≈ 560 GB. Un solo Mac Studio de 512 GB. Calidad muy degradada: no recomendado.

#DeepSeek V4 Flash 284B

FP16
≈ 570 GB. Clúster H100/H200 o Mac Studio 512 + estación de trabajo NVIDIA en swarm.
Q8_0
≈ 305 GB. Un solo Mac Studio M3 Ultra de 512 GB, o 4× RTX 6000 Ada de 48 GB.
Q5_K_M
≈ 210 GB. Mac Studio Ultra de 256 GB (al límite), o 3× RTX 4090 24GB + offload.
Q4_K_M (recomendado)
≈ 170 GB. Un solo Mac Studio M2 Ultra de 192 GB, 2× A6000 de 48 GB o 4× RTX 4090 de 24 GB.
IQ3_M
≈ 130 GB. 2× RTX 4090 24GB + descarga a la RAM, o Mac Studio 128 GB.
→
Umbral práctico: 192 GB unificados o aproximadamente 96 GB de VRAM
A partir de un Mac Studio con 192 GB o de una configuración con 2–4 GPU profesionales que sumen ~96–192 GB, Flash Q4 funciona con holgura. Este es el punto en el que dejas de aspirar a Pro: salvo que alquiles un clúster dedicado, no podrás ejecutarlo en una sola máquina.

#2. Costo real de la GPU por versión

Los números a continuación son presupuestos de compra de hardware, excluyendo electricidad, basados en los precios de mayo de 2026.

#Para ejecutar V4 Pro (Q4 ~1 040 GB)

Cluster 8× H200 141GB
≈ 280 000 € hardware + servidor ≈ 320 000 € instalado. El setup vLLM "limpio" con FP8 nativo.
Cluster 8× A100 80GB de ocasión
≈ 90 000 € en hardware; con el chasis, ≈ 110 000 €. Paralelismo tensorial con 640 GB de VRAM. Más asequible, pero más lento.
Swarm 2× Mac Studio M3 Ultra 512 GB
≈ 28 000 € a precios de mayo de 2026 (el M3 Ultra ya no se vende nuevo; M5 Ultra de 512 GB anunciado a finales de octubre de 2026). La opción local más barata para Pro Q4. Tasa de generación modesta (5-8 tok/s), pero real, mediante llama.cpp RPC sobre 10 GbE.
Alquiler equivalente en la nube
≈ 60 €/h en Lambda/Crusoe para 8× H200. Resulta rentable frente a la compra por encima de unas 5 500 h acumuladas.

#Para ejecutar V4 Flash (Q4 ~170 GB)

Mac Studio M2 Ultra 192 GB
≈ 4 200 € reacondicionado (ya no se vende nuevo). Camino más corto solo.
Mac Studio M3 Ultra 256 GB
Apple ya no lo vende nuevo (sustituido por el M5 Ultra, disponible con 256 GB); buscarlo de segunda mano, con precio variable. Un margen más holgado para contextos largos y el modo thinking Max.
Estación de trabajo con 4× RTX 4090 de 24 GB
GPU de segunda mano (RTX 4090, precio variable) + ≈ 4.500 € (chasis/fuente de alimentación/CPU). CUDA puro, vLLM posible.
2× RTX 6000 Ada 48GB
Precio por verificar (tarjeta profesional cuyo precio no se monitoriza). Una configuración más ordenada que 4× 4090 y menos ruidosa.
Alquiler equivalente en la nube
≈ 4 €/h en Hyperstack/Lambda para 4× A100 80GB. Rentable frente al Mac Studio a partir de ~1 600 horas acumuladas.
!
La relación costo/calidad está muy claramente en favor de Flash
Un Mac Studio de gama alta (hay que comprobar la configuración de memoria, pues los niveles de capacidad han cambiado en Apple) ejecuta Flash Q4 a unos 12 tok/s. Para Pro Q4 a la misma velocidad, se necesita un clúster H200 de 320 000 €. Con un presupuesto local razonable (<30 000 €), Flash es matemáticamente la única opción viable.

#3. Comparación de latencia y velocidad de generación

Aquí los números medidos en modo thinking, no, contexto 8k, prompt 500 tokens, generación 1000 tokens. Medidas provenientes del paper DeepSeek + benchmarks comunitarios de mayo 2026.

#V4 Pro Q4_K_M

Clúster 8× H200 (vLLM FP8)
TTFT ~0,8s · tasa 38 tok/s · 1000 tokens en ~27s.
Cluster 8× A100 80GB (vLLM Q4)
TTFT ~1,4s · velocidad 22 tok/s · 1000 tokens en ~47s.
Swarm 2× Mac Studio M3 Ultra 512 (llama.cpp RPC)
TTFT ~6 s · tasa de generación de 6 tok/s · 1000 tokens en ~3 min. La penalización de la red RPC es el factor dominante.

#V4 Flash Q4_K_M

Mac Studio M3 Ultra 256 GB (MLX)
TTFT ~0,4 s · velocidad de generación de 28 tok/s · 1000 tokens en ~36 s. El punto óptimo para un solo usuario.
Mac Studio M2 Ultra 192 GB (llama.cpp)
TTFT ~0,6s · velocidad 14 tok/s · 1000 tokens en ~72s.
4× RTX 4090 24GB (vLLM)
TTFT ~0,3 s · velocidad de generación de 52 tok/s · 1000 tokens en ~19 s. El más rápido en local.
2× A6000 48GB (vLLM)
TTFT ~0,4s · tasa 38 tok/s · 1000 tokens en ~26s.
i
El modo thinking cambia todo
Las cifras anteriores corresponden al modo thinking desactivado. En modo High, añade entre 5 y 20 segundos de reflexión antes de la respuesta. En modo Max, calcula entre 3 y 30 minutos: este es el modo que desploma la velocidad de generación. Si comparas Pro y Flash en modo Max, la diferencia en el tiempo de espera se vuelve gigantesca (Pro Max en un clúster sigue por debajo de 5 minutos, mientras que Flash Max en Mac suele superar los 20 minutos).

#4. Árbol de decisión según tu hardware

Cinco preguntas, un veredicto. Lee de arriba a abajo, detente en la primera respuesta.

  1. 01
    ¿Tienes un presupuesto para GPU > 200 000 € y necesitas modelos de vanguardia sin concesiones?
    → DeepSeek V4 Pro Q4 en un clúster de 8× H200 o 8× A100. Eres un banco, un laboratorio o una administración soberana. Este es el único escenario en el que Pro es razonable.
  2. 02
    ¿Tienes o piensas adquirir 2× Mac Studio M3 Ultra de 512 GB (precio variable, por verificar) y aceptas 5-8 tok/s?
    → V4 Pro Q4 mediante llama.cpp RPC es posible. Reserva esta opción para el procesamiento nocturno por lotes, nunca para un uso interactivo. De lo contrario, pasa al siguiente paso.
  3. 03
    ¿Tienes un Mac Studio Ultra de gama alta (niveles de memoria diferentes hoy en día, precios por verificar)?
    → V4 Flash Q4 en MLX o llama.cpp. 12-28 tok/s según la generación. Mejor experiencia individual en 2026.
  4. 04
    ¿Tienes entre 2 y 4 GPU NVIDIA que sumen más de 80 GB de VRAM?
    → V4 Flash Q4 con vLLM (preferible) o llama.cpp. Mayor velocidad de generación que el Mac Studio, pero más ruido, mayor consumo eléctrico y más espacio ocupado.
  5. 05
    ¿Tienes menos de 80 GB de VRAM (una sola RTX 4090, etc.)?
    → Ni Pro ni Flash en Q4. Consulta las destilaciones Flash→32B previstas, o recurre a DeepSeek V3.5 32B / Qwen3.6 35B-A3B mientras tanto.
→
El criterio decisivo: interactivo o en lote
Si quieres chatear en directo, mira la tasa de generación en tok/s. Si quieres analizar un PDF de 800 páginas por la noche, mira la calidad en modo Max. Flash en modo interactivo > Pro en procesamiento nocturno por lotes > Pro en modo interactivo (salvo que tengas presupuesto para un clúster).

#5. Para qué uso elegir uno u otro

Los benchmarks públicos no dicen todo. Aquí está la evaluación honesta por categoría de uso.

Asistente de chat general, traducción, resumen
Flash es más que suficiente. Para estos usos, la diferencia con Pro es de 2-4 puntos y no se aprecia en la práctica. Prioriza la velocidad de generación.
Código (generación, refactor, depuración)
Flash en modo High está muy cerca de Pro Non. Para depuración compleja, Pro Max mantiene la ventaja, pero hay que esperar 10 minutos por respuesta.
Matemáticas, demostración, AIME/GPQA
Pro Max supera a Flash Max por un margen de 8 a 15 puntos según la dificultad. Es el uso en el que Pro se justifica realmente.
Análisis de documentos largos (>200k tokens)
Igualdad técnica (ambos manejan 1M de tokens). Diferencia dominada por la atención CSA, idéntica en ambos. Elegir según la VRAM disponible para el caché KV.
Agentes con llamada a herramientas
Flash basta. Las llamadas a herramientas se rigen por la plantilla de chat y el ajuste fino Instruct, no por el tamaño del modelo.
Fine-tuning local (LoRA)
Flash es viable en 2× H100. Pro está fuera de alcance para entrenamiento local con LoRA: se necesita un clúster de entrenamiento.
!
La trampa de «quiero el mejor modelo»
Muchos quieren Pro "por principio" y se arrepienten después de haber quemado 320 000 € para generar correos electrónicos. Si tus consultas se pueden resolver en modo Non, estás pagando por un 99 % de capacidad que no utilizas. Empieza con Flash, mide los casos en los que Flash Max realmente falla y considera Pro solo si esa lista justifica la diferencia de coste.

#Consejos y posibles problemas

Cuantización de la caché KV
En los dos modelos, --cache-type-k q8_0 --cache-type-v q8_0 (llama.cpp) o --kv-cache-dtype fp8 (vLLM) divide por 2 la memoria KV con una pérdida de calidad casi nula. Esencial para más de 64k de contexto.
Flash Attention obligatoria
Activa -fa (llama.cpp) o --enable-flash-attn (vLLM). Sin ello, la tasa de generación cae un 30 % y el consumo de memoria se dispara por encima de 32k.
Modo thinking por defecto
En ambos modelos, nunca dejes el modo Max activado por defecto: un agente que entre en bucle puede generar horas de reflexión. Cambia el modo explícitamente mediante /think o /think_max.
Multi-GPU en Pro: evitar el paralelismo de pipeline
En un clúster H200, paralelismo tensorial en 8 GPU. El paralelismo de pipeline añade una latencia entre capas que predomina en MoE 1.6T. vLLM lo gestiona automáticamente con --tensor-parallel-size 8.
Swarm Mac Studio: 10 GbE mínimo
El RPC de llama.cpp transmite muchos tensores intermedios. Con 1 GbE, la velocidad de Pro cae por debajo de 1 tok/s. Prevé un conmutador de 10 GbE y cables SFP+.
Plantillas de chat estrictamente idénticas
Pro y Flash comparten el mismo formato. Un script que funciona para uno también funciona para el otro: útil para realizar pruebas A/B sin reescribir el código de tu aplicación.

#Para ir más allá

Una vez elegida la versión, aquí tienes las guías para su implementación:

DeepSeek V4 Pro 1.6T: arquitectura, instalación, benchmarks
La guía de instalación en clúster para quienes han decidido optar por Pro.
DeepSeek V4 Flash 284B: el primer modelo frontier que cabe en Mac Studio
Instalación paso a paso en Mac Studio Ultra y benchmarks detallados.
¿Qué LLM en Mac Studio (M2/M3/M4 Ultra, 64–512 GB)?
Para calibrar la configuración del Mac Studio que corresponda a tu presupuesto.
Configuración multi-GPU con llama.cpp
Referencia para conectar 2 a 4 GPU NVIDIA localmente sin perder tokens/sec.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.