DeepSeek V4 Flash 284B : el 1er frontier que cabe en Mac Studio
DeepSeek V4 Flash 284B se lanzó el 24 de abril de 2026 al mismo tiempo que V4 Pro. Es la variante "efficient": 284 mil millones de parámetros totales en MoE (13B activos por token), licencia MIT, contexto de 1M tokens, la misma arquitectura CSA+HCA y los mismos 3 modos de razonamiento que el Pro. Sobre todo, es el primer modelo de frontera que cabe en una sola estación de trabajo: 170 GB en Q4; un Mac Studio M3 Ultra de 256 GB basta. Esta guía explica cómo instalarlo y qué tal funciona.
#DeepSeek V4 Flash en resumen
- Fecha de lanzamiento
- 24 de abril de 2026, al mismo tiempo que V4 Pro. Disponible en HuggingFace: deepseek-ai/DeepSeek-V4-Flash.
- Arquitectura
- MoE 284B totales, 13B activos por token. 128 expertos por capa, routing top-8. Variantes Base + Instruct disponibles.
- Innovaciones heredadas del Pro
- Atención CSA+HCA, mHC, optimizador Muon, entrenamiento mixto FP4+FP8.
- Contexto
- 1 000 000 tokens nativos (igual que el Pro).
- Modos de pensamiento
- 3 niveles Non / High / Max — seleccionables mediante el prompt.
- Licencia
- MIT, igual que el Pro. Ninguna restricción de uso comercial ni geográfica.
#1. Por qué es un acontecimiento
Antes del 24 de abril de 2026, ejecutar un modelo frontera localmente implicaba o bien un cluster de GPU de 80 k€+ o bien aceptar una calidad degradada de un modelo de 70B. DeepSeek V4 Flash cambia eso: 170 GB en Q4 caben en configuraciones de 4 a 8 k€ de ocasión.
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
- Mac Studio M3 Ultra 256 GB
- 7 299 € en el catálogo hasta septiembre de 2026, ahora de segunda mano (el M5 Ultra de 256 GB lo sustituye en Apple). 170 GB para el modelo + 30 GB para el contexto = cabe con amplio margen. ~10-12 tok/s en Q4.
- 2× RTX 5090 32 GB (64 GB VRAM)
- ≈ 11 400 €. Insuficiente: faltan ~110 GB. Posible con offload a la CPU, pero lento (3-5 tok/s).
- 4× RTX A6000 48 GB (192 GB VRAM)
- ~12 000 € de segunda mano. Cabe con holgura, ~18-25 tok/s.
- Estación de trabajo 2× Mac Studio Max 64 GB
- Insuficiente en single. Con llama.cpp RPC swarm y 4× Mac Studio: posible, ~5 tok/s.
#2. Arquitectura (variante eficiente de V4)
V4 Flash es una reducción proporcional de V4 Pro: unas 5,7 veces menos expertos, unas 3,8 veces menos parámetros activos, pero la misma estructura CSA+HCA + Muon + FP4/FP8. Es esta homogeneidad la que permite a V4 Flash heredar la calidad del Pro a un costo mucho menor.
- Expertos por capa
- 128 (vs 256 para Pro). Ruteo top-8 idéntico.
- Parámetros activos
- 13B (frente a 49B para Pro). Velocidad de inferencia aproximadamente 3,8 veces mayor con el mismo número total de parámetros.
- Capas
- 61 (Pro: 76). Reducción moderada para preservar la profundidad del razonamiento.
- Cabezas de atención
- Igual que el Pro (CSA+HCA configurados de la misma manera). No se reduce la atención para preservar la calidad con contextos largos.
- Preentrenamiento
- Objetivo «efficient reasoning»: 18T tokens (frente a 32T para Pro), con una mezcla de datos optimizada para matemáticas + código.
#3. Hardware por cuantización
| Quantization | VRAM del modelo | + KV 32k | Configuraciones recomendadas |
|---|---|---|---|
| FP16 (referencia) | 568 GB | ~620 GB | DC: 4× H200 141GB. Uso local inviable. |
| Q8_0 | 305 GB | ~340 GB | Mac Studio M3 Ultra 512 GB o 8× RTX 4090 24GB. |
| Q5_K_M | 205 GB | ~235 GB | Mac Studio Ultra de 256 GB (muy justo); 4× RTX A6000 de 48 GB, con margen suficiente. |
| Q4_K_M | 170 GB | ~200 GB | Mac Studio Ultra 256 GB, 4× RTX 4090 24GB, 2× RTX 6000 Ada 48GB. |
| IQ3_M (comprimido) | 130 GB | ~160 GB | Mac Studio M2 Ultra 192 GB, 4× RTX 4090 (offload ligero). |
| IQ2_XS (extrema) | 85 GB | ~115 GB | RTX 5090 + 64 GB de RAM DDR5 para offload, o 2× RTX 4090. |
#4. Configuración de Mac Studio Ultra 256/512 GB
#5. Configuración multi-GPU NVIDIA
#Opción A — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)
#Opción B — llama.cpp con offload parcial
#6. Benchmarks y tokens/sec medidos
| Benchmark | V4 Flash | V4 Pro | Llama 4 Scout 109B | Mistral Large 2 |
|---|---|---|---|---|
| MMLU-Pro | 79.4 | 84.2 | 76.8 | 75.3 |
| GPQA Diamond | 70.1 | 78.5 | 63.2 | 59.4 |
| AIME 2025 | 76.5 | 87.0 | 61.3 | 52.1 |
| LiveCodeBench v5 | 72.6 | 79.8 | 65.4 | 61.8 |
| LongBench v2 (1M) | 68.9 | 72.6 | — | — |
| Setup | Tok/s en modo Non | Tok/s en modo High | Tok/s en modo Max |
|---|---|---|---|
| Mac Studio M3 Ultra 256 GB | 10-12 | 8-10 | 5-7 |
| Mac Studio M3 Ultra 512 GB | 12-14 | 10-12 | 7-9 |
| 4× RTX A6000 48GB | 20-25 | 16-20 | 12-15 |
| 2× RTX 5090 + 64GB offload | 3-5 | 2-4 | 1-2 |
#7. Modos de pensamiento y contexto largo
V4 Flash hereda los tres modos de pensamiento de V4 Pro con calidad ligeramente inferior, pero con un costo de inferencia mucho menor. Es la opción adecuada para agentes que deben razonar sin monopolizar una infraestructura.
- Modo No
- Respuesta directa. Latencia muy baja (~1s para iniciar el streaming). Para chat conversacional, traducción.
- Modo High
- 200-2000 tokens de cadena de pensamiento antes de la respuesta. +25 % de calidad en matemáticas/código. Latencia de 5 a 15 segundos antes del primer token de la respuesta final.
- Modo Max
- Hasta 16k tokens de reflexión. Latencia de 1 a 5 minutos en local. Reservar para problemas difíciles (demostraciones matemáticas, depuración compleja).
- Contexto largo 1M
- Mismas capacidades que V4 Pro gracias a HCA — Needle-in-Haystack 1M ~95 % (vs 98 % para Pro). Excelente para RAG en grandes bases.
#V4 Flash vs V4 Pro: elegir
| Criterio | V4 Flash 284B | V4 Pro 1.6T |
|---|---|---|
| Parámetros totales | 284 B | 1 600 B |
| Parámetros activos / token | 13 B | 49 B |
| VRAM Q4_K_M | 170 GB | 960 GB |
| Hardware mínimo local | Mac Studio Ultra 256 GB (M3 Ultra de segunda mano o M5 Ultra nuevo) | Clúster ~80 000 € |
| Tokens/segundo habituales en local | 10-25 | 0,5-2 |
| Calidad MMLU-Pro | 79.4 | 84.2 |
| Calidad AIME 2025 | 76.5 | 87.0 |
| Contexto nativo | 1 M | 1 M |
| Modo de pensamiento máximo | Sí | Sí (mejor calidad) |
| Licencia | MIT | MIT |
#Presentado oficialmente el 31 de julio de 2026 (build 0731)
DeepSeek sacó V4-Flash de la fase de preview a finales de julio de 2026 con la versión «0731»: la API está en beta pública y, de paso, el precio de los tokens de salida de V4-Pro baja un 75 % (0,87 $ por millón de tokens de salida). Artificial Analysis vuelve a situar a la familia V4 «entre los líderes de pesos abiertos». En cuanto a los pesos, nada cambia: 284B en total y 13B activos; sigue siendo la única variante V4 medianamente viable en local con equipos de gama alta (Mac de 256 GB, Strix Halo, varios GPU) y cuantización agresiva.
Desde el 2 de agosto, LM Studio también lo ofrece: en local si tu máquina tiene capacidad suficiente, o a través de la app Bionic en servidores estadounidenses con «Zero Data Retention» por defecto; una solución de compromiso que conviene conocer, aunque la filosofía de este sitio sigue siendo el funcionamiento 100 % local.
#FAQ
¿Funciona realmente DeepSeek V4 Flash en un Mac Studio M3 Ultra de 256 GB?+
¿Cuánto cuesta un setup viable para V4 Flash en local?+
¿Se debe elegir V4 Flash o esperar una destilación de 70B?+
¿V4 Flash supera a Llama 4 Maverick / Scout?+
¿Cuál es el consumo eléctrico de un Mac Studio M3 Ultra al ejecutar la inferencia con V4 Flash?+
¿El modo thinking Max vale la pena en V4 Flash?+
¿Se puede hacer un ajuste fino de V4 Flash localmente?+
¿Existe una versión cuantizada Q4 estable al 25 de abril de 2026?+
Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.