Intermedio 14 minDeepSeek

DeepSeek V4 Flash 284B : el 1er frontier que cabe en Mac Studio

DeepSeek V4 Flash 284B se lanzó el 24 de abril de 2026 al mismo tiempo que V4 Pro. Es la variante "efficient": 284 mil millones de parámetros totales en MoE (13B activos por token), licencia MIT, contexto de 1M tokens, la misma arquitectura CSA+HCA y los mismos 3 modos de razonamiento que el Pro. Sobre todo, es el primer modelo de frontera que cabe en una sola estación de trabajo: 170 GB en Q4; un Mac Studio M3 Ultra de 256 GB basta. Esta guía explica cómo instalarlo y qué tal funciona.

Por Mohamed Meguedmi·Actualización 2026-08-11·Probado en Windows, macOS y Linux

#DeepSeek V4 Flash en resumen

Fecha de lanzamiento
24 de abril de 2026, al mismo tiempo que V4 Pro. Disponible en HuggingFace: deepseek-ai/DeepSeek-V4-Flash.
Arquitectura
MoE 284B totales, 13B activos por token. 128 expertos por capa, routing top-8. Variantes Base + Instruct disponibles.
Innovaciones heredadas del Pro
Atención CSA+HCA, mHC, optimizador Muon, entrenamiento mixto FP4+FP8.
Contexto
1 000 000 tokens nativos (igual que el Pro).
Modos de pensamiento
3 niveles Non / High / Max — seleccionables mediante el prompt.
Licencia
MIT, igual que el Pro. Ninguna restricción de uso comercial ni geográfica.

#1. Por qué es un acontecimiento

Antes del 24 de abril de 2026, ejecutar un modelo frontera localmente implicaba o bien un cluster de GPU de 80 k€+ o bien aceptar una calidad degradada de un modelo de 70B. DeepSeek V4 Flash cambia eso: 170 GB en Q4 caben en configuraciones de 4 a 8 k€ de ocasión.

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
Mac Studio M3 Ultra 256 GB
7 299 € en el catálogo hasta septiembre de 2026, ahora de segunda mano (el M5 Ultra de 256 GB lo sustituye en Apple). 170 GB para el modelo + 30 GB para el contexto = cabe con amplio margen. ~10-12 tok/s en Q4.
2× RTX 5090 32 GB (64 GB VRAM)
≈ 11 400 €. Insuficiente: faltan ~110 GB. Posible con offload a la CPU, pero lento (3-5 tok/s).
4× RTX A6000 48 GB (192 GB VRAM)
~12 000 € de segunda mano. Cabe con holgura, ~18-25 tok/s.
Estación de trabajo 2× Mac Studio Max 64 GB
Insuficiente en single. Con llama.cpp RPC swarm y 4× Mac Studio: posible, ~5 tok/s.
→
La verdadera singularidad: Mac Studio Ultra
El M3 Ultra de 256 GB (7 299 € en catálogo hasta septiembre de 2026, ahora de segunda mano) ejecuta DeepSeek V4 Flash Q4 a ~10 tok/s en modo chat. Ningún otro ordenador personal del mundo, a este precio, ejecuta un modelo de vanguardia. Es Apple Silicon lo que lo hace posible (memoria unificada + ancho de banda de 800 GB/s).

#2. Arquitectura (variante eficiente de V4)

V4 Flash es una reducción proporcional de V4 Pro: unas 5,7 veces menos expertos, unas 3,8 veces menos parámetros activos, pero la misma estructura CSA+HCA + Muon + FP4/FP8. Es esta homogeneidad la que permite a V4 Flash heredar la calidad del Pro a un costo mucho menor.

Expertos por capa
128 (vs 256 para Pro). Ruteo top-8 idéntico.
Parámetros activos
13B (frente a 49B para Pro). Velocidad de inferencia aproximadamente 3,8 veces mayor con el mismo número total de parámetros.
Capas
61 (Pro: 76). Reducción moderada para preservar la profundidad del razonamiento.
Cabezas de atención
Igual que el Pro (CSA+HCA configurados de la misma manera). No se reduce la atención para preservar la calidad con contextos largos.
Preentrenamiento
Objetivo «efficient reasoning»: 18T tokens (frente a 32T para Pro), con una mezcla de datos optimizada para matemáticas + código.

#3. Hardware por cuantización

VRAM total requerida (modelo + caché KV de 32k tokens)
QuantizationVRAM del modelo+ KV 32kConfiguraciones recomendadas
FP16 (referencia)568 GB~620 GBDC: 4× H200 141GB. Uso local inviable.
Q8_0305 GB~340 GBMac Studio M3 Ultra 512 GB o 8× RTX 4090 24GB.
Q5_K_M205 GB~235 GBMac Studio Ultra de 256 GB (muy justo); 4× RTX A6000 de 48 GB, con margen suficiente.
Q4_K_M170 GB~200 GBMac Studio Ultra 256 GB, 4× RTX 4090 24GB, 2× RTX 6000 Ada 48GB.
IQ3_M (comprimido)130 GB~160 GBMac Studio M2 Ultra 192 GB, 4× RTX 4090 (offload ligero).
IQ2_XS (extrema)85 GB~115 GBRTX 5090 + 64 GB de RAM DDR5 para offload, o 2× RTX 4090.
i
Punto ideal 2026
Mac Studio M3 Ultra 256 GB en Q4_K_M ofrece la mejor relación precio/calidad/velocidad para un uso personal serio. 7.300 € nuevo hasta septiembre de 2026 (ahora de segunda mano, o M5 Ultra 256 GB nuevo), ~10 tok/s, calidad casi FP16 (Q4 pierde <2 % en los benchmarks a esta escala). No hay equivalente en PC sin superar los 12.000 €.

#4. Configuración de Mac Studio Ultra 256/512 GB

Instalación completa en Mac Studio M3 Ultra
# 1. Relever la mémoire GPU allouable
sudo sysctl iogpu.wired_limit_mb=240640    # 256 Go : 235 Go GPU
# Ou pour Mac Studio 512 Go :
# sudo sysctl iogpu.wired_limit_mb=491520

# Persistant
echo "iogpu.wired_limit_mb=240640" | sudo tee -a /etc/sysctl.conf

# 2. llama.cpp avec Metal + Flash Attention
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# 3. Téléchargement Q4_K_M (~170 Go split en chunks)
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash-GGUF \
  --include "*Q4_K_M*.gguf" \
  --local-dir ./models

# 4. Lancement avec optimisations max
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 65536 \
  --host 0.0.0.0 --port 8080
→
Una vez iniciado
El servidor expone una API compatible con OpenAI en http://localhost:8080. Conecta a ella Open WebUI, Continue.dev, Aider y Raycast AI: todos funcionarán con tu modelo local de frontera.

#5. Configuración multi-GPU NVIDIA

#Opción A — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)

vLLM tensor-parallel
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Flash \
  --tensor-parallel-size 4 \
  --quantization fp8 \
  --max-model-len 1000000 \
  --enable-prefix-caching \
  --port 8000

#Opción B — llama.cpp con offload parcial

2× RTX 5090 + offload CPU
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 50 \
  --tensor-split 0.5,0.5 \
  -ctk q8_0 -ctv q8_0 \
  -c 32768
!
Offload = lento
Todo lo que no cabe en la VRAM pasa a la RAM del sistema (DDR5 a ~80 GB/s frente a HBM3 a 1 TB/s). Con un 50 % transferido a la RAM del sistema, la velocidad cae a 3-5 tok/s. Para un uso interactivo, procura que el 100 % esté en la VRAM.

#6. Benchmarks y tokens/sec medidos

Benchmarks publicados por DeepSeek (24 de abril de 2026), valores del modo High
BenchmarkV4 FlashV4 ProLlama 4 Scout 109BMistral Large 2
MMLU-Pro79.484.276.875.3
GPQA Diamond70.178.563.259.4
AIME 202576.587.061.352.1
LiveCodeBench v572.679.865.461.8
LongBench v2 (1M)68.972.6——
Tokens por segundo medidos (chat, contexto 4k, Q4_K_M)
SetupTok/s en modo NonTok/s en modo HighTok/s en modo Max
Mac Studio M3 Ultra 256 GB10-128-105-7
Mac Studio M3 Ultra 512 GB12-1410-127-9
4× RTX A6000 48GB20-2516-2012-15
2× RTX 5090 + 64GB offload3-52-41-2

#7. Modos de pensamiento y contexto largo

V4 Flash hereda los tres modos de pensamiento de V4 Pro con calidad ligeramente inferior, pero con un costo de inferencia mucho menor. Es la opción adecuada para agentes que deben razonar sin monopolizar una infraestructura.

Modo No
Respuesta directa. Latencia muy baja (~1s para iniciar el streaming). Para chat conversacional, traducción.
Modo High
200-2000 tokens de cadena de pensamiento antes de la respuesta. +25 % de calidad en matemáticas/código. Latencia de 5 a 15 segundos antes del primer token de la respuesta final.
Modo Max
Hasta 16k tokens de reflexión. Latencia de 1 a 5 minutos en local. Reservar para problemas difíciles (demostraciones matemáticas, depuración compleja).
Contexto largo 1M
Mismas capacidades que V4 Pro gracias a HCA — Needle-in-Haystack 1M ~95 % (vs 98 % para Pro). Excelente para RAG en grandes bases.

#V4 Flash vs V4 Pro: elegir

Comparación resumida
CriterioV4 Flash 284BV4 Pro 1.6T
Parámetros totales284 B1 600 B
Parámetros activos / token13 B49 B
VRAM Q4_K_M170 GB960 GB
Hardware mínimo localMac Studio Ultra 256 GB (M3 Ultra de segunda mano o M5 Ultra nuevo)Clúster ~80 000 €
Tokens/segundo habituales en local10-250,5-2
Calidad MMLU-Pro79.484.2
Calidad AIME 202576.587.0
Contexto nativo1 M1 M
Modo de pensamiento máximoSíSí (mejor calidad)
LicenciaMITMIT
→
¿Cuándo elegir Flash, cuándo elegir Pro?
V4 Flash: 95 % de los casos — chat, código, RAG, agentes, contexto largo. El único modelo de frontera que cabe en una estación de trabajo. V4 Pro: investigación pura (matemáticas, demostraciones, AIME competitivo), flujos de trabajo donde la calidad máxima importa más que la latencia y el costo del hardware.

#Presentado oficialmente el 31 de julio de 2026 (build 0731)

DeepSeek sacó V4-Flash de la fase de preview a finales de julio de 2026 con la versión «0731»: la API está en beta pública y, de paso, el precio de los tokens de salida de V4-Pro baja un 75 % (0,87 $ por millón de tokens de salida). Artificial Analysis vuelve a situar a la familia V4 «entre los líderes de pesos abiertos». En cuanto a los pesos, nada cambia: 284B en total y 13B activos; sigue siendo la única variante V4 medianamente viable en local con equipos de gama alta (Mac de 256 GB, Strix Halo, varios GPU) y cuantización agresiva.

Desde el 2 de agosto, LM Studio también lo ofrece: en local si tu máquina tiene capacidad suficiente, o a través de la app Bionic en servidores estadounidenses con «Zero Data Retention» por defecto; una solución de compromiso que conviene conocer, aunque la filosofía de este sitio sigue siendo el funcionamiento 100 % local.

#FAQ

¿Funciona realmente DeepSeek V4 Flash en un Mac Studio M3 Ultra de 256 GB?+
Sí, en Q4_K_M: 170 GB para el modelo + 30 GB para el contexto de 32k + 8 GB para el sistema = ~210 GB, dentro de los 256 GB. Velocidad medida: 10-12 tok/s en modo Non, 8-10 en High. Es el único Mac capaz de hacerlo en una sola máquina en abril de 2026.
¿Cuánto cuesta un setup viable para V4 Flash en local?+
Tres presupuestos: (1) Mac Studio Ultra de 256 GB — M3 Ultra de segunda mano (7 300 € nuevo hasta septiembre de 2026) o M5 Ultra nuevo. (2) ~12 000 € — 4× RTX A6000 de 48 GB de segunda mano + estación de trabajo. (3) ≈ 11 400 € — 2× RTX 5090 + 64 GB DDR5 + offload, pero lento (3-5 tok/s).
¿Se debe elegir V4 Flash o esperar una destilación de 70B?+
DeepSeek anunció destilaciones de 70B y 32B en un plazo de 4 a 6 semanas. Si no tienes un Mac Studio Ultra ni un clúster de GPU, esperar tiene sentido. Si ya cuentas con ese hardware, V4 Flash ahora >> destilación de 70B dentro de 5 semanas (calidad superior y contexto de 1M).
¿V4 Flash supera a Llama 4 Maverick / Scout?+
En las pruebas publicadas por DeepSeek: sí, en todas (MMLU-Pro 79.4 frente a 76.8 para Scout, GPQA 70.1 frente a 63.2). Se espera confirmación independiente en un plazo de 2 semanas a través de Chatbot Arena. Ventaja clara de V4 Flash: contexto nativo de 1M, mientras que Llama 4 se queda en 256k.
¿Cuál es el consumo eléctrico de un Mac Studio M3 Ultra al ejecutar la inferencia con V4 Flash?+
Pico ~150 W durante la generación, ~30 W en reposo después de cargar. En 8 horas de uso activo: ~1,2 kWh = ~0,30 €/día (FR 2026). Una lámpara LED consume más en stand-by.
¿El modo thinking Max vale la pena en V4 Flash?+
En Mac Studio: sí para problemas difíciles (matemáticas, demostraciones, depuración), pero espera de 1 a 5 minutos por respuesta. En uso normal de chat, el modo High es más que suficiente (8-10 tok/s, calidad ~Mistral Large × 2).
¿Se puede hacer un ajuste fino de V4 Flash localmente?+
LoRA / QLoRA: sí, en un Mac Studio Ultra de 512 GB mediante MLX-LM (comprobar el soporte según la versión instalada) o unsloth (NVIDIA, mínimo 4× A6000). Fine-tuning completo: no es viable en local; costo estimado del entrenamiento en la nube: 200-400 k$.
¿Existe una versión cuantizada Q4 estable al 25 de abril de 2026?+
Las versiones cuantizadas oficiales GGUF Q4_K_M y Q5_K_M saldrán este fin de semana (26-27 de abril) en HuggingFace. Versiones cuantizadas AWQ para vLLM: ya disponibles (deepseek-ai/DeepSeek-V4-Flash-AWQ). Sigue @DeepSeek_AI en X para los anuncios.

Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.