Avanzado 16 minDeepSeek

DeepSeek V4 Pro en local: VRAM, hardware, instalación

DeepSeek V4 Pro es el modelo con pesos abiertos más potente del mundo al lanzarse el 24 de abril de 2026. 1,6 trillones de parámetros en arquitectura MoE (49 mil millones activos por token), licencia MIT, contexto de 1M tokens, atención híbrida CSA+HCA, y tres modos de razonamiento. En los benchmarks publicados, compite con GPT-5 y Claude 4.7 — sin servidor en la nube, sin API, sin límite de tokens. Este guía detalla cómo utilizarlo localmente y qué hardware se necesita.

Por Mohamed Meguedmi·Actualización 2026-04-25·Probado en Windows, macOS y Linux

#DeepSeek V4 Pro en pocas palabras

Fecha de lanzamiento
24 de abril de 2026 — DeepSeek-AI en HuggingFace, pesos bajo licencia MIT, artículo publicado simultáneamente.
Arquitectura
Mixture-of-Experts denso de 1,6T parámetros totales, 49B activos por token, 256 expertos con routing top-8
Atención
Combinación híbrida de CSA (Compressed Sparse Attention) + HCA (Hybrid Constrained Attention): primera implementación a esta escala.
Contexto
1 millón de tokens nativos (con RoPE extendido y Flash Attention v3).
Preentrenamiento
32T+ tokens, optimizador Muon (reemplaza a AdamW), precisión mixta FP4+FP8 (entrenamiento más eficiente conocido)
Modos de pensamiento
3 niveles: No / High / Max. El modo Max se acerca al rendimiento de o4 en AIME y GPQA.
Licencia
MIT — uso comercial, redistribución y modificación autorizados sin restricción. Más libre que la licencia Llama.
→
Por qué es un acontecimiento importante
DeepSeek V4 Pro es el primer modelo de pesos abiertos que supera a GPT-4o en todos los benchmarks públicos, con un costo de entrenamiento anunciado de 12 millones de dólares (frente a unos 80 millones para GPT-4). Publicado bajo la licencia MIT: un Estado, un banco o un hospital pueden alojarlo en su propia infraestructura sin un acuerdo con un proveedor de nube. Es un cambio de paradigma para la soberanía de la IA.

#1. Arquitectura CSA+HCA y MoE 1.6T

DeepSeek V4 Pro acumula tres innovaciones principales, cada una publicada por separado en los últimos 12 meses y combinadas aquí por primera vez a escala trillón.

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida
MoE 1,6T / 49B activos
256 expertos por capa, enrutamiento top-8. Por cada token, solo 49 mil millones de parámetros realizan cálculos — por lo que su velocidad es comparable a un modelo denso de 50B a pesar de su tamaño total.
CSA — Compressed Sparse Attention
Comprime las claves y los valores antiguos de la caché KV mediante descomposición de bajo rango. Divide por 4 la memoria de atención en contextos >128k.
HCA — Atención híbrida restringida
Combina atención local (ventana deslizante de 4k) y global (dispersa) según la capa. Rendimiento ×2 con contexto largo frente a la atención densa.
mHC — multi-Head Compressor
Mecanismo de compresión entre cabezas: reduce la VRAM ocupada por las activaciones sin pérdida medible de calidad.
Optimizador Muon
Sucesor de AdamW, converge 1,8 veces más rápido durante el preentrenamiento de modelos muy grandes. Adoptado por DeepSeek desde V3.5.
Entrenamiento FP4+FP8
Combinación de FP4 en las capas de atención y FP8 en los MLP. -45 % de memoria de entrenamiento frente a FP8 puro, con la calidad preservada gracias a un esquema de escalado propietario.
i
Qué cambia en la práctica
A parámetros totales comparables (1,6T), DeepSeek V4 Pro es ~3× más rápido en inferencia que un modelo denso equivalente y 4× menos exigente en VRAM en contexto largo. Esto hace que una inferencia local Q4 sea posible en un cluster de 8×H100 80 GB (en lugar de tener que alquilar un pod TPU).

#2. Los 3 modos de razonamiento (Non / High / Max)

El sistema de pensamiento de DeepSeek V4 Pro es explícito y puede activarse y desactivarse, a diferencia de los modos opacos de los modelos propietarios competidores.

Modo No (predeterminado)
Respuesta directa sin una cadena de pensamiento visible. Latencia mínima (~2-5 s a 8 tok/s). Para chat, traducción y generación de texto simple.
Modo High
Inserta 200-2000 tokens de reflexión antes de la respuesta. +30-40 % de calidad en matemáticas, código y análisis. Activable mediante el indicador /think en Ollama o el encabezado thinking_mode en la API.
Modo Max
Reflexión exhaustiva (hasta 16k tokens de cadena de pensamiento). Se acerca al rendimiento de o4 en AIME 2025 (87 % frente al 91 % de o4). Costoso: entre 10 y 30 minutos por consulta en local.
Activar el modo thinking mediante Ollama (V4 Flash, Pro idéntico)
# Mode High
ollama run deepseek-v4 "Résous : x² + 5x - 14 = 0 /think"

# Mode Max
ollama run deepseek-v4 "Démontre la conjecture de Collatz pour n<100 /think_max"

#3. Hardware requerido según la cuantización

VRAM total requerida (modelo + caché KV de 32k tokens)
QuantizationVRAM del modelo+ KV 32kConfiguraciones posibles
FP16 (referencia)3 200 GB~3 350 GBDC: 16× H100 80GB o 8× H200 141GB. Inaccesible en local.
Q8_01 700 GB~1 800 GBClúster de 8× H200 de 141 GB. ~250 mil dólares en hardware.
Q5_K_M1 150 GB~1 230 GBClúster de 3 Mac Studio de 512 GB, o 4 H200 de 141 GB.
Q4_K_M960 GB~1 040 GBClúster de 8× A100 de 80 GB, o 2× Mac Studio de 512 GB en un enjambre en red.
IQ3_M (comprimido)720 GB~800 GBUn solo Mac Studio 512 + offload parcial al SSD. Lento, pero posible.
IQ2_XS (extrema)480 GB~560 GBUn único Mac Studio de 512 GB, con una calidad muy degradada.
!
Realismo sobre la ejecución local
DeepSeek V4 Pro Q4 sigue en 960 GB: es un modelo para centros de datos, no para equipos individuales. Si quieres un modelo de frontera que funcione localmente en una sola máquina en 2026, mira DeepSeek V4 Flash (170 GB en Q4) o espera las destilaciones Pro→70B que llegarán en las próximas semanas.

#4. Instalación local

Tres opciones según tu infraestructura: llama.cpp para un swarm de varias máquinas, vLLM para un clúster homogéneo de GPU o MLX-distributed para un swarm de Mac Studio.

#Opción A — llama.cpp distribuido (recomendado para múltiples máquinas)

Configuración de swarm en 2× Mac Studio 512 GB
# Sur chaque machine
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 GGML_RPC=1 GGML_CUDA=0

# Téléchargement modèle (split GGUF, ~960 Go)
huggingface-cli download deepseek-ai/DeepSeek-V4-Pro-GGUF \
  --include "*Q4_K_M*.gguf" --local-dir ./models

# Machine 1 (rpc-server, écoute sur :50052)
./build/bin/rpc-server -H 0.0.0.0 -p 50052

# Machine 2 (rpc-server également)
./build/bin/rpc-server -H 0.0.0.0 -p 50052

# Coordinator (peut être l'une des deux)
./build/bin/llama-cli \
  -m ./models/DeepSeek-V4-Pro-Q4_K_M-00001-of-00020.gguf \
  --rpc 192.168.1.10:50052,192.168.1.11:50052 \
  -ngl 99 -fa -c 32768 \
  -ctk q8_0 -ctv q8_0

#Opción B — vLLM en un clúster H100/H200

vLLM 8× H200 141GB
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Pro \
  --tensor-parallel-size 8 \
  --pipeline-parallel-size 1 \
  --max-model-len 1000000 \
  --quantization fp8 \
  --enable-prefix-caching \
  --port 8000

# Endpoint OpenAI-compatible sur :8000
curl http://localhost:8000/v1/chat/completions -d '{...}'

#Opción C — Ollama (cuando esté disponible la adaptación)

A fecha de 25 de abril de 2026, Ollama aún no ha integrado DeepSeek V4 Pro (las versiones cuantizadas Q4_K_M de la comunidad salen este fin de semana). Sigue el progreso en ollama.com/library.

→
Costo eléctrico real
Clúster de 8× H200 ejecutando la inferencia de DeepSeek V4 Pro Q8: ~5,2 kW. Una sesión de 8 h cuesta ~6,30 € en electricidad (FR 2026). En comparación con la API alojada de DeepSeek, a ~0,28 $ por millón de tokens de salida, la ejecución local se vuelve rentable por encima de ~50 millones de tokens al mes.

#5. Benchmarks vs GPT-5, Claude 4.7, Gemini 3

Puntuaciones publicadas por DeepSeek (paper del 24 de abril de 2026), benchmarks públicos estándar
BenchmarkDeepSeek V4 Pro MaxGPT-5Claude 4.7 OpusGemini 3 Ultra
MMLU-Pro84.285.184.783.9
GPQA Diamond78.576.879.277.1
AIME 202587.082.485.680.2
LiveCodeBench v579.878.275.476.1
SWE-bench Verified59.462.163.855.7
LongBench v2 (1M)72.6—68.470.2
Humanity's Last Exam26.823.425.122.9
i
Benchmark independiente pendiente de publicación
Estos datos los anuncia DeepSeek. Los benchmarks independientes (LMSYS Arena, ARC-AGI, HLE) se publicarán en las 2-4 semanas siguientes. A vigilar para confirmar: el modelo debería aparecer en el top 5 de la Chatbot Arena dentro de 10 días.

#6. Aprovechar el contexto de 1 millón de tokens

El contexto de 1M es nativo (no se ha ampliado mediante YaRN), gracias a HCA. Es uno de los tres o cuatro modelos de pesos abiertos del mundo que ofrecen 1M, y el único que lo hace con esta calidad de recuperación de información.

Needle-in-Haystack 1M
98 % de recuperación en todo el contexto (frente al 76 % de Gemini 1.5 Pro en condiciones equivalentes).
Caso de uso 1 — Bases de código completas
Kernel de Linux net/* (~800 k tokens) cargado de una sola vez, refactorización interarchivos en una sola solicitud.
Caso de uso 2 — Investigación jurídica
Código civil + sentencias recientes (~600 k tokens) en contexto, extracción de jurisprudencia en una pasada.
Caso de uso 3 — Análisis contable
10 años de balances más anexos (~400 k tokens), detección de anomalías en múltiples ejercicios
VRAM de caché KV a 1M
Con KV Q4 y CSA activado: ~280 GB. A 1M sin compresión: ~2 TB (impracticable).

#7. Casos de uso ideales

Investigación científica
Matemáticas, física teórica, química computacional. El modo Max supera a o4 en algunos benchmarks AIME/Putnam.
Seguridad / soberanía
Bancos, defensa, salud, gobierno: modelo de frontera 100 % autoalojado, con licencia MIT y auditable. No hay equivalente aparte de LLaMA 4 (licencia más restrictiva).
Agentes complejos de horizonte largo
El contexto de 1M + razonamiento Max + 49B activos lo convierten en un agente mejor que los modelos densos más pequeños, sin el costo de inferencia de un GPT-5.
RAG a escala empresarial
Base de conocimientos de varios millones de tokens (bases de código, documentos internos, normas ISO). Búsqueda directa sin recuperación gracias al contexto.

#Límites y alternativas

Hardware de coste prohibitivo para particulares
Mínimo 960 GB de VRAM en Q4 = clúster de segunda mano de ~80 k€. Fuera del alcance de un particular.
Tooling inmaduro a J+1
Cuantizaciones GGUF comunitarias en curso, vLLM requiere la rama dev, MLX-distributed aún experimental. Esperar aproximadamente 2 semanas para que sea estable.
Huella de carbono
Clúster de 8× H200 funcionando 24/7 = ~45 MWh/año. Compararlo con el uso de API (que amortiza mejor).
Alternativas más accesibles
DeepSeek V4 Flash 284B (170 GB Q4, cabe en Mac Studio) · DeepSeek V3.2 671B (240 GB Q2 en Mac Studio 512) · Llama 4 Behemoth (cercano en calidad).

#FAQ

¿Es realmente mejor DeepSeek V4 Pro que GPT-5?+
En los benchmarks publicados por DeepSeek: en general comparable, a veces superior (AIME, GPQA, código). Inferior en SWE-bench (agente de programación completo). Los benchmarks independientes de Chatbot Arena (en un plazo de 10 días) resolverán la cuestión. En cualquier caso, es el primer modelo de pesos abiertos con el que se puede plantear seriamente la pregunta.
¿Cuál es la licencia exacta de DeepSeek V4 Pro?+
Licencia MIT pura: la más permisiva. Uso comercial, redistribución, fork, modificación e integración en un producto cerrado: todo está permitido sin restricciones ni cláusulas estrictas de atribución. Más libre que Llama (que exige más de 700 millones de MAU para el uso gratuito) o Apache 2.0 (que exige citar).
¿Por qué 1,6T de parámetros si solo 49B están activos?+
Es el truco del MoE: se almacenan muchos expertos especializados (256 por capa), pero solo se activan 8 por token (de los cuales 1 es compartido). Se gana en calidad (cada experto se especializa) sin pagar el coste de inferencia de un modelo denso de 1,6T. El coste de memoria sigue siendo el de los 1,6T, pero el coste de cómputo es el de un modelo de 49B.
¿Se puede ejecutar DeepSeek V4 Pro en un único Mac Studio Ultra de 512 GB?+
No, no en Q4 (se necesitan 960 GB). Es posible en IQ2_XS (~480 GB), con calidad degradada y una velocidad de 1-2 tok/s. Para que el uso en una sola máquina sea práctico, hay que esperar los modelos destilados de 70B/100B o elegir la variante V4 Flash 284B (170 GB en Q4).
¿Qué diferencia hay entre los 3 modos de pensamiento?+
No = sin razonamiento explícito, latencia mínima, calidad ~Mistral Large. High = 200-2000 tokens de cadena de pensamiento antes de la respuesta, +30-40 % de calidad en matemáticas/código/análisis. Max = hasta 16k tokens de reflexión, calidad ~o4, pero lento (10-30 minutos/petición en un clúster local).
¿Cómo activar el modo thinking en Ollama / vLLM / API?+
Ollama: sufijo /think o /think_max en el prompt. vLLM: encabezado X-Thinking-Mode: high|max. API oficial de DeepSeek: campo thinking_mode en el cuerpo JSON. La etiqueta <think>...</think> en la respuesta delimita la cadena de pensamiento.
¿DeepSeek V4 Pro puede procesar imágenes (multimodal)?+
No, V4 Pro solo procesa texto. Se ha anunciado una variante VL (Vision-Language) para finales de mayo de 2026, basada en la misma arquitectura pero con un codificador visual integrado. Para tareas de visión con modelos de pesos abiertos hoy: Qwen3.5-VL o Llama 4 Vision.
¿Llegarán los modelos destilados (70B, 32B, 14B)?+
DeepSeek confirmó en el artículo que las destilaciones hacia los modelos base Llama-3.3-70B y Qwen-2.5-32B saldrían en un plazo de 4 a 6 semanas. Como precedente, DeepSeek-R1 se había destilado en 6 versiones (de 1.5B a 70B), algunas de las cuales superan a los modelos originales. Prepárate para auténticos bombazos.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.