DeepSeek V4 Pro en local: VRAM, hardware, instalación
DeepSeek V4 Pro es el modelo con pesos abiertos más potente del mundo al lanzarse el 24 de abril de 2026. 1,6 trillones de parámetros en arquitectura MoE (49 mil millones activos por token), licencia MIT, contexto de 1M tokens, atención híbrida CSA+HCA, y tres modos de razonamiento. En los benchmarks publicados, compite con GPT-5 y Claude 4.7 — sin servidor en la nube, sin API, sin límite de tokens. Este guía detalla cómo utilizarlo localmente y qué hardware se necesita.
#DeepSeek V4 Pro en pocas palabras
- Fecha de lanzamiento
- 24 de abril de 2026 — DeepSeek-AI en HuggingFace, pesos bajo licencia MIT, artículo publicado simultáneamente.
- Arquitectura
- Mixture-of-Experts denso de 1,6T parámetros totales, 49B activos por token, 256 expertos con routing top-8
- Atención
- Combinación híbrida de CSA (Compressed Sparse Attention) + HCA (Hybrid Constrained Attention): primera implementación a esta escala.
- Contexto
- 1 millón de tokens nativos (con RoPE extendido y Flash Attention v3).
- Preentrenamiento
- 32T+ tokens, optimizador Muon (reemplaza a AdamW), precisión mixta FP4+FP8 (entrenamiento más eficiente conocido)
- Modos de pensamiento
- 3 niveles: No / High / Max. El modo Max se acerca al rendimiento de o4 en AIME y GPQA.
- Licencia
- MIT — uso comercial, redistribución y modificación autorizados sin restricción. Más libre que la licencia Llama.
#1. Arquitectura CSA+HCA y MoE 1.6T
DeepSeek V4 Pro acumula tres innovaciones principales, cada una publicada por separado en los últimos 12 meses y combinadas aquí por primera vez a escala trillón.
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
- MoE 1,6T / 49B activos
- 256 expertos por capa, enrutamiento top-8. Por cada token, solo 49 mil millones de parámetros realizan cálculos — por lo que su velocidad es comparable a un modelo denso de 50B a pesar de su tamaño total.
- CSA — Compressed Sparse Attention
- Comprime las claves y los valores antiguos de la caché KV mediante descomposición de bajo rango. Divide por 4 la memoria de atención en contextos >128k.
- HCA — Atención híbrida restringida
- Combina atención local (ventana deslizante de 4k) y global (dispersa) según la capa. Rendimiento ×2 con contexto largo frente a la atención densa.
- mHC — multi-Head Compressor
- Mecanismo de compresión entre cabezas: reduce la VRAM ocupada por las activaciones sin pérdida medible de calidad.
- Optimizador Muon
- Sucesor de AdamW, converge 1,8 veces más rápido durante el preentrenamiento de modelos muy grandes. Adoptado por DeepSeek desde V3.5.
- Entrenamiento FP4+FP8
- Combinación de FP4 en las capas de atención y FP8 en los MLP. -45 % de memoria de entrenamiento frente a FP8 puro, con la calidad preservada gracias a un esquema de escalado propietario.
#2. Los 3 modos de razonamiento (Non / High / Max)
El sistema de pensamiento de DeepSeek V4 Pro es explícito y puede activarse y desactivarse, a diferencia de los modos opacos de los modelos propietarios competidores.
- Modo No (predeterminado)
- Respuesta directa sin una cadena de pensamiento visible. Latencia mínima (~2-5 s a 8 tok/s). Para chat, traducción y generación de texto simple.
- Modo High
- Inserta 200-2000 tokens de reflexión antes de la respuesta. +30-40 % de calidad en matemáticas, código y análisis. Activable mediante el indicador /think en Ollama o el encabezado thinking_mode en la API.
- Modo Max
- Reflexión exhaustiva (hasta 16k tokens de cadena de pensamiento). Se acerca al rendimiento de o4 en AIME 2025 (87 % frente al 91 % de o4). Costoso: entre 10 y 30 minutos por consulta en local.
#3. Hardware requerido según la cuantización
| Quantization | VRAM del modelo | + KV 32k | Configuraciones posibles |
|---|---|---|---|
| FP16 (referencia) | 3 200 GB | ~3 350 GB | DC: 16× H100 80GB o 8× H200 141GB. Inaccesible en local. |
| Q8_0 | 1 700 GB | ~1 800 GB | Clúster de 8× H200 de 141 GB. ~250 mil dólares en hardware. |
| Q5_K_M | 1 150 GB | ~1 230 GB | Clúster de 3 Mac Studio de 512 GB, o 4 H200 de 141 GB. |
| Q4_K_M | 960 GB | ~1 040 GB | Clúster de 8× A100 de 80 GB, o 2× Mac Studio de 512 GB en un enjambre en red. |
| IQ3_M (comprimido) | 720 GB | ~800 GB | Un solo Mac Studio 512 + offload parcial al SSD. Lento, pero posible. |
| IQ2_XS (extrema) | 480 GB | ~560 GB | Un único Mac Studio de 512 GB, con una calidad muy degradada. |
#4. Instalación local
Tres opciones según tu infraestructura: llama.cpp para un swarm de varias máquinas, vLLM para un clúster homogéneo de GPU o MLX-distributed para un swarm de Mac Studio.
#Opción A — llama.cpp distribuido (recomendado para múltiples máquinas)
#Opción B — vLLM en un clúster H100/H200
#Opción C — Ollama (cuando esté disponible la adaptación)
A fecha de 25 de abril de 2026, Ollama aún no ha integrado DeepSeek V4 Pro (las versiones cuantizadas Q4_K_M de la comunidad salen este fin de semana). Sigue el progreso en ollama.com/library.
#5. Benchmarks vs GPT-5, Claude 4.7, Gemini 3
| Benchmark | DeepSeek V4 Pro Max | GPT-5 | Claude 4.7 Opus | Gemini 3 Ultra |
|---|---|---|---|---|
| MMLU-Pro | 84.2 | 85.1 | 84.7 | 83.9 |
| GPQA Diamond | 78.5 | 76.8 | 79.2 | 77.1 |
| AIME 2025 | 87.0 | 82.4 | 85.6 | 80.2 |
| LiveCodeBench v5 | 79.8 | 78.2 | 75.4 | 76.1 |
| SWE-bench Verified | 59.4 | 62.1 | 63.8 | 55.7 |
| LongBench v2 (1M) | 72.6 | — | 68.4 | 70.2 |
| Humanity's Last Exam | 26.8 | 23.4 | 25.1 | 22.9 |
#6. Aprovechar el contexto de 1 millón de tokens
El contexto de 1M es nativo (no se ha ampliado mediante YaRN), gracias a HCA. Es uno de los tres o cuatro modelos de pesos abiertos del mundo que ofrecen 1M, y el único que lo hace con esta calidad de recuperación de información.
- Needle-in-Haystack 1M
- 98 % de recuperación en todo el contexto (frente al 76 % de Gemini 1.5 Pro en condiciones equivalentes).
- Caso de uso 1 — Bases de código completas
- Kernel de Linux net/* (~800 k tokens) cargado de una sola vez, refactorización interarchivos en una sola solicitud.
- Caso de uso 2 — Investigación jurídica
- Código civil + sentencias recientes (~600 k tokens) en contexto, extracción de jurisprudencia en una pasada.
- Caso de uso 3 — Análisis contable
- 10 años de balances más anexos (~400 k tokens), detección de anomalías en múltiples ejercicios
- VRAM de caché KV a 1M
- Con KV Q4 y CSA activado: ~280 GB. A 1M sin compresión: ~2 TB (impracticable).
#7. Casos de uso ideales
- Investigación científica
- Matemáticas, física teórica, química computacional. El modo Max supera a o4 en algunos benchmarks AIME/Putnam.
- Seguridad / soberanía
- Bancos, defensa, salud, gobierno: modelo de frontera 100 % autoalojado, con licencia MIT y auditable. No hay equivalente aparte de LLaMA 4 (licencia más restrictiva).
- Agentes complejos de horizonte largo
- El contexto de 1M + razonamiento Max + 49B activos lo convierten en un agente mejor que los modelos densos más pequeños, sin el costo de inferencia de un GPT-5.
- RAG a escala empresarial
- Base de conocimientos de varios millones de tokens (bases de código, documentos internos, normas ISO). Búsqueda directa sin recuperación gracias al contexto.
#Límites y alternativas
- Hardware de coste prohibitivo para particulares
- Mínimo 960 GB de VRAM en Q4 = clúster de segunda mano de ~80 k€. Fuera del alcance de un particular.
- Tooling inmaduro a J+1
- Cuantizaciones GGUF comunitarias en curso, vLLM requiere la rama dev, MLX-distributed aún experimental. Esperar aproximadamente 2 semanas para que sea estable.
- Huella de carbono
- Clúster de 8× H200 funcionando 24/7 = ~45 MWh/año. Compararlo con el uso de API (que amortiza mejor).
- Alternativas más accesibles
- DeepSeek V4 Flash 284B (170 GB Q4, cabe en Mac Studio) · DeepSeek V3.2 671B (240 GB Q2 en Mac Studio 512) · Llama 4 Behemoth (cercano en calidad).
#FAQ
¿Es realmente mejor DeepSeek V4 Pro que GPT-5?+
¿Cuál es la licencia exacta de DeepSeek V4 Pro?+
¿Por qué 1,6T de parámetros si solo 49B están activos?+
¿Se puede ejecutar DeepSeek V4 Pro en un único Mac Studio Ultra de 512 GB?+
¿Qué diferencia hay entre los 3 modos de pensamiento?+
¿Cómo activar el modo thinking en Ollama / vLLM / API?+
¿DeepSeek V4 Pro puede procesar imágenes (multimodal)?+
¿Llegarán los modelos destilados (70B, 32B, 14B)?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.