¿Qué LLM para 4 GB de VRAM? ?
4 GB de VRAM es el mínimo absoluto para ejecutar un LLM localmente en 2026. GTX 1650, GTX 1050 Ti, RTX 3050 Mobile… tarjetas antiguas o de gama muy básica. Aun así, puedes instalar Ollama y conversar con Qwen 3.5 2B o Granite 4.2 3B. Esta guía explica exactamente qué funciona, qué no funciona y cómo aprovechar al máximo esos 4 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para pasar a 16 GB de VRAM: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#4 GB de VRAM en 2026
#1. ¿Qué GPU tienen 4 GB?
- GTX 1650 (4 GB)
- Pascal-Turing 2019. Difícil de encontrar nueva hoy; de segunda mano, el precio varía.
- GTX 1050 Ti (4 GB)
- Pascal 2016. Antigua pero aún funcional. De segunda mano, precio variable.
- RTX 3050 Mobile 4 GB
- Versión de portátil de entrada de gama.
- GTX 1630 (4 GB)
- Gama de entrada más básica, a evitar: rendimiento insuficiente incluso para un LLM ligero.
#2. Modelos utilizables
| Modelo | Quant | VRAM | ¿OK? |
|---|---|---|---|
| Gemma 4 2B | Q5_K_M | 1,4 GB | ★★★★★ cómodo |
| Qwen 3.5 2B | Q4_K_M | 1,9 GB | ★★★★★ cómodo |
| Granite 4.2 3B | Q4_K_M | 2,2 GB | ★★★★★ |
| Qwen 3.5 4B | Q4_K_M | 2,3 GB | ★★★★ |
| Gemma 4 E2B | QAT | 4,3 GB | ⚠️ muy justo (límite de 4 GB) |
| Granite 4.2 8B | Q4_K_M | 5,3 GB | ❌ No cabe |
#3. Consejos para aprovechar 4 GB
- KV cache Q4
- OLLAMA_KV_CACHE_TYPE=q4_0 (en lugar de q8_0). Más agresivo, ahorra un 50 % de la caché.
- Contexto máximo de 2k
- Más allá, la memoria se desborda. 2k tokens = ~5-10 frases en francés, suficiente para un chat sencillo.
- Cierra todo lo demás
- Chrome acelerado con GPU, Discord, OBS — todo consume VRAM. Modo minimalista obligatorio.
- Sin RAG
- Embeddings + LLM = demasiado. Quédate con un chat sencillo sin documentos.
#Actualización recomendada
- RTX 3060 12 GB (de segunda mano, precio variable)
- El salto más rentable. +200 % de VRAM, acceso a modelos de 14B. La mejor actualización posible para LLM.
- RTX 5050 8 GB (precio de la tarjeta nueva por verificar, sin seguimiento)
- Si quieres comprar nuevo. +100 % de VRAM, FP4 preparado para el futuro.
- Mac mini M4 16 GB (normalmente reemplazado por M5/M6; verificar)
- Si cambias de plataforma. Memoria unificada, silencioso.
#Preguntas frecuentes
¿Se puede ejecutar un modelo de 7-8B con 4 GB de VRAM?+
¿Cuál es el mejor LLM para 4 GB de VRAM?+
¿Basta una GTX 1650 de 4 GB para descubrir la IA local?+
¿Es imprescindible una GPU? ¿Puede bastar mi CPU?+
¿Se puede hacer RAG con 4 GB de VRAM?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.