Principiante 8 minPor VRAM

¿Qué LLM para 4 GB de VRAM? ?

4 GB de VRAM es el mínimo absoluto para ejecutar un LLM localmente en 2026. GTX 1650, GTX 1050 Ti, RTX 3050 Mobile… tarjetas antiguas o de gama muy básica. Aun así, puedes instalar Ollama y conversar con Qwen 3.5 2B o Granite 4.2 3B. Esta guía explica exactamente qué funciona, qué no funciona y cómo aprovechar al máximo esos 4 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Para pasar a 16 GB de VRAM: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#4 GB de VRAM en 2026

i
El mínimo vital
4 GB de VRAM = puedes probar un LLM en local, pero con limitaciones importantes. Un modelo de 8B de 2026 como Granite 4.2 8B Q4 (5,3 GB) supera la capacidad de la VRAM —quédate con modelos de 2B-4B que quepan holgadamente.

#1. ¿Qué GPU tienen 4 GB?

GTX 1650 (4 GB)
Pascal-Turing 2019. Difícil de encontrar nueva hoy; de segunda mano, el precio varía.
GTX 1050 Ti (4 GB)
Pascal 2016. Antigua pero aún funcional. De segunda mano, precio variable.
RTX 3050 Mobile 4 GB
Versión de portátil de entrada de gama.
GTX 1630 (4 GB)
Gama de entrada más básica, a evitar: rendimiento insuficiente incluso para un LLM ligero.

#2. Modelos utilizables

4 GB de VRAM — modelos LLM 2026
ModeloQuantVRAM¿OK?
Gemma 4 2BQ5_K_M1,4 GB★★★★★ cómodo
Qwen 3.5 2BQ4_K_M1,9 GB★★★★★ cómodo
Granite 4.2 3BQ4_K_M2,2 GB★★★★★
Qwen 3.5 4BQ4_K_M2,3 GB★★★★
Gemma 4 E2BQAT4,3 GB⚠️ muy justo (límite de 4 GB)
Granite 4.2 8BQ4_K_M5,3 GB❌ No cabe

#3. Consejos para aprovechar 4 GB

KV cache Q4
OLLAMA_KV_CACHE_TYPE=q4_0 (en lugar de q8_0). Más agresivo, ahorra un 50 % de la caché.
Contexto máximo de 2k
Más allá, la memoria se desborda. 2k tokens = ~5-10 frases en francés, suficiente para un chat sencillo.
Cierra todo lo demás
Chrome acelerado con GPU, Discord, OBS — todo consume VRAM. Modo minimalista obligatorio.
Sin RAG
Embeddings + LLM = demasiado. Quédate con un chat sencillo sin documentos.

#Actualización recomendada

RTX 3060 12 GB (de segunda mano, precio variable)
El salto más rentable. +200 % de VRAM, acceso a modelos de 14B. La mejor actualización posible para LLM.
RTX 5050 8 GB (precio de la tarjeta nueva por verificar, sin seguimiento)
Si quieres comprar nuevo. +100 % de VRAM, FP4 preparado para el futuro.
Mac mini M4 16 GB (normalmente reemplazado por M5/M6; verificar)
Si cambias de plataforma. Memoria unificada, silencioso.

#Preguntas frecuentes

¿Se puede ejecutar un modelo de 7-8B con 4 GB de VRAM?+
No con comodidad. Un modelo 8B de 2026 como Granite 4.2 8B Q4 (5,3 GB) supera la capacidad de la VRAM. Quédate con Granite 4.2 3B Q4 (2,2 GB): calidad aceptable, velocidad aceptable.
¿Cuál es el mejor LLM para 4 GB de VRAM?+
Granite 4.2 3B Q4_K_M o Qwen 3.5 4B Q4. Excelentes modelos pequeños de 2026, calidad muy superior a un 7B de hace 2 años.
¿Basta una GTX 1650 de 4 GB para descubrir la IA local?+
Sí para modelos de 2B-3B. Instalas Ollama, hablas con Granite 4.2 3B a 25-30 tok/s. Suficiente para empezar.
¿Es imprescindible una GPU? ¿Puede bastar mi CPU?+
Con una CPU reciente (Ryzen 5 7600 o superior, Core i5 de 13.ª generación o posterior), Granite 4.2 8B en Q4 funciona a 5-10 tok/s. Es lento, pero utilizable. Con una GPU de 4 GB, obtienes ~20 tok/s con un modelo de 3B, lo que resulta preferible.
¿Se puede hacer RAG con 4 GB de VRAM?+
No de forma cómoda. Embeddings BGE-M3 (~2 GB) + LLM 3B (~2 GB) = memoria saturada. Limítate al chat simple o pasa a 8 GB o más.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.