◆ IA Local — Tu ChatGPT privado y gratuito, en tu máquina, en 1 h · 24 € · o todos los kits 49 € →

Herramienta · cálculo instantáneo

Calculadora de VRAM para LLM

¿Cuánta memoria de GPU necesita realmente un LLM local? Pesos del modelo + caché KV + sobrecarga: una estimación honesta.

La regla: VRAM ≈ parámetros (miles de millones) × bytes por peso + caché KV + ~20 % de sobrecarga. En Q4, son aproximadamente 0,55-0,6 GB por cada mil millones de parámetros; en FP16, 2 GB por cada mil millones. Un contexto más largo hace que la caché KV crezca mucho más allá del 20 %.

Estimación = memoria ocupada por los pesos × (1 + 0,2 × contexto/8K). Es una aproximación para modelos densos; los modelos MoE (mezcla de expertos) activan menos pesos por token y pueden rendir mejor de lo que su tamaño sugiere. Reserva siempre 1-2 GB para el sistema operativo y la salida de pantalla.

VRAM necesaria según tamaño del modelo (contexto 8K)

TamañoQ4_K_MQ8_0FP16Cabe en (Q4)
7B4,9 GB9,0 GB16,8 GBTarjetas de 8 GB (RTX 3050, 4060)
9B6,3 GB11,6 GB21,6 GBTarjetas de 8-12 GB
14B9,7 GB18,0 GB33,6 GBTarjetas de 12-16 GB
27B18,8 GB34,7 GB64,8 GBTarjetas de 24 GB (RTX 3090/4090)
32B22,3 GB41,1 GB76,8 GBTarjetas de 24 GB, contexto corto
70B48,7 GB89,9 GB168,0 GB48 GB+ o dos GPUs de 24 GB

Las cifras incluyen un margen del 20 % para la caché KV y la sobrecarga con un contexto de 8K, y están redondeadas a una décima de GB.

Ahora, elige el modelo

Conocer la memoria disponible es solo la mitad del camino. El configurador de hardware te propone modelos reales adecuados para tu GPU o tu modelo concreto de Mac; el ranking de LLM locales clasifica todos los modelos que puedes ejecutar en local. Los rankings por capacidad de hardware van directos al grano: mejor LLM para 8 GB de VRAM, RTX 4090, Mac de 16 GB. ¿Dudas entre la nube y la ejecución local? Haz las cuentas con la calculadora de costes.

Preguntas frecuentes

¿Cuánta VRAM se necesita por cada mil millones de parámetros?

Por cada mil millones de parámetros, se necesitan aproximadamente 2 GB en FP16, 1,1 GB en Q8 y 0,55-0,6 GB con cuantización Q4. Añade alrededor de un 20 % para la caché KV y la sobrecarga con un contexto estándar de 8K; reserva más si el contexto es más largo.

¿8 GB de VRAM son suficientes para un LLM local?

Sí. En Q4, un modelo de 8-9B (aproximadamente 5-6 GB de pesos) cabe por completo en una GPU de 8 GB y deja margen para el contexto. Consulta nuestro ranking de los mejores LLM para 8 GB de VRAM.

¿Puede una GPU de 24 GB (RTX 3090/4090) ejecutar un modelo de 32B?

Sí. En Q4, un modelo denso de 32B necesita aproximadamente 20-22 GB, por lo que cabe en una tarjeta de 24 GB con un contexto corto. Para un contexto largo, elegir un modelo de 27B es más prudente.

¿La memoria unificada de un Mac cuenta como VRAM?

Los Mac con Apple Silicon comparten un único conjunto de memoria unificada entre la CPU y la GPU. Por eso, un Mac de 32 GB puede cargar modelos más grandes que una GPU dedicada de 16 GB, pero debes reservar 8-10 GB para el propio macOS.

Más herramientas gratuitas