Metodología · actualización 2026
Recomendador de cuantización
Una guía que relaciona tu cantidad exacta de VRAM con la cuantización GGUF, GPTQ o AWQ óptima, sin tanteos ni memoria desperdiciada.
Fórmula básica: VRAM_Go = (Paramètres_Md × Bits / 8) × 1,2. El multiplicador 1,2 cubre la caché KV y la sobrecarga de las activaciones con un contexto de 8K.
¿Qué cuantización para mi máquina?
Indica tu memoria: la herramienta enumera los modelos del catálogo que caben, con la mejor cuantización posible para cada uno.
Cargando el catálogo…
La elección en 30 segundos
Localiza tu VRAM disponible a continuación y consulta el modelo más grande y la cuantización que caben con un contexto de 8K. Tamaños habituales de archivos GGUF (ajustes predeterminados de llama.cpp/Ollama, caché KV en FP16); la última columna indica el margen restante para pasar a un contexto de 16K.
| VRAM | GPU típica | Modelo + cuantización recomendados | Margen 16K |
|---|---|---|---|
| 6 GB | RTX 3060 Laptop (6 GB), RTX 4050 Laptop | Qwen 3 4B Q5_K_M, o Qwen 3 8B Q3_K_M | Muy justo — volver a Q4_K_S |
| 8 GB | RTX 3050 8 GB, RTX 4060, RTX 5060 | Qwen 3 8B Q4_K_M, Llama 3.1 8B Q4_K_M | OK en Q4_K_M |
| 12 GB | RTX 3060 12 GB, RTX 4070, RTX 5070 | Qwen 3 14B Q4_K_M, Qwen 2.5 Coder 14B Q4_K_M, Gemma 3 12B Q5_K_M | Solo para un 14B |
| 16 GB | RTX 4060 Ti 16 GB, RTX 5060 Ti 16 GB, RTX 5070 Ti, RTX 5080 | Qwen 3 14B Q6_K, Mistral Small 3.2 24B Q4_K_M (con poco margen) | Bueno para un 14B |
| 24 GB | RTX 3090, RTX 4090, RX 7900 XTX | Qwen 3 32B Q4_K_M, Qwen3-Coder 30B-A3B Q4_K_M, Gemma 3 27B Q4_K_M | Muy justo para un modelo denso de 32B; holgado para uno de 27B |
| 32 GB | RTX 5090 | Qwen 3 32B Q6_K, Qwen 3 30B-A3B Q6_K | Solo para el 32B en Q6_K |
| 48 GB | RTX 6000 Ada, 2× RTX 3090/4090 | Llama 3.3 70B Q4_K_M, Qwen 2.5 72B Q4_K_S | Solo contexto corto (8K) |
| 80 GB | H100 80 GB, A100 80 GB | gpt-oss 120B (MXFP4), Llama 3.3 70B Q8_0 (contexto corto) | Funciona bien para gpt-oss 120B |
El cálculo en que se basa la recomendación
La cuantización comprime cada peso de FP16 (16 bits) hasta 2-8 bits. Un modelo de 7B en Q4_K_M utiliza en promedio ~4,85 bits/peso, es decir, 7.000.000.000 × 4,85 / 8 ≈ 4,2 GB. Al sumar la caché KV (que crece con el contexto), llegamos a unos 5,5 GB para un contexto de 8K en un modelo con atención agrupada (Mistral 7B, Qwen, Llama 3). Para un contexto largo, la caché KV tiene un peso mucho mayor que el multiplicador ×1,2.
Referencia de bits por peso
| Quant | Bits efectivos por peso | VRAM (8B) | VRAM (32B) | VRAM (70B) |
|---|---|---|---|---|
| FP16 | 16,0 | 16,0 GB | 64,0 GB | 140,0 GB |
| Q8_0 | 8,5 | 8,5 GB | 34,0 GB | 74,4 GB |
| Q6_K | 6,6 | 6,6 GB | 26,4 GB | 57,8 GB |
| Q5_K_M | 5,7 | 5,7 GB | 22,8 GB | 49,9 GB |
| Q4_K_M | 4,83 | 4,83 GB | 19,3 GB | 42,3 GB |
| Q4_K_S | 4,58 | 4,58 GB | 18,3 GB | 40,1 GB |
| Q3_K_M | 3,9 | 3,9 GB | 15,6 GB | 34,1 GB |
| Q2_K | 3,35 | 3,35 GB | 13,4 GB | 29,3 GB |
Pérdida de calidad: lo que dicen realmente los números
La medida de referencia sigue siendo la perplejidad publicada con los k-quants de llama.cpp (PR #1684, LLaMA 7B, FP16 = 5,9066). Cuanto menor sea la diferencia, más se parecerá el comportamiento del modelo cuantizado al del original. El salto entre Q4_K_M y Q3_K_M es pronunciado, y la mejora de Q5 a Q6 es mínima.
| Quant | Perplexidad (LLaMA 7B) | Diferencia respecto a FP16 | Veredicto |
|---|---|---|---|
| Q8_0 | — | despreciable | Indistinguible |
| Q6_K | 5,9110 | +0,07 % | Casi sin pérdida |
| Q5_K_M | 5,9208 | +0,24 % | Excelente |
| Q4_K_M | 5,9601 | +0,91 % | Punto de equilibrio |
| Q4_K_S | 6,0215 | +1,95 % | Aceptable |
| Q3_K_M | 6,1503 | +4,13 % | Perceptible |
| Q2_K | 6,7764 | +14,7 % | Último recurso |
Mediciones de 2023 sobre LLaMA 7B: los modelos recientes, entrenados con muchos más datos, suelen ser un poco más sensibles a la cuantización. El orden de magnitud sigue siendo válido.
Con la misma cantidad de memoria, un modelo más grande en Q4_K_M suele funcionar mejor que un modelo más pequeño en Q8_0. Si tienes dudas, aumenta el número de parámetros, no los bits.
GGUF, GPTQ o AWQ: el formato adecuado, no solo el número adecuado de bits
GGUF (llama.cpp / Ollama / LM Studio): la opción predeterminada para la inferencia de un solo usuario, la descarga de procesamiento a la CPU y Apple Silicon. GPTQ : 4 bits, inferencia exclusivamente en GPU con vLLM/TGI. AWQ : 4 bits, exclusivamente en GPU — la opción más rápida en 2026 para la inferencia por lotes en RTX 4090, RTX 5090, H100/H200.
| Casos de uso | Mejor formato | Por qué |
|---|---|---|
| Un solo usuario, equipo de trabajo, estilo ChatGPT | GGUF Q4_K_M | Descarga de procesamiento en la CPU, capas GPU parciales, funciona en cualquier equipo |
| Apple Silicon (M1-M5) | GGUF Q4_K_M o MLX 4 bits | Kernels Metal, memoria unificada |
| API por lotes, más de 4 usuarios simultáneos | AWQ de 4 bits en vLLM | Mayor tasa de procesamiento con lotes grandes |
| Ampere antiguo (A100, RTX 3090) | GPTQ 4 bits o AWQ | Ambos funcionan; realizar pruebas de rendimiento en el caso de uso propio |
Preguntas frecuentes
¿Es realmente Q4_K_M el punto de equilibrio, o solo popular?
Los dos. En las mediciones de perplexidad publicadas con los k-quants de llama.cpp (LLaMA 7B), Q4_K_M se desvía solo en un 0,9 % respecto al FP16 y consume aproximadamente un 30 % menos de memoria. Q5_K_M baja al 0,2 % de desviación con un 17 % más de memoria, pero rara vez es rentable, a menos que se tenga margen libre.
¿Cuánta VRAM se necesita para un modelo de 70B?
En Q4_K_M, aproximadamente 42 GB para los pesos, más 2 a 3 GB de caché KV a 8K para Llama 3.3 70B (gracias a la atención agrupada). Esto cabe en una tarjeta de 48 GB (RTX 6000 Ada) o en dos tarjetas de 24 GB (2×RTX 3090/4090), con un contexto corto. En Q2_K, los pesos bajan a alrededor de 26 GB, pero la calidad disminuye drásticamente.
GGUF, GPTQ o AWQ: ¿cuál elegir?
GGUF para un uso de un solo usuario en un equipo de trabajo o en Apple Silicon. AWQ para ofrecer un servicio API con procesamiento por lotes en GPU Ada, Hopper o Blackwell. GPTQ sigue siendo una opción histórica que aún funciona en Ampere, pero rara vez es la más rápida en 2026.
¿La cuantización de la caché KV degrada la calidad?
El cache KV en Q8_0 reduce su tamaño por la mitad, con una pérdida generalmente considerada despreciable. En Q4_0, la pérdida se vuelve medible: reservarla para casos en los que sea la única forma de mantener un contexto largo.
¿Los modelos MoE como DeepSeek V3 son diferentes?
Sí. El almacenamiento utiliza el número total de parámetros, por lo que un MoE de 671B siempre necesita cientos de GB incluso en Q4. La velocidad, en cambio, depende de los parámetros activos (37B para DeepSeek V3). Por debajo de Q4, la pérdida de calidad aumenta rápidamente; sin embargo, las cuantizaciones dinámicas (como las de Unsloth para DeepSeek R1, por ejemplo) muestran que un MoE muy grande puede seguir siendo utilizable a 2 bits.
¿Cómo verificar que una cuantización realmente cabe en la VRAM?
Ejecuta nvidia-smi -l 1 durante la generación de 500 tokens. Si el uso de VRAM sube y luego se estabiliza, está bien. Si alcanza un límite y los tokens/seg se desploman, parte del modelo está pasando a la RAM del sistema: baja un nivel de cuantización o reduce el contexto.
¿Quieres ir más allá? El calculador de VRAM calcula la memoria exacta que necesita tu modelo, y nuestra guía Q4 vs Q5 vs Q8 detalla los tests de calidad.