¿Qué LLM para 24 GB de VRAM? ?
Con 24 GB de VRAM, carga un modelo denso de 27 mil millones en Q4 como Qwen 3.8 27B (16 GB de pesos, 8 GB de margen) o un modelo MoE de 30 a 35 mil millones (19 a 21 GB). Un modelo denso de 70B en Q4 (aproximadamente 40 GB) no cabe: requiere dos tarjetas o memoria unificada.
Veinticuatro gigabytes de VRAM son el umbral para los modelos de 27 a 35 mil millones de parámetros. Esta guía explica qué modelos caben, qué tarjetas tienen realmente 24 GB, qué velocidad máxima permite su ancho de banda y hasta dónde se puede llegar con el fine-tuning.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#24 GB de VRAM: el umbral de los modelos de 27 a 35 mil millones
Con 24 GB de VRAM, cargas por completo en memoria un modelo denso de 27 mil millones de parámetros en Q4 (16 GB de pesos según el catálogo QuelLLM) con 8 GB de margen para el contexto, o un modelo MoE de 30 a 35 mil millones de parámetros, de los cuales 3 mil millones están activos (19 a 21 GB), con un contexto más corto. Un 70B denso en Q4 pesa aproximadamente 40 GB: no cabe y requiere dos tarjetas o memoria unificada. El umbral de 24 GB es el punto en el que se pasa de modelos de 9 a 14 mil millones de parámetros a modelos que rivalizan con los grandes modelos de ayer.
| Modelo | Pesos Q4 | Margen disponible con 24 GB | Nota |
|---|---|---|---|
| gpt-oss 20B (MoE) | 13 GB | 11 GB | Muy amplio, contexto largo |
| Devstral Small 2 24B | 14 GB | 10 GB | Agente de código |
| Qwen 3.8 27B | 16 GB | 8 GB | Denso, generalista, contexto anunciado de 262.144 tokens |
| Gemma 4 31B | 18 GB | 6 GB | Denso, Q5 con 22 GB deja demasiado poco margen |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 5 GB | Código, 3 mil millones de parámetros activos |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 3 GB | Contexto corto, cabe por muy poco |
| Qwen 3.8 27B en Q8 | 29 GB | No | Supera la capacidad |
Una corrección respecto a una versión anterior de esta guía: a veces indicaba 18 GB y otras 16 GB para Qwen 3.8 27B, y 23 GB para Qwen 3.6 35B-A3B. El catálogo indica 16 GB y 21 GB. Estas cifras corresponden al tamaño redondeado de los pesos en Q4; añade siempre la caché KV y aproximadamente un gigabyte de margen.
#¿Qué tarjetas tienen 24 GB y cuál es la diferencia?
Tres tarjetas para el mercado de consumo dominan este nivel. NVIDIA describe la RTX 3090 con 24 GB de GDDR6X y la RTX 4090 con 24 GB de GDDR6X. AMD indica 24 GB de GDDR6 y un ancho de banda de hasta 960 GB/s para la RX 7900 XTX. La RTX 5090, con 32 GB de GDDR7 en un bus de 512 bits según NVIDIA, pertenece al nivel superior. No las confundas con la RX 7900 XT, que tiene 20 GB: la tabla de rendimiento de llama.cpp la incluye con 20 GB de GDDR6.
| Tarjeta | Software | Preferible si | Guide |
|---|---|---|---|
| RTX 3090 / 3090 Ti | CUDA | Quieres CUDA y un precio de entrada moderado en el mercado de segunda mano | LLM en RTX 3090 |
| RTX 4090 | CUDA | Quieres CUDA en una arquitectura más reciente | LLM en RTX 4090 |
| RX 7900 XTX | ROCm 7 o Vulkan | Usas Linux y aceptas ROCm | Modelo LLM en RX 7900 XTX |
La elección depende de tres criterios: el ecosistema de software, la antigüedad de la tarjeta (estado, garantía) y el precio del día, que no dejamos fijado. El seguimiento de precios del sitio indica el coste por gigabyte de VRAM, actualizado dos veces por semana; es el indicador adecuado para decidir entre una tarjeta de segunda mano de 24 GB y una nueva de 16 GB.
#¿Qué modelo elegir con 24 GB según el uso?
| Uso | Modelo | Por qué |
|---|---|---|
| Generalista polivalente | Qwen 3.8 27B Q4 | Denso, 8 GB de margen para el contexto |
| Velocidad y razonamiento | gpt-oss 20B | MoE ligero, 11 GB de margen |
| Código y agentes de desarrollo | Devstral Small 2 24B o Qwen3-Coder 30B-A3B | 14 o 19 GB, contexto según el margen |
| Modelo MoE más grande | Qwen 3.6 35B-A3B Q4 | 21 GB, 3 mil millones de parámetros activos, contexto corto |
| Agentes y llamadas a herramientas | GLM 4.7 Flash Q4 | 19 GB, licencia MIT según el catálogo |
La elección entre un modelo denso y uno MoE es la decisión clave en este nivel. Un modelo denso de 27 mil millones lee todos sus pesos en cada token: es más lento que un MoE, pero deja más VRAM disponible para el contexto. Un modelo MoE de 35 mil millones solo lee sus parámetros activos, por lo que genera más rápido, pero su peso total ocupa casi toda la tarjeta. La guía sobre los MoE explica el mecanismo.
#¿Y el 70B? Lo que realmente permiten 24 GB
Los pesos de un modelo denso de 70B en Q4 ocupan unos 40 GB según la referencia del sitio: superan los 24 GB en al menos 16 GB. Habría que trasladar esa parte a la memoria RAM, y la generación se realizaría entonces a la velocidad de la RAM y del bus PCIe, no a la de la tarjeta. No damos una velocidad de generación para este caso por falta de una fuente verificable: ten presente que es demasiado lento para un uso interactivo cómodo. Los MoE de 30 a 35 mil millones de parámetros son, a igualdad de calidad, la respuesta práctica a esta limitación.
- Una sola tarjeta de 24 GB
- MoE 30-35B en Q4, denso 27-31B en Q4 o Q5, con 3 a 8 GB para el contexto.
- Dos tarjetas de 24 GB (48 GB)
- 70B en Q4 (aproximadamente 40 GB) con un poco de contexto, distribuyendo las capas entre las tarjetas.
- Una tarjeta de 32 GB
- La RTX 5090: un modelo de 70B en Q4 sigue sin caber por completo en una sola tarjeta, pero los modelos densos de 27 a 32 mil millones de parámetros caben con holgura.
En llama.cpp, el modo de distribución predeterminado reparte el modelo por capas entre las tarjetas, en pipeline, con proporciones ajustables por tarjeta. La mejora afecta a la capacidad, no a la velocidad por token, ya que las tarjetas trabajan una tras otra.
#Velocidad: el límite que fija el ancho de banda
Durante la generación, se lee la mayor parte de los pesos de un modelo denso para cada token: el límite teórico es el ancho de banda dividido por el tamaño de los pesos. La ficha de AMD indica 960 GB/s para la RX 7900 XTX; para las tarjetas NVIDIA, consulta el ancho de banda en la ficha del modelo exacto. La tabla indica el límite por cada 100 GB/s para los modelos densos; los MoE leen menos pesos por token y son más rápidos.
| Modelo en Q4 | Pesos leídos | Por cada 100 GB/s | Ejemplo 960 GB/s (7900 XTX) |
|---|---|---|---|
| Devstral Small 2 24B | 14 GB | ≈ 7 tokens/s | ≈ 69 tokens/s |
| Qwen 3.8 27B | 16 GB | ≈ 6 tokens/s | 60 tokens/s |
| Gemma 4 31B | 18 GB | ≈ 5,6 tokens/s | ≈ 53 tokens/s |
Estos valores son límites máximos, nunca mediciones: la velocidad real es menor y varía según el controlador, el software y el contexto. No publicamos cifras de tokens por segundo para cada tarjeta porque no disponemos de un banco de pruebas público comparable para estos modelos. Para medir tu propia instalación, ejecuta ollama run con la opción --verbose.
#El contexto: el verdadero límite con 24 GB
Con 24 GB, la caché KV determina la longitud de contexto utilizable. Un Qwen 3.8 27B en Q4 deja 8 GB, y un Qwen 3.6 35B-A3B solo 3 GB. Ollama usa por defecto un contexto de 4.096 tokens según su documentación, modificable con OLLAMA_CONTEXT_LENGTH. Para ahorrar espacio, cuantiza la caché: OLLAMA_KV_CACHE_TYPE=q8_0 utiliza aproximadamente la mitad de la memoria del f16 por defecto, siempre que Flash Attention esté activada.
#Cálculo de margen en tres líneas
Para saber si un modelo y su contexto caben en la memoria, suma tres términos: el peso del catálogo, la caché KV y aproximadamente un gigabyte de margen. Tomemos dos ejemplos con los pesos del catálogo. Un Qwen 3.8 27B en Q5 pesa 19 GB: quedan 24 menos 19 menos 1, es decir, 4 GB para la caché KV. Un Qwen 3.6 35B-A3B en Q4 pesa 21 GB: quedan 24 menos 21 menos 1, es decir, solo 2 GB, por lo que el contexto será corto, a menos que cuantices la caché. El mismo 27B en Q4 (16 GB) libera 7 GB, lo que permite un contexto mucho más largo.
Este cálculo explica una elección habitual: preferir la cuantización Q4 a Q5 cuando el contexto es la prioridad, y Q5 a Q4 cuando trabajas con textos cortos y la fidelidad del modelo importa. La guía sobre la elección de cuantización detalla las diferencias de calidad, y la guía sobre la caché KV, el ahorro de espacio.
#Comprar una tarjeta de 24 GB de segunda mano: las comprobaciones que hay que hacer
Las tarjetas de 24 GB más comunes datan de 2020 a 2022: muchas se venden de segunda mano y algunas han funcionado durante largos periodos sin interrupción. Antes de comprar, pide una captura de una prueba de carga, comprueba la temperatura de la memoria durante esa prueba y revisa el ruido de los ventiladores. Asegúrate de que el controlador indique realmente la capacidad anunciada de 24 GB, de que tu fuente de alimentación soporte el consumo de la tarjeta y de que quede espacio en la caja. Los precios de estas tarjetas cambian de una semana a otra: el seguimiento de precios del sitio permite comparar cuánto cuesta cada gigabyte de VRAM en tarjetas nuevas y de segunda mano.
#Fine-tuning con 24 GB: lo que funciona, lo que no funciona
La documentación de Unsloth publica una tabla de VRAM mínima por tamaño de modelo y por método, especificando que se trata de mínimos absolutos. En QLoRA (4 bits), un modelo de 7B requiere 5 GB, uno de 14B 8,5 GB y uno de 27B 22 GB. En LoRA de 16 bits, un modelo de 8B requiere 22 GB y uno de 14B 33 GB. Con 24 GB, hay margen suficiente para aplicar QLoRA a un modelo de hasta 14 mil millones de parámetros; uno de 27B apenas cabe, sin margen, y aplicar LoRA de 16 bits a uno de 14B es imposible.
| Modelo | QLoRA (4 bits) | LoRA (16 bits) | Con 24 GB |
|---|---|---|---|
| 7B | 5 GB | 19 GB | QLoRA y LoRA |
| 9B | 6,5 GB | 24 GB | QLoRA; LoRA sin margen |
| 14B | 8,5 GB | 33 GB | Solo QLoRA |
| 27B | 22 GB | 64 GB | QLoRA al límite |
| 32B | 26 GB | 76 GB | No |
| 70B | 41 GB | 164 GB | No |
- ¿Qué LLM para 32 GB de VRAM?
- ¿Qué LLM para 16 GB de VRAM?
- LLM en RTX 3090 / 3090 Ti (24 GB)
- LLM en RX 7900 XTX (24 GB)
- MoE explicado: por qué un 30B-A3B funciona como un modelo pequeño
- Precios de las tarjetas gráficas para IA local
- Fuente: requisitos de VRAM de Unsloth
- Fuente: Preguntas frecuentes de Ollama (contexto, caché KV)
- Fuente: ficha NVIDIA de la RTX 4090
- Fuente: ficha AMD de la RX 7900 XTX
#Preguntas frecuentes
¿Cuál es el mejor LLM para 24 GB de VRAM?+
Con 24 GB, ¿sigue teniendo sentido optar por un 70B?+
¿RTX 3090, RTX 4090 o RX 7900 XTX para 24 GB?+
¿Cuántos tokens por segundo con 24 GB?+
¿24 GB son suficientes para el fine-tuning?+
¿Se pueden usar dos tarjetas de 24 GB juntas?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.