Intermedio 11 minPor VRAM

¿Qué LLM para 24 GB de VRAM? ?

Respuesta directa

Con 24 GB de VRAM, carga un modelo denso de 27 mil millones en Q4 como Qwen 3.8 27B (16 GB de pesos, 8 GB de margen) o un modelo MoE de 30 a 35 mil millones (19 a 21 GB). Un modelo denso de 70B en Q4 (aproximadamente 40 GB) no cabe: requiere dos tarjetas o memoria unificada.

Veinticuatro gigabytes de VRAM son el umbral para los modelos de 27 a 35 mil millones de parámetros. Esta guía explica qué modelos caben, qué tarjetas tienen realmente 24 GB, qué velocidad máxima permite su ancho de banda y hasta dónde se puede llegar con el fine-tuning.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#24 GB de VRAM: el umbral de los modelos de 27 a 35 mil millones

Con 24 GB de VRAM, cargas por completo en memoria un modelo denso de 27 mil millones de parámetros en Q4 (16 GB de pesos según el catálogo QuelLLM) con 8 GB de margen para el contexto, o un modelo MoE de 30 a 35 mil millones de parámetros, de los cuales 3 mil millones están activos (19 a 21 GB), con un contexto más corto. Un 70B denso en Q4 pesa aproximadamente 40 GB: no cabe y requiere dos tarjetas o memoria unificada. El umbral de 24 GB es el punto en el que se pasa de modelos de 9 a 14 mil millones de parámetros a modelos que rivalizan con los grandes modelos de ayer.

Lo que 24 GB pueden albergar (peso del catálogo QuelLLM, Q4 salvo indicación)
ModeloPesos Q4Margen disponible con 24 GBNota
gpt-oss 20B (MoE)13 GB11 GBMuy amplio, contexto largo
Devstral Small 2 24B14 GB10 GBAgente de código
Qwen 3.8 27B16 GB8 GBDenso, generalista, contexto anunciado de 262.144 tokens
Gemma 4 31B18 GB6 GBDenso, Q5 con 22 GB deja demasiado poco margen
Qwen3-Coder 30B-A3B (MoE)19 GB5 GBCódigo, 3 mil millones de parámetros activos
Qwen 3.6 35B-A3B (MoE)21 GB3 GBContexto corto, cabe por muy poco
Qwen 3.8 27B en Q829 GBNoSupera la capacidad

Una corrección respecto a una versión anterior de esta guía: a veces indicaba 18 GB y otras 16 GB para Qwen 3.8 27B, y 23 GB para Qwen 3.6 35B-A3B. El catálogo indica 16 GB y 21 GB. Estas cifras corresponden al tamaño redondeado de los pesos en Q4; añade siempre la caché KV y aproximadamente un gigabyte de margen.

#¿Qué tarjetas tienen 24 GB y cuál es la diferencia?

Tres tarjetas para el mercado de consumo dominan este nivel. NVIDIA describe la RTX 3090 con 24 GB de GDDR6X y la RTX 4090 con 24 GB de GDDR6X. AMD indica 24 GB de GDDR6 y un ancho de banda de hasta 960 GB/s para la RX 7900 XTX. La RTX 5090, con 32 GB de GDDR7 en un bus de 512 bits según NVIDIA, pertenece al nivel superior. No las confundas con la RX 7900 XT, que tiene 20 GB: la tabla de rendimiento de llama.cpp la incluye con 20 GB de GDDR6.

Tres formas de obtener 24 GB
TarjetaSoftwarePreferible siGuide
RTX 3090 / 3090 TiCUDAQuieres CUDA y un precio de entrada moderado en el mercado de segunda manoLLM en RTX 3090
RTX 4090CUDAQuieres CUDA en una arquitectura más recienteLLM en RTX 4090
RX 7900 XTXROCm 7 o VulkanUsas Linux y aceptas ROCmModelo LLM en RX 7900 XTX

La elección depende de tres criterios: el ecosistema de software, la antigüedad de la tarjeta (estado, garantía) y el precio del día, que no dejamos fijado. El seguimiento de precios del sitio indica el coste por gigabyte de VRAM, actualizado dos veces por semana; es el indicador adecuado para decidir entre una tarjeta de segunda mano de 24 GB y una nueva de 16 GB.

#¿Qué modelo elegir con 24 GB según el uso?

Un punto de partida por uso
UsoModeloPor qué
Generalista polivalenteQwen 3.8 27B Q4Denso, 8 GB de margen para el contexto
Velocidad y razonamientogpt-oss 20BMoE ligero, 11 GB de margen
Código y agentes de desarrolloDevstral Small 2 24B o Qwen3-Coder 30B-A3B14 o 19 GB, contexto según el margen
Modelo MoE más grandeQwen 3.6 35B-A3B Q421 GB, 3 mil millones de parámetros activos, contexto corto
Agentes y llamadas a herramientasGLM 4.7 Flash Q419 GB, licencia MIT según el catálogo

La elección entre un modelo denso y uno MoE es la decisión clave en este nivel. Un modelo denso de 27 mil millones lee todos sus pesos en cada token: es más lento que un MoE, pero deja más VRAM disponible para el contexto. Un modelo MoE de 35 mil millones solo lee sus parámetros activos, por lo que genera más rápido, pero su peso total ocupa casi toda la tarjeta. La guía sobre los MoE explica el mecanismo.

#¿Y el 70B? Lo que realmente permiten 24 GB

Los pesos de un modelo denso de 70B en Q4 ocupan unos 40 GB según la referencia del sitio: superan los 24 GB en al menos 16 GB. Habría que trasladar esa parte a la memoria RAM, y la generación se realizaría entonces a la velocidad de la RAM y del bus PCIe, no a la de la tarjeta. No damos una velocidad de generación para este caso por falta de una fuente verificable: ten presente que es demasiado lento para un uso interactivo cómodo. Los MoE de 30 a 35 mil millones de parámetros son, a igualdad de calidad, la respuesta práctica a esta limitación.

Una sola tarjeta de 24 GB
MoE 30-35B en Q4, denso 27-31B en Q4 o Q5, con 3 a 8 GB para el contexto.
Dos tarjetas de 24 GB (48 GB)
70B en Q4 (aproximadamente 40 GB) con un poco de contexto, distribuyendo las capas entre las tarjetas.
Una tarjeta de 32 GB
La RTX 5090: un modelo de 70B en Q4 sigue sin caber por completo en una sola tarjeta, pero los modelos densos de 27 a 32 mil millones de parámetros caben con holgura.

En llama.cpp, el modo de distribución predeterminado reparte el modelo por capas entre las tarjetas, en pipeline, con proporciones ajustables por tarjeta. La mejora afecta a la capacidad, no a la velocidad por token, ya que las tarjetas trabajan una tras otra.

#Velocidad: el límite que fija el ancho de banda

Durante la generación, se lee la mayor parte de los pesos de un modelo denso para cada token: el límite teórico es el ancho de banda dividido por el tamaño de los pesos. La ficha de AMD indica 960 GB/s para la RX 7900 XTX; para las tarjetas NVIDIA, consulta el ancho de banda en la ficha del modelo exacto. La tabla indica el límite por cada 100 GB/s para los modelos densos; los MoE leen menos pesos por token y son más rápidos.

Límite teórico de modelos densos por tramos de 100 GB/s
Modelo en Q4Pesos leídosPor cada 100 GB/sEjemplo 960 GB/s (7900 XTX)
Devstral Small 2 24B14 GB≈ 7 tokens/s≈ 69 tokens/s
Qwen 3.8 27B16 GB≈ 6 tokens/s60 tokens/s
Gemma 4 31B18 GB≈ 5,6 tokens/s≈ 53 tokens/s

Estos valores son límites máximos, nunca mediciones: la velocidad real es menor y varía según el controlador, el software y el contexto. No publicamos cifras de tokens por segundo para cada tarjeta porque no disponemos de un banco de pruebas público comparable para estos modelos. Para medir tu propia instalación, ejecuta ollama run con la opción --verbose.

#El contexto: el verdadero límite con 24 GB

Con 24 GB, la caché KV determina la longitud de contexto utilizable. Un Qwen 3.8 27B en Q4 deja 8 GB, y un Qwen 3.6 35B-A3B solo 3 GB. Ollama usa por defecto un contexto de 4.096 tokens según su documentación, modificable con OLLAMA_CONTEXT_LENGTH. Para ahorrar espacio, cuantiza la caché: OLLAMA_KV_CACHE_TYPE=q8_0 utiliza aproximadamente la mitad de la memoria del f16 por defecto, siempre que Flash Attention esté activada.

Contexto de 32k con caché KV en q8_0
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=32768 ollama serve
ollama ps

#Cálculo de margen en tres líneas

Para saber si un modelo y su contexto caben en la memoria, suma tres términos: el peso del catálogo, la caché KV y aproximadamente un gigabyte de margen. Tomemos dos ejemplos con los pesos del catálogo. Un Qwen 3.8 27B en Q5 pesa 19 GB: quedan 24 menos 19 menos 1, es decir, 4 GB para la caché KV. Un Qwen 3.6 35B-A3B en Q4 pesa 21 GB: quedan 24 menos 21 menos 1, es decir, solo 2 GB, por lo que el contexto será corto, a menos que cuantices la caché. El mismo 27B en Q4 (16 GB) libera 7 GB, lo que permite un contexto mucho más largo.

Este cálculo explica una elección habitual: preferir la cuantización Q4 a Q5 cuando el contexto es la prioridad, y Q5 a Q4 cuando trabajas con textos cortos y la fidelidad del modelo importa. La guía sobre la elección de cuantización detalla las diferencias de calidad, y la guía sobre la caché KV, el ahorro de espacio.

#Comprar una tarjeta de 24 GB de segunda mano: las comprobaciones que hay que hacer

Las tarjetas de 24 GB más comunes datan de 2020 a 2022: muchas se venden de segunda mano y algunas han funcionado durante largos periodos sin interrupción. Antes de comprar, pide una captura de una prueba de carga, comprueba la temperatura de la memoria durante esa prueba y revisa el ruido de los ventiladores. Asegúrate de que el controlador indique realmente la capacidad anunciada de 24 GB, de que tu fuente de alimentación soporte el consumo de la tarjeta y de que quede espacio en la caja. Los precios de estas tarjetas cambian de una semana a otra: el seguimiento de precios del sitio permite comparar cuánto cuesta cada gigabyte de VRAM en tarjetas nuevas y de segunda mano.

#Fine-tuning con 24 GB: lo que funciona, lo que no funciona

La documentación de Unsloth publica una tabla de VRAM mínima por tamaño de modelo y por método, especificando que se trata de mínimos absolutos. En QLoRA (4 bits), un modelo de 7B requiere 5 GB, uno de 14B 8,5 GB y uno de 27B 22 GB. En LoRA de 16 bits, un modelo de 8B requiere 22 GB y uno de 14B 33 GB. Con 24 GB, hay margen suficiente para aplicar QLoRA a un modelo de hasta 14 mil millones de parámetros; uno de 27B apenas cabe, sin margen, y aplicar LoRA de 16 bits a uno de 14B es imposible.

VRAM mínima de fine-tuning según Unsloth
ModeloQLoRA (4 bits)LoRA (16 bits)Con 24 GB
7B5 GB19 GBQLoRA y LoRA
9B6,5 GB24 GBQLoRA; LoRA sin margen
14B8,5 GB33 GBSolo QLoRA
27B22 GB64 GBQLoRA al límite
32B26 GB76 GBNo
70B41 GB164 GBNo
!
Error corregido: el QLoRA 70B no cabe en 24 GB
Una versión anterior de esta guía afirmaba que el QLoRA de un 70B cabía «muy justo» en 22-23 GB. Unsloth indica un mínimo de 41 GB en QLoRA para un 70B, y 22 GB para un 27B. El 70B requiere por tanto al menos dos tarjetas de 24 GB, o una tarjeta de mayor capacidad.

#Preguntas frecuentes

Preguntas frecuentes
¿Cuál es el mejor LLM para 24 GB de VRAM?+
Para un modelo generalista, Qwen 3.8 27B en Q4: 16 GB de peso según el catálogo QuelLLM, por lo tanto 8 GB de margen para el contexto. Para la velocidad, gpt-oss 20B (13 GB). Para el código, Devstral Small 2 24B (14 GB) o Qwen3-Coder 30B-A3B (19 GB). Para un gran MoE, Qwen 3.6 35B-A3B (21 GB), con un contexto corto.
Con 24 GB, ¿sigue teniendo sentido optar por un 70B?+
No. Un modelo denso de 70B en Q4 pesa aproximadamente 40 GB: al menos 16 GB deben alojarse en la memoria RAM, y la velocidad resulta demasiado baja para un uso interactivo. Un modelo MoE de 30 a 35 mil millones de parámetros cabe en la tarjeta. Para un modelo de 70B, prevé dos tarjetas de 24 GB, es decir, 48 GB.
¿RTX 3090, RTX 4090 o RX 7900 XTX para 24 GB?+
Las tres tienen 24 GB. La elección depende del ecosistema: CUDA para las dos RTX, ROCm 7 o Vulkan para la RX 7900 XTX, y del precio del día, que no fijamos. Consulta el seguimiento de precios del sitio, que calcula el coste por gigabyte de VRAM.
¿Cuántos tokens por segundo con 24 GB?+
Depende del modelo y de la tarjeta. Para un modelo denso, el límite teórico es el ancho de banda dividido entre el tamaño de los pesos: aproximadamente 60 tokens/s para un modelo de 27B cuyos pesos ocupan 16 GB, con un ancho de banda de 960 GB/s; ese límite nunca se alcanza exactamente. No publicamos mediciones por tarjeta; ollama run con --verbose te da la tuya.
¿24 GB son suficientes para el fine-tuning?+
Para el QLoRA de un modelo de hasta 14 mil millones de parámetros, sí, de sobra: Unsloth indica un mínimo de 8,5 GB para un 14B. Un 27B requiere 22 GB, justo al límite. El LoRA en 16 bits de un 14B (33 GB) y el QLoRA de un 70B (41 GB) no caben en 24 GB.
¿Se pueden usar dos tarjetas de 24 GB juntas?+
Sí, con llama.cpp, cuyo modo predeterminado distribuye las capas y la caché KV entre las GPU. Obtienes 48 GB, suficientes para un 70B en Q4, pero la velocidad por token no se duplica, ya que las tarjetas trabajan en pipeline. Prevé la alimentación y la refrigeración para dos tarjetas.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.