Intermedio 13 minRTX 30

¿Qué LLM usar en una RTX 3090 / 3090 Ti (24 GB)? ?

Respuesta directa

Una RTX 3090 ofrece 24 GB de VRAM y 936 GB/s de ancho de banda: suficiente para ejecutar en Q4 modelos densos de 27 a 32 mil millones de parámetros (Qwen 3.5 27B, Qwen3 32B, Gemma 4 31B) y modelos con expertos como gpt-oss 20B. La 3090 Ti solo añade un 6 a 8 % de velocidad. Un 70B no cabe en una sola tarjeta.

Con 24 GB, la RTX 3090 y la 3090 Ti mantienen en VRAM un modelo denso de 27 a 32 mil millones de parámetros, lo que no permiten las tarjetas de 12 y 16 GB. Esta guía presenta los modelos que realmente caben, con su peso exacto, las velocidades medidas por Hardware Corner, el efecto del contexto, el límite de potencia que reduce el consumo y los puntos que debes comprobar antes de comprar. También sabrás cuándo preferir una 4090 o una 5090.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 3090 para un LLM local: lo que permiten 24 GB

Para un LLM local, una RTX 3090 destaca ante todo por sus 24 GB de GDDR6X y sus 936 GB/s de ancho de banda: mantiene íntegramente en VRAM modelos de 27 a 32 mil millones de parámetros en Q4, que las tarjetas de 12 y 16 GB no pueden alojar. Según la biblioteca de Ollama, Qwen 3.5 27B ocupa 17 GB, Qwen 3.8 27B 18 GB, y Qwen3 32B y Gemma 4 31B 20 GB. Hardware Corner mide aproximadamente entre 33 y 35 tokens por segundo en estos modelos densos con 4 000 tokens de contexto, y más de 100 en modelos con expertos como gpt-oss 20B. Un modelo de 70B en Q4 (43 GB para Llama 3.3) sigue fuera del alcance de una sola tarjeta. La 3090 Ti solo añade un 8 % de ancho de banda.

Memoria
24 GB de GDDR6X sobre un bus de 384 bits; 936 GB/s para la 3090 y 1.008 GB/s para la 3090 Ti, según la tabla de Wikipedia.
Consumo
350 W de potencia gráfica para la 3090, 450 W para la Ti; se requiere una fuente de alimentación de 750 W para el sistema con la 3090 y de 850 W con la Ti, según NVIDIA.
Software
Ollama incluye la RTX 3090 entre las tarjetas de capacidad de cálculo 8.6, compatibles con un controlador 550 o más reciente.
i
En internet circula una cifra de ancho de banda de 986 GB/s
Algunas páginas de benchmark citan 986 GB/s para la 3090. El valor derivado del bus de 384 bits y de la memoria a 19,5 Gbit/s es de 936 GB/s (384 × 19,5 ÷ 8), el que aparece en la tabla de Wikipedia. Esa es la cifra que utiliza esta guía.

#Los modelos que caben en 24 GB

Los tamaños indicados a continuación corresponden a los archivos de la biblioteca de Ollama, consultados el 29 de septiembre de 2026. El margen es lo que queda de los 24 GB antes de reservar memoria para el contexto, la caché y los búferes del motor: reserva también espacio para el sistema si la tarjeta se encarga de tu pantalla.

Modelos para RTX 3090 / 3090 Ti (archivos de Ollama, Q4 salvo que se indique lo contrario)
ModeloArchivo OllamaMargen brutoLo que aporta
gpt-oss 20B14 GB10 GBRazonamiento rápido, contexto largo posible
Devstral Small 2 24B15 GB9 GBCódigo y agentes
Qwen 3.5 27B17 GB7 GBModelo denso y polivalente, texto e imagen
Qwen 3.8 27B18 GB6 GBGeneración reciente, modelo denso de 27B
Qwen3-Coder 30B19 GB5 GBCódigo, modelo de mezcla de expertos
Gemma 4 26B19 GB5 GBModelo de expertos, alta tasa de generación
Qwen3 32B / Gemma 4 31B20 GB4 GBLímite superior de los modelos densos
Qwen 3.5 35B24 GB0 GBNo cabe en Q4: contexto imposible
Llama 3.3 70B43 GBFaltan 19 GBFuera del alcance de una sola tarjeta

Parte de un modelo denso de 27 mil millones: Qwen 3.5 27B deja 7 GB para el contexto. Por encima de 20 GB, el margen se vuelve demasiado estrecho para un contexto útil. Los modelos con expertos (Qwen3-Coder 30B, Gemma 4 26B, gpt-oss 20B) van mucho más rápido que los densos porque cada token activa solo parte de los pesos.

#Contexto y caché KV: la ventaja de los 24 GB

Ollama establece el contexto por defecto según la memoria de vídeo: su documentación indica 4k tokens por debajo de 24 GiB de VRAM y 32k tokens entre 24 y 48 GiB. Una RTX 3090 se encuentra en el límite: según lo que la tarjeta indique al motor, obtienes 32k o 4k, y un agente lanzado con los ajustes por defecto puede perder su historial sin previo aviso. Comprueba el valor real con ollama ps y configúralo tú mismo para los agentes, para los que la documentación recomienda al menos 64 000 tokens.

La caché KV tiene un coste en memoria: cada token de contexto almacena claves y valores de atención. El principal ajuste es la cuantización de la caché: según la FAQ de Ollama, q8_0 utiliza aproximadamente la mitad de la memoria de f16, con una pérdida de precisión muy baja. El contexto también tiene un coste en velocidad: Hardware Corner pasa de 70 a 52 y luego a 39 tokens por segundo en Qwen3 14B entre 4k, 16k y 32k.

Lectura del prompt y generación en RTX 3090, tokens por segundo (Hardware Corner, mediciones de terceros)
Modelo (Q4_K, o MXFP4 para gpt-oss)Generación 4kGeneración 16kGeneración 32kLectura del prompt de 4kLectura del prompt 32k
Qwen3 8B115,387,567,94 049,61 714,6
Qwen3 14B70,052,138,62 459,01 175,7
gpt-oss 20B147,5128,5112,64 400,32 547,2
Qwen3 30B A3B153,6113,887,22 988,61 336,8
Qwen 3.5 27B33,532,331,01 104,2848,2
Gemma 4 31B34,733,531,41 155,8723,7

Se distinguen dos comportamientos. Los modelos clásicos como Qwen3 14B pierden casi la mitad de su velocidad entre 4k y 32k. Qwen 3.5 27B, en cambio, solo pierde un 7 % en el mismo rango (33,5 a 31,0). La fuente no da la razón, pero para documentos largos este comportamiento cuenta más que el tamaño del modelo. Estos números provienen de Hardware Corner, no de mediciones de QuelLLM.

#Instalar Ollama y verificar que el modelo cabe

La 3090 es una tarjeta Ampere con capacidad de cálculo 8.6, compatible con Ollama con un controlador NVIDIA 550 o más reciente; en Windows, la documentación requiere la versión 551.61 o posterior. Flash Attention 2, que reduce la memoria del contexto, funciona en Ampere según su repositorio oficial; la versión 3 está reservada para Hopper (H100) y no está disponible en una 3090.

  1. 01
    Verificar el controlador
    Ejecuta nvidia-smi en un terminal: la versión del controlador debe ser 550 o superior (551.61 en Windows) y la memoria total debe mostrar aproximadamente 24 GB.
  2. 02
    Instalar Ollama
    Instala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
  3. 03
    Iniciar un modelo de 27 mil millones
    Ejecuta ollama run qwen3.5:27b: la descarga de 17 GB se realiza una sola vez. Para un modelo más rápido, prueba ollama run gpt-oss:20b (14 GB).
  4. 04
    Comprobar la distribución de la memoria
    En un segundo terminal, ejecuta ollama ps: la columna Procesador debe mostrar 100 % GPU. Una distribución CPU/GPU significa que parte del modelo o de su contexto se carga en la memoria RAM.
  5. 05
    Ajustar el contexto
    Fija el contexto con OLLAMA_CONTEXT_LENGTH y luego vuelve a ejecutar ollama ps. Si falta margen, establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar el servidor.
Comandos básicos
ollama run qwen3.5:27b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Velocidades de generación: lo que realmente permite el ancho de banda

La generación está limitada por el ancho de banda: la GPU vuelve a leer todos los pesos activos para cada token, por lo que el límite teórico equivale aproximadamente al ancho de banda dividido por el peso del modelo. Con 936 GB/s, Qwen3 14B (9,3 GB) tiene un límite de unos 100 tokens por segundo y Hardware Corner mide 70,0 a 4k, es decir, el 70 %. Qwen 3.5 27B (17 GB) tiene un límite de 55 y una velocidad medida de 33,5: el 61 %. Qwen3 32B (20 GB) tiene un límite de 47 y una velocidad medida de 35,1: el 75 %. Un modelo denso de 27B o 32B funciona, por tanto, a entre el 60 y el 75 % de su límite, es decir, entre 33 y 35 tokens por segundo, una velocidad que sigue siendo muy cómoda para la lectura.

El ranking comunitario de llama.cpp confirma la relación entre las dos tarjetas. En Llama 2 7B Q4_0 (3,56 GiB), la 3090 genera 158,16 tokens por segundo sin Flash Attention y 161,89 con ella, frente a 171,19 y 172,26 para la 3090 Ti: un +8 % y un +6 %, coherentes con el 8 % adicional de ancho de banda. Ambas series provienen de colaboradores diferentes, por lo que la diferencia real depende de la máquina.

→
El prompt cuenta tanto como la generación
La lectura del prompt depende del cálculo, no del ancho de banda. En Qwen 3.5 27B, Hardware Corner registra 1.104 tokens por segundo a 4k y 848 a 32k: un documento de 32.000 tokens se lee en unos cuarenta segundos. Para un agente que vuelve a enviar grandes contextos en cada turno, esta demora pesa más que la velocidad de generación.

#Refrigeración, límite de potencia y compra de segunda mano

La 3090 consume 350 W y la Ti 450 W, con temperaturas máximas de la GPU de 93 y 92 °C, respectivamente, según NVIDIA. Bajo una carga sostenida de LLM, el ruido y el calor de la caja importan: prevé una caja bien ventilada y una fuente de alimentación que cumpla los 750 W (3090) o 850 W (Ti) exigidos por NVIDIA. Un LLM utiliza sobre todo la memoria: limitar la potencia apenas reduce la velocidad.

La clasificación de llama.cpp da una idea del orden de magnitud: un colaborador limita su 3090 a 250 W y registra 137,72 tokens por segundo con Llama 2 7B Q4_0, frente a 158,16 en la serie de mediciones con la configuración de fábrica. Es aproximadamente un 13 % menos de velocidad con un 29 % menos de potencia. Las dos mediciones proceden de máquinas diferentes: tómalas como orientación y luego mide en tu propio equipo.

Limitar la potencia (se requiere permiso de administrador)
sudo nvidia-smi -pl 250

La opción -pl de nvidia-smi fija la potencia máxima en vatios. En Windows, abre el terminal como administrador; el ajuste desaparece al reiniciar mientras no se automatice. En una tarjeta de segunda mano, vigila también la temperatura de la memoria con una herramienta como HWiNFO: si alcanza una temperatura claramente superior a la del núcleo, conviene considerar sustituir las almohadillas térmicas.

#Comprar una 3090 de segunda mano: lo que hay que verificar

La 3090 es una tarjeta Ampere que se encuentra principalmente de segunda mano. Para los precios actuales, consulta nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana, junto con el precio por GB de VRAM.

Identidad
Verifica con nvidia-smi que la tarjeta muestre 24 GB y el modelo correcto (3090 o 3090 Ti), no otra referencia.
Estabilidad
Ejecuta un modelo de 27 mil millones en bucle durante unos treinta minutos: los fallos, los artefactos o la limitación térmica del rendimiento son señales de alarma.
Temperatura de memoria
Compara la temperatura de la memoria con la del núcleo: una diferencia importante indica que las almohadillas térmicas están desgastadas.
Garantía
Exige la posibilidad de devolución o una garantía del vendedor: sustituir las almohadillas térmicas o la pasta térmica es un costo que debes prever.
Alimentación
350 W o 450 W de pico: comprueba la fuente de alimentación y los conectores de alimentación de la tarjeta antes de comprar.

#3090, 4090, 5090: ¿qué ganamos pagando más?

La RTX 4090 también ofrece 24 GB, con más capacidad de cálculo: su ventaja está en el procesamiento del prompt más que en la generación, que sigue limitada por el ancho de banda. La RTX 5090 pasa a 32 GB, una categoría en la que un modelo denso de 32B conserva margen para un contexto largo. Las guías de estas dos tarjetas detallan cada caso.

#vLLM, dos tarjetas y fine-tuning en 3090

Tres usos son habituales con la 3090. vLLM funciona: requiere una capacidad de cómputo de 7.5 o superior según su documentación, y la 3090 tiene una de 8.6. Para elegir entre llama.cpp y vLLM, consulta la comparativa de motores. Dos 3090 se pueden combinar con un puente NVLink para las tarjetas de la serie 30: la guía multi-GPU detalla el reparto de las capas.

Para el fine-tuning, Unsloth indica mínimos de VRAM en QLoRA de 4 bits: 6 GB para un modelo de 8 mil millones de parámetros, 8,5 GB para 14 mil millones, 22 GB para 27 mil millones y 26 GB para 32 mil millones. Por tanto, la 3090 permite realizar fine-tuning de modelos de hasta 27B en QLoRA, con muy poco margen, un tamaño de lote de 1 y un contexto corto, pero no de un modelo de 32B. En LoRA de 16 bits, 9 mil millones de parámetros ya requieren 24 GB, es decir, toda la memoria de la tarjeta.

#Veredicto: en qué casos la 3090 sigue siendo una buena opción

Qué decisión tomar según tu situación
SituaciónDecisiónRazón respaldada por cifras
Quieres un modelo denso de 27B o 32B en local3090 (o 4090)24 GB: de 17 a 20 GB para los pesos y de 4 a 7 GB de margen
Buscas principalmente modelos de 7 a 14 mil millonesUna tarjeta de 12 o 16 GB bastaLa 3090 solo aporta velocidad: 936 GB/s
Quieres un modelo de 70B o contextos muy largos5090 o dos tarjetas43 GB de pesos para un 70B Q4
El silencio y el consumo tienen prioridad sobre todo lo demásUna tarjeta reciente de 16 GB750 W de alimentación requerida para la 3090
Estás dudando entre 3090 y 3090 TiElige la más barata de las dosSolo +6 a +8 % en generación

La 3090 sigue siendo el punto de entrada más común para un 27B en local: es la conclusión de Hardware Corner, que la considera el mejor punto de entrada de segunda mano para un uso serio. La 4090 la reemplaza si el presupuesto lo permite, y la 5090 si quieres 32 GB.

#Preguntas frecuentes

FAQ
¿Qué LLM ejecutar en una RTX 3090?+
Empieza por Qwen 3.5 27B: su archivo Ollama de 17 GB deja aproximadamente 7 GB de margen para el contexto y genera alrededor de 33 tokens por segundo según Hardware Corner. Para mayor velocidad, gpt-oss 20B (14 GB) supera los 100 tokens por segundo. Qwen3 32B y Gemma 4 31B (20 GB) son el límite superior.
¿Puede una RTX 3090 ejecutar un 70B?+
No, no completamente. Llama 3.3 70B pesa 43 GB en Ollama, es decir, 19 GB más que la capacidad de la tarjeta. Al repartirlo entre la VRAM y la RAM, se vuelve muy lento, porque cada token vuelve a leer todos los pesos. Para alojar un 70B en VRAM, se necesitan dos tarjetas de 24 GB o una tarjeta de más de 43 GB.
¿RTX 3090 o 3090 Ti para un LLM local?+
Son casi equivalentes: la misma memoria de 24 GB, 936 frente a 1.008 GB/s de ancho de banda y una mejora del 6 al 8 % en la generación según la clasificación de llama.cpp. La Ti consume 450 W frente a 350 W. Salvo que la diferencia de precio sea mínima, la 3090 es la mejor opción.
¿Qué fuente de alimentación se necesita para una RTX 3090?+
NVIDIA indica que se requiere una fuente de alimentación de 750 W para el sistema con una 3090 (350 W de potencia gráfica) y de 850 W con una 3090 Ti (450 W). Estos valores corresponden a un PC completo. Limitar la tarjeta a 250 W reduce su consumo a cambio de aproximadamente un 13 % menos de velocidad, según una medición de la comunidad.
¿La RTX 3090 soporta vLLM y Flash Attention?+
Sí a los dos. vLLM requiere una capacidad de cálculo de 7.5 o más y la 3090 tiene 8.6. Flash Attention 2 funciona en las GPU Ampere, incluida la 3090, según su repositorio oficial. Flash Attention 3, en cambio, está reservado para Hopper: no lo busques en una tarjeta Ampere de consumo.
¿Se puede realizar un ajuste fino de un modelo en una RTX 3090?+
Sí, en QLoRA. Según Unsloth, el mínimo es de 22 GB para un 27B y de 8,5 GB para un 14B, lo que hace que el 27B sea apenas posible con un lote de 1. Un 32B requiere 26 GB y no cabe. En LoRA de 16 bits, el límite práctico está alrededor de 9 mil millones.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.