¿Qué LLM usar en una RTX 3090 / 3090 Ti (24 GB)? ?
Una RTX 3090 ofrece 24 GB de VRAM y 936 GB/s de ancho de banda: suficiente para ejecutar en Q4 modelos densos de 27 a 32 mil millones de parámetros (Qwen 3.5 27B, Qwen3 32B, Gemma 4 31B) y modelos con expertos como gpt-oss 20B. La 3090 Ti solo añade un 6 a 8 % de velocidad. Un 70B no cabe en una sola tarjeta.
Con 24 GB, la RTX 3090 y la 3090 Ti mantienen en VRAM un modelo denso de 27 a 32 mil millones de parámetros, lo que no permiten las tarjetas de 12 y 16 GB. Esta guía presenta los modelos que realmente caben, con su peso exacto, las velocidades medidas por Hardware Corner, el efecto del contexto, el límite de potencia que reduce el consumo y los puntos que debes comprobar antes de comprar. También sabrás cuándo preferir una 4090 o una 5090.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 3090 para un LLM local: lo que permiten 24 GB
Para un LLM local, una RTX 3090 destaca ante todo por sus 24 GB de GDDR6X y sus 936 GB/s de ancho de banda: mantiene íntegramente en VRAM modelos de 27 a 32 mil millones de parámetros en Q4, que las tarjetas de 12 y 16 GB no pueden alojar. Según la biblioteca de Ollama, Qwen 3.5 27B ocupa 17 GB, Qwen 3.8 27B 18 GB, y Qwen3 32B y Gemma 4 31B 20 GB. Hardware Corner mide aproximadamente entre 33 y 35 tokens por segundo en estos modelos densos con 4 000 tokens de contexto, y más de 100 en modelos con expertos como gpt-oss 20B. Un modelo de 70B en Q4 (43 GB para Llama 3.3) sigue fuera del alcance de una sola tarjeta. La 3090 Ti solo añade un 8 % de ancho de banda.
- Memoria
- 24 GB de GDDR6X sobre un bus de 384 bits; 936 GB/s para la 3090 y 1.008 GB/s para la 3090 Ti, según la tabla de Wikipedia.
- Consumo
- 350 W de potencia gráfica para la 3090, 450 W para la Ti; se requiere una fuente de alimentación de 750 W para el sistema con la 3090 y de 850 W con la Ti, según NVIDIA.
- Software
- Ollama incluye la RTX 3090 entre las tarjetas de capacidad de cálculo 8.6, compatibles con un controlador 550 o más reciente.
#Los modelos que caben en 24 GB
Los tamaños indicados a continuación corresponden a los archivos de la biblioteca de Ollama, consultados el 29 de septiembre de 2026. El margen es lo que queda de los 24 GB antes de reservar memoria para el contexto, la caché y los búferes del motor: reserva también espacio para el sistema si la tarjeta se encarga de tu pantalla.
| Modelo | Archivo Ollama | Margen bruto | Lo que aporta |
|---|---|---|---|
| gpt-oss 20B | 14 GB | 10 GB | Razonamiento rápido, contexto largo posible |
| Devstral Small 2 24B | 15 GB | 9 GB | Código y agentes |
| Qwen 3.5 27B | 17 GB | 7 GB | Modelo denso y polivalente, texto e imagen |
| Qwen 3.8 27B | 18 GB | 6 GB | Generación reciente, modelo denso de 27B |
| Qwen3-Coder 30B | 19 GB | 5 GB | Código, modelo de mezcla de expertos |
| Gemma 4 26B | 19 GB | 5 GB | Modelo de expertos, alta tasa de generación |
| Qwen3 32B / Gemma 4 31B | 20 GB | 4 GB | Límite superior de los modelos densos |
| Qwen 3.5 35B | 24 GB | 0 GB | No cabe en Q4: contexto imposible |
| Llama 3.3 70B | 43 GB | Faltan 19 GB | Fuera del alcance de una sola tarjeta |
Parte de un modelo denso de 27 mil millones: Qwen 3.5 27B deja 7 GB para el contexto. Por encima de 20 GB, el margen se vuelve demasiado estrecho para un contexto útil. Los modelos con expertos (Qwen3-Coder 30B, Gemma 4 26B, gpt-oss 20B) van mucho más rápido que los densos porque cada token activa solo parte de los pesos.
#Contexto y caché KV: la ventaja de los 24 GB
Ollama establece el contexto por defecto según la memoria de vídeo: su documentación indica 4k tokens por debajo de 24 GiB de VRAM y 32k tokens entre 24 y 48 GiB. Una RTX 3090 se encuentra en el límite: según lo que la tarjeta indique al motor, obtienes 32k o 4k, y un agente lanzado con los ajustes por defecto puede perder su historial sin previo aviso. Comprueba el valor real con ollama ps y configúralo tú mismo para los agentes, para los que la documentación recomienda al menos 64 000 tokens.
La caché KV tiene un coste en memoria: cada token de contexto almacena claves y valores de atención. El principal ajuste es la cuantización de la caché: según la FAQ de Ollama, q8_0 utiliza aproximadamente la mitad de la memoria de f16, con una pérdida de precisión muy baja. El contexto también tiene un coste en velocidad: Hardware Corner pasa de 70 a 52 y luego a 39 tokens por segundo en Qwen3 14B entre 4k, 16k y 32k.
| Modelo (Q4_K, o MXFP4 para gpt-oss) | Generación 4k | Generación 16k | Generación 32k | Lectura del prompt de 4k | Lectura del prompt 32k |
|---|---|---|---|---|---|
| Qwen3 8B | 115,3 | 87,5 | 67,9 | 4 049,6 | 1 714,6 |
| Qwen3 14B | 70,0 | 52,1 | 38,6 | 2 459,0 | 1 175,7 |
| gpt-oss 20B | 147,5 | 128,5 | 112,6 | 4 400,3 | 2 547,2 |
| Qwen3 30B A3B | 153,6 | 113,8 | 87,2 | 2 988,6 | 1 336,8 |
| Qwen 3.5 27B | 33,5 | 32,3 | 31,0 | 1 104,2 | 848,2 |
| Gemma 4 31B | 34,7 | 33,5 | 31,4 | 1 155,8 | 723,7 |
Se distinguen dos comportamientos. Los modelos clásicos como Qwen3 14B pierden casi la mitad de su velocidad entre 4k y 32k. Qwen 3.5 27B, en cambio, solo pierde un 7 % en el mismo rango (33,5 a 31,0). La fuente no da la razón, pero para documentos largos este comportamiento cuenta más que el tamaño del modelo. Estos números provienen de Hardware Corner, no de mediciones de QuelLLM.
#Instalar Ollama y verificar que el modelo cabe
La 3090 es una tarjeta Ampere con capacidad de cálculo 8.6, compatible con Ollama con un controlador NVIDIA 550 o más reciente; en Windows, la documentación requiere la versión 551.61 o posterior. Flash Attention 2, que reduce la memoria del contexto, funciona en Ampere según su repositorio oficial; la versión 3 está reservada para Hopper (H100) y no está disponible en una 3090.
- 01Verificar el controladorEjecuta nvidia-smi en un terminal: la versión del controlador debe ser 550 o superior (551.61 en Windows) y la memoria total debe mostrar aproximadamente 24 GB.
- 02Instalar OllamaInstala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
- 03Iniciar un modelo de 27 mil millonesEjecuta ollama run qwen3.5:27b: la descarga de 17 GB se realiza una sola vez. Para un modelo más rápido, prueba ollama run gpt-oss:20b (14 GB).
- 04Comprobar la distribución de la memoriaEn un segundo terminal, ejecuta ollama ps: la columna Procesador debe mostrar 100 % GPU. Una distribución CPU/GPU significa que parte del modelo o de su contexto se carga en la memoria RAM.
- 05Ajustar el contextoFija el contexto con OLLAMA_CONTEXT_LENGTH y luego vuelve a ejecutar ollama ps. Si falta margen, establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar el servidor.
#Velocidades de generación: lo que realmente permite el ancho de banda
La generación está limitada por el ancho de banda: la GPU vuelve a leer todos los pesos activos para cada token, por lo que el límite teórico equivale aproximadamente al ancho de banda dividido por el peso del modelo. Con 936 GB/s, Qwen3 14B (9,3 GB) tiene un límite de unos 100 tokens por segundo y Hardware Corner mide 70,0 a 4k, es decir, el 70 %. Qwen 3.5 27B (17 GB) tiene un límite de 55 y una velocidad medida de 33,5: el 61 %. Qwen3 32B (20 GB) tiene un límite de 47 y una velocidad medida de 35,1: el 75 %. Un modelo denso de 27B o 32B funciona, por tanto, a entre el 60 y el 75 % de su límite, es decir, entre 33 y 35 tokens por segundo, una velocidad que sigue siendo muy cómoda para la lectura.
El ranking comunitario de llama.cpp confirma la relación entre las dos tarjetas. En Llama 2 7B Q4_0 (3,56 GiB), la 3090 genera 158,16 tokens por segundo sin Flash Attention y 161,89 con ella, frente a 171,19 y 172,26 para la 3090 Ti: un +8 % y un +6 %, coherentes con el 8 % adicional de ancho de banda. Ambas series provienen de colaboradores diferentes, por lo que la diferencia real depende de la máquina.
#Refrigeración, límite de potencia y compra de segunda mano
La 3090 consume 350 W y la Ti 450 W, con temperaturas máximas de la GPU de 93 y 92 °C, respectivamente, según NVIDIA. Bajo una carga sostenida de LLM, el ruido y el calor de la caja importan: prevé una caja bien ventilada y una fuente de alimentación que cumpla los 750 W (3090) o 850 W (Ti) exigidos por NVIDIA. Un LLM utiliza sobre todo la memoria: limitar la potencia apenas reduce la velocidad.
La clasificación de llama.cpp da una idea del orden de magnitud: un colaborador limita su 3090 a 250 W y registra 137,72 tokens por segundo con Llama 2 7B Q4_0, frente a 158,16 en la serie de mediciones con la configuración de fábrica. Es aproximadamente un 13 % menos de velocidad con un 29 % menos de potencia. Las dos mediciones proceden de máquinas diferentes: tómalas como orientación y luego mide en tu propio equipo.
La opción -pl de nvidia-smi fija la potencia máxima en vatios. En Windows, abre el terminal como administrador; el ajuste desaparece al reiniciar mientras no se automatice. En una tarjeta de segunda mano, vigila también la temperatura de la memoria con una herramienta como HWiNFO: si alcanza una temperatura claramente superior a la del núcleo, conviene considerar sustituir las almohadillas térmicas.
#Comprar una 3090 de segunda mano: lo que hay que verificar
La 3090 es una tarjeta Ampere que se encuentra principalmente de segunda mano. Para los precios actuales, consulta nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana, junto con el precio por GB de VRAM.
- Identidad
- Verifica con nvidia-smi que la tarjeta muestre 24 GB y el modelo correcto (3090 o 3090 Ti), no otra referencia.
- Estabilidad
- Ejecuta un modelo de 27 mil millones en bucle durante unos treinta minutos: los fallos, los artefactos o la limitación térmica del rendimiento son señales de alarma.
- Temperatura de memoria
- Compara la temperatura de la memoria con la del núcleo: una diferencia importante indica que las almohadillas térmicas están desgastadas.
- Garantía
- Exige la posibilidad de devolución o una garantía del vendedor: sustituir las almohadillas térmicas o la pasta térmica es un costo que debes prever.
- Alimentación
- 350 W o 450 W de pico: comprueba la fuente de alimentación y los conectores de alimentación de la tarjeta antes de comprar.
#3090, 4090, 5090: ¿qué ganamos pagando más?
La RTX 4090 también ofrece 24 GB, con más capacidad de cálculo: su ventaja está en el procesamiento del prompt más que en la generación, que sigue limitada por el ancho de banda. La RTX 5090 pasa a 32 GB, una categoría en la que un modelo denso de 32B conserva margen para un contexto largo. Las guías de estas dos tarjetas detallan cada caso.
#vLLM, dos tarjetas y fine-tuning en 3090
Tres usos son habituales con la 3090. vLLM funciona: requiere una capacidad de cómputo de 7.5 o superior según su documentación, y la 3090 tiene una de 8.6. Para elegir entre llama.cpp y vLLM, consulta la comparativa de motores. Dos 3090 se pueden combinar con un puente NVLink para las tarjetas de la serie 30: la guía multi-GPU detalla el reparto de las capas.
Para el fine-tuning, Unsloth indica mínimos de VRAM en QLoRA de 4 bits: 6 GB para un modelo de 8 mil millones de parámetros, 8,5 GB para 14 mil millones, 22 GB para 27 mil millones y 26 GB para 32 mil millones. Por tanto, la 3090 permite realizar fine-tuning de modelos de hasta 27B en QLoRA, con muy poco margen, un tamaño de lote de 1 y un contexto corto, pero no de un modelo de 32B. En LoRA de 16 bits, 9 mil millones de parámetros ya requieren 24 GB, es decir, toda la memoria de la tarjeta.
#Veredicto: en qué casos la 3090 sigue siendo una buena opción
| Situación | Decisión | Razón respaldada por cifras |
|---|---|---|
| Quieres un modelo denso de 27B o 32B en local | 3090 (o 4090) | 24 GB: de 17 a 20 GB para los pesos y de 4 a 7 GB de margen |
| Buscas principalmente modelos de 7 a 14 mil millones | Una tarjeta de 12 o 16 GB basta | La 3090 solo aporta velocidad: 936 GB/s |
| Quieres un modelo de 70B o contextos muy largos | 5090 o dos tarjetas | 43 GB de pesos para un 70B Q4 |
| El silencio y el consumo tienen prioridad sobre todo lo demás | Una tarjeta reciente de 16 GB | 750 W de alimentación requerida para la 3090 |
| Estás dudando entre 3090 y 3090 Ti | Elige la más barata de las dos | Solo +6 a +8 % en generación |
La 3090 sigue siendo el punto de entrada más común para un 27B en local: es la conclusión de Hardware Corner, que la considera el mejor punto de entrada de segunda mano para un uso serio. La 4090 la reemplaza si el presupuesto lo permite, y la 5090 si quieres 32 GB.
- Fuente: NVIDIA, especificaciones RTX 3090 y 3090 Ti
- Fuente: Hardware Corner, benchmarks de LLM en RTX 3090
- Fuente: clasificación comunitaria de llama.cpp con CUDA
- Fuente: documentación de Ollama, longitud de contexto
- Fuente: Unsloth, VRAM requerida para el fine-tuning
#Preguntas frecuentes
¿Qué LLM ejecutar en una RTX 3090?+
¿Puede una RTX 3090 ejecutar un 70B?+
¿RTX 3090 o 3090 Ti para un LLM local?+
¿Qué fuente de alimentación se necesita para una RTX 3090?+
¿La RTX 3090 soporta vLLM y Flash Attention?+
¿Se puede realizar un ajuste fino de un modelo en una RTX 3090?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.