Intermedio 11 minRTX 30

¿Qué LLM en RTX 3080 / 3080 Ti (10-12 GB)? ?

Respuesta directa

Para un LLM local, una RTX 3080 o 3080 Ti de 12 GB ejecuta Qwen 3.5 9B en Q8 (10 GB) y Gemma 4 12B en Q4 (7 GB) con margen, a aproximadamente 140 tokens/s en un 7B: la RTX 3080 de 10 GB alcanza 139,7 en la prueba de llama.cpp. La versión de 10 GB se limita a los 8-9B en Q4. Ninguna de las tres carga un 20B en Q4 (13 GB) sin trasladar parte del modelo a la RAM.

Tres tarjetas llevan el nombre de RTX 3080: la de 10 GB de septiembre de 2020, la de 12 GB de enero de 2022 y la 3080 Ti de 12 GB de junio de 2021. Tienen el mismo chip, pero no la misma memoria, y es esta última la que determina qué puedes ejecutar. Esta guía se basa en una medición pública para la velocidad y en las fichas oficiales para la capacidad.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5080 16 GB.

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 3080 y 3080 Ti para un LLM local: las tres variantes

Una RTX 3080 o una 3080 Ti de 12 GB ejecuta cómodamente un modelo de 12 mil millones de parámetros en Q4 o un modelo de 9 mil millones en Q8; la versión de 10 GB se limita a modelos de 7 a 9 mil millones en Q4. Según el catálogo QuelLLM, Gemma 4 12B pesa 7 GB en Q4 y 9 GB en Q5; Qwen 3.5 9B pesa 6 GB en Q4 y 10 GB en Q8, lo que requiere al menos 12 GB en cuanto se añade contexto. En cuanto a velocidad, estas tarjetas se encuentran entre las más rápidas de las generaciones anteriores: la 3080 de 10 GB genera 139,7 tokens por segundo con un modelo de 7 mil millones en Q4_0 según la tabla pública de llama.cpp, casi el doble que la RTX 3060 de 12 GB (75,6). La elección de una RTX 3080 para un LLM depende, por tanto, de la memoria, nunca de la velocidad.

RTX 3080 10 GB
Septiembre de 2020, 8.704 núcleos CUDA, 10 GB de GDDR6X en un bus de 320 bits, es decir, 760 GB/s. Potencia de la tarjeta de 320 W.
RTX 3080 12 GB
Enero 2022, 8 960 núcleos, 12 GB de GDDR6X en bus de 384 bits, es decir, 912 GB/s, 350 W. Aproximadamente un 20 % más de ancho de banda.
RTX 3080 Ti
Junio de 2021, 10 240 núcleos, 12 GB de GDDR6X en un bus de 384 bits como la 3080 de 12 GB, por lo que se espera un ancho de banda idéntico, 350 W.

El cálculo del límite ayuda a entenderlo: la generación de texto lee los pesos en cada token, por lo que el ancho de banda determina la velocidad máxima. Las 3080 de 12 GB y las Ti tienen un 20 % más de ancho de banda que la de 10 GB, pero la 3080 Ti añade sobre todo núcleos de cálculo, que aceleran la lectura del prompt más que la generación.

#3080 10 GB, 12 GB o 3080 Ti: ¿qué elegir?

Las tres RTX 3080
Criterio3080 10 GB3080 12 GB3080 Ti 12 GB
Núcleos CUDA8 7048 96010 240
Memoria10 GB GDDR6X12 GB GDDR6X12 GB GDDR6X
Bus / ancho de banda320 bits / 760 GB/s384 bits / 912 GB/s384 bits, mismo ancho de banda esperado
Potencia de la tarjeta320 W350 W350 W
Generación en Llama 2 7B Q4_0139,7 tok/s (medición)estimación: hasta aproximadamente 167estimación: similar a la versión de 12 GB

Para la IA local, la 3080 Ti y la 3080 de 12 GB son intercambiables: los mismos 12 GB, el mismo bus y una velocidad de generación muy similar. La estimación para estas dos tarjetas es un límite superior que aplica a 912 GB/s el rendimiento medido de la versión de 10 GB: en la práctica, la 3090, cuyo bus también es de 384 bits, registra 158,2 tokens por segundo. Así que elige la más barata de las dos, sin dejarte guiar por el número de núcleos. La versión de 10 GB, en cambio, está un escalón por debajo por su capacidad: sus 10 GB no permiten ejecutar modelos de 9 mil millones de parámetros en Q8.

#Modelos compatibles según la memoria

Lo que cabe en 10 GB y en 12 GB (peso según el catálogo QuelLLM)
Modelo y cuantizaciónTamaño del modelo3080 10 GB3080 12 GB / Ti
Qwen 3.5 9B en Q46 GBSí, con contextoSí, con mucho contexto
Gemma 4 12B en Q47 GBSí, contexto moderadoSí, cómodo
Gemma 4 12B en Q59 GBMuy ajustadoSí, contexto moderado
Qwen 3.5 9B en Q810 GBNoSí, pero con poco contexto
gpt-oss 20B en Q413 GBNoNo: excede la capacidad en 1 GB

Dos puntos de esta tabla merecen atención. Primero, la 3080 de 10 GB puede ejecutar Gemma 4 12B en Q4 (7 GB), pese a lo que podría parecer: quedan 3 GB para el contexto, lo que basta para conversaciones de longitud media. Segundo, la diferencia entre 12 y 16 GB es clara: un modelo de la categoría de 20 mil millones de parámetros en Q4, como gpt-oss 20B, pesa 13 GB y no cabe en ninguna de las tres tarjetas. Si ese es tu objetivo, necesitas una tarjeta de 16 GB o más, y la guía sobre los 12 GB de VRAM detalla lo que se puede hacer precisamente con 12 GB.

#Instalación, alimentación y ajustes

Las RTX 3080 y 3080 Ti forman parte de las tarjetas con capacidad de cálculo 8.6 listadas por Ollama, que requiere un controlador 550 o más reciente. Un aspecto que debes vigilar en estas tarjetas: la ficha de NVIDIA indica 350 W para la tarjeta, 320 W para la de 10 GB, y recomienda una fuente de alimentación de 750 W para el sistema. Comprueba tu fuente de alimentación antes de instalar la tarjeta y conecta sus conectores a cables distintos.

  1. 01
    Verificar la alimentación
    Asegúrate de que alcance 750 W y que tenga los conectores solicitados por tu modelo de tarjeta.
  2. 02
    Instalar el controlador y Ollama
    Instala un controlador 550 o más reciente, luego Ollama, y arranca un modelo de tu elección.
  3. 03
    Ajustar la memoria
    En la versión de 10 GB, inicia el servidor con OLLAMA_FLASH_ATTENTION=1 y OLLAMA_KV_CACHE_TYPE=q8_0: la documentación especifica que la caché K/V puede cuantizarse cuando se activa Flash Attention.
  4. 04
    Comprobar
    Con nvidia-smi, monitorea la memoria y la temperatura en carga: estas tarjetas se calientan más que los modelos recientes.
Linux: iniciar Ollama con los ajustes de memoria
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#Velocidad: la medición pública y sus extrapolaciones

La tabla colaborativa de llama.cpp, que mide Llama 2 7B en Q4_0 (archivo de 3,56 GiB, es decir, 3,82 GB), registra para la RTX 3080 de 10 GB 139,65 tokens por segundo en generación y 5.014 en procesamiento del prompt. Con Flash Attention, la generación se mantiene en 139,95, pero el procesamiento sube a 5.570 tokens por segundo, una mejora de aproximadamente el 11 %. El ancho de banda de 760 GB/s permitiría en teoría cerca de 199 tokens por segundo: la medición alcanza el 70 % de este límite. El rendimiento también depende del controlador, del sistema y del fabricante de la tarjeta, incluso con el mismo chip.

Comparación con otras tarjetas (Llama 2 7B Q4_0, generación)
TarjetaMemoriaGeneración (tok/s)
RTX 3060 12 GB12 GB75,6
RTX 3080 10 GB10 GB139,7
RTX 309024 GB158,2

Según una regla de tres basada en el tamaño de los archivos, la 3080 10 GB daría como máximo alrededor de 89 tokens por segundo en Qwen 3.5 9B en Q4 (6 GB) y alrededor de 76 en Gemma 4 12B en Q4 (7 GB). Son límites teóricos superiores, no mediciones. En una 3080 12 GB, el Q8 de Qwen 3.5 9B (10 GB) quedaría por debajo de 65 tokens por segundo en teoría, lo cual es cómodo. En todos los casos, estas tarjetas superan ampliamente la velocidad de lectura; el límite es la capacidad, no la velocidad.

La lectura del prompt es el segundo punto fuerte de estas tarjetas. A 5.014 tokens por segundo, la 3080 de 10 GB lee un documento de 10.000 tokens en aproximadamente dos segundos, y a 5.570 con Flash Attention, en algo menos: son dos cálculos teóricos que suponen una tasa constante. Es aproximadamente el doble de rápido que una 3060 de 12 GB (2.138 tokens por segundo). Esta lectura del prompt cobra aún más importancia cuando varias personas comparten la misma máquina, ya que cada solicitud debe volver a leer primero su propio contexto antes de generar respuesta alguna, y es ahí donde se amplía la diferencia con una tarjeta más modesta. Para RAG sobre documentos voluminosos o un asistente de código que vuelve a leer archivos grandes en cada solicitud, supone una mejora real en la comodidad de uso, mucho más perceptible que la diferencia en la generación, cuya velocidad ya supera ampliamente el ritmo de lectura.

#Comprar en 2026: dónde se sitúan estas tarjetas

Frente a una tarjeta nueva de 16 GB, el argumento a favor de una RTX 3080 de segunda mano es la velocidad a un precio moderado, pero le falta memoria. La 3090 alcanza una velocidad medida de 158,2 tokens por segundo con 24 GB, lo que la convierte en una referencia del mercado de segunda mano para quienes buscan modelos de 20 a 30 mil millones de parámetros. Los precios de las tarjetas de segunda mano varían cada semana: el seguimiento del sitio registra el precio más bajo de cada tarjeta y el precio por GB de VRAM, lo que resulta más útil que una cifra escrita aquí.

Qué tarjeta elegir según tu modelo objetivo
Modelo objetivoMemoria necesariaTarjeta adecuada
8 a 9B en Q46 GB de pesosToda tarjeta de 8 GB
12B en Q4 o 9B en Q8Entre 7 y 10 GB de pesos3080 12 GB o Ti, o 3080 10 GB para el Q4
20B en Q4 (gpt-oss 20B)13 GB de pesosTarjeta de 16 GB o más

#Veredicto 2026

3080 12 GB o 3080 Ti de ocasión
Muy buena opción si el precio sigue siendo claramente inferior al de una tarjeta nueva de 12 a 16 GB: 12 GB, velocidad alta y un modelo de 9B en Q8 o uno de 12B en Q4 con margen.
3080 10 GB
Útil para modelos de 8 a 12 mil millones en Q4. Sin espacio para modelos de 9B en Q8 ni margen para el contexto, una 3060 de 12 GB puede ser más adecuada si buscas capacidad en lugar de velocidad.
Al comprar
Verifica la fuente de alimentación, la indicación de 10 o 12 GB y el estado de los ventiladores: estas tarjetas han estado sometidas a altas temperaturas y tienen varios años de uso.

#Preguntas frecuentes

Preguntas frecuentes
¿RTX 3080 de 10 GB o 12 GB para un LLM?+
Elige la de 12 GB si los precios son similares: sus 2 GB adicionales permiten ejecutar Qwen 3.5 9B en Q8 (10 GB de pesos) y dan margen a Gemma 4 12B, mientras que la de 10 GB se limita a modelos de 8-9B en Q4 y a uno de 12B en Q4 con un contexto moderado. Su bus más ancho aporta además aproximadamente un 20 % más de ancho de banda.
¿RTX 3080 Ti o RTX 3090 para un LLM?+
La 3090 tiene 24 GB frente a 12 GB y alcanza 158,2 tokens por segundo en la prueba de llama.cpp, lo que permite usar modelos de 20 a 30 mil millones de parámetros en Q4. La 3080 Ti basta si te mantienes en modelos de 12 mil millones de parámetros como máximo. Para estos modelos, las velocidades de generación son similares: la capacidad decide.
¿Puede la RTX 3080 de 12 GB ejecutar gpt-oss 20B?+
No completamente en la tarjeta. El catálogo indica 13 GB en Q4 para este modelo, es decir, 1 GB más que la memoria de una 3080 de 12 GB: el modelo se repartiría entre la memoria de la tarjeta y la RAM del sistema, y la velocidad caería. Se necesita una tarjeta de 16 GB para ejecutarlo a plena velocidad.
¿Cuántos tokens por segundo en una RTX 3080?+
La tabla pública de llama.cpp indica 139,7 tokens por segundo para la 3080 de 10 GB con Llama 2 7B en Q4_0. Un modelo más pesado será más lento: aproximadamente 89 para un 9B en Q4 y 76 para un 12B en Q4, según una estimación teórica. La versión de 12 GB y la Ti deberían ser un poco más rápidas, aunque no hay mediciones públicas.
¿Qué fuente de alimentación para una RTX 3080 Ti?+
NVIDIA anuncia 350 W para la tarjeta y recomienda una fuente de alimentación de 750 W para el sistema, tanto para la 3080 como para la 3080 Ti. Una de 650 W está por debajo de esta recomendación. Prevé también los conectores adecuados y una buena ventilación del chasis, ya que estas tarjetas disipan mucho calor bajo carga.
¿Funciona Ollama en una RTX 3080?+
Sí. Ollama incluye las RTX 3080 y 3080 Ti entre las tarjetas con capacidad de cálculo 8.6 y requiere un controlador 550 o más reciente. En la versión de 10 GB, activa Flash Attention y la cuantización de la caché K/V para ahorrar memoria en contextos largos.
¿La RTX 3080 sigue valiendo la pena en 2026?+
Sí, si su precio de segunda mano sigue siendo claramente inferior al de una tarjeta nueva equivalente en memoria. Su velocidad es excelente, pero su capacidad de 10 o 12 GB es lo que importa: consulta el seguimiento de precios del sitio y compara la tarjeta con tarjetas de 16 GB antes de decidir.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.