¿Qué LLM en RTX 3080 / 3080 Ti (10-12 GB)? ?
Para un LLM local, una RTX 3080 o 3080 Ti de 12 GB ejecuta Qwen 3.5 9B en Q8 (10 GB) y Gemma 4 12B en Q4 (7 GB) con margen, a aproximadamente 140 tokens/s en un 7B: la RTX 3080 de 10 GB alcanza 139,7 en la prueba de llama.cpp. La versión de 10 GB se limita a los 8-9B en Q4. Ninguna de las tres carga un 20B en Q4 (13 GB) sin trasladar parte del modelo a la RAM.
Tres tarjetas llevan el nombre de RTX 3080: la de 10 GB de septiembre de 2020, la de 12 GB de enero de 2022 y la 3080 Ti de 12 GB de junio de 2021. Tienen el mismo chip, pero no la misma memoria, y es esta última la que determina qué puedes ejecutar. Esta guía se basa en una medición pública para la velocidad y en las fichas oficiales para la capacidad.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5080 16 GB.
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 3080 y 3080 Ti para un LLM local: las tres variantes
Una RTX 3080 o una 3080 Ti de 12 GB ejecuta cómodamente un modelo de 12 mil millones de parámetros en Q4 o un modelo de 9 mil millones en Q8; la versión de 10 GB se limita a modelos de 7 a 9 mil millones en Q4. Según el catálogo QuelLLM, Gemma 4 12B pesa 7 GB en Q4 y 9 GB en Q5; Qwen 3.5 9B pesa 6 GB en Q4 y 10 GB en Q8, lo que requiere al menos 12 GB en cuanto se añade contexto. En cuanto a velocidad, estas tarjetas se encuentran entre las más rápidas de las generaciones anteriores: la 3080 de 10 GB genera 139,7 tokens por segundo con un modelo de 7 mil millones en Q4_0 según la tabla pública de llama.cpp, casi el doble que la RTX 3060 de 12 GB (75,6). La elección de una RTX 3080 para un LLM depende, por tanto, de la memoria, nunca de la velocidad.
- RTX 3080 10 GB
- Septiembre de 2020, 8.704 núcleos CUDA, 10 GB de GDDR6X en un bus de 320 bits, es decir, 760 GB/s. Potencia de la tarjeta de 320 W.
- RTX 3080 12 GB
- Enero 2022, 8 960 núcleos, 12 GB de GDDR6X en bus de 384 bits, es decir, 912 GB/s, 350 W. Aproximadamente un 20 % más de ancho de banda.
- RTX 3080 Ti
- Junio de 2021, 10 240 núcleos, 12 GB de GDDR6X en un bus de 384 bits como la 3080 de 12 GB, por lo que se espera un ancho de banda idéntico, 350 W.
El cálculo del límite ayuda a entenderlo: la generación de texto lee los pesos en cada token, por lo que el ancho de banda determina la velocidad máxima. Las 3080 de 12 GB y las Ti tienen un 20 % más de ancho de banda que la de 10 GB, pero la 3080 Ti añade sobre todo núcleos de cálculo, que aceleran la lectura del prompt más que la generación.
#3080 10 GB, 12 GB o 3080 Ti: ¿qué elegir?
| Criterio | 3080 10 GB | 3080 12 GB | 3080 Ti 12 GB |
|---|---|---|---|
| Núcleos CUDA | 8 704 | 8 960 | 10 240 |
| Memoria | 10 GB GDDR6X | 12 GB GDDR6X | 12 GB GDDR6X |
| Bus / ancho de banda | 320 bits / 760 GB/s | 384 bits / 912 GB/s | 384 bits, mismo ancho de banda esperado |
| Potencia de la tarjeta | 320 W | 350 W | 350 W |
| Generación en Llama 2 7B Q4_0 | 139,7 tok/s (medición) | estimación: hasta aproximadamente 167 | estimación: similar a la versión de 12 GB |
Para la IA local, la 3080 Ti y la 3080 de 12 GB son intercambiables: los mismos 12 GB, el mismo bus y una velocidad de generación muy similar. La estimación para estas dos tarjetas es un límite superior que aplica a 912 GB/s el rendimiento medido de la versión de 10 GB: en la práctica, la 3090, cuyo bus también es de 384 bits, registra 158,2 tokens por segundo. Así que elige la más barata de las dos, sin dejarte guiar por el número de núcleos. La versión de 10 GB, en cambio, está un escalón por debajo por su capacidad: sus 10 GB no permiten ejecutar modelos de 9 mil millones de parámetros en Q8.
#Modelos compatibles según la memoria
| Modelo y cuantización | Tamaño del modelo | 3080 10 GB | 3080 12 GB / Ti |
|---|---|---|---|
| Qwen 3.5 9B en Q4 | 6 GB | Sí, con contexto | Sí, con mucho contexto |
| Gemma 4 12B en Q4 | 7 GB | Sí, contexto moderado | Sí, cómodo |
| Gemma 4 12B en Q5 | 9 GB | Muy ajustado | Sí, contexto moderado |
| Qwen 3.5 9B en Q8 | 10 GB | No | Sí, pero con poco contexto |
| gpt-oss 20B en Q4 | 13 GB | No | No: excede la capacidad en 1 GB |
Dos puntos de esta tabla merecen atención. Primero, la 3080 de 10 GB puede ejecutar Gemma 4 12B en Q4 (7 GB), pese a lo que podría parecer: quedan 3 GB para el contexto, lo que basta para conversaciones de longitud media. Segundo, la diferencia entre 12 y 16 GB es clara: un modelo de la categoría de 20 mil millones de parámetros en Q4, como gpt-oss 20B, pesa 13 GB y no cabe en ninguna de las tres tarjetas. Si ese es tu objetivo, necesitas una tarjeta de 16 GB o más, y la guía sobre los 12 GB de VRAM detalla lo que se puede hacer precisamente con 12 GB.
#Instalación, alimentación y ajustes
Las RTX 3080 y 3080 Ti forman parte de las tarjetas con capacidad de cálculo 8.6 listadas por Ollama, que requiere un controlador 550 o más reciente. Un aspecto que debes vigilar en estas tarjetas: la ficha de NVIDIA indica 350 W para la tarjeta, 320 W para la de 10 GB, y recomienda una fuente de alimentación de 750 W para el sistema. Comprueba tu fuente de alimentación antes de instalar la tarjeta y conecta sus conectores a cables distintos.
- 01Verificar la alimentaciónAsegúrate de que alcance 750 W y que tenga los conectores solicitados por tu modelo de tarjeta.
- 02Instalar el controlador y OllamaInstala un controlador 550 o más reciente, luego Ollama, y arranca un modelo de tu elección.
- 03Ajustar la memoriaEn la versión de 10 GB, inicia el servidor con OLLAMA_FLASH_ATTENTION=1 y OLLAMA_KV_CACHE_TYPE=q8_0: la documentación especifica que la caché K/V puede cuantizarse cuando se activa Flash Attention.
- 04ComprobarCon nvidia-smi, monitorea la memoria y la temperatura en carga: estas tarjetas se calientan más que los modelos recientes.
#Velocidad: la medición pública y sus extrapolaciones
La tabla colaborativa de llama.cpp, que mide Llama 2 7B en Q4_0 (archivo de 3,56 GiB, es decir, 3,82 GB), registra para la RTX 3080 de 10 GB 139,65 tokens por segundo en generación y 5.014 en procesamiento del prompt. Con Flash Attention, la generación se mantiene en 139,95, pero el procesamiento sube a 5.570 tokens por segundo, una mejora de aproximadamente el 11 %. El ancho de banda de 760 GB/s permitiría en teoría cerca de 199 tokens por segundo: la medición alcanza el 70 % de este límite. El rendimiento también depende del controlador, del sistema y del fabricante de la tarjeta, incluso con el mismo chip.
| Tarjeta | Memoria | Generación (tok/s) |
|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 |
| RTX 3080 10 GB | 10 GB | 139,7 |
| RTX 3090 | 24 GB | 158,2 |
Según una regla de tres basada en el tamaño de los archivos, la 3080 10 GB daría como máximo alrededor de 89 tokens por segundo en Qwen 3.5 9B en Q4 (6 GB) y alrededor de 76 en Gemma 4 12B en Q4 (7 GB). Son límites teóricos superiores, no mediciones. En una 3080 12 GB, el Q8 de Qwen 3.5 9B (10 GB) quedaría por debajo de 65 tokens por segundo en teoría, lo cual es cómodo. En todos los casos, estas tarjetas superan ampliamente la velocidad de lectura; el límite es la capacidad, no la velocidad.
La lectura del prompt es el segundo punto fuerte de estas tarjetas. A 5.014 tokens por segundo, la 3080 de 10 GB lee un documento de 10.000 tokens en aproximadamente dos segundos, y a 5.570 con Flash Attention, en algo menos: son dos cálculos teóricos que suponen una tasa constante. Es aproximadamente el doble de rápido que una 3060 de 12 GB (2.138 tokens por segundo). Esta lectura del prompt cobra aún más importancia cuando varias personas comparten la misma máquina, ya que cada solicitud debe volver a leer primero su propio contexto antes de generar respuesta alguna, y es ahí donde se amplía la diferencia con una tarjeta más modesta. Para RAG sobre documentos voluminosos o un asistente de código que vuelve a leer archivos grandes en cada solicitud, supone una mejora real en la comodidad de uso, mucho más perceptible que la diferencia en la generación, cuya velocidad ya supera ampliamente el ritmo de lectura.
#Comprar en 2026: dónde se sitúan estas tarjetas
Frente a una tarjeta nueva de 16 GB, el argumento a favor de una RTX 3080 de segunda mano es la velocidad a un precio moderado, pero le falta memoria. La 3090 alcanza una velocidad medida de 158,2 tokens por segundo con 24 GB, lo que la convierte en una referencia del mercado de segunda mano para quienes buscan modelos de 20 a 30 mil millones de parámetros. Los precios de las tarjetas de segunda mano varían cada semana: el seguimiento del sitio registra el precio más bajo de cada tarjeta y el precio por GB de VRAM, lo que resulta más útil que una cifra escrita aquí.
| Modelo objetivo | Memoria necesaria | Tarjeta adecuada |
|---|---|---|
| 8 a 9B en Q4 | 6 GB de pesos | Toda tarjeta de 8 GB |
| 12B en Q4 o 9B en Q8 | Entre 7 y 10 GB de pesos | 3080 12 GB o Ti, o 3080 10 GB para el Q4 |
| 20B en Q4 (gpt-oss 20B) | 13 GB de pesos | Tarjeta de 16 GB o más |
- Precios de las tarjetas gráficas para IA local (seguimiento semanal)
- ¿Qué LLM usar con una RTX 3090 / 3090 Ti (24 GB)?
- ¿Qué LLM en RTX 4070 Ti Super (16 GB)?
#Veredicto 2026
- 3080 12 GB o 3080 Ti de ocasión
- Muy buena opción si el precio sigue siendo claramente inferior al de una tarjeta nueva de 12 a 16 GB: 12 GB, velocidad alta y un modelo de 9B en Q8 o uno de 12B en Q4 con margen.
- 3080 10 GB
- Útil para modelos de 8 a 12 mil millones en Q4. Sin espacio para modelos de 9B en Q8 ni margen para el contexto, una 3060 de 12 GB puede ser más adecuada si buscas capacidad en lugar de velocidad.
- Al comprar
- Verifica la fuente de alimentación, la indicación de 10 o 12 GB y el estado de los ventiladores: estas tarjetas han estado sometidas a altas temperaturas y tienen varios años de uso.
#Preguntas frecuentes
¿RTX 3080 de 10 GB o 12 GB para un LLM?+
¿RTX 3080 Ti o RTX 3090 para un LLM?+
¿Puede la RTX 3080 de 12 GB ejecutar gpt-oss 20B?+
¿Cuántos tokens por segundo en una RTX 3080?+
¿Qué fuente de alimentación para una RTX 3080 Ti?+
¿Funciona Ollama en una RTX 3080?+
¿La RTX 3080 sigue valiendo la pena en 2026?+
- Fuente: tabla de rendimiento de llama.cpp en CUDA
- Fuente: ficha de NVIDIA de las RTX 3080 y 3080 Ti
- Fuente: tarjetas NVIDIA admitidas por Ollama
- Fuente: preguntas frecuentes de Ollama (Flash Attention, caché K/V)
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.