¿Qué LLM en RTX 2080 Ti (11 GB)? ?
Con 11 GB de GDDR6 y 616 GB/s de ancho de banda, la RTX 2080 Ti ejecuta sin desbordarse a la RAM un modelo de 12 mil millones de parámetros en Q4 como Gemma 4 12B (7 GB), o un 8B en Q8 como Granite 4.2 8B (9 GB). En la prueba de referencia de llama.cpp, genera 107 tokens/s con un 7B en Q4_0. Es uno de los pocos casos de una tarjeta de 2018 cuya capacidad sigue siendo útil.
La RTX 2080 Ti (septiembre de 2018) es la única tarjeta de la generación Turing que supera los 8 GB: tiene 11. Esta guía relaciona sus características con mediciones públicas, especifica qué modelos caben en su memoria, compara su relación entre capacidad y velocidad con la de tarjetas más recientes y explica cómo instalarla y comprobar que ningún modelo tenga que cargarse parcialmente en la RAM del sistema.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#RTX 2080 Ti en 2026: la capacidad que cuenta
La RTX 2080 Ti ejecuta un modelo de 12 mil millones de parámetros en Q4 sin desbordar su memoria, algo que ninguna tarjeta de 8 GB hace correctamente. Según el catálogo QuelLLM, Gemma 4 12B pesa 7 GB en Q4, Granite 4.2 8B 4,6 GB y Qwen 3.5 9B 6 GB; en Q8, Granite 4.2 8B sube a 9 GB, lo que también cabe en los 11 GB. La tarjeta se basa en un chip TU102, 4.352 núcleos CUDA y 11 GB de memoria GDDR6 en un bus de 352 bits, lo que da 616 GB/s. En la tabla pública de llama.cpp, alcanza 107,5 tokens por segundo en generación con un modelo de 7 mil millones de parámetros en Q4_0. Esta combinación de velocidad y capacidad explica que la 2080 Ti siga siendo relevante, aunque tarjetas más recientes de 8 GB la superen en juegos pero no en IA.
- Arquitectura
- Turing, chip TU102, lanzamiento en septiembre de 2018.
- Memoria
- 11 GB de GDDR6, bus de 352 bits, ancho de banda de 616 GB/s.
- Cœurs
- 4.352 núcleos CUDA y núcleos Tensor de segunda generación.
- Alimentación
- Consulta la ficha de tu modelo específico: las versiones de fábrica varían según el fabricante.
#Modelos compatibles con 11 GB
| Modelo | Q4 | Q5 | Q8 | Con 11 GB |
|---|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | 6 GB | 9 GB | Q4 y Q5 caben con amplio margen; Q8 es posible con un contexto moderado |
| Qwen 3.5 9B | 6 GB | 7 GB | 10 GB | Q4 y Q5 funcionan con margen; Q8 deja apenas 1 GB para el contexto |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | Q4 con 3 a 4 GB de margen; Q5 muy justo; Q8 no cabe |
La columna Q5 muestra la ventaja de una tarjeta de 11 GB: con un 8B o un 9B, se puede elegir una cuantización más fiel que Q4 sin sacrificar nada. Q5 para un 12B (9 GB), en cambio, deja menos de 2 GB para la caché, lo que limita el contexto. Un modelo en Q4 con un contexto amplio suele ser más útil que uno en Q5 con una ventana reducida: decide según tu uso, ya sea para resumir documentos largos o para mantener conversaciones cortas.
Dos referencias prácticas. En primer lugar, un modelo de 8B en Q8 (9 GB) cabe en la tarjeta y ofrece una calidad muy cercana a la precisión completa: es un uso que las tarjetas de 8 GB no permiten. En segundo lugar, el margen de 3 a 4 GB en un modelo de 12B en Q4 se consume con el contexto: más allá de unos pocos miles de tokens, cuantiza la caché K/V o reduce la ventana. Para elegir el nivel de cuantización, la guía dedicada detalla las pérdidas de calidad.
#Instalación y verificación
Ollama admite Turing: la documentación enumera las RTX 2080 Ti, 2080, 2070 y 2060 entre las tarjetas con capacidad de cálculo 7.5 y requiere un controlador 550 o más reciente. El procedimiento es el mismo que para cualquier tarjeta NVIDIA, con una última comprobación importante: verificar que el modelo esté completamente en la tarjeta.
- 01Actualizar el controladorInstala un controlador NVIDIA de la versión 550 o posterior y luego comprueba con nvidia-smi que se detecte la tarjeta con sus 11 GB.
- 02Instalar OllamaSigue la guía de instalación de Ollama para tu sistema, luego inicia un modelo con ollama run.
- 03Controlar la distribuciónEscribe ollama ps: la columna Processor debe mostrar 100% GPU. Si aparece un porcentaje de CPU, el modelo está utilizando parte de la RAM: reduce el tamaño del contexto o del modelo.
- 04Ajustar el caché K/V si es necesarioInicia Ollama con OLLAMA_FLASH_ATTENTION=1 y OLLAMA_KV_CACHE_TYPE=q8_0 para ganar espacio en contextos largos.
#Velocidad: lo que mide llama.cpp
La tabla colaborativa del repositorio llama.cpp indica, para la RTX 2080 Ti, 107,5 tokens por segundo en generación y 2 891 en lectura del prompt con Llama 2 7B en Q4_0, un archivo de 3,56 GiB. Con Flash Attention, estos valores pasan a 109,2 y 3 108. Un punto llama la atención: el ancho de banda de 616 GB/s permitiría en teoría unos 161 tokens por segundo con este archivo de 3,82 GB, pero la medición alcanza el 67 % de esa cifra. Las tarjetas más modestas se acercan más. Por lo tanto, el rendimiento real depende de otros factores además de la memoria, como las frecuencias o los controladores, y la propia tabla recuerda que los resultados varían según la tarjeta y el sistema.
Para estimar la velocidad de un modelo actual, se puede aplicar una regla de tres al tamaño del archivo. Un modelo de 4,6 GB como Granite 4.2 8B en Q4 daría, en el mejor de los casos, 107,5 × 3,82 ÷ 4,6, es decir, unos 89 tokens por segundo. Para un Gemma 4 12B de 7 GB, la cifra baja a unos 59 tokens por segundo. Son límites superiores teóricos, no mediciones; las arquitecturas recientes pueden desviarse de ellos. En todos los casos, estas velocidades superan el ritmo de lectura.
#Contexto largo y documentos: lectura del prompt y caché K/V
La velocidad de generación es solo la mitad de la experiencia: en cuanto pegas un documento o inicias una búsqueda en tus archivos, lo que te hace esperar es la lectura del prompt. La tabla de llama.cpp la mide por separado (pp512). A 2 891 tokens por segundo, la 2080 Ti lee un documento de 10 000 tokens en algo más de tres segundos y medio, frente a unos cuatro segundos y medio para la 3060 de 12 GB (2 138) y dos segundos para la 3080 de 10 GB (5 014). Este cálculo es teórico y supone una tasa de procesamiento constante, pero da una idea del orden de magnitud: la 2080 Ti sigue ofreciendo una experiencia agradable para RAG.
La segunda restricción es la memoria. La caché K/V crece con el contexto, y con un modelo de 12B en Q4 que deja entre 3 y 4 GB de margen, un documento largo consume rápidamente esa reserva. La documentación de Ollama especifica que la caché K/V se puede cuantizar cuando Flash Attention está activada, y que el formato q8_0 utiliza aproximadamente la mitad de la memoria del formato f16 predeterminado. El ajuste es global para la instancia de Ollama: se aplica a todos los modelos que sirve.
Haz pruebas y mide los resultados: carga el modelo, llena un contexto comparable al de tu uso real y comprueba con ollama ps que siga ejecutándose al 100 % en la GPU. Si el modelo no cabe por completo en la memoria de la GPU, la solución menos costosa casi siempre es reducir la ventana de contexto antes de cambiar de modelo o de tarjeta. La guía sobre la ventana de contexto explica cómo ajustarla.
#2080 Ti, 3060 12 GB, 5060 Ti 16 GB: qué decisión tomar
| Tarjeta | Memoria | Generación (tok/s) | Lectura del prompt (tok/s) |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 | 2 138 |
| RTX 5060 Ti 16 GB | 16 GB | 90,9 | 3 737 |
| RTX 2080 Ti | 11 GB | 107,5 | 2 891 |
| RTX 3080 10 GB | 10 GB | 139,7 | 5 014 |
La 2080 Ti genera aproximadamente un 42 % más rápido que la 3060 de 12 GB, e incluso más rápido que la RTX 5060 Ti de 16 GB, cuyo bus de 128 bits supone una limitación. En capacidad de memoria, en cambio, la 2080 Ti queda por detrás de ambas: 11 GB frente a 12 y 16 GB, respectivamente. Por tanto, la elección depende del modelo que quieras utilizar. Para un modelo de 12B en Q4, la 2080 Ti basta y sigue siendo la más rápida de las tres. Para un modelo de 20 mil millones o más, o un contexto muy largo, se necesitan 16 GB y la tarjeta de nueva generación se convierte en la mejor opción. Los precios cambian cada semana; el seguimiento del sitio indica el precio por GB de VRAM.
- Pregunta 1: ¿qué modelo deseas?
- Para un modelo de 8 a 12B: conserva o compra la 2080 Ti. Para uno de 20B o más: busca 16 GB.
- Pregunta 2: ¿qué longitud de contexto?
- Unos miles de tokens: 11 GB bastan. Decenas de miles: faltará margen.
- Pregunta 3: ¿qué presupuesto para electricidad?
- Compara el consumo indicado en la ficha de tu modelo de tarjeta con el de las tarjetas recientes, que consumen menos a una velocidad comparable.
- Precios de las tarjetas gráficas para IA local (seguimiento semanal)
- ¿Qué LLM para RTX 3060 12 GB?
- ¿Qué LLM usar en una RTX 5060 Ti (8/16 GB)?
#Compatibilidad con Turing: lo que está confirmado y lo que no
Turing es hoy la arquitectura mínima compatible con CUDA 13: las notas de versión indican que sus bibliotecas han dejado de admitir las arquitecturas anteriores (Maxwell, Volta, Pascal). Esto significa que la 2080 Ti es compatible, pero también que es una de las tarjetas más antiguas aún incluidas. Ninguna fuente consultada anuncia el fin del soporte para Turing; en cambio, las novedades de hardware de las generaciones recientes (formatos de cálculo más eficientes, por ejemplo) nunca estarán disponibles en esta arquitectura. Para llama.cpp y Ollama con modelos GGUF clásicos, esto no es un obstáculo.
#Veredicto 2026
- Consérvala si
- Ya la tienes: sus 11 GB y sus 107 tokens por segundo con un 7B la convierten en una tarjeta más útil para la IA que muchas tarjetas recientes de 8 GB.
- Compra de segunda mano si
- El precio es significativamente inferior al de una tarjeta de 12 a 16 GB, y tu objetivo es un modelo de 8 o 12B. Verifica el estado de los ventiladores y la garantía; estas tarjetas tienen varios años de uso.
- Aumenta a 16 GB si
- Buscas un modelo de 20 mil millones o más, o un contexto de decenas de miles de tokens.
#Preguntas frecuentes
¿La RTX 2080 Ti sigue siendo relevante para un LLM en 2026?+
¿RTX 2080 Ti o RTX 3060 de 12 GB para un LLM?+
¿Cuántos tokens por segundo en una RTX 2080 Ti?+
¿La RTX 2080 Ti soporta Flash Attention?+
¿Cómo saber si mi modelo cabe completamente en la tarjeta?+
¿La RTX 2080 Ti podría dejar de ser compatible?+
- Fuente: tabla de rendimiento de llama.cpp en CUDA
- Fuente: tarjetas NVIDIA admitidas por Ollama
- Fuente: Preguntas frecuentes de Ollama (ollama ps, caché K/V)
- Fuente: características de las tarjetas GeForce serie 20
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.