Intermedio 11 minRTX 20

¿Qué LLM en RTX 2080 Ti (11 GB)? ?

Respuesta directa

Con 11 GB de GDDR6 y 616 GB/s de ancho de banda, la RTX 2080 Ti ejecuta sin desbordarse a la RAM un modelo de 12 mil millones de parámetros en Q4 como Gemma 4 12B (7 GB), o un 8B en Q8 como Granite 4.2 8B (9 GB). En la prueba de referencia de llama.cpp, genera 107 tokens/s con un 7B en Q4_0. Es uno de los pocos casos de una tarjeta de 2018 cuya capacidad sigue siendo útil.

La RTX 2080 Ti (septiembre de 2018) es la única tarjeta de la generación Turing que supera los 8 GB: tiene 11. Esta guía relaciona sus características con mediciones públicas, especifica qué modelos caben en su memoria, compara su relación entre capacidad y velocidad con la de tarjetas más recientes y explica cómo instalarla y comprobar que ningún modelo tenga que cargarse parcialmente en la RAM del sistema.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#RTX 2080 Ti en 2026: la capacidad que cuenta

La RTX 2080 Ti ejecuta un modelo de 12 mil millones de parámetros en Q4 sin desbordar su memoria, algo que ninguna tarjeta de 8 GB hace correctamente. Según el catálogo QuelLLM, Gemma 4 12B pesa 7 GB en Q4, Granite 4.2 8B 4,6 GB y Qwen 3.5 9B 6 GB; en Q8, Granite 4.2 8B sube a 9 GB, lo que también cabe en los 11 GB. La tarjeta se basa en un chip TU102, 4.352 núcleos CUDA y 11 GB de memoria GDDR6 en un bus de 352 bits, lo que da 616 GB/s. En la tabla pública de llama.cpp, alcanza 107,5 tokens por segundo en generación con un modelo de 7 mil millones de parámetros en Q4_0. Esta combinación de velocidad y capacidad explica que la 2080 Ti siga siendo relevante, aunque tarjetas más recientes de 8 GB la superen en juegos pero no en IA.

Arquitectura
Turing, chip TU102, lanzamiento en septiembre de 2018.
Memoria
11 GB de GDDR6, bus de 352 bits, ancho de banda de 616 GB/s.
Cœurs
4.352 núcleos CUDA y núcleos Tensor de segunda generación.
Alimentación
Consulta la ficha de tu modelo específico: las versiones de fábrica varían según el fabricante.

#Modelos compatibles con 11 GB

Modelos para una RTX 2080 Ti (peso según el catálogo QuelLLM)
ModeloQ4Q5Q8Con 11 GB
Granite 4.2 8B4,6 GB6 GB9 GBQ4 y Q5 caben con amplio margen; Q8 es posible con un contexto moderado
Qwen 3.5 9B6 GB7 GB10 GBQ4 y Q5 funcionan con margen; Q8 deja apenas 1 GB para el contexto
Gemma 4 12B7 GB9 GB13 GBQ4 con 3 a 4 GB de margen; Q5 muy justo; Q8 no cabe

La columna Q5 muestra la ventaja de una tarjeta de 11 GB: con un 8B o un 9B, se puede elegir una cuantización más fiel que Q4 sin sacrificar nada. Q5 para un 12B (9 GB), en cambio, deja menos de 2 GB para la caché, lo que limita el contexto. Un modelo en Q4 con un contexto amplio suele ser más útil que uno en Q5 con una ventana reducida: decide según tu uso, ya sea para resumir documentos largos o para mantener conversaciones cortas.

Dos referencias prácticas. En primer lugar, un modelo de 8B en Q8 (9 GB) cabe en la tarjeta y ofrece una calidad muy cercana a la precisión completa: es un uso que las tarjetas de 8 GB no permiten. En segundo lugar, el margen de 3 a 4 GB en un modelo de 12B en Q4 se consume con el contexto: más allá de unos pocos miles de tokens, cuantiza la caché K/V o reduce la ventana. Para elegir el nivel de cuantización, la guía dedicada detalla las pérdidas de calidad.

#Instalación y verificación

Ollama admite Turing: la documentación enumera las RTX 2080 Ti, 2080, 2070 y 2060 entre las tarjetas con capacidad de cálculo 7.5 y requiere un controlador 550 o más reciente. El procedimiento es el mismo que para cualquier tarjeta NVIDIA, con una última comprobación importante: verificar que el modelo esté completamente en la tarjeta.

  1. 01
    Actualizar el controlador
    Instala un controlador NVIDIA de la versión 550 o posterior y luego comprueba con nvidia-smi que se detecte la tarjeta con sus 11 GB.
  2. 02
    Instalar Ollama
    Sigue la guía de instalación de Ollama para tu sistema, luego inicia un modelo con ollama run.
  3. 03
    Controlar la distribución
    Escribe ollama ps: la columna Processor debe mostrar 100% GPU. Si aparece un porcentaje de CPU, el modelo está utilizando parte de la RAM: reduce el tamaño del contexto o del modelo.
  4. 04
    Ajustar el caché K/V si es necesario
    Inicia Ollama con OLLAMA_FLASH_ATTENTION=1 y OLLAMA_KV_CACHE_TYPE=q8_0 para ganar espacio en contextos largos.

#Velocidad: lo que mide llama.cpp

La tabla colaborativa del repositorio llama.cpp indica, para la RTX 2080 Ti, 107,5 tokens por segundo en generación y 2 891 en lectura del prompt con Llama 2 7B en Q4_0, un archivo de 3,56 GiB. Con Flash Attention, estos valores pasan a 109,2 y 3 108. Un punto llama la atención: el ancho de banda de 616 GB/s permitiría en teoría unos 161 tokens por segundo con este archivo de 3,82 GB, pero la medición alcanza el 67 % de esa cifra. Las tarjetas más modestas se acercan más. Por lo tanto, el rendimiento real depende de otros factores además de la memoria, como las frecuencias o los controladores, y la propia tabla recuerda que los resultados varían según la tarjeta y el sistema.

Para estimar la velocidad de un modelo actual, se puede aplicar una regla de tres al tamaño del archivo. Un modelo de 4,6 GB como Granite 4.2 8B en Q4 daría, en el mejor de los casos, 107,5 × 3,82 ÷ 4,6, es decir, unos 89 tokens por segundo. Para un Gemma 4 12B de 7 GB, la cifra baja a unos 59 tokens por segundo. Son límites superiores teóricos, no mediciones; las arquitecturas recientes pueden desviarse de ellos. En todos los casos, estas velocidades superan el ritmo de lectura.

#Contexto largo y documentos: lectura del prompt y caché K/V

La velocidad de generación es solo la mitad de la experiencia: en cuanto pegas un documento o inicias una búsqueda en tus archivos, lo que te hace esperar es la lectura del prompt. La tabla de llama.cpp la mide por separado (pp512). A 2 891 tokens por segundo, la 2080 Ti lee un documento de 10 000 tokens en algo más de tres segundos y medio, frente a unos cuatro segundos y medio para la 3060 de 12 GB (2 138) y dos segundos para la 3080 de 10 GB (5 014). Este cálculo es teórico y supone una tasa de procesamiento constante, pero da una idea del orden de magnitud: la 2080 Ti sigue ofreciendo una experiencia agradable para RAG.

La segunda restricción es la memoria. La caché K/V crece con el contexto, y con un modelo de 12B en Q4 que deja entre 3 y 4 GB de margen, un documento largo consume rápidamente esa reserva. La documentación de Ollama especifica que la caché K/V se puede cuantizar cuando Flash Attention está activada, y que el formato q8_0 utiliza aproximadamente la mitad de la memoria del formato f16 predeterminado. El ajuste es global para la instancia de Ollama: se aplica a todos los modelos que sirve.

Linux: Flash Attention y caché K/V en q8_0
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

Haz pruebas y mide los resultados: carga el modelo, llena un contexto comparable al de tu uso real y comprueba con ollama ps que siga ejecutándose al 100 % en la GPU. Si el modelo no cabe por completo en la memoria de la GPU, la solución menos costosa casi siempre es reducir la ventana de contexto antes de cambiar de modelo o de tarjeta. La guía sobre la ventana de contexto explica cómo ajustarla.

#2080 Ti, 3060 12 GB, 5060 Ti 16 GB: qué decisión tomar

Generación con Llama 2 7B Q4_0 (tabla pública de llama.cpp)
TarjetaMemoriaGeneración (tok/s)Lectura del prompt (tok/s)
RTX 3060 12 GB12 GB75,62 138
RTX 5060 Ti 16 GB16 GB90,93 737
RTX 2080 Ti11 GB107,52 891
RTX 3080 10 GB10 GB139,75 014

La 2080 Ti genera aproximadamente un 42 % más rápido que la 3060 de 12 GB, e incluso más rápido que la RTX 5060 Ti de 16 GB, cuyo bus de 128 bits supone una limitación. En capacidad de memoria, en cambio, la 2080 Ti queda por detrás de ambas: 11 GB frente a 12 y 16 GB, respectivamente. Por tanto, la elección depende del modelo que quieras utilizar. Para un modelo de 12B en Q4, la 2080 Ti basta y sigue siendo la más rápida de las tres. Para un modelo de 20 mil millones o más, o un contexto muy largo, se necesitan 16 GB y la tarjeta de nueva generación se convierte en la mejor opción. Los precios cambian cada semana; el seguimiento del sitio indica el precio por GB de VRAM.

Pregunta 1: ¿qué modelo deseas?
Para un modelo de 8 a 12B: conserva o compra la 2080 Ti. Para uno de 20B o más: busca 16 GB.
Pregunta 2: ¿qué longitud de contexto?
Unos miles de tokens: 11 GB bastan. Decenas de miles: faltará margen.
Pregunta 3: ¿qué presupuesto para electricidad?
Compara el consumo indicado en la ficha de tu modelo de tarjeta con el de las tarjetas recientes, que consumen menos a una velocidad comparable.

#Compatibilidad con Turing: lo que está confirmado y lo que no

Turing es hoy la arquitectura mínima compatible con CUDA 13: las notas de versión indican que sus bibliotecas han dejado de admitir las arquitecturas anteriores (Maxwell, Volta, Pascal). Esto significa que la 2080 Ti es compatible, pero también que es una de las tarjetas más antiguas aún incluidas. Ninguna fuente consultada anuncia el fin del soporte para Turing; en cambio, las novedades de hardware de las generaciones recientes (formatos de cálculo más eficientes, por ejemplo) nunca estarán disponibles en esta arquitectura. Para llama.cpp y Ollama con modelos GGUF clásicos, esto no es un obstáculo.

#Veredicto 2026

Consérvala si
Ya la tienes: sus 11 GB y sus 107 tokens por segundo con un 7B la convierten en una tarjeta más útil para la IA que muchas tarjetas recientes de 8 GB.
Compra de segunda mano si
El precio es significativamente inferior al de una tarjeta de 12 a 16 GB, y tu objetivo es un modelo de 8 o 12B. Verifica el estado de los ventiladores y la garantía; estas tarjetas tienen varios años de uso.
Aumenta a 16 GB si
Buscas un modelo de 20 mil millones o más, o un contexto de decenas de miles de tokens.

#Preguntas frecuentes

Preguntas frecuentes
¿La RTX 2080 Ti sigue siendo relevante para un LLM en 2026?+
Sí, especialmente por sus 11 GB de memoria. Puede ejecutar un 12B en Q4 como Gemma 4 12B (7 GB) y un 8B en Q8, algo que las tarjetas de 8 GB no permiten. En el test público de llama.cpp, genera 107 tokens por segundo en un 7B en Q4_0, una velocidad muy cómoda.
¿RTX 2080 Ti o RTX 3060 de 12 GB para un LLM?+
La 2080 Ti genera aproximadamente un 42 % más rápido (107,5 frente a 75,6 tokens por segundo); la 3060 ofrece 1 GB más de memoria y consume menos. Para un 12B en Q4, ambas son suficientes y la 2080 Ti es más rápida. La 3060 de 12 GB se justifica principalmente por su precio y su consumo más bajos.
¿Cuántos tokens por segundo en una RTX 2080 Ti?+
La tabla pública de llama.cpp indica 107,5 tokens por segundo para Llama 2 7B en Q4_0. Un modelo más pesado será más lento, aproximadamente de forma proporcional: alrededor de 89 tokens por segundo para un 8B de 4,6 GB y 59 para un 12B de 7 GB, como estimación teórica. El contexto largo reduce aún más estos valores.
¿La RTX 2080 Ti soporta Flash Attention?+
Sí: la tabla de llama.cpp incluye un resultado con Flash Attention para la 2080 Ti, a 109,2 tokens por segundo en lugar de 107,5. Ollama lo activa automáticamente cuando la tarjeta lo permite y puedes forzarlo con OLLAMA_FLASH_ATTENTION=1. El principal beneficio es la memoria ahorrada en contextos largos.
¿Cómo saber si mi modelo cabe completamente en la tarjeta?+
Ejecuta ollama ps: la columna Processor muestra 100% GPU cuando el modelo está completamente cargado en la tarjeta. Una proporción como 48%/52% CPU/GPU indica que la carga está repartida entre la tarjeta y la RAM, lo que provoca una caída de velocidad. En este caso, reduce el contexto, cuantiza la caché K/V o elige un modelo más ligero.
¿La RTX 2080 Ti podría dejar de ser compatible?+
Ninguna de las fuentes consultadas anuncia el fin del soporte. Ollama incluye la tarjeta entre las de capacidad de cómputo 7.5 con un controlador 550 o más reciente, y CUDA 13 establece Turing como mínimo. Revisa las notas de versión en cada actualización principal de CUDA: ahí es donde se anunciaría la retirada del soporte.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.