Principiante 11 minGTX 10

¿Qué LLM en GTX 1080 Ti (11 GB)? ?

Respuesta directa

Sí: la GTX 1080 Ti (11 GB, 484 GB/s) sigue siendo una de las mejores tarjetas Pascal para un LLM local. El benchmark público de llama.cpp mide 62,49 tokens/s en generación en un modelo Llama 2 7B en Q4_0, lo que equivale al rendimiento de una RTX 2060 Super, con 3 GB más de memoria. Puede alojar un 8B o un 9B en Q4 con margen, y un 12B con un contexto modesto. Sin embargo, su futuro en cuanto al soporte de software es limitado: Pascal ha sido retirado de CUDA 13.

La GTX 1080 Ti salió en marzo de 2017 con 11 GB de GDDR5X en un bus de 352 bits, una capacidad poco habitual durante mucho tiempo que aún le da una ventaja sobre las tarjetas de 8 GB. Esta guía cuantifica lo que esta memoria permite hoy y recoge lo que dicen las mediciones públicas, además de corregir una idea extendida: el FP16 de una GPU Pascal no es «dos veces más lento», es casi inutilizable, pero eso importa poco para los modelos cuantizados.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#La GTX 1080 Ti en 2026: lo que tiene, lo que no tiene

La GTX 1080 Ti es una tarjeta Pascal (chip GP102) de 3 584 núcleos CUDA, 11 GB de GDDR5X y 484 GB/s de ancho de banda, con una potencia de 250 W. En el banco de pruebas público de llama.cpp, produce 62,49 tokens/s en generación y 1 084,41 tokens/s en lectura del prompt con un Llama 2 7B en Q4_0. Estos resultados la sitúan al nivel de una RTX 2060 Super en generación, con 3 GB más: es esa capacidad, más que la velocidad, la que justifica seguir interesándose por ella.

Características (Wikipedia, GeForce 10 series)
ElementoValor
ChipGP102-350, Pascal
Núcleos CUDA3 584
Memoria11 GB GDDR5X, bus 352 bits
Ancho de banda484 GB/s
Potencia de cálculo FP3210 609 GFLOPS
Potencia de cálculo FP16166 GFLOPS
Potencia de diseño térmico (TDP)250 W

La tabla ya contiene la información más importante: en esta tarjeta, el rendimiento en FP16 es aproximadamente 1/64 del rendimiento en FP32. El párrafo siguiente explica por qué esto no supone una desventaja tan grande como se cree.

#Las limitaciones de Pascal, lo que cuenta y lo que no cuenta

Hay tres limitaciones reales. La primera es la ausencia de Tensor Cores, las unidades de cálculo matricial que aparecieron con Volta y Turing: aceleran la lectura del prompt y el entrenamiento, no la generación, que depende de la memoria. La segunda es el FP16, con un rendimiento ridículamente bajo en las GPU Pascal de consumo (aproximadamente 166 GFLOPS frente a 10 609 en FP32): los motores como llama.cpp sortean el problema realizando los cálculos de los modelos cuantizados con números enteros. La tercera es el fin del soporte de software, que se aborda más abajo.

Dos afirmaciones repetidas con frecuencia son falsas. El FP16 no es simplemente el doble de lento, es sesenta veces más lento. Y Flash Attention no está reservada a los Tensor Cores: el banco de pruebas llama.cpp ejecuta la 1080 Ti con Flash Attention activada, a 1 138,14 tokens/s en la lectura del prompt y 61,38 tokens/s en la generación, frente a 1 084,41 y 62,49 sin ella. La mejora en la tasa de procesamiento es pequeña, pero la función está disponible y reduce la memoria del contexto.

!
Sin FP8 ni FP4
Los formatos recientes de cuantización por hardware (FP8, FP4) requieren tarjetas más recientes. En la 1080 Ti, usa las cuantizaciones GGUF clásicas (Q4_K_M, Q5_K_M, Q8_0), que funcionan mediante cálculos con números enteros.

#Lo que permiten 11 GB: la tabla de decisión

La referencia del sitio sitúa un 8B en Q4 alrededor de 5 GB y un 14B alrededor de 9 GB, sin contar la caché KV. Con 11 GB, un 12B deja 4 GB de margen y un 14B solo 2 GB. La tabla aplica el rendimiento observado en el banco de pruebas (el 49 % del máximo teórico de 484 GB/s, es decir, 62,49 tokens/s para 3,82 GB de pesos) a los modelos habituales: son proyecciones, no mediciones.

Modelos con 11 GB disponibles, límite teórico y proyección con una eficiencia del 49 %
Modelo (Q4)Tamaño del modeloMargen disponible en 11 GBLímite de 484 GB/sProyección
Granite 4.2 8B4,6 GB6,4 GB105 tokens/saproximadamente 51 tokens/s
Qwen3.5 9B6 GB5 GB81 tokens/saproximadamente 40 tokens/s
Gemma 4 12B7 GB4 GB69 tokens/saproximadamente 34 tokens/s
Phi-4 14B9 GB2 GB54 tokens/saproximadamente 26 tokens/s, contexto corto
Gemma 4 26B-A4B (MoE)16 GBnegativono cabe en la memoria de la GPUfuera de alcance

El rango más interesante es el de 12B: es el modelo más grande que sigue funcionando con holgura, con un contexto de varios miles de tokens. En una tarjeta de 8 GB, este mismo modelo deja apenas 1 GB y obliga a reducir drásticamente el contexto. Por encima de ese tamaño, un 14B en Q4 cabe, pero sin margen, y un modelo de 30 mil millones de parámetros no cabe.

#Lo que dicen los benchmarks públicos

QuelLLM no prueba esta tarjeta. El banco de pruebas de la discusión «Performance of llama.cpp on Nvidia CUDA» compara todas las tarjetas con el mismo modelo, lo que permite situar la 1080 Ti frente a las tarjetas próximas a ella.

Banco de pruebas de llama.cpp con CUDA, Llama 2 7B Q4_0, sin Flash Attention
TarjetaMemoriaPrompt (pp512)Generación (tg128)
GTX 1080 Ti11 GB GDDR5X, 352 bits1 084,41 tokens/s62,49 tokens/s
Tesla P40 (Pascal)24 GB GDDR5, 384 bits1 007,42 tokens/s54,74 tokens/s
RTX 2060 Super8 GB GDDR6, 256 bits1 420,24 tokens/s60.04 tokens/s
RTX 306012 GB GDDR6, 192 bits2 137,50 tokens/s75,57 tokens/s
RTX 2080 Ti11 GB GDDR6, 352 bits2 890,66 tokens/s107,51 tokens/s

Se desprenden tres conclusiones. En generación, la 1080 Ti iguala a la RTX 2060 Super y queda un 17 % por detrás de una RTX 3060 de 12 GB. En el procesamiento del prompt, la diferencia aumenta: la RTX 3060 alcanza casi el doble de su velocidad, y la RTX 2080 Ti, con la misma capacidad, alcanza 2,7 veces su velocidad. Por último, la Tesla P40, una tarjeta Pascal de 24 GB, alcanza 54,74 tokens/s: demuestra que esta arquitectura permite alcanzar una capacidad de 24 GB, con una tasa de generación inferior a la de la 1080 Ti.

i
Generación frente a lectura del prompt
Para chats con mensajes cortos, predomina la generación y la 1080 Ti sigue siendo competitiva. Para resumir documentos largos o usar RAG, la lectura del prompt cuenta: las tarjetas Turing y Ampere ofrecen en ese aspecto una ventaja de un factor de 2 a 3.

#Aprovechar los 11 GB: aplicar una cuantización menos agresiva

Una ventaja propia de los 11 GB es poder aumentar la calidad en lugar del tamaño. El catálogo QuelLLM indica para un Granite 4.2 8B: 4,6 GB en Q4, 6 GB en Q5 y 9 GB en Q8. Con 8 GB, solo Q4 deja margen. Con 11 GB, Q5 (6 GB) sigue dejando un margen muy cómodo y Q8 (9 GB) cabe con un contexto corto.

Granite 4.2 8B según la cuantización con 11 GB de VRAM
CuantizaciónTamaño del modeloMargenLímite de 484 GB/s
Q44,6 GB6,4 GB105 tokens/s
Q56 GB5 GB81 tokens/s
Q89 GB2 GB54 tokens/s

El compromiso es claro: cada nivel de cuantización reduce los errores del modelo, pero ralentiza la generación, ya que se releen más pesos para cada token. Para conversaciones habituales, Q5 ofrece un buen equilibrio; Q8 se justifica por la precisión (extracción, código) cuando la velocidad de generación importa poco. La guía de cuantización detalla la diferencia de calidad.

#Dos tarjetas para 22 GB: posible, pero debe verificarse

El banco de pruebas de llama.cpp indica en sus instrucciones que los colaboradores con varias GPU deben forzar el uso de una sola GPU con -sm none -mg, salvo que el modelo sea demasiado grande para la VRAM: por tanto, el motor sí distribuye un modelo entre varias tarjetas. Dos GTX 1080 Ti ofrecerían 22 GB para los pesos, suficientes para alojar un modelo de 32 mil millones de parámetros en Q4 (19 a 20 GB según la referencia del sitio), sin margen para el contexto.

La distribución no suma las velocidades: las capas se reparten entre las tarjetas y pasan por el bus PCIe, lo que limita la ganancia. Este montaje también requiere una caja, una fuente de alimentación y una placa base adecuadas, y duplica la exposición al fin del soporte de Pascal. Para un proyecto que requiera 24 GB, compara primero el coste de una sola tarjeta más reciente.

#Instalar y verificar en cuatro pasos

  1. 01
    Comprobar el controlador
    Ejecuta nvidia-smi. Para las tarjetas de compute capability 5.0 a 6.2, como la GTX 1080 Ti, la documentación de Ollama exige un controlador 570 o más reciente.
  2. 02
    Instalar Ollama
    Sigue la guía de instalación para tu sistema. Ollama reconoce la tarjeta como GTX 1080 Ti (capacidad de cómputo 6.1) en su lista oficial.
  3. 03
    Elegir un modelo adecuado
    Comienza con un 8B en Q4 para validar todo el proceso, luego prueba un 12B con un contexto de 4 096 tokens.
  4. 04
    Comprobar dónde se ejecuta
    Inicia ollama ps: la columna PROCESSOR debe indicar 100 % GPU. De lo contrario, reduce el contexto o el modelo.

Si falla la carga, no busques una variable poco habitual para sortear el problema: Ollama activa automáticamente Flash Attention cuando el motor y la tarjeta son compatibles con ella, y la variable documentada es OLLAMA_FLASH_ATTENTION (1 para forzar su activación, 0 para desactivarla). La guía de solución de problemas detalla los errores comunes.

#Fin de vida de Pascal: lo que hay que planificar

Las notas de versión de CUDA 13 indican que Maxwell, Pascal y Volta ya no son compatibles. Wikipedia informa de que NVIDIA dejó de ofrecer soporte Game Ready para estas arquitecturas en diciembre de 2025, con actualizaciones de seguridad hasta octubre de 2028. Actualmente, la GTX 1080 Ti funciona con Ollama y un controlador de la versión 570 o posterior: el riesgo es que los futuros motores de inferencia solo se orienten a CUDA 13. Anota las versiones de tu controlador y de Ollama antes de cualquier actualización.

#Veredicto: conservarla, sí; comprarla, con condiciones

Decisión según tu situación
Tu situaciónRecomendación
Ya tienes una 1080 TiConservarla: modelos de 8-12B con holgura, 62 tokens/s en el banco de pruebas
Quieres un 12B con contexto sin gastarEs adecuada: 11 GB, margen de 4 GB
Trabajas con documentos largos o con RAGUna tarjeta Ampere o Turing lee el prompt 2 a 3 veces más rápido
Buscas una compra que te dureOptar por Turing o una arquitectura más reciente: CUDA 13 ya no tiene Pascal como arquitectura de destino
Quieres 16 GB o másCambiar de gama: la 1080 Ti tiene un límite de 11 GB

Para comparar las opciones actuales sin listar precios que cambian cada semana, las páginas del sitio indican los modelos adecuados para cada capacidad de memoria y enlazan a la página de precios de las tarjetas.

FAQ
¿Puede la GTX 1080 Ti seguir ejecutando un LLM en 2026?+
Sí. El banco de pruebas público de llama.cpp mide 62,49 tokens/s en un modelo de 7B en Q4_0, y sus 11 GB permiten alojar un 8B o un 9B con margen, y un 12B con un contexto modesto. Sigue siendo una opción pertinente mientras las herramientas sean compatibles con Pascal.
¿GTX 1080 Ti o RTX 2060 Super para un LLM?+
Para la generación, rinden de forma similar: 62,49 frente a 60,04 tokens/s en las pruebas. La 1080 Ti tiene 3 GB más de memoria, lo que importa para un 12B; la 2060 Super lee el prompt más rápido (1 420 frente a 1 084 tokens/s) y sigue siendo compatible con CUDA 13.
¿La GTX 1080 Ti es más lenta que una RTX 3060 para un LLM?+
Sí, un 17 % en generación (62,49 contra 75,57 tokens/s) y casi la mitad en lectura del prompt (1 084 contra 2 137 tokens/s). La 3060 tiene solo 12 GB contra 11: la ventaja de capacidad es mínima. La 3060 gana principalmente por su soporte de software más largo.
¿La 1080 Ti soporta Flash Attention?+
Sí. La prueba de rendimiento de llama.cpp mide su velocidad con Flash Attention en 1 138,14 tokens/s al procesar el prompt y 61,38 al generar texto. La mejora en la velocidad de procesamiento es pequeña, pero la función reduce la memoria utilizada por el contexto. Ollama la activa automáticamente cuando la tarjeta es compatible con ella.
¿Qué controlador se necesita para la GTX 1080 Ti con Ollama?+
La documentación de Ollama requiere un controlador NVIDIA 570 o más reciente para tarjetas con compute capability de 5.0 a 6.2, entre ellas la GTX 1080 Ti. Verifica tu versión con nvidia-smi antes de instalar. NVIDIA prevé actualizaciones de seguridad de la rama 580 hasta octubre de 2028, pero no nuevas optimizaciones.
¿Cuándo hay que reemplazar la GTX 1080 Ti?+
Cuando una herramienta que necesitas deja de ser compatible con Pascal, o cuando tus usos exigen más de 11 GB o una lectura rápida del prompt, como ocurre con los documentos largos y el RAG. CUDA 13 ya ha retirado la compatibilidad con Pascal: es la señal que debes vigilar en cada actualización de Ollama o de llama.cpp.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.