¿Qué LLM en GTX 1080 Ti (11 GB)? ?
Sí: la GTX 1080 Ti (11 GB, 484 GB/s) sigue siendo una de las mejores tarjetas Pascal para un LLM local. El benchmark público de llama.cpp mide 62,49 tokens/s en generación en un modelo Llama 2 7B en Q4_0, lo que equivale al rendimiento de una RTX 2060 Super, con 3 GB más de memoria. Puede alojar un 8B o un 9B en Q4 con margen, y un 12B con un contexto modesto. Sin embargo, su futuro en cuanto al soporte de software es limitado: Pascal ha sido retirado de CUDA 13.
La GTX 1080 Ti salió en marzo de 2017 con 11 GB de GDDR5X en un bus de 352 bits, una capacidad poco habitual durante mucho tiempo que aún le da una ventaja sobre las tarjetas de 8 GB. Esta guía cuantifica lo que esta memoria permite hoy y recoge lo que dicen las mediciones públicas, además de corregir una idea extendida: el FP16 de una GPU Pascal no es «dos veces más lento», es casi inutilizable, pero eso importa poco para los modelos cuantizados.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#La GTX 1080 Ti en 2026: lo que tiene, lo que no tiene
La GTX 1080 Ti es una tarjeta Pascal (chip GP102) de 3 584 núcleos CUDA, 11 GB de GDDR5X y 484 GB/s de ancho de banda, con una potencia de 250 W. En el banco de pruebas público de llama.cpp, produce 62,49 tokens/s en generación y 1 084,41 tokens/s en lectura del prompt con un Llama 2 7B en Q4_0. Estos resultados la sitúan al nivel de una RTX 2060 Super en generación, con 3 GB más: es esa capacidad, más que la velocidad, la que justifica seguir interesándose por ella.
| Elemento | Valor |
|---|---|
| Chip | GP102-350, Pascal |
| Núcleos CUDA | 3 584 |
| Memoria | 11 GB GDDR5X, bus 352 bits |
| Ancho de banda | 484 GB/s |
| Potencia de cálculo FP32 | 10 609 GFLOPS |
| Potencia de cálculo FP16 | 166 GFLOPS |
| Potencia de diseño térmico (TDP) | 250 W |
La tabla ya contiene la información más importante: en esta tarjeta, el rendimiento en FP16 es aproximadamente 1/64 del rendimiento en FP32. El párrafo siguiente explica por qué esto no supone una desventaja tan grande como se cree.
#Las limitaciones de Pascal, lo que cuenta y lo que no cuenta
Hay tres limitaciones reales. La primera es la ausencia de Tensor Cores, las unidades de cálculo matricial que aparecieron con Volta y Turing: aceleran la lectura del prompt y el entrenamiento, no la generación, que depende de la memoria. La segunda es el FP16, con un rendimiento ridículamente bajo en las GPU Pascal de consumo (aproximadamente 166 GFLOPS frente a 10 609 en FP32): los motores como llama.cpp sortean el problema realizando los cálculos de los modelos cuantizados con números enteros. La tercera es el fin del soporte de software, que se aborda más abajo.
Dos afirmaciones repetidas con frecuencia son falsas. El FP16 no es simplemente el doble de lento, es sesenta veces más lento. Y Flash Attention no está reservada a los Tensor Cores: el banco de pruebas llama.cpp ejecuta la 1080 Ti con Flash Attention activada, a 1 138,14 tokens/s en la lectura del prompt y 61,38 tokens/s en la generación, frente a 1 084,41 y 62,49 sin ella. La mejora en la tasa de procesamiento es pequeña, pero la función está disponible y reduce la memoria del contexto.
#Lo que permiten 11 GB: la tabla de decisión
La referencia del sitio sitúa un 8B en Q4 alrededor de 5 GB y un 14B alrededor de 9 GB, sin contar la caché KV. Con 11 GB, un 12B deja 4 GB de margen y un 14B solo 2 GB. La tabla aplica el rendimiento observado en el banco de pruebas (el 49 % del máximo teórico de 484 GB/s, es decir, 62,49 tokens/s para 3,82 GB de pesos) a los modelos habituales: son proyecciones, no mediciones.
| Modelo (Q4) | Tamaño del modelo | Margen disponible en 11 GB | Límite de 484 GB/s | Proyección |
|---|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | 6,4 GB | 105 tokens/s | aproximadamente 51 tokens/s |
| Qwen3.5 9B | 6 GB | 5 GB | 81 tokens/s | aproximadamente 40 tokens/s |
| Gemma 4 12B | 7 GB | 4 GB | 69 tokens/s | aproximadamente 34 tokens/s |
| Phi-4 14B | 9 GB | 2 GB | 54 tokens/s | aproximadamente 26 tokens/s, contexto corto |
| Gemma 4 26B-A4B (MoE) | 16 GB | negativo | no cabe en la memoria de la GPU | fuera de alcance |
El rango más interesante es el de 12B: es el modelo más grande que sigue funcionando con holgura, con un contexto de varios miles de tokens. En una tarjeta de 8 GB, este mismo modelo deja apenas 1 GB y obliga a reducir drásticamente el contexto. Por encima de ese tamaño, un 14B en Q4 cabe, pero sin margen, y un modelo de 30 mil millones de parámetros no cabe.
#Lo que dicen los benchmarks públicos
QuelLLM no prueba esta tarjeta. El banco de pruebas de la discusión «Performance of llama.cpp on Nvidia CUDA» compara todas las tarjetas con el mismo modelo, lo que permite situar la 1080 Ti frente a las tarjetas próximas a ella.
| Tarjeta | Memoria | Prompt (pp512) | Generación (tg128) |
|---|---|---|---|
| GTX 1080 Ti | 11 GB GDDR5X, 352 bits | 1 084,41 tokens/s | 62,49 tokens/s |
| Tesla P40 (Pascal) | 24 GB GDDR5, 384 bits | 1 007,42 tokens/s | 54,74 tokens/s |
| RTX 2060 Super | 8 GB GDDR6, 256 bits | 1 420,24 tokens/s | 60.04 tokens/s |
| RTX 3060 | 12 GB GDDR6, 192 bits | 2 137,50 tokens/s | 75,57 tokens/s |
| RTX 2080 Ti | 11 GB GDDR6, 352 bits | 2 890,66 tokens/s | 107,51 tokens/s |
Se desprenden tres conclusiones. En generación, la 1080 Ti iguala a la RTX 2060 Super y queda un 17 % por detrás de una RTX 3060 de 12 GB. En el procesamiento del prompt, la diferencia aumenta: la RTX 3060 alcanza casi el doble de su velocidad, y la RTX 2080 Ti, con la misma capacidad, alcanza 2,7 veces su velocidad. Por último, la Tesla P40, una tarjeta Pascal de 24 GB, alcanza 54,74 tokens/s: demuestra que esta arquitectura permite alcanzar una capacidad de 24 GB, con una tasa de generación inferior a la de la 1080 Ti.
#Aprovechar los 11 GB: aplicar una cuantización menos agresiva
Una ventaja propia de los 11 GB es poder aumentar la calidad en lugar del tamaño. El catálogo QuelLLM indica para un Granite 4.2 8B: 4,6 GB en Q4, 6 GB en Q5 y 9 GB en Q8. Con 8 GB, solo Q4 deja margen. Con 11 GB, Q5 (6 GB) sigue dejando un margen muy cómodo y Q8 (9 GB) cabe con un contexto corto.
| Cuantización | Tamaño del modelo | Margen | Límite de 484 GB/s |
|---|---|---|---|
| Q4 | 4,6 GB | 6,4 GB | 105 tokens/s |
| Q5 | 6 GB | 5 GB | 81 tokens/s |
| Q8 | 9 GB | 2 GB | 54 tokens/s |
El compromiso es claro: cada nivel de cuantización reduce los errores del modelo, pero ralentiza la generación, ya que se releen más pesos para cada token. Para conversaciones habituales, Q5 ofrece un buen equilibrio; Q8 se justifica por la precisión (extracción, código) cuando la velocidad de generación importa poco. La guía de cuantización detalla la diferencia de calidad.
#Dos tarjetas para 22 GB: posible, pero debe verificarse
El banco de pruebas de llama.cpp indica en sus instrucciones que los colaboradores con varias GPU deben forzar el uso de una sola GPU con -sm none -mg, salvo que el modelo sea demasiado grande para la VRAM: por tanto, el motor sí distribuye un modelo entre varias tarjetas. Dos GTX 1080 Ti ofrecerían 22 GB para los pesos, suficientes para alojar un modelo de 32 mil millones de parámetros en Q4 (19 a 20 GB según la referencia del sitio), sin margen para el contexto.
La distribución no suma las velocidades: las capas se reparten entre las tarjetas y pasan por el bus PCIe, lo que limita la ganancia. Este montaje también requiere una caja, una fuente de alimentación y una placa base adecuadas, y duplica la exposición al fin del soporte de Pascal. Para un proyecto que requiera 24 GB, compara primero el coste de una sola tarjeta más reciente.
#Instalar y verificar en cuatro pasos
- 01Comprobar el controladorEjecuta nvidia-smi. Para las tarjetas de compute capability 5.0 a 6.2, como la GTX 1080 Ti, la documentación de Ollama exige un controlador 570 o más reciente.
- 02Instalar OllamaSigue la guía de instalación para tu sistema. Ollama reconoce la tarjeta como GTX 1080 Ti (capacidad de cómputo 6.1) en su lista oficial.
- 03Elegir un modelo adecuadoComienza con un 8B en Q4 para validar todo el proceso, luego prueba un 12B con un contexto de 4 096 tokens.
- 04Comprobar dónde se ejecutaInicia ollama ps: la columna PROCESSOR debe indicar 100 % GPU. De lo contrario, reduce el contexto o el modelo.
Si falla la carga, no busques una variable poco habitual para sortear el problema: Ollama activa automáticamente Flash Attention cuando el motor y la tarjeta son compatibles con ella, y la variable documentada es OLLAMA_FLASH_ATTENTION (1 para forzar su activación, 0 para desactivarla). La guía de solución de problemas detalla los errores comunes.
#Fin de vida de Pascal: lo que hay que planificar
Las notas de versión de CUDA 13 indican que Maxwell, Pascal y Volta ya no son compatibles. Wikipedia informa de que NVIDIA dejó de ofrecer soporte Game Ready para estas arquitecturas en diciembre de 2025, con actualizaciones de seguridad hasta octubre de 2028. Actualmente, la GTX 1080 Ti funciona con Ollama y un controlador de la versión 570 o posterior: el riesgo es que los futuros motores de inferencia solo se orienten a CUDA 13. Anota las versiones de tu controlador y de Ollama antes de cualquier actualización.
#Veredicto: conservarla, sí; comprarla, con condiciones
| Tu situación | Recomendación |
|---|---|
| Ya tienes una 1080 Ti | Conservarla: modelos de 8-12B con holgura, 62 tokens/s en el banco de pruebas |
| Quieres un 12B con contexto sin gastar | Es adecuada: 11 GB, margen de 4 GB |
| Trabajas con documentos largos o con RAG | Una tarjeta Ampere o Turing lee el prompt 2 a 3 veces más rápido |
| Buscas una compra que te dure | Optar por Turing o una arquitectura más reciente: CUDA 13 ya no tiene Pascal como arquitectura de destino |
| Quieres 16 GB o más | Cambiar de gama: la 1080 Ti tiene un límite de 11 GB |
Para comparar las opciones actuales sin listar precios que cambian cada semana, las páginas del sitio indican los modelos adecuados para cada capacidad de memoria y enlazan a la página de precios de las tarjetas.
- ¿Qué LLM usar en una RTX 3060 de 12 GB?
- ¿Qué LLM en RTX 2080 Ti (11 GB)?
- Qué modelos usar con 12 GB de VRAM, en cualquier tarjeta
- Comparar los precios de las GPU para la IA
- Fuente: benchmark público de llama.cpp con CUDA
- Fuente: documentación de Ollama, hardware NVIDIA compatible
- Fuente: Serie GeForce 10, características
- Fuente: notas de versión del CUDA Toolkit
¿Puede la GTX 1080 Ti seguir ejecutando un LLM en 2026?+
¿GTX 1080 Ti o RTX 2060 Super para un LLM?+
¿La GTX 1080 Ti es más lenta que una RTX 3060 para un LLM?+
¿La 1080 Ti soporta Flash Attention?+
¿Qué controlador se necesita para la GTX 1080 Ti con Ollama?+
¿Cuándo hay que reemplazar la GTX 1080 Ti?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.