Qué LLM ejecutar en una GTX 1070 / 1080 (8 GB) ?
Sí: una GTX 1070, 1070 Ti o 1080 de 8 GB puede ejecutar sin problemas un modelo de 7 a 9 mil millones de parámetros en Q4, con un contexto razonable. El benchmark público de llama.cpp mide 37,82 tokens/s para una GTX 1070 Ti en un 7B Q4_0; la 1080, con memoria más rápida, debería rendir mejor, aunque no haya una medición directa. Por encima de 9 mil millones de parámetros, los 8 GB se convierten en una limitación, y la arquitectura Pascal ya no tiene futuro en cuanto al soporte de software.
Las GTX 1070 (junio de 2016), 1070 Ti (noviembre de 2017) y 1080 (mayo de 2016) comparten el mismo chip GP104 y 8 GB de memoria. Se han convertido en las tarjetas de segunda mano más tentadoras para probar un LLM local sin gastar. Esta guía cuantifica lo que permite su memoria, lo que dicen las mediciones públicas sobre su velocidad y por qué la fecha de fin del soporte de Pascal pesa más que el precio.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#GTX 1070, 1070 Ti, 1080: lo que las distingue para un LLM
Para un LLM, estas tres tarjetas tienen la misma capacidad, 8 GB, y se diferencian por el ancho de banda de memoria, que determina la velocidad de generación. La 1070 y la 1070 Ti usan GDDR5 con un bus de 256 bits, es decir, 256 GB/s; la 1080 alcanza los 320 GB/s con GDDR5X. Como un LLM vuelve a leer todos sus pesos en cada token, esta diferencia del 25 % se traduce casi directamente en velocidad, mucho más que los 2.560 núcleos de la 1080 frente a los 1.920 de la 1070. Ninguna tiene Tensor Cores: Pascal sigue utilizando el cálculo CUDA clásico.
| Tarjeta | Núcleos CUDA | Memoria | Ancho de banda | Velocidad medida (7B Q4_0) |
|---|---|---|---|---|
| GTX 1070 | 1 920 | 8 GB GDDR5 | 256 GB/s | no medido en el banco de pruebas |
| GTX 1070 Ti | 2 432 | 8 GB GDDR5 | 256 GB/s | 37,82 tokens/s |
| GTX 1080 | 2 560 | 8 GB GDDR5X | 320 GB/s | no medido en el banco de pruebas |
Una GTX 1080 Ti, con 11 GB y 484 GB/s, pertenece a otra categoría: tiene su propia página. Si tu tarjeta es una 1080 Ti, lee mejor la guía dedicada a ella.
#Lo que realmente permiten 8 GB
El criterio que cuenta es la relación entre los pesos y la memoria disponible, ya que también hay que alojar la caché KV. El sitio da como referencia un modelo de 7-8B en Q4 con unos 5 GB de pesos: con 8 GB, quedan aproximadamente 3 GB para el contexto y el sistema, un margen real. Un modelo de 9B en Q4, con 6 GB de pesos, deja 2 GB: es posible con un contexto corto. Con 12 mil millones de parámetros, los pesos alcanzan los 7 GB: no queda casi nada.
| Modelo (Q4) | Tamaño del modelo | Margen disponible con 8 GB | Límite con 256 GB/s | Límite de 320 GB/s |
|---|---|---|---|---|
| Granite 4.1 3B | 2 GB | 6 GB | 128 tokens/s | 160 tokens/s |
| Granite 4.2 8B | 4,6 GB | 3,4 GB | 55 tokens/s | 70 tokens/s |
| Qwen3.5 9B | 6 GB | 2 GB | 43 tokens/s | 53 tokens/s |
| Gemma 4 12B | 7 GB | 1 GB | desaconsejado | desaconsejado |
| Phi-4 14B | 9 GB | negativo | no cabe en la memoria de la GPU | no cabe en la memoria de la GPU |
Un límite teórico nunca se alcanza. En el banco de pruebas público, la GTX 1070 Ti alcanza 37,82 tokens/s con un modelo de 3,56 GiB, es decir, aproximadamente el 56 % de su límite de 256 GB/s. Al aplicar esta misma eficiencia a los modelos anteriores, un Granite 4.2 8B funcionaría a unos 30 tokens/s en una 1070 Ti: es una extrapolación proporcional, no una medición.
#Lo que dicen los benchmarks públicos
QuelLLM no prueba estas tarjetas. Las cifras provienen de la discusión «Performance of llama.cpp on Nvidia CUDA» del repositorio llama.cpp, donde cada colaborador ejecuta llama-bench con Llama 2 7B en Q4_0 y todas las capas en la GPU. La GTX 1070 Ti registra allí 714,44 tokens/s en el procesamiento del prompt y 37,82 tokens/s en generación.
La comparación entre las tarjetas de la misma página para las que hay mediciones es útil: la RTX 2060 Super, una tarjeta Turing de 8 GB con un bus de 256 bits, produce 60,04 tokens/s en la misma prueba, frente a los 37,82 de la 1070 Ti. Con un ancho de banda de memoria similar, la mejora es del 59 %. La prueba explica así mejor la diferencia que los núcleos o el precio: Turing aprovecha mejor su memoria.
| Tarjeta | Memoria | Prompt (pp512) | Generación (tg128) |
|---|---|---|---|
| GTX 1070 Ti | 8 GB GDDR5, 256 bits | 714,44 tokens/s | 37,82 tokens/s |
| RTX 2060 Super | 8 GB GDDR6, 256 bits | 1 420,24 tokens/s | 60.04 tokens/s |
| GTX 1080 Ti | 11 GB GDDR5X, 352 bits | 1 084,41 tokens/s | 62,49 tokens/s |
Estas cifras deben interpretarse con tres precauciones. Cada fila del banco de pruebas es una contribución individual: el controlador, el sistema, la refrigeración y el fabricante de la tarjeta varían de un colaborador a otro, lo que explica algunos puntos de diferencia para un mismo chip. El modelo de prueba, un Llama 2 7B, es más antiguo y más pequeño que los modelos actuales: sirve como referencia común, no como predicción para un modelo concreto. Por último, la generación depende sobre todo de la memoria, mientras que la lectura del prompt depende de la potencia de cálculo: las dos columnas no cuentan lo mismo.
#Estimar la GTX 1080 sin medición: método y límites
La 1080 no aparece en las pruebas. Para hacerse una idea, se puede aplicar la relación entre los anchos de banda: 320 ÷ 256 = 1,25, es decir, aproximadamente 47 tokens/s (37,82 × 1,25) si el rendimiento se mantiene igual al de la 1070 Ti. Es una hipótesis plausible, no un resultado: los controladores, la versión de llama.cpp, la temperatura o la refrigeración de la tarjeta hacen variar las velocidades de forma considerable.
Si compras una tarjeta de segunda mano para este uso, pide al vendedor una captura de una prueba real o ejecuta tú mismo llama-bench con el modelo utilizado en el banco de pruebas en cuanto la recibas: el resultado se puede comparar directamente con la tabla pública.
#El contexto: en qué se consumen los 3 GB de margen
Con 8 GB, un Granite 4.2 8B en Q4 deja aproximadamente 3,4 GB libres. Esta reserva se reparte entre la caché KV, que crece con cada token de la conversación, los búferes de cálculo y el espacio ocupado por el controlador y la salida de vídeo si la tarjeta también controla tu pantalla. Ollama arranca con una ventana de 4.096 tokens, modificable mediante la variable OLLAMA_CONTEXT_LENGTH; duplicar la ventana duplica la caché KV.
Una regla de decisión sencilla: si quieres trabajar con documentos largos (16 000 tokens o más), elige un modelo de 3 a 4 mil millones de parámetros, o un 8B con una caché KV cuantizada. Si conversas mediante mensajes cortos, el 8B en Q4 es la opción adecuada. En ambos casos, comprueba con ollama ps que el modelo esté cargado al 100 % en la GPU: que se reparta entre la GPU y el procesador indica que el margen se ha agotado.
#Flash Attention en Pascal: ¿útil o no?
Una idea errónea sostiene que Flash Attention está reservado para tarjetas con Tensor Cores. El benchmark de llama.cpp lo refuta: prueba cada tarjeta con y sin Flash Attention, y la GTX 1080 Ti, de generación Pascal, figura en ambas tablas. Con Flash Attention, pasa de 1 084,41 a 1 138,14 tokens/s en procesamiento del prompt, es decir, aproximadamente un 5 % más, y de 62,49 a 61,38 tokens/s en generación, es decir, un 2 % menos. El principal beneficio de Flash Attention no es la velocidad, sino la memoria: reduce la huella del contexto, lo cual es importante con 8 GB.
Ollama activa Flash Attention automáticamente cuando el motor y la tarjeta son compatibles con esta función; la variable OLLAMA_FLASH_ATTENTION=1 fuerza su activación y el valor 0 la desactiva. La cuantización de la caché KV, que reduce aún más la memoria necesaria para el contexto, requiere que Flash Attention esté activada.
#¿Para qué sirve una tarjeta Pascal de 8 GB?
| Uso | Adecuación | Ajuste recomendado |
|---|---|---|
| Chat, reformulación, traducción | Buena | Granite 4.2 8B en Q4, contexto de 4 096 tokens |
| Ayuda para programar en el editor | Aceptable | Modelo 7-8B, contexto medio, un solo modelo cargado |
| Resumen de documentos largos | Limitada | Modelo de 3-4B o caché KV cuantizada |
| Búsqueda en documentos propios (RAG) | Aceptable | Modelo de 3-8B, extractos cortos, sin 12B |
| Agentes con llamadas a herramientas en cadena | Débil | Demasiado contexto y demasiadas llamadas para 8 GB |
#Pascal: el soporte de software, la verdadera limitación
El principal riesgo no proviene de la velocidad sino del software. Ollama requiere un controlador NVIDIA 570 o más reciente para tarjetas con una capacidad de cómputo de 5.0 a 6.2, entre las que figuran las GTX 1070 a 1080. Pero las notas de versión de CUDA 13 indican que se ha retirado el soporte para Pascal, y Wikipedia recuerda que NVIDIA dejó de ofrecer soporte Game Ready para esta generación en diciembre de 2025, con actualizaciones de seguridad hasta octubre de 2028.
- Aujourd'hui
- Ollama y llama.cpp funcionan con un controlador 570 o superior y builds CUDA 12.
- Mañana
- Las nuevas funciones y los nuevos motores se orientarán a CUDA 13: cada actualización puede eliminar la compatibilidad con Pascal.
- Seguridad
- Hay parches de seguridad para el controlador hasta octubre de 2028, pero no nuevas optimizaciones.
#¿Es mejor una 1070 Ti u otra opción?
Con el mismo presupuesto para comprar de segunda mano, la comparación se basa en tres criterios: la memoria (8 GB como mínimo), la generación de la arquitectura (Turing o más reciente para aprovechar CUDA 13) y el ancho de banda. Sin citar precios, que cambian cada semana, así se sitúan las distintas opciones.
| Opción | Puntos fuertes | Puntos débiles |
|---|---|---|
| GTX 1070 / 1070 Ti / 1080 (si ya la tienes) | Gratis; modelos de 7-9B funcionan con holgura | Pascal al final de su período de soporte, más lenta con el mismo ancho de banda |
| RTX 2060 Super (8 GB) | 60,04 tokens/s en el banco de pruebas, Turing, Tensor Cores | Siempre 8 GB |
| RTX 3050 (6 o 8 GB) | Ampere, soporte de software a largo plazo | Ancho de banda limitado según la versión |
| Tarjeta de 12 GB (RTX 3060 12 GB) | Margen para 12-14B y contexto largo | Presupuesto más alto |
- ¿Qué LLM usar en una RTX 2060 / 2060 Super?
- ¿Qué LLM usar en una RTX 3060 de 12 GB?
- Qué modelos usar con 8 GB de VRAM, independientemente de la tarjeta
- Comparar los precios de las GPU para la IA
#Veredicto: descubrir sí, invertir no
Si ya tienes una GTX 1070, 1070 Ti o 1080, es una excelente opción para empezar: 8 GB bastan para un modelo 8B en Q4, y la velocidad de generación sigue siendo cómoda para chatear. Si buscas una tarjeta para comprar, prioriza una de 8 GB con arquitectura Turing o más reciente: con la misma memoria, las velocidades de generación son claramente superiores y el soporte de software dura más tiempo.
Un último criterio práctico: el consumo. Estas tarjetas consumen entre 150 y 180 W en juegos; durante la inferencia, se calientan menos que en juegos, pero un chasis mal ventilado puede reducir la velocidad de generación. Comprueba las temperaturas durante una generación larga antes de concluir que la tarjeta es lenta.
- Fuente: benchmark público de llama.cpp con CUDA
- Fuente: documentación de Ollama, hardware NVIDIA compatible
- Fuente: Serie GeForce 10, características
- Fuente: notas de versión del CUDA Toolkit
¿Puede una GTX 1070 o 1080 ejecutar un modelo de 8B?+
¿GTX 1070 o GTX 1080 para un LLM local?+
¿Cuántos tokens por segundo en una GTX 1080?+
¿Se puede ejecutar Qwen3.5 9B en una GTX 1070?+
¿Conviene comprar una GTX 1080 de segunda mano en 2026?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.