Principiante 11 minGTX 10

Qué LLM ejecutar en una GTX 1070 / 1080 (8 GB) ?

Respuesta directa

Sí: una GTX 1070, 1070 Ti o 1080 de 8 GB puede ejecutar sin problemas un modelo de 7 a 9 mil millones de parámetros en Q4, con un contexto razonable. El benchmark público de llama.cpp mide 37,82 tokens/s para una GTX 1070 Ti en un 7B Q4_0; la 1080, con memoria más rápida, debería rendir mejor, aunque no haya una medición directa. Por encima de 9 mil millones de parámetros, los 8 GB se convierten en una limitación, y la arquitectura Pascal ya no tiene futuro en cuanto al soporte de software.

Las GTX 1070 (junio de 2016), 1070 Ti (noviembre de 2017) y 1080 (mayo de 2016) comparten el mismo chip GP104 y 8 GB de memoria. Se han convertido en las tarjetas de segunda mano más tentadoras para probar un LLM local sin gastar. Esta guía cuantifica lo que permite su memoria, lo que dicen las mediciones públicas sobre su velocidad y por qué la fecha de fin del soporte de Pascal pesa más que el precio.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#GTX 1070, 1070 Ti, 1080: lo que las distingue para un LLM

Para un LLM, estas tres tarjetas tienen la misma capacidad, 8 GB, y se diferencian por el ancho de banda de memoria, que determina la velocidad de generación. La 1070 y la 1070 Ti usan GDDR5 con un bus de 256 bits, es decir, 256 GB/s; la 1080 alcanza los 320 GB/s con GDDR5X. Como un LLM vuelve a leer todos sus pesos en cada token, esta diferencia del 25 % se traduce casi directamente en velocidad, mucho más que los 2.560 núcleos de la 1080 frente a los 1.920 de la 1070. Ninguna tiene Tensor Cores: Pascal sigue utilizando el cálculo CUDA clásico.

Las tres tarjetas de un vistazo (Wikipedia, serie GeForce 10; medición: banco de pruebas llama.cpp)
TarjetaNúcleos CUDAMemoriaAncho de bandaVelocidad medida (7B Q4_0)
GTX 10701 9208 GB GDDR5256 GB/sno medido en el banco de pruebas
GTX 1070 Ti2 4328 GB GDDR5256 GB/s37,82 tokens/s
GTX 10802 5608 GB GDDR5X320 GB/sno medido en el banco de pruebas

Una GTX 1080 Ti, con 11 GB y 484 GB/s, pertenece a otra categoría: tiene su propia página. Si tu tarjeta es una 1080 Ti, lee mejor la guía dedicada a ella.

#Lo que realmente permiten 8 GB

El criterio que cuenta es la relación entre los pesos y la memoria disponible, ya que también hay que alojar la caché KV. El sitio da como referencia un modelo de 7-8B en Q4 con unos 5 GB de pesos: con 8 GB, quedan aproximadamente 3 GB para el contexto y el sistema, un margen real. Un modelo de 9B en Q4, con 6 GB de pesos, deja 2 GB: es posible con un contexto corto. Con 12 mil millones de parámetros, los pesos alcanzan los 7 GB: no queda casi nada.

Modelos en 8 GB, límites teóricos (ancho de banda ÷ peso; no son medidas reales)
Modelo (Q4)Tamaño del modeloMargen disponible con 8 GBLímite con 256 GB/sLímite de 320 GB/s
Granite 4.1 3B2 GB6 GB128 tokens/s160 tokens/s
Granite 4.2 8B4,6 GB3,4 GB55 tokens/s70 tokens/s
Qwen3.5 9B6 GB2 GB43 tokens/s53 tokens/s
Gemma 4 12B7 GB1 GBdesaconsejadodesaconsejado
Phi-4 14B9 GBnegativono cabe en la memoria de la GPUno cabe en la memoria de la GPU

Un límite teórico nunca se alcanza. En el banco de pruebas público, la GTX 1070 Ti alcanza 37,82 tokens/s con un modelo de 3,56 GiB, es decir, aproximadamente el 56 % de su límite de 256 GB/s. Al aplicar esta misma eficiencia a los modelos anteriores, un Granite 4.2 8B funcionaría a unos 30 tokens/s en una 1070 Ti: es una extrapolación proporcional, no una medición.

#Lo que dicen los benchmarks públicos

QuelLLM no prueba estas tarjetas. Las cifras provienen de la discusión «Performance of llama.cpp on Nvidia CUDA» del repositorio llama.cpp, donde cada colaborador ejecuta llama-bench con Llama 2 7B en Q4_0 y todas las capas en la GPU. La GTX 1070 Ti registra allí 714,44 tokens/s en el procesamiento del prompt y 37,82 tokens/s en generación.

La comparación entre las tarjetas de la misma página para las que hay mediciones es útil: la RTX 2060 Super, una tarjeta Turing de 8 GB con un bus de 256 bits, produce 60,04 tokens/s en la misma prueba, frente a los 37,82 de la 1070 Ti. Con un ancho de banda de memoria similar, la mejora es del 59 %. La prueba explica así mejor la diferencia que los núcleos o el precio: Turing aprovecha mejor su memoria.

Banco de pruebas de llama.cpp con CUDA, Llama 2 7B Q4_0, sin Flash Attention
TarjetaMemoriaPrompt (pp512)Generación (tg128)
GTX 1070 Ti8 GB GDDR5, 256 bits714,44 tokens/s37,82 tokens/s
RTX 2060 Super8 GB GDDR6, 256 bits1 420,24 tokens/s60.04 tokens/s
GTX 1080 Ti11 GB GDDR5X, 352 bits1 084,41 tokens/s62,49 tokens/s

Estas cifras deben interpretarse con tres precauciones. Cada fila del banco de pruebas es una contribución individual: el controlador, el sistema, la refrigeración y el fabricante de la tarjeta varían de un colaborador a otro, lo que explica algunos puntos de diferencia para un mismo chip. El modelo de prueba, un Llama 2 7B, es más antiguo y más pequeño que los modelos actuales: sirve como referencia común, no como predicción para un modelo concreto. Por último, la generación depende sobre todo de la memoria, mientras que la lectura del prompt depende de la potencia de cálculo: las dos columnas no cuentan lo mismo.

i
Las diferencias de velocidad también vienen del prompt
La lectura del prompt es aproximadamente dos veces más lenta en la 1070 Ti que en la 2060 Super. Con un documento largo pegado en la conversación, la espera antes de la primera respuesta es, por tanto, considerablemente más larga en Pascal.

#Estimar la GTX 1080 sin medición: método y límites

La 1080 no aparece en las pruebas. Para hacerse una idea, se puede aplicar la relación entre los anchos de banda: 320 ÷ 256 = 1,25, es decir, aproximadamente 47 tokens/s (37,82 × 1,25) si el rendimiento se mantiene igual al de la 1070 Ti. Es una hipótesis plausible, no un resultado: los controladores, la versión de llama.cpp, la temperatura o la refrigeración de la tarjeta hacen variar las velocidades de forma considerable.

Si compras una tarjeta de segunda mano para este uso, pide al vendedor una captura de una prueba real o ejecuta tú mismo llama-bench con el modelo utilizado en el banco de pruebas en cuanto la recibas: el resultado se puede comparar directamente con la tabla pública.

#El contexto: en qué se consumen los 3 GB de margen

Con 8 GB, un Granite 4.2 8B en Q4 deja aproximadamente 3,4 GB libres. Esta reserva se reparte entre la caché KV, que crece con cada token de la conversación, los búferes de cálculo y el espacio ocupado por el controlador y la salida de vídeo si la tarjeta también controla tu pantalla. Ollama arranca con una ventana de 4.096 tokens, modificable mediante la variable OLLAMA_CONTEXT_LENGTH; duplicar la ventana duplica la caché KV.

Una regla de decisión sencilla: si quieres trabajar con documentos largos (16 000 tokens o más), elige un modelo de 3 a 4 mil millones de parámetros, o un 8B con una caché KV cuantizada. Si conversas mediante mensajes cortos, el 8B en Q4 es la opción adecuada. En ambos casos, comprueba con ollama ps que el modelo esté cargado al 100 % en la GPU: que se reparta entre la GPU y el procesador indica que el margen se ha agotado.

#Flash Attention en Pascal: ¿útil o no?

Una idea errónea sostiene que Flash Attention está reservado para tarjetas con Tensor Cores. El benchmark de llama.cpp lo refuta: prueba cada tarjeta con y sin Flash Attention, y la GTX 1080 Ti, de generación Pascal, figura en ambas tablas. Con Flash Attention, pasa de 1 084,41 a 1 138,14 tokens/s en procesamiento del prompt, es decir, aproximadamente un 5 % más, y de 62,49 a 61,38 tokens/s en generación, es decir, un 2 % menos. El principal beneficio de Flash Attention no es la velocidad, sino la memoria: reduce la huella del contexto, lo cual es importante con 8 GB.

Ollama activa Flash Attention automáticamente cuando el motor y la tarjeta son compatibles con esta función; la variable OLLAMA_FLASH_ATTENTION=1 fuerza su activación y el valor 0 la desactiva. La cuantización de la caché KV, que reduce aún más la memoria necesaria para el contexto, requiere que Flash Attention esté activada.

Forzar la activación de Flash Attention al iniciar el servidor
OLLAMA_FLASH_ATTENTION=1 ollama serve

#¿Para qué sirve una tarjeta Pascal de 8 GB?

Tareas comunes y adecuación
UsoAdecuaciónAjuste recomendado
Chat, reformulación, traducciónBuenaGranite 4.2 8B en Q4, contexto de 4 096 tokens
Ayuda para programar en el editorAceptableModelo 7-8B, contexto medio, un solo modelo cargado
Resumen de documentos largosLimitadaModelo de 3-4B o caché KV cuantizada
Búsqueda en documentos propios (RAG)AceptableModelo de 3-8B, extractos cortos, sin 12B
Agentes con llamadas a herramientas en cadenaDébilDemasiado contexto y demasiadas llamadas para 8 GB

#Pascal: el soporte de software, la verdadera limitación

El principal riesgo no proviene de la velocidad sino del software. Ollama requiere un controlador NVIDIA 570 o más reciente para tarjetas con una capacidad de cómputo de 5.0 a 6.2, entre las que figuran las GTX 1070 a 1080. Pero las notas de versión de CUDA 13 indican que se ha retirado el soporte para Pascal, y Wikipedia recuerda que NVIDIA dejó de ofrecer soporte Game Ready para esta generación en diciembre de 2025, con actualizaciones de seguridad hasta octubre de 2028.

Aujourd'hui
Ollama y llama.cpp funcionan con un controlador 570 o superior y builds CUDA 12.
Mañana
Las nuevas funciones y los nuevos motores se orientarán a CUDA 13: cada actualización puede eliminar la compatibilidad con Pascal.
Seguridad
Hay parches de seguridad para el controlador hasta octubre de 2028, pero no nuevas optimizaciones.
!
No confíes en la fecha de 2028
Esta fecha se refiere a la seguridad del controlador, no a la compatibilidad de las herramientas de IA. Un motor de inferencia puede dejar de ser compatible con Pascal mucho antes: prevé una tarjeta de reemplazo.

#¿Es mejor una 1070 Ti u otra opción?

Con el mismo presupuesto para comprar de segunda mano, la comparación se basa en tres criterios: la memoria (8 GB como mínimo), la generación de la arquitectura (Turing o más reciente para aprovechar CUDA 13) y el ancho de banda. Sin citar precios, que cambian cada semana, así se sitúan las distintas opciones.

Opciones de gama de entrada para un LLM local
OpciónPuntos fuertesPuntos débiles
GTX 1070 / 1070 Ti / 1080 (si ya la tienes)Gratis; modelos de 7-9B funcionan con holguraPascal al final de su período de soporte, más lenta con el mismo ancho de banda
RTX 2060 Super (8 GB)60,04 tokens/s en el banco de pruebas, Turing, Tensor CoresSiempre 8 GB
RTX 3050 (6 o 8 GB)Ampere, soporte de software a largo plazoAncho de banda limitado según la versión
Tarjeta de 12 GB (RTX 3060 12 GB)Margen para 12-14B y contexto largoPresupuesto más alto

#Veredicto: descubrir sí, invertir no

Si ya tienes una GTX 1070, 1070 Ti o 1080, es una excelente opción para empezar: 8 GB bastan para un modelo 8B en Q4, y la velocidad de generación sigue siendo cómoda para chatear. Si buscas una tarjeta para comprar, prioriza una de 8 GB con arquitectura Turing o más reciente: con la misma memoria, las velocidades de generación son claramente superiores y el soporte de software dura más tiempo.

Un último criterio práctico: el consumo. Estas tarjetas consumen entre 150 y 180 W en juegos; durante la inferencia, se calientan menos que en juegos, pero un chasis mal ventilado puede reducir la velocidad de generación. Comprueba las temperaturas durante una generación larga antes de concluir que la tarjeta es lenta.

FAQ
¿Puede una GTX 1070 o 1080 ejecutar un modelo de 8B?+
Sí. Un Granite 4.2 8B en Q4 pesa aproximadamente 4,6 GB, lo que deja más de 3 GB de los 8 GB disponibles para el contexto y el sistema. El benchmark de llama.cpp da 37,82 tokens/s para una 1070 Ti con un 7B Q4_0, una velocidad de generación cómoda para chatear.
¿GTX 1070 o GTX 1080 para un LLM local?+
La 1080. Su memoria GDDR5X a 320 GB/s frente a 256 GB/s en la 1070 aumenta la tasa de generación en aproximadamente un 25 % para un modelo idéntico, ya que la velocidad está limitada por la memoria. La capacidad sigue siendo la misma, 8 GB. Revisa el estado y la refrigeración de una tarjeta de segunda mano.
¿Cuántos tokens por segundo en una GTX 1080?+
No existe ninguna medición de la GTX 1080 en el banco de pruebas público de llama.cpp. La GTX 1070 Ti, con un ancho de banda de 256 GB/s, alcanza 37,82 tokens/s en un modelo de 7B en Q4_0. Según la proporción entre los anchos de banda, la 1080 debería superar los 45 tokens/s, una estimación que debe verificarse con llama-bench.
¿Se puede ejecutar Qwen3.5 9B en una GTX 1070?+
Sí, pero con poco margen: los pesos en Q4 ocupan aproximadamente 6 GB de los 8 disponibles, y quedan 2 GB para la caché KV y el sistema. Mantén un contexto corto y comprueba con ollama ps que el modelo siga en la GPU.
¿Conviene comprar una GTX 1080 de segunda mano en 2026?+
Solo a un precio muy bajo y para probar. Pascal se ha eliminado de CUDA 13 y el soporte Game Ready terminó en diciembre de 2025; una RTX 2060 Super de 8 GB produce 60,04 tokens/s en el banco de pruebas, frente a 37,82 para una 1070 Ti. Con un presupuesto similar, la tarjeta Turing es la mejor compra.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.