¿Qué LLM usar con una RTX 2070 / 2070 Super (8 GB)? ?
Una RTX 2070 o 2070 Super (8 GB de GDDR6) ejecuta cómodamente modelos de 7 a 9 mil millones de parámetros en Q4: Granite 4.2 8B (4,6 GB de pesos) o Qwen 3.5 9B (6 GB) caben completamente en la tarjeta. En el test de referencia de llama.cpp, la 2070 Super genera 88 tokens/s. Por encima de 9B, hay que cargar parte del modelo en la RAM del sistema y la velocidad de generación cae drásticamente.
La RTX 2070 (octubre de 2018) y la RTX 2070 Super (julio de 2019) son tarjetas Turing con 8 GB de memoria. En 2026 ofrecen un buen rendimiento para un asistente 8B en Q4 y están al límite para todo lo demás. Esta guía relaciona sus características con una prueba pública de velocidad, explica en qué se utilizan los 8 GB e indica cuándo vale la pena cambiar de tarjeta.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 2070 y 2070 Super: lo que permiten 8 GB
En una RTX 2070 o una 2070 Super, los modelos de 7 a 9 mil millones de parámetros con cuantización Q4 caben completamente en la memoria de vídeo: es la zona de confort de estas tarjetas. Según el catálogo QuelLLM, Granite 4.2 8B requiere 4,6 GB para los pesos en Q4 y Qwen 3.5 9B, aproximadamente 6 GB. Queda entonces espacio para el contexto, siempre que su longitud sea razonable. Un modelo de 12 mil millones como Gemma 4 12B (7 GB en Q4) deja apenas un gigabyte para la caché y el sistema: cabe sobre el papel, pero en la práctica funciona mal. En cuanto a velocidad, la 2070 Super alcanza 88 tokens por segundo en la prueba de referencia de llama.cpp con un modelo de 7 mil millones en Q4_0, muy por encima de la velocidad de lectura humana. El verdadero límite de estas tarjetas no es, por tanto, la velocidad, sino la capacidad de memoria.
- RTX 2070
- Octubre de 2018, 2 304 núcleos CUDA, 8 GB de GDDR6 en un bus de 256 bits, equivalentes a 448 GB/s (256 bits a 14 Gbit/s).
- RTX 2070 Super
- Julio de 2019, 2.560 núcleos CUDA, los mismos 8 GB y el mismo ancho de banda de 448 GB/s, consumo de 215 W.
- Lo que los distingue para un LLM
- Casi nada: el ancho de banda y la capacidad son idénticos. La Super tiene más núcleos, lo que ayuda sobre todo en la lectura del prompt, no en la generación.
Este último punto es contraintuitivo: para generar texto, el procesador gráfico vuelve a leer todos los pesos del modelo con cada token, de modo que el ancho de banda de memoria importa más que el número de núcleos. Dos tarjetas con 448 GB/s producirán velocidades de generación similares, aunque una sea claramente más rápida en los juegos.
#Qué modelos caben en 8 GB
Los pesos son solo una parte del consumo de memoria: hay que sumar la caché de contexto (KV cache), que crece con la longitud de la conversación, y después dejar un margen para el controlador y la visualización. En una tarjeta de 8 GB, la regla práctica es optar por pesos que ocupen como máximo 6 GB si quieres un contexto de varios miles de tokens. Como referencia, la herramienta de prueba de llama.cpp muestra 7 838 MiB de memoria libre en una RTX 3060 Ti de 8 GB, algo menos que los 8 192 MiB teóricos: unos cientos de megabytes ya están ocupados antes incluso de cargar un modelo.
| Modelo | Peso en Q4 | Veredicto para 8 GB |
|---|---|---|
| Qwen 3.5 4B | 2,3 GB (Q8: 4,3 GB) | Funciona con mucha holgura, incluso en Q8 y con un contexto largo |
| Granite 4.2 8B | 4,6 GB (Q8 : 9 GB) | Zona de confort en Q4, contexto de varios miles de tokens |
| Qwen 3.5 9B | 6 GB (Q8: 10 GB) | Cabe en Q4 con un contexto moderado; utiliza la caché K/V cuantizada para contextos mayores |
| Gemma 4 12B | 7 GB (Q8: 13 GB) | Límite: no hay margen para el contexto; es probable que parte del modelo pase a la RAM. |
Un modelo de 8B en Q8 (9 GB) no cabe: con 8 GB, la cuantización Q4 es la norma, y Q5 sigue siendo posible para los modelos más pequeños. Para comparar los niveles de cuantización, la guía sobre cómo elegir entre Q4, Q5 y Q8 detalla la pérdida de calidad esperada. Para un proyecto concreto, la calculadora de VRAM del sitio te indica la cantidad exacta de memoria que ocupa según el modelo y el contexto.
#Velocidad: lo que mide el test de referencia
La única referencia pública utilizable es la tabla colaborativa del repositorio llama.cpp, donde los usuarios publican el resultado del mismo comando: llama-bench con Llama 2 7B en Q4_0, un archivo de 3,56 GiB, con todas las capas en la GPU. La tabla especifica que los resultados varían según el controlador, el sistema y el fabricante de la tarjeta, incluso con el mismo chip. No son mediciones del sitio: las cifras que aparecen a continuación provienen de esta tabla, y la columna «lectura» indica la velocidad de procesamiento del prompt (pp512), mientras que «generación» indica la velocidad de generación de la respuesta (tg128).
| Tarjeta | Memoria | Generación (tok/s) | Lectura del prompt (tok/s) |
|---|---|---|---|
| RTX 2060 Super | 8 GB | 60,0 | 1 420 |
| RTX 2070 Super | 8 GB | 88,1 | 2 088 |
| RTX 3060 12 GB | 12 GB | 75,6 | 2 138 |
| RTX 2080 Ti | 11 GB | 107,5 | 2 891 |
Dos conclusiones. En primer lugar, la 2070 Super genera más rápido que una RTX 3060 de 12 GB (88,1 frente a 75,6 tokens por segundo, lo que representa aproximadamente un 17 % de diferencia): la velocidad no es lo que justifica reemplazarla. En segundo lugar, la RTX 2060 Super tiene el mismo ancho de banda de 448 GB/s que la 2070 Super, pero alcanza 60 tokens por segundo, un 32 % menos. Por tanto, un límite de ancho de banda no es una predicción: el estado de los controladores, las frecuencias y la ficha técnica de la tarjeta también cuentan. Trata estos valores como órdenes de magnitud.
#De un modelo de prueba a un modelo actual: la regla de tres
El modelo de prueba pesa 3,82 GB (3,56 GiB). Como la generación está limitada por la lectura de los pesos, un modelo más pesado es proporcionalmente más lento, en igualdad de condiciones. Para Granite 4.2 8B en Q4 (4,6 GB), se obtiene, en el mejor de los casos, 88 × 3,82 ÷ 4,6, es decir, aproximadamente 73 tokens por segundo; para Qwen 3.5 9B en Q4 (6 GB), aproximadamente 56 tokens por segundo. Son límites superiores teóricos, no mediciones: las arquitecturas recientes (modelos híbridos, mezclas de expertos) y la longitud del contexto modifican el resultado, en un sentido o en otro.
Esta regla tiene un uso práctico. Si una cifra anunciada para tu configuración es muy inferior a estos órdenes de magnitud, por ejemplo menos de 15 tokens por segundo en un 8B en Q4, es señal de que parte del modelo se ha trasladado a la RAM del sistema: verifica el uso de la VRAM antes de culpar a la tarjeta. La guía de resolución de problemas con Ollama describe el procedimiento.
#Contexto y caché KV: donde los 8 GB están en juego
La velocidad de generación disminuye cuando la conversación se alarga, porque el modelo también vuelve a leer la caché en cada token. En una tarjeta de 8 GB, la disminución sigue siendo moderada, del orden de unos pocos puntos porcentuales en las mediciones públicas disponibles para tarjetas similares. El segundo efecto afecta a la memoria: la caché K/V ocupa VRAM en proporción al contexto. Dos ajustes de Ollama reducen la carga sobre una tarjeta de 8 GB. Flash Attention reduce la memoria consumida cuando el contexto crece, y la documentación de Ollama especifica que la caché K/V se puede cuantizar cuando Flash Attention está activada. El tipo q8_0 utiliza aproximadamente la mitad de la memoria del formato f16 predeterminado, con una pérdida de precisión muy baja según la documentación.
- 01Activar Flash AttentionInicia el servidor con la variable OLLAMA_FLASH_ATTENTION=1. Ollama lo activa ya automáticamente cuando la tarjeta y el modelo lo permiten; la variable sirve para forzarlo.
- 02Cuantizar la caché K/VAñade OLLAMA_KV_CACHE_TYPE=q8_0. Solo baja a q4_0 como último recurso: la documentación indica una posible degradación en contextos largos.
- 03Verificar el usoEjecuta un prompt largo y observa la memoria de la tarjeta con nvidia-smi: si la VRAM se satura, reduce el contexto en lugar de dejar que Ollama pase parte del modelo a la RAM.
En la 2070 Super, la prueba de llama.cpp con Flash Attention da 87,7 tokens por segundo en generación frente a 88,1 sin Flash Attention: aquí no cabe esperar ninguna mejora de velocidad. En cambio, la lectura del prompt pasa de 2.088 a 2.293 tokens por segundo, lo que importa para los documentos largos y el RAG. Para profundizar en este tema, hay una guía completa dedicada a la cuantización de la caché.
#Turing en 2026: controladores, soporte y límites
Las tarjetas Turing siguen siendo compatibles. La documentación de Ollama exige una capacidad de cálculo mínima de 5.0 y un controlador de la versión 550 o posterior; las RTX 2070, 2080 y 2080 Ti figuran en su lista de tarjetas con capacidad de cálculo 7.5. Turing se ha convertido incluso en el mínimo admitido: las notas de versión de CUDA 13 indican que se ha abandonado el soporte de las arquitecturas anteriores a Turing (Maxwell, Volta y Pascal). Nada permite establecer una fecha de fin del soporte para Turing, y sería aventurado anunciar una; lo prudente es revisar estas notas de versión con cada actualización importante de CUDA.
Sigue habiendo una limitación práctica: los modelos recientes suelen salir primero en formatos diseñados para hardware más nuevo, y después la comunidad ofrece conversiones GGUF en Q4 para tarjetas como la tuya. Esto no bloquea Ollama ni llama.cpp, pero puede retrasar uno o dos días la llegada de un modelo en un formato que puedan leer.
#2070 Super, 3060 12 GB o 3060 Ti: ¿cuál elegir?
| Tarjeta | Memoria | Generación (tok/s) | Lo que aporta |
|---|---|---|---|
| RTX 2070 Super | 8 GB | 88,1 | Velocidad aceptable; límite de 9B en Q4 |
| RTX 3060 Ti | 8 GB | 92,2 | Un poco más rápido; mismo límite de capacidad |
| RTX 3060 12 GB | 12 GB | 75,6 | Más lenta, pero con 4 GB más: Gemma 4 12B en Q4 con margen |
A velocidad comparable, la capacidad es lo que decide. Pasar de una 2070 Super a una 3060 Ti no cambia el límite de 9B; pasar a una 3060 de 12 GB permite usar modelos de 12 mil millones y contextos largos, a costa de un caudal de generación algo menor. Los precios de segunda mano cambian cada semana: consulta el seguimiento del sitio antes de decidir.
- Precios de las tarjetas gráficas para IA local (seguimiento semanal)
- ¿Qué LLM para RTX 3060 12 GB?
- ¿Qué LLM para 8 GB de VRAM? (todas las tarjetas)
#Veredicto 2026: mantener, comprar o pasar a otra cosa
- Consérvala si
- Usas un asistente de 7 a 9B en Q4 para código corto, resúmenes o RAG moderado. La velocidad de generación es muy cómoda y nada exige que cambies.
- Pasa a otra cosa si
- Quieres un 12B con un contexto real, un modelo de 14B o más, o documentos muy largos. Entonces necesitas al menos 12 GB, y 16 GB para estar tranquilo.
- Al comprar de segunda mano
- Una 2070 Super solo es interesante si su precio queda claramente por debajo del de una tarjeta de 12 GB. Revisa la garantía y el estado del ventilador: estas tarjetas tienen varios años de uso.
#Preguntas frecuentes
¿Puede la RTX 2070 ejecutar un LLM en 2026?+
¿RTX 2070 o RTX 2070 Super para un LLM?+
¿Se puede ejecutar Gemma 4 12B en una RTX 2070?+
¿Cuántos tokens por segundo en una RTX 2070 Super?+
¿Los controladores actuales siguen siendo compatibles con la RTX 2070?+
¿Se debe activar Flash Attention en una RTX 2070?+
- Fuente: tabla de rendimiento de llama.cpp en CUDA
- Fuente: tarjetas NVIDIA admitidas por Ollama
- Fuente: preguntas frecuentes de Ollama (Flash Attention, caché K/V)
- Fuente: características de las tarjetas GeForce serie 20
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.