Principiante 11 minRTX 20

¿Qué LLM usar con una RTX 2070 / 2070 Super (8 GB)? ?

Respuesta directa

Una RTX 2070 o 2070 Super (8 GB de GDDR6) ejecuta cómodamente modelos de 7 a 9 mil millones de parámetros en Q4: Granite 4.2 8B (4,6 GB de pesos) o Qwen 3.5 9B (6 GB) caben completamente en la tarjeta. En el test de referencia de llama.cpp, la 2070 Super genera 88 tokens/s. Por encima de 9B, hay que cargar parte del modelo en la RAM del sistema y la velocidad de generación cae drásticamente.

La RTX 2070 (octubre de 2018) y la RTX 2070 Super (julio de 2019) son tarjetas Turing con 8 GB de memoria. En 2026 ofrecen un buen rendimiento para un asistente 8B en Q4 y están al límite para todo lo demás. Esta guía relaciona sus características con una prueba pública de velocidad, explica en qué se utilizan los 8 GB e indica cuándo vale la pena cambiar de tarjeta.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 2070 y 2070 Super: lo que permiten 8 GB

En una RTX 2070 o una 2070 Super, los modelos de 7 a 9 mil millones de parámetros con cuantización Q4 caben completamente en la memoria de vídeo: es la zona de confort de estas tarjetas. Según el catálogo QuelLLM, Granite 4.2 8B requiere 4,6 GB para los pesos en Q4 y Qwen 3.5 9B, aproximadamente 6 GB. Queda entonces espacio para el contexto, siempre que su longitud sea razonable. Un modelo de 12 mil millones como Gemma 4 12B (7 GB en Q4) deja apenas un gigabyte para la caché y el sistema: cabe sobre el papel, pero en la práctica funciona mal. En cuanto a velocidad, la 2070 Super alcanza 88 tokens por segundo en la prueba de referencia de llama.cpp con un modelo de 7 mil millones en Q4_0, muy por encima de la velocidad de lectura humana. El verdadero límite de estas tarjetas no es, por tanto, la velocidad, sino la capacidad de memoria.

RTX 2070
Octubre de 2018, 2 304 núcleos CUDA, 8 GB de GDDR6 en un bus de 256 bits, equivalentes a 448 GB/s (256 bits a 14 Gbit/s).
RTX 2070 Super
Julio de 2019, 2.560 núcleos CUDA, los mismos 8 GB y el mismo ancho de banda de 448 GB/s, consumo de 215 W.
Lo que los distingue para un LLM
Casi nada: el ancho de banda y la capacidad son idénticos. La Super tiene más núcleos, lo que ayuda sobre todo en la lectura del prompt, no en la generación.

Este último punto es contraintuitivo: para generar texto, el procesador gráfico vuelve a leer todos los pesos del modelo con cada token, de modo que el ancho de banda de memoria importa más que el número de núcleos. Dos tarjetas con 448 GB/s producirán velocidades de generación similares, aunque una sea claramente más rápida en los juegos.

#Qué modelos caben en 8 GB

Los pesos son solo una parte del consumo de memoria: hay que sumar la caché de contexto (KV cache), que crece con la longitud de la conversación, y después dejar un margen para el controlador y la visualización. En una tarjeta de 8 GB, la regla práctica es optar por pesos que ocupen como máximo 6 GB si quieres un contexto de varios miles de tokens. Como referencia, la herramienta de prueba de llama.cpp muestra 7 838 MiB de memoria libre en una RTX 3060 Ti de 8 GB, algo menos que los 8 192 MiB teóricos: unos cientos de megabytes ya están ocupados antes incluso de cargar un modelo.

Modelos para una RTX 2070 / 2070 Super (peso según el catálogo QuelLLM)
ModeloPeso en Q4Veredicto para 8 GB
Qwen 3.5 4B2,3 GB (Q8: 4,3 GB)Funciona con mucha holgura, incluso en Q8 y con un contexto largo
Granite 4.2 8B4,6 GB (Q8 : 9 GB)Zona de confort en Q4, contexto de varios miles de tokens
Qwen 3.5 9B6 GB (Q8: 10 GB)Cabe en Q4 con un contexto moderado; utiliza la caché K/V cuantizada para contextos mayores
Gemma 4 12B7 GB (Q8: 13 GB)Límite: no hay margen para el contexto; es probable que parte del modelo pase a la RAM.

Un modelo de 8B en Q8 (9 GB) no cabe: con 8 GB, la cuantización Q4 es la norma, y Q5 sigue siendo posible para los modelos más pequeños. Para comparar los niveles de cuantización, la guía sobre cómo elegir entre Q4, Q5 y Q8 detalla la pérdida de calidad esperada. Para un proyecto concreto, la calculadora de VRAM del sitio te indica la cantidad exacta de memoria que ocupa según el modelo y el contexto.

#Velocidad: lo que mide el test de referencia

La única referencia pública utilizable es la tabla colaborativa del repositorio llama.cpp, donde los usuarios publican el resultado del mismo comando: llama-bench con Llama 2 7B en Q4_0, un archivo de 3,56 GiB, con todas las capas en la GPU. La tabla especifica que los resultados varían según el controlador, el sistema y el fabricante de la tarjeta, incluso con el mismo chip. No son mediciones del sitio: las cifras que aparecen a continuación provienen de esta tabla, y la columna «lectura» indica la velocidad de procesamiento del prompt (pp512), mientras que «generación» indica la velocidad de generación de la respuesta (tg128).

Prueba llama.cpp, Llama 2 7B Q4_0, sin Flash Attention
TarjetaMemoriaGeneración (tok/s)Lectura del prompt (tok/s)
RTX 2060 Super8 GB60,01 420
RTX 2070 Super8 GB88,12 088
RTX 3060 12 GB12 GB75,62 138
RTX 2080 Ti11 GB107,52 891

Dos conclusiones. En primer lugar, la 2070 Super genera más rápido que una RTX 3060 de 12 GB (88,1 frente a 75,6 tokens por segundo, lo que representa aproximadamente un 17 % de diferencia): la velocidad no es lo que justifica reemplazarla. En segundo lugar, la RTX 2060 Super tiene el mismo ancho de banda de 448 GB/s que la 2070 Super, pero alcanza 60 tokens por segundo, un 32 % menos. Por tanto, un límite de ancho de banda no es una predicción: el estado de los controladores, las frecuencias y la ficha técnica de la tarjeta también cuentan. Trata estos valores como órdenes de magnitud.

#De un modelo de prueba a un modelo actual: la regla de tres

El modelo de prueba pesa 3,82 GB (3,56 GiB). Como la generación está limitada por la lectura de los pesos, un modelo más pesado es proporcionalmente más lento, en igualdad de condiciones. Para Granite 4.2 8B en Q4 (4,6 GB), se obtiene, en el mejor de los casos, 88 × 3,82 ÷ 4,6, es decir, aproximadamente 73 tokens por segundo; para Qwen 3.5 9B en Q4 (6 GB), aproximadamente 56 tokens por segundo. Son límites superiores teóricos, no mediciones: las arquitecturas recientes (modelos híbridos, mezclas de expertos) y la longitud del contexto modifican el resultado, en un sentido o en otro.

Esta regla tiene un uso práctico. Si una cifra anunciada para tu configuración es muy inferior a estos órdenes de magnitud, por ejemplo menos de 15 tokens por segundo en un 8B en Q4, es señal de que parte del modelo se ha trasladado a la RAM del sistema: verifica el uso de la VRAM antes de culpar a la tarjeta. La guía de resolución de problemas con Ollama describe el procedimiento.

#Contexto y caché KV: donde los 8 GB están en juego

La velocidad de generación disminuye cuando la conversación se alarga, porque el modelo también vuelve a leer la caché en cada token. En una tarjeta de 8 GB, la disminución sigue siendo moderada, del orden de unos pocos puntos porcentuales en las mediciones públicas disponibles para tarjetas similares. El segundo efecto afecta a la memoria: la caché K/V ocupa VRAM en proporción al contexto. Dos ajustes de Ollama reducen la carga sobre una tarjeta de 8 GB. Flash Attention reduce la memoria consumida cuando el contexto crece, y la documentación de Ollama especifica que la caché K/V se puede cuantizar cuando Flash Attention está activada. El tipo q8_0 utiliza aproximadamente la mitad de la memoria del formato f16 predeterminado, con una pérdida de precisión muy baja según la documentación.

  1. 01
    Activar Flash Attention
    Inicia el servidor con la variable OLLAMA_FLASH_ATTENTION=1. Ollama lo activa ya automáticamente cuando la tarjeta y el modelo lo permiten; la variable sirve para forzarlo.
  2. 02
    Cuantizar la caché K/V
    Añade OLLAMA_KV_CACHE_TYPE=q8_0. Solo baja a q4_0 como último recurso: la documentación indica una posible degradación en contextos largos.
  3. 03
    Verificar el uso
    Ejecuta un prompt largo y observa la memoria de la tarjeta con nvidia-smi: si la VRAM se satura, reduce el contexto en lugar de dejar que Ollama pase parte del modelo a la RAM.
Linux: ejecutar Ollama con los dos ajustes
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

En la 2070 Super, la prueba de llama.cpp con Flash Attention da 87,7 tokens por segundo en generación frente a 88,1 sin Flash Attention: aquí no cabe esperar ninguna mejora de velocidad. En cambio, la lectura del prompt pasa de 2.088 a 2.293 tokens por segundo, lo que importa para los documentos largos y el RAG. Para profundizar en este tema, hay una guía completa dedicada a la cuantización de la caché.

#Turing en 2026: controladores, soporte y límites

Las tarjetas Turing siguen siendo compatibles. La documentación de Ollama exige una capacidad de cálculo mínima de 5.0 y un controlador de la versión 550 o posterior; las RTX 2070, 2080 y 2080 Ti figuran en su lista de tarjetas con capacidad de cálculo 7.5. Turing se ha convertido incluso en el mínimo admitido: las notas de versión de CUDA 13 indican que se ha abandonado el soporte de las arquitecturas anteriores a Turing (Maxwell, Volta y Pascal). Nada permite establecer una fecha de fin del soporte para Turing, y sería aventurado anunciar una; lo prudente es revisar estas notas de versión con cada actualización importante de CUDA.

Sigue habiendo una limitación práctica: los modelos recientes suelen salir primero en formatos diseñados para hardware más nuevo, y después la comunidad ofrece conversiones GGUF en Q4 para tarjetas como la tuya. Esto no bloquea Ollama ni llama.cpp, pero puede retrasar uno o dos días la llegada de un modelo en un formato que puedan leer.

#2070 Super, 3060 12 GB o 3060 Ti: ¿cuál elegir?

Tres tarjetas de 8 a 12 GB para uso LLM
TarjetaMemoriaGeneración (tok/s)Lo que aporta
RTX 2070 Super8 GB88,1Velocidad aceptable; límite de 9B en Q4
RTX 3060 Ti8 GB92,2Un poco más rápido; mismo límite de capacidad
RTX 3060 12 GB12 GB75,6Más lenta, pero con 4 GB más: Gemma 4 12B en Q4 con margen

A velocidad comparable, la capacidad es lo que decide. Pasar de una 2070 Super a una 3060 Ti no cambia el límite de 9B; pasar a una 3060 de 12 GB permite usar modelos de 12 mil millones y contextos largos, a costa de un caudal de generación algo menor. Los precios de segunda mano cambian cada semana: consulta el seguimiento del sitio antes de decidir.

#Veredicto 2026: mantener, comprar o pasar a otra cosa

Consérvala si
Usas un asistente de 7 a 9B en Q4 para código corto, resúmenes o RAG moderado. La velocidad de generación es muy cómoda y nada exige que cambies.
Pasa a otra cosa si
Quieres un 12B con un contexto real, un modelo de 14B o más, o documentos muy largos. Entonces necesitas al menos 12 GB, y 16 GB para estar tranquilo.
Al comprar de segunda mano
Una 2070 Super solo es interesante si su precio queda claramente por debajo del de una tarjeta de 12 GB. Revisa la garantía y el estado del ventilador: estas tarjetas tienen varios años de uso.

#Preguntas frecuentes

Preguntas frecuentes
¿Puede la RTX 2070 ejecutar un LLM en 2026?+
Sí, dentro del límite de sus 8 GB. Un modelo de 7 a 9 mil millones de parámetros en Q4, como Granite 4.2 8B o Qwen 3.5 9B, cabe completamente en la tarjeta. En la prueba de referencia de llama.cpp, la 2070 Super genera 88 tokens por segundo, lo cual es más que suficiente para un chat o para recibir ayuda con el código.
¿RTX 2070 o RTX 2070 Super para un LLM?+
Ambas tienen 8 GB de GDDR6 y el mismo ancho de banda de 448 GB/s; la generación depende principalmente del ancho de banda. La Super, con más núcleos, ayuda sobre todo en la lectura de prompts largos. Si la diferencia de precio es considerable, la 2070 estándar ofrece una experiencia de generación muy similar.
¿Se puede ejecutar Gemma 4 12B en una RTX 2070?+
Está al límite. El catálogo indica 7 GB de pesos en Q4, lo que apenas deja espacio para la caché de contexto y el sistema con 8 GB. El modelo se carga, pero pronto empieza a utilizar la RAM en cuanto se alarga la conversación. Prefiere Granite 4.2 8B o Qwen 3.5 9B, o pasa a 12 GB de VRAM.
¿Cuántos tokens por segundo en una RTX 2070 Super?+
La tabla pública de llama.cpp indica 88 tokens por segundo para Llama 2 7B en Q4_0. Un modelo más pesado será más lento, aproximadamente en proporción a su tamaño: calcula unos 55 a 75 tokens por segundo para un modelo de 8 a 9B en Q4, como estimación teórica. Un contexto largo reduce esta cifra.
¿Los controladores actuales siguen siendo compatibles con la RTX 2070?+
Sí. Ollama incluye las RTX 2070, 2080 y 2080 Ti entre las tarjetas con capacidad de cálculo 7.5 y solo exige un controlador de la versión 550 o posterior. CUDA 13 incluso estableció Turing como arquitectura mínima al dejar de admitir las arquitecturas anteriores. No se ha anunciado el fin del soporte en las fuentes consultadas.
¿Se debe activar Flash Attention en una RTX 2070?+
Ollama la activa automáticamente cuando el hardware lo permite; puedes forzar su activación con OLLAMA_FLASH_ATTENTION=1. En la 2070 Super, no cambia la velocidad de generación, pero acelera la lectura del prompt en aproximadamente un 10 % y reduce la memoria utilizada con contextos largos, algo importante con 8 GB.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.