Qué LLM usar en una RTX 2060 / 2060 Super (6-8 GB) ?
Sí, una RTX 2060 puede ejecutar un LLM local: con 6 GB, un modelo de 3 a 4 mil millones de parámetros en Q4 cabe holgadamente; con 8 GB (2060 Super), un modelo de 8B en Q4 (4,6 a 5,2 GB) cabe con un contexto moderado; la variante de 12 GB de finales de 2021 permite ejecutar un modelo de 14B. Lanzada en enero de 2019, la 2060 sigue siendo compatible con Ollama y CUDA. Su verdadera limitación es la memoria, no la antigüedad.
Existen tres tarjetas con este nombre: la RTX 2060 de enero de 2019 (6 GB), la 2060 Super de julio de 2019 (8 GB) y una 2060 de diciembre de 2021 con 12 GB. Para la IA local, no son equivalentes en absoluto. Esta página muestra las características de cada una, qué puede ejecutar hoy, lo que indica el cálculo de velocidad, y cuándo pasar a otra opción.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.
#RTX 2060, 2060 Super, 2060 12 GB: tres tarjetas, tres usos
La RTX 2060 se lanzó el 15 de enero de 2019, la 2060 Super el 9 de julio de 2019 y una variante de la 2060 con 12 GB el 7 de diciembre de 2021, según la tabla de las GeForce de la serie 20 de Wikipedia. Todas se basan en el chip Turing TU106. Para un LLM, lo que importa es la memoria (capacidad, bus, ancho de banda) más que los núcleos CUDA.
| Tarjeta | Fecha de lanzamiento | Núcleos CUDA | Memoria | Ancho de banda | Potencia |
|---|---|---|---|---|---|
| RTX 2060 | 15 de enero de 2019 | 1 920 | 6 GB, bus de 192 bits | 336 GB/s | 160 W |
| RTX 2060 Super | 9 de julio de 2019 | 2 176 | 8 GB, bus de 256 bits | 448 GB/s | 175 W |
| RTX 2060 12 GB | 7 de diciembre de 2021 | 2 176 | 12 GB | no especificado en esta tabla | 185 W |
La 2060 Super ofrece 448 GB/s de ancho de banda frente a los 336 GB/s de la 2060 original: con el mismo modelo, genera aproximadamente un tercio más rápido. La variante de 12 GB es rara y llega tarde, pero es, con diferencia, la más interesante para la IA local: es la única de las tres en la que cabe un 14B en Q4 (aproximadamente 9 GB) con margen. Comprueba, por tanto, la capacidad exacta de la tarjeta antes de cualquier compra: el nombre por sí solo no la indica.
#Lo que cada variante ejecuta
La regla es la misma que para cualquier tarjeta: los pesos en Q4 (referencia del sitio: 3B ≈ 2 GB, 7-8B ≈ 5 GB, 14B ≈ 9 GB) más la caché de contexto y aproximadamente 0,5 GB reservados por el sistema y el motor. La tabla también indica el límite teórico de generación, que es el ancho de banda dividido por el tamaño de los pesos. No tenemos mediciones de velocidad de generación en estas tarjetas y no citamos ninguna.
| Modelo (Q4) | Tamaño del modelo | 2060 6 GB (336 GB/s) | 2060 Super 8 GB (448 GB/s) | 2060 12 GB |
|---|---|---|---|---|
| Gemma 4 2B | 1,2 GB | Sí, límite aproximado de 280 t/s | Sí, alrededor de 370 t/s | Sí |
| Qwen 3.5 4B | 2,3 GB | Sí, aproximadamente 146 t/s | Sí, aproximadamente 195 t/s | Sí |
| Granite 4.2 8B | 4,6 GB | Muy justo, contexto muy corto, alrededor de 73 t/s | Sí, aproximadamente 97 t/s | Sí |
| Qwen3 8B (Ollama) | 5,2 GB | No de forma confiable | Sí, contexto moderado, aproximadamente 86 t/s | Sí |
| Qwen 3.5 9B | 6 GB | No | Cabe muy justo, aproximadamente 75 t/s | Sí |
| Qwen3 14B (Ollama) | 9,3 GB | No | No | Sí, contexto corto |
Estos límites nunca se alcanzan en la práctica; sirven para comparar las tarjetas entre sí y saber si un modelo será interactivo. Un modelo que pesa el doble genera aproximadamente a la mitad de velocidad. Para conversar, cualquier velocidad real que supere unos diez tokens por segundo resulta cómoda para la lectura.
#Turing en 2026: sigue teniendo soporte
La antigüedad de la tarjeta es menos preocupante de lo que se cree. La documentación de Ollama indica que admite GPU NVIDIA con capacidad de cálculo 5.0 o superior y un controlador de la versión 550 o posterior, e incluye la RTX 2060 en la familia con capacidad 7.5. Las notas de versión de CUDA 13 indican, por su parte, que se ha retirado el soporte para Maxwell, Pascal y Volta en algunas bibliotecas: Turing es la generación más antigua que sigue contando con soporte en esta línea. Es un argumento a favor de la 2060 frente a las GTX 10 a largo plazo, aunque Ollama siga admitiendo las capacidades 5.0 a 6.2 con un controlador de la versión 570 o posterior: el riesgo es que las próximas funciones solo estén destinadas a las arquitecturas recientes.
No es la potencia de cálculo la que limita la generación de texto en esta tarjeta, sino el ancho de banda de la memoria: por tanto, no pagues un sobreprecio solo por los Tensor Cores. El controlador es el requisito clave: una instalación actualizada evita la mayoría de los fallos de detección de la GPU.
#El cálculo de memoria para tu tarjeta
El cálculo se hace en tres líneas: la memoria de la tarjeta, menos unos 0,5 GB reservados por el sistema y el motor, menos el peso del modelo, da el espacio restante para la caché de contexto. El consumo de la caché por token depende de la arquitectura del modelo; la calculadora del sitio lo indica para un modelo concreto, y la cuantización de la caché q8_0 lo reduce aproximadamente a la mitad.
| Tarjeta | Utilizable (memoria − 0,5 GB) | Con Granite 4.2 8B (4,6 GB) | Con Qwen3 8B (5,2 GB) | Con Qwen3 14B (9,3 GB) |
|---|---|---|---|---|
| RTX 2060 6 GB | 5,5 GB | 0,9 GB | 0,3 GB | No cabe |
| RTX 2060 Super 8 GB | 7,5 GB | 2,9 GB | 2,3 GB | No cabe |
| RTX 2060 12 GB | 11,5 GB | 6,9 GB | 6,3 GB | 2,2 GB |
Esta tabla explica por qué la misma familia de modelos resulta cómoda de usar en la Super y poco fluida en la versión de 6 GB: con menos de un gigabyte de margen, unos pocos miles de tokens de contexto bastan para que parte del modelo pase a ejecutarse en el procesador. También muestra que ejecutar el 14B con 12 GB es posible, pero deja poco margen: 2,2 GB para el contexto, lo que obliga a usar una ventana corta.
#Consejos para las versiones de 6 GB y 8 GB
Para la tarjeta de 6 GB, la guía «¿Qué LLM para 6 GB de VRAM?» detalla el presupuesto de memoria completo; en resumen, busca un modelo de 4B o uno de 8B con un contexto corto. En la Super de 8 GB, el contexto pasa a ser el primer ajuste que debes vigilar.
- 01Instalar un driver recienteActualiza el controlador NVIDIA a la versión 550 o más reciente, como exige Ollama, luego instala Ollama en tu sistema.
- 02Elegir el tamaño del modelo6 GB: un 4B, o un 8B con contexto corto. 8 GB: un 8B en Q4 con un contexto de 4 000 a 8 000 tokens. 12 GB: un 14B en Q4, contexto corto.
- 03Reducir el caché de contextoActiva Flash Attention y la cuantización del caché en q8_0: reduce aproximadamente por la mitad la memoria de caché en comparación con f16, según la FAQ de Ollama.
- 04Verificar con ollama psLa columna Processor debe mostrar 100 % GPU. Una distribución entre CPU y GPU indica que parte del modelo queda fuera de la VRAM y, por tanto, la velocidad es menor.
- 05Cerrar las aplicaciones que consumen muchos recursosUn navegador con aceleración por hardware o un juego ocupan VRAM que el modelo no podrá usar.
Las preguntas frecuentes de Ollama también proponen una cuantización q4_0 de la caché, más agresiva, que reduce aún más el uso de memoria a costa de una posible pérdida de calidad; pruébala con tu caso de uso antes de conservarla.
#Lo que realmente se puede hacer con una 2060
- Chat y redacción
- Un modelo de 4B o de 8B responde correctamente en el uso diario; es el uso en el que la tarjeta cumple mejor sus promesas.
- RAG y documentos
- Un pequeño modelo de 4B y un modelo de embedding caben en memoria; limita el número de fragmentos enviados.
- Código
- Autocompletado con un pequeño modelo de código; no hay agentes fiables con modelos de este tamaño.
- Lo que excede la capacidad de la tarjeta
- Los contextos extensos, las tareas de visión exigentes, los modelos de 14B con 6 u 8 GB y cualquier agente que encadene herramientas con prompts largos.
La 2060 también es una tarjeta de 160 a 185 W: bajo carga continua, se calienta y hace ruido como cualquier tarjeta de su categoría. La guía sobre gestión térmica explica cómo limitar la potencia para un servidor que funciona todo el día.
#Veredicto y cuándo pasar a otra cosa
Una RTX 2060 ya instalada no necesita reemplazarse si tus usos son el chat, la síntesis de textos y un RAG ligero. Si vas a comprar una tarjeta, la memoria prima sobre todo: la variante de 12 GB o la 2060 Super de 8 GB son preferibles a la de 6 GB. Los precios cambian cada semana y no aparecen en esta página; el seguimiento del sitio registra el precio más bajo de cada tarjeta.
| Tarjeta | Lo que aporta | Las limitaciones que implica |
|---|---|---|
| RTX 2060 6 GB | El punto de entrada, modelos de 3-4B | Poco margen; 8B solo con un contexto muy corto |
| RTX 2060 Super 8 GB | Permite ejecutar cómodamente un 8B en Q4 | 448 GB/s, más rápida que la 3060 de 12 GB |
| RTX 3060 12 GB | 12 GB: 14B en Q4 y contexto largo | 360 GB/s: más lenta que la 2060 Super con un mismo modelo que cabe en ambas tarjetas |
| RTX 3050 6 GB | Eficiencia energética | 168 GB/s, la mitad de rápido que la 2060 de 6 GB |
Esta comparación corrige una idea extendida: la RTX 3060 12 GB no es más rápida que la 2060 Super para la generación de texto. Su ancho de banda es de 360 GB/s según Wikipedia, frente a 448 GB/s para la 2060 Super. Gana por su capacidad: 12 GB permiten cargar modelos que no caben en la Super. Elige según el modelo que quieras utilizar, no según un porcentaje general de velocidad.
Si compras una tarjeta de segunda mano, revisa tres cosas antes de quedártela. Verifica en nvidia-smi la memoria total anunciada: el nombre de la tarjeta no basta para distinguir las variantes de 6, 8 y 12 GB. Ejecuta una generación continua durante unos veinte minutos y monitorea la temperatura y la frecuencia del núcleo: una tarjeta que se ralentiza mucho necesita una limpieza o pasta térmica nueva. Por último, prueba un modelo real con el contexto deseado y verifica con ollama ps que permanezca completamente en la tarjeta.
- ¿Qué LLM usar en una RTX 3060 de 12 GB?
- ¿Qué LLM en RTX 2070 / 2070 Super?
- ¿Qué LLM usar en una RTX 3050?
- Seguimiento de precios de tarjetas gráficas para IA local
- Fuente: Wikipedia, serie GeForce 20
- Fuente: Ollama, hardware soportado
- Fuente: FAQ oficial de Ollama
#Preguntas frecuentes
¿Puede la RTX 2060 ejecutar un LLM?+
¿Cuál es la fecha de lanzamiento de la RTX 2060?+
¿RTX 2060 o RTX 2060 Super para un LLM?+
¿Un LLM moderno de 8B cabe en una RTX 2060 Super?+
¿La RTX 2060 de 6 GB sigue valiendo la pena para la IA local?+
¿La RTX 3060 12 GB es más rápida que la 2060 Super?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.