Principiante 11 minRTX 20

Qué LLM usar en una RTX 2060 / 2060 Super (6-8 GB) ?

Respuesta directa

Sí, una RTX 2060 puede ejecutar un LLM local: con 6 GB, un modelo de 3 a 4 mil millones de parámetros en Q4 cabe holgadamente; con 8 GB (2060 Super), un modelo de 8B en Q4 (4,6 a 5,2 GB) cabe con un contexto moderado; la variante de 12 GB de finales de 2021 permite ejecutar un modelo de 14B. Lanzada en enero de 2019, la 2060 sigue siendo compatible con Ollama y CUDA. Su verdadera limitación es la memoria, no la antigüedad.

Existen tres tarjetas con este nombre: la RTX 2060 de enero de 2019 (6 GB), la 2060 Super de julio de 2019 (8 GB) y una 2060 de diciembre de 2021 con 12 GB. Para la IA local, no son equivalentes en absoluto. Esta página muestra las características de cada una, qué puede ejecutar hoy, lo que indica el cálculo de velocidad, y cuándo pasar a otra opción.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.

#RTX 2060, 2060 Super, 2060 12 GB: tres tarjetas, tres usos

La RTX 2060 se lanzó el 15 de enero de 2019, la 2060 Super el 9 de julio de 2019 y una variante de la 2060 con 12 GB el 7 de diciembre de 2021, según la tabla de las GeForce de la serie 20 de Wikipedia. Todas se basan en el chip Turing TU106. Para un LLM, lo que importa es la memoria (capacidad, bus, ancho de banda) más que los núcleos CUDA.

Las tres variantes (Wikipedia, GeForce serie 20)
TarjetaFecha de lanzamientoNúcleos CUDAMemoriaAncho de bandaPotencia
RTX 206015 de enero de 20191 9206 GB, bus de 192 bits336 GB/s160 W
RTX 2060 Super9 de julio de 20192 1768 GB, bus de 256 bits448 GB/s175 W
RTX 2060 12 GB7 de diciembre de 20212 17612 GBno especificado en esta tabla185 W

La 2060 Super ofrece 448 GB/s de ancho de banda frente a los 336 GB/s de la 2060 original: con el mismo modelo, genera aproximadamente un tercio más rápido. La variante de 12 GB es rara y llega tarde, pero es, con diferencia, la más interesante para la IA local: es la única de las tres en la que cabe un 14B en Q4 (aproximadamente 9 GB) con margen. Comprueba, por tanto, la capacidad exacta de la tarjeta antes de cualquier compra: el nombre por sí solo no la indica.

#Lo que cada variante ejecuta

La regla es la misma que para cualquier tarjeta: los pesos en Q4 (referencia del sitio: 3B ≈ 2 GB, 7-8B ≈ 5 GB, 14B ≈ 9 GB) más la caché de contexto y aproximadamente 0,5 GB reservados por el sistema y el motor. La tabla también indica el límite teórico de generación, que es el ancho de banda dividido por el tamaño de los pesos. No tenemos mediciones de velocidad de generación en estas tarjetas y no citamos ninguna.

Modelos compatibles y límite teórico de generación
Modelo (Q4)Tamaño del modelo2060 6 GB (336 GB/s)2060 Super 8 GB (448 GB/s)2060 12 GB
Gemma 4 2B1,2 GBSí, límite aproximado de 280 t/sSí, alrededor de 370 t/sSí
Qwen 3.5 4B2,3 GBSí, aproximadamente 146 t/sSí, aproximadamente 195 t/sSí
Granite 4.2 8B4,6 GBMuy justo, contexto muy corto, alrededor de 73 t/sSí, aproximadamente 97 t/sSí
Qwen3 8B (Ollama)5,2 GBNo de forma confiableSí, contexto moderado, aproximadamente 86 t/sSí
Qwen 3.5 9B6 GBNoCabe muy justo, aproximadamente 75 t/sSí
Qwen3 14B (Ollama)9,3 GBNoNoSí, contexto corto

Estos límites nunca se alcanzan en la práctica; sirven para comparar las tarjetas entre sí y saber si un modelo será interactivo. Un modelo que pesa el doble genera aproximadamente a la mitad de velocidad. Para conversar, cualquier velocidad real que supere unos diez tokens por segundo resulta cómoda para la lectura.

#Turing en 2026: sigue teniendo soporte

La antigüedad de la tarjeta es menos preocupante de lo que se cree. La documentación de Ollama indica que admite GPU NVIDIA con capacidad de cálculo 5.0 o superior y un controlador de la versión 550 o posterior, e incluye la RTX 2060 en la familia con capacidad 7.5. Las notas de versión de CUDA 13 indican, por su parte, que se ha retirado el soporte para Maxwell, Pascal y Volta en algunas bibliotecas: Turing es la generación más antigua que sigue contando con soporte en esta línea. Es un argumento a favor de la 2060 frente a las GTX 10 a largo plazo, aunque Ollama siga admitiendo las capacidades 5.0 a 6.2 con un controlador de la versión 570 o posterior: el riesgo es que las próximas funciones solo estén destinadas a las arquitecturas recientes.

No es la potencia de cálculo la que limita la generación de texto en esta tarjeta, sino el ancho de banda de la memoria: por tanto, no pagues un sobreprecio solo por los Tensor Cores. El controlador es el requisito clave: una instalación actualizada evita la mayoría de los fallos de detección de la GPU.

#El cálculo de memoria para tu tarjeta

El cálculo se hace en tres líneas: la memoria de la tarjeta, menos unos 0,5 GB reservados por el sistema y el motor, menos el peso del modelo, da el espacio restante para la caché de contexto. El consumo de la caché por token depende de la arquitectura del modelo; la calculadora del sitio lo indica para un modelo concreto, y la cuantización de la caché q8_0 lo reduce aproximadamente a la mitad.

Espacio restante para el contexto, sin contar la caché (estimación)
TarjetaUtilizable (memoria − 0,5 GB)Con Granite 4.2 8B (4,6 GB)Con Qwen3 8B (5,2 GB)Con Qwen3 14B (9,3 GB)
RTX 2060 6 GB5,5 GB0,9 GB0,3 GBNo cabe
RTX 2060 Super 8 GB7,5 GB2,9 GB2,3 GBNo cabe
RTX 2060 12 GB11,5 GB6,9 GB6,3 GB2,2 GB

Esta tabla explica por qué la misma familia de modelos resulta cómoda de usar en la Super y poco fluida en la versión de 6 GB: con menos de un gigabyte de margen, unos pocos miles de tokens de contexto bastan para que parte del modelo pase a ejecutarse en el procesador. También muestra que ejecutar el 14B con 12 GB es posible, pero deja poco margen: 2,2 GB para el contexto, lo que obliga a usar una ventana corta.

#Consejos para las versiones de 6 GB y 8 GB

Para la tarjeta de 6 GB, la guía «¿Qué LLM para 6 GB de VRAM?» detalla el presupuesto de memoria completo; en resumen, busca un modelo de 4B o uno de 8B con un contexto corto. En la Super de 8 GB, el contexto pasa a ser el primer ajuste que debes vigilar.

  1. 01
    Instalar un driver reciente
    Actualiza el controlador NVIDIA a la versión 550 o más reciente, como exige Ollama, luego instala Ollama en tu sistema.
  2. 02
    Elegir el tamaño del modelo
    6 GB: un 4B, o un 8B con contexto corto. 8 GB: un 8B en Q4 con un contexto de 4 000 a 8 000 tokens. 12 GB: un 14B en Q4, contexto corto.
  3. 03
    Reducir el caché de contexto
    Activa Flash Attention y la cuantización del caché en q8_0: reduce aproximadamente por la mitad la memoria de caché en comparación con f16, según la FAQ de Ollama.
  4. 04
    Verificar con ollama ps
    La columna Processor debe mostrar 100 % GPU. Una distribución entre CPU y GPU indica que parte del modelo queda fuera de la VRAM y, por tanto, la velocidad es menor.
  5. 05
    Cerrar las aplicaciones que consumen muchos recursos
    Un navegador con aceleración por hardware o un juego ocupan VRAM que el modelo no podrá usar.
Ajustes para una tarjeta de 6 a 8 GB (configurarlos y luego reiniciar Ollama)
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q8_0
OLLAMA_CONTEXT_LENGTH=6144

Las preguntas frecuentes de Ollama también proponen una cuantización q4_0 de la caché, más agresiva, que reduce aún más el uso de memoria a costa de una posible pérdida de calidad; pruébala con tu caso de uso antes de conservarla.

#Lo que realmente se puede hacer con una 2060

Chat y redacción
Un modelo de 4B o de 8B responde correctamente en el uso diario; es el uso en el que la tarjeta cumple mejor sus promesas.
RAG y documentos
Un pequeño modelo de 4B y un modelo de embedding caben en memoria; limita el número de fragmentos enviados.
Código
Autocompletado con un pequeño modelo de código; no hay agentes fiables con modelos de este tamaño.
Lo que excede la capacidad de la tarjeta
Los contextos extensos, las tareas de visión exigentes, los modelos de 14B con 6 u 8 GB y cualquier agente que encadene herramientas con prompts largos.

La 2060 también es una tarjeta de 160 a 185 W: bajo carga continua, se calienta y hace ruido como cualquier tarjeta de su categoría. La guía sobre gestión térmica explica cómo limitar la potencia para un servidor que funciona todo el día.

#Veredicto y cuándo pasar a otra cosa

Una RTX 2060 ya instalada no necesita reemplazarse si tus usos son el chat, la síntesis de textos y un RAG ligero. Si vas a comprar una tarjeta, la memoria prima sobre todo: la variante de 12 GB o la 2060 Super de 8 GB son preferibles a la de 6 GB. Los precios cambian cada semana y no aparecen en esta página; el seguimiento del sitio registra el precio más bajo de cada tarjeta.

¿2060 o una alternativa para la IA local?
TarjetaLo que aportaLas limitaciones que implica
RTX 2060 6 GBEl punto de entrada, modelos de 3-4BPoco margen; 8B solo con un contexto muy corto
RTX 2060 Super 8 GBPermite ejecutar cómodamente un 8B en Q4448 GB/s, más rápida que la 3060 de 12 GB
RTX 3060 12 GB12 GB: 14B en Q4 y contexto largo360 GB/s: más lenta que la 2060 Super con un mismo modelo que cabe en ambas tarjetas
RTX 3050 6 GBEficiencia energética168 GB/s, la mitad de rápido que la 2060 de 6 GB

Esta comparación corrige una idea extendida: la RTX 3060 12 GB no es más rápida que la 2060 Super para la generación de texto. Su ancho de banda es de 360 GB/s según Wikipedia, frente a 448 GB/s para la 2060 Super. Gana por su capacidad: 12 GB permiten cargar modelos que no caben en la Super. Elige según el modelo que quieras utilizar, no según un porcentaje general de velocidad.

Si compras una tarjeta de segunda mano, revisa tres cosas antes de quedártela. Verifica en nvidia-smi la memoria total anunciada: el nombre de la tarjeta no basta para distinguir las variantes de 6, 8 y 12 GB. Ejecuta una generación continua durante unos veinte minutos y monitorea la temperatura y la frecuencia del núcleo: una tarjeta que se ralentiza mucho necesita una limpieza o pasta térmica nueva. Por último, prueba un modelo real con el contexto deseado y verifica con ollama ps que permanezca completamente en la tarjeta.

#Preguntas frecuentes

FAQ
¿Puede la RTX 2060 ejecutar un LLM?+
Sí. Con 6 GB, un modelo de 3 a 4 mil millones de parámetros en Q4 cabe holgadamente, y uno de 8B cabe con un contexto muy corto. Ollama admite GPU con capacidad de cálculo 7.5, entre ellas la RTX 2060, con un controlador de versión 550 o posterior. El límite es la memoria, no la antigüedad de la tarjeta.
¿Cuál es la fecha de lanzamiento de la RTX 2060?+
La RTX 2060 salió el 15 de enero de 2019 con 6 GB de memoria. La RTX 2060 Super, con 8 GB, llegó el 9 de julio de 2019, y una variante de la 2060 con 12 GB apareció el 7 de diciembre de 2021, según Wikipedia. Para la IA local, la capacidad de memoria de la variante cuenta más que su fecha.
¿RTX 2060 o RTX 2060 Super para un LLM?+
La Super: 8 GB frente a 6 GB y 448 GB/s frente a 336 GB/s. Un modelo 8B en Q4 (4,6 a 5,2 GB) cabe en la Super con un contexto moderado, y la generación es aproximadamente un tercio más rápida con el mismo modelo, según el ancho de banda. En la versión de 6 GB, mantén un modelo 4B.
¿Un LLM moderno de 8B cabe en una RTX 2060 Super?+
Sí, en Q4: Granite 4.2 8B ocupa 4,6 GB y Qwen3 8B, 5,2 GB en la biblioteca de Ollama, lo que deja algunos gigabytes para la caché con 8 GB. Limita el contexto a entre 4 000 y 8 000 tokens y verifica con ollama ps que el modelo permanezca íntegramente en la tarjeta.
¿La RTX 2060 de 6 GB sigue valiendo la pena para la IA local?+
Solo si ya tienes una o si el precio es muy bajo: basta para un modelo de 4B y para chatear. Si vas a comprar, prefiere una tarjeta de 8 GB o 12 GB, ya que la memoria es el principal factor limitante. Los precios cambian cada semana; consulta el seguimiento del sitio.
¿La RTX 3060 12 GB es más rápida que la 2060 Super?+
Para la generación de texto, no: su ancho de banda es de 360 GB/s frente a los 448 GB/s de la 2060 Super, y es lo que determina la velocidad cuando el modelo cabe en ambas tarjetas. La 3060 12 GB gana por su capacidad, que permite cargar un 14B en Q4 cuando la Super no tiene suficiente memoria.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.