Principiante 11 minGTX 16

¿Qué LLM usar en una GTX 1650 / 1660 / Super / Ti? ?

Respuesta directa

Una GTX 1660 (6 GB) ejecuta un LLM local de 7 a 8 mil millones de parámetros en Q4: el banco de pruebas público de llama.cpp mide 41,35 tokens/s en generación con un 7B Q4_0, pero solo 148,91 tokens/s para leer el prompt. Las 1660 Super y Ti, con memoria más rápida, deberían ser más rápidas. La GTX 1650, limitada a 4 GB, se limita a modelos de 2 a 3 mil millones de parámetros. Todas siguen siendo compatibles con CUDA 13.

La serie GTX 16, lanzada en 2019, pertenece a la arquitectura Turing y no incluye Tensor Cores ni núcleos de ray tracing. A diferencia de las GTX 10, no está afectada por el final del soporte de Pascal. Esta guía distingue las cuatro tarjetas según lo que importa para un LLM —la memoria y su ancho de banda—, se basa en mediciones públicas y advierte de un posible error: una generación correcta no implica una lectura rápida de prompts largos.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#La serie GTX 16 para un LLM: lo que hay que recordar

Para un LLM, la serie GTX 16 se distingue por la memoria: 4 GB para la GTX 1650, 6 GB para las GTX 1660, 1660 Super y 1660 Ti. La velocidad de generación depende del ancho de banda, que varía de uno a tres: 128 GB/s para la 1650 en GDDR5, 192 GB/s para la 1660, 288 GB/s para la 1660 Ti y 336 GB/s para la 1660 Super. A igual capacidad de 6 GB, la 1660 Super es, por tanto, la más rápida de la serie y la 1660 original la más lenta.

Ancho de banda y memoria de las GTX 16 (Wikipedia, GeForce 16 series)
TarjetaMemoriaAncho de bandaNúcleos CUDA
GTX 1650 (GDDR5)4 GB, GDDR5, 128 bits128 GB/s896
GTX 1650 (GDDR6, abril de 2020)GDDR6192 GB/s896
GTX 16606 GB, GDDR5, 192 bits192 GB/s1 408
GTX 1660 Super6 GB, GDDR6336 GB/sno detallado
GTX 1660 Ti6 GB, GDDR6288 GB/s1 536

La serie no tiene Tensor Cores ni RT Cores: Wikipedia señala que se basa en la arquitectura Turing de las RTX 20, pero prescinde de estos dos tipos de unidades y conserva los núcleos dedicados a operaciones con enteros. Para los modelos cuantizados en enteros, la ausencia de Tensor Cores influye poco en la generación.

#Turing sin Tensor Cores: qué cambia respecto a Pascal

El punto fuerte de la serie es el FP16. En una GTX 1660, Wikipedia indica 8.617 GFLOPS en media precisión frente a 4.309 en precisión simple: el FP16 funciona dos veces más rápido que el FP32, mientras que en una GTX 10 de consumo funciona mucho más lento que el FP32, como muestra la guía de la GTX 1080 Ti. Esto explica que la 1660, con el mismo ancho de banda de 192 GB/s, supere claramente a una GTX 1060 en generación, y que CUDA 13 no la haya abandonado.

El contraejemplo se encuentra en la lectura del prompt. El benchmark de llama.cpp da 148,91 tokens/s en la 1660 al procesar el prompt, contra 416,85 para la GTX 1060: una tarjeta más reciente puede leer un texto largo casi tres veces más lentamente. El benchmark no detalla la causa; el resultado proviene de un único contribuyente y debe interpretarse como una estimación de orden de magnitud. Sin embargo, basta para moderar el entusiasmo por documentos largos.

Banco de pruebas con llama.cpp CUDA, Llama 2 7B Q4_0: una 1660 frente a sus vecinas
TarjetaAncho de bandaPrompt (pp512)Generación (tg128)
GTX 1060 6 GB (Pascal)192 GB/s416,85 tokens/s27,79 tokens/s
GTX 1660 6 GB (Turing)192 GB/s148,91 tokens/s41,35 tokens/s
Quadro T1000 4 GB128 GB/s79,44 tokens/s27,82 tokens/s
!
Una sola contribución, una sola tarjeta
Cada fila del banco de pruebas procede de un colaborador, con su controlador y su sistema. Comparar una 1660 con una 1060 en este banco de pruebas da un orden de magnitud, no una ley. Si el procesamiento del prompt es importante para ti, prueba tu tarjeta con llama-bench.

#Las cuatro variantes una a una

GTX 1650 (4 GB)
El banco de pruebas no tiene una 1650, pero incluye una Quadro T1000 de 4 GB y 128 bits, con el mismo ancho de banda: puede ejecutar un 7B en Q4_0 a 27,82 tokens/s con un contexto mínimo. Ese es el límite: con 4 GB, es mejor un modelo de 2 a 3 mil millones de parámetros.
GTX 1660 (6 GB GDDR5)
La tarjeta del banco de pruebas: 41,35 tokens/s en generación. La más lenta de las tarjetas de 6 GB, pero suficiente para chat en Q4.
GTX 1660 Ti (6 GB GDDR6)
288 GB/s: un 50 % más de ancho de banda que la 1660, por lo que se espera una mejora de la tasa de procesamiento de magnitud similar, pendiente de confirmación mediante mediciones.
GTX 1660 Super (6 GB GDDR6)
336 GB/s : la mejor de la serie para un LLM, con un 75 % más de ancho de banda que la 1660.

Estas extrapolaciones se basan únicamente en el ancho de banda. Tomando el rendimiento de la 1660 (82 % de su máximo teórico), una 1660 Ti produciría alrededor de 62 tokens/s y una 1660 Super aproximadamente 72 con el mismo 7B Q4_0. Son proyecciones que deben confirmarse mediante una medición en tu tarjeta, nunca resultados.

Una trampa al comprar: existen dos GTX 1650. La versión original de 2019 utiliza GDDR5 con un bus de 128 bits, lo que supone 128 GB/s; una revisión de abril de 2020 pasa a GDDR6 a 12 Gbit/s y 192 GB/s. Para un LLM, esto supone un aumento del 50 % en la velocidad potencial con el mismo modelo. Comprueba si el anuncio indica GDDR5 o GDDR6, o consulta la ficha en GPU-Z, antes de comprar una 1650 de segunda mano.

#El contexto en 4 y 6 GB: el verdadero límite

Ollama arranca con una ventana de 4.096 tokens, modificable mediante OLLAMA_CONTEXT_LENGTH. El caché KV crece con cada token de la conversación: duplicar la ventana duplica el caché. En 6 GB, con un Granite 4.2 8B en Q4, el margen de aproximadamente 1,4 GB se consume rápidamente; en 4 GB, un modelo de 3B deja 2 GB, un margen más cómodo que con un 8B en 6 GB.

Regla práctica: en lugar de una cuantización más agresiva, reduce el tamaño del modelo o el contexto. Un modelo de 3B con un contexto largo da mejores resultados en estas tarjetas que uno de 8B que descarga parte del trabajo al procesador. Comprueba siempre con ollama ps que el modelo permanezca al 100 % en la GPU: descargar parte del modelo a la memoria principal hace caer la velocidad de generación, porque esta memoria es mucho más lenta que la de la tarjeta.

¿Qué uso para qué tarjeta?
UsoGTX 1650 (4 GB)GTX 1660 / Super / Ti (6 GB)
Chat corto, traducción, reformulaciónModelo de 2 a 3B8B en Q4, contexto corto
Autocompletado de código en el editorModelo de 2 a 3B, calidad limitadaModelo de 7-8B posible
Resumen de documentos largosNo recomendadoLento: lectura del prompt a 148,91 tokens/s en la 1660
Búsqueda en tus documentos (RAG)Modelo de 3B, extractos cortosModelo de 3-8B, extractos cortos

#Lo que entra: 4 GB contra 6 GB

Según los valores de referencia del sitio, un modelo de 3B en Q4 ocupa alrededor de 2 GB y uno de 7-8B, alrededor de 5 GB, a lo que hay que sumar la caché KV. Con 6 GB, quedan aproximadamente 1,4 GB con un Granite 4.2 8B en Q4: suficiente para un contexto de unos pocos miles de tokens, pero no más. Con 4 GB, un modelo de 3B es el máximo razonable.

Lo que cabe en 4 GB y en 6 GB (pesos en Q4, catálogo QuelLLM)
Modelo (Q4)Tamaño del modeloEn 4 GBCon 6 GB
Gemma 4 2B1,2 GBCon solturaCon soltura
Granite 4.1 3B2 GBCon solturaCon soltura
Phi-4 Mini 3,8B3 GBAjustadoCon soltura
Granite 4.2 8B4,6 GBNo cabeMargen de 1,4 GB
Qwen3.5 9B6 GBNo cabeExcede la memoria disponible al añadir el contexto

En la 1650, limítate a los modelos de 2 a 4 mil millones de parámetros; también es un rango adecuado para redactar borradores, traducir o clasificar. En las 1660, un modelo de 8B en Q4 es el límite: sigue siendo utilizable para chat, pero deja poco espacio para un contexto largo.

#Soporte software: ventaja clara sobre las GTX 10

Ollama requiere un controlador NVIDIA 550 o más reciente para las tarjetas recientes, frente al 570 para las tarjetas con compute capability de 5.0 a 6.2 (Pascal incluido). La lista oficial de Ollama menciona la GTX 1650 Ti, así como las RTX 20, con compute capability 7.5. Los demás modelos GTX 16 comparten la misma arquitectura Turing sin figurar individualmente en la lista: verificar en el momento de la instalación.

En cuanto a CUDA, las notas de la versión 13 indican que se ha retirado la compatibilidad con las arquitecturas anteriores a Turing (Maxwell, Volta y Pascal): Turing y, por tanto, las GTX 16 siguen siendo compatibles. Para una compra de segunda mano, este es el argumento principal a favor de una GTX 16 en lugar de una GTX 10 de precio similar.

Comparación de la compatibilidad con el software
PuntoGTX 16 (Turing)GTX 10 (Pascal)
Controlador requerido por Ollama550 o más reciente570 o más reciente
CUDA 13CompatibleRetirado
Flash Attention en llama.cppDisponibleDisponible

#Instalar y configurar

  1. 01
    Verificar el controlador
    Ejecuta nvidia-smi: la versión debe superar 550.
  2. 02
    Instalar Ollama
    Sigue la guía de instalación de tu sistema, luego descarga un modelo adecuado para tu memoria.
  3. 03
    Comprobar dónde se ejecuta el modelo
    Inicia ollama ps: la columna PROCESSOR debe mostrar 100 % GPU. Un uso compartido con el procesador indica un desbordamiento.
  4. 04
    Limitar el contexto
    Ollama arranca con 4.096 tokens. Con 4 o 6 GB, no aumentes el contexto salvo que hayas verificado que queda espacio disponible.

Flash Attention no está reservada a las tarjetas con Tensor Cores: llama.cpp la ejecuta tanto en la GTX 1660 como en una tarjeta Pascal, y el banco de pruebas registra 154,45 tokens/s en lectura del prompt y 41,43 en generación con ella, frente a 148,91 y 41,35 sin ella. La mejora es pequeña, pero disminuye la memoria utilizada por el contexto, lo que resulta útil con 6 GB. Ollama la activa automáticamente cuando la tarjeta es compatible con ella.

#Veredicto: qué GTX 16 y cuándo pasar a otra cosa

Decisión según tu situación
Tu situaciónRecomendación
Tienes una 1660 Super o 1660 TiEl mejor de la serie: 8B en Q4, chat fluido
Tienes una 1660Suficiente para chat; lectura de prompts lenta
Tienes una 1650 (4 GB)Solo modelos de 2 a 4 mil millones de parámetros
Quieres leer documentos largosUna tarjeta Ampere o más reciente lee el prompt mucho más rápido
Quieres un 12B o másCambiar de gama: buscar 12 GB o más

Un último punto de referencia: estas tarjetas no están diseñadas para cargas pesadas, pero su potencia de diseño térmico sigue siendo modesta (120 W para la GTX 1660, según Wikipedia). Para un asistente local que responda a unas cuantas preguntas al día, esto representa una ventaja real frente a una tarjeta de 250 W.

Con un presupuesto comparable para comprar de segunda mano, la 1660 Super es una mejor opción que una GTX 1060 o 1070: misma capacidad, memoria más rápida y soporte de software durante más tiempo. Para comprar una tarjeta nueva o usarla habitualmente, una RTX 3050 o una RTX 2060 añaden núcleos Tensor y más memoria según la versión. Los precios cambian cada semana: consulta la página de precios del sitio.

FAQ
¿Se puede ejecutar un LLM en una GTX 1660?+
Sí. El banco de pruebas público de llama.cpp mide 41,35 tokens/s en generación para un modelo de 7B en Q4_0 en una GTX 1660 de 6 GB, lo que basta para chatear. La lectura del prompt es más lenta (148,91 tokens/s), por lo que los documentos largos hacen esperar. Un modelo de 8B en Q4 es el límite razonable.
¿Qué GTX 16 elegir para un LLM?+
La GTX 1660 Super: 6 GB y 336 GB/s de ancho de banda, la mejor de la serie para la generación. La 1660 Ti (288 GB/s) viene a continuación, luego la 1660 (192 GB/s). No elijas la 1650 a menos que busques modelos de 2 a 3 mil millones de parámetros.
¿Puede la GTX 1650 de 4 GB ejecutar un modelo de 7B?+
Apenas. El banco de pruebas incluye una Quadro T1000 de 4 GB que ejecuta un 7B en Q4_0 a 27,82 tokens/s, con un contexto mínimo. En la práctica, una 1650 se adapta mejor a modelos de 2 a 3 mil millones de parámetros, que dejan espacio para el contexto.
¿Las GTX 16 soportan Flash Attention?+
Sí. El banco de pruebas de llama.cpp mide su rendimiento en una GTX 1660: 154,45 tokens/s al procesar el prompt y 41,43 en generación con Flash Attention, frente a 148,91 y 41,35 sin Flash Attention. La mejora es pequeña, pero Flash Attention reduce la memoria necesaria para el contexto. Por tanto, la ausencia de Tensor Cores no impide que funcione.
¿Una GTX 1660 Super es mejor que una GTX 1060 para la IA?+
Sí. A igual capacidad de 6 GB, la 1660 Super tiene 336 GB/s frente a 192 GB/s, y Turing aprovecha mejor su memoria: una 1660 registra 41,35 tokens/s frente a 27,79 de una 1060. Turing también sigue siendo compatible con CUDA 13, a diferencia de Pascal.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.