¿Qué LLM usar en una GTX 1650 / 1660 / Super / Ti? ?
Una GTX 1660 (6 GB) ejecuta un LLM local de 7 a 8 mil millones de parámetros en Q4: el banco de pruebas público de llama.cpp mide 41,35 tokens/s en generación con un 7B Q4_0, pero solo 148,91 tokens/s para leer el prompt. Las 1660 Super y Ti, con memoria más rápida, deberían ser más rápidas. La GTX 1650, limitada a 4 GB, se limita a modelos de 2 a 3 mil millones de parámetros. Todas siguen siendo compatibles con CUDA 13.
La serie GTX 16, lanzada en 2019, pertenece a la arquitectura Turing y no incluye Tensor Cores ni núcleos de ray tracing. A diferencia de las GTX 10, no está afectada por el final del soporte de Pascal. Esta guía distingue las cuatro tarjetas según lo que importa para un LLM —la memoria y su ancho de banda—, se basa en mediciones públicas y advierte de un posible error: una generación correcta no implica una lectura rápida de prompts largos.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#La serie GTX 16 para un LLM: lo que hay que recordar
Para un LLM, la serie GTX 16 se distingue por la memoria: 4 GB para la GTX 1650, 6 GB para las GTX 1660, 1660 Super y 1660 Ti. La velocidad de generación depende del ancho de banda, que varía de uno a tres: 128 GB/s para la 1650 en GDDR5, 192 GB/s para la 1660, 288 GB/s para la 1660 Ti y 336 GB/s para la 1660 Super. A igual capacidad de 6 GB, la 1660 Super es, por tanto, la más rápida de la serie y la 1660 original la más lenta.
| Tarjeta | Memoria | Ancho de banda | Núcleos CUDA |
|---|---|---|---|
| GTX 1650 (GDDR5) | 4 GB, GDDR5, 128 bits | 128 GB/s | 896 |
| GTX 1650 (GDDR6, abril de 2020) | GDDR6 | 192 GB/s | 896 |
| GTX 1660 | 6 GB, GDDR5, 192 bits | 192 GB/s | 1 408 |
| GTX 1660 Super | 6 GB, GDDR6 | 336 GB/s | no detallado |
| GTX 1660 Ti | 6 GB, GDDR6 | 288 GB/s | 1 536 |
La serie no tiene Tensor Cores ni RT Cores: Wikipedia señala que se basa en la arquitectura Turing de las RTX 20, pero prescinde de estos dos tipos de unidades y conserva los núcleos dedicados a operaciones con enteros. Para los modelos cuantizados en enteros, la ausencia de Tensor Cores influye poco en la generación.
#Turing sin Tensor Cores: qué cambia respecto a Pascal
El punto fuerte de la serie es el FP16. En una GTX 1660, Wikipedia indica 8.617 GFLOPS en media precisión frente a 4.309 en precisión simple: el FP16 funciona dos veces más rápido que el FP32, mientras que en una GTX 10 de consumo funciona mucho más lento que el FP32, como muestra la guía de la GTX 1080 Ti. Esto explica que la 1660, con el mismo ancho de banda de 192 GB/s, supere claramente a una GTX 1060 en generación, y que CUDA 13 no la haya abandonado.
El contraejemplo se encuentra en la lectura del prompt. El benchmark de llama.cpp da 148,91 tokens/s en la 1660 al procesar el prompt, contra 416,85 para la GTX 1060: una tarjeta más reciente puede leer un texto largo casi tres veces más lentamente. El benchmark no detalla la causa; el resultado proviene de un único contribuyente y debe interpretarse como una estimación de orden de magnitud. Sin embargo, basta para moderar el entusiasmo por documentos largos.
| Tarjeta | Ancho de banda | Prompt (pp512) | Generación (tg128) |
|---|---|---|---|
| GTX 1060 6 GB (Pascal) | 192 GB/s | 416,85 tokens/s | 27,79 tokens/s |
| GTX 1660 6 GB (Turing) | 192 GB/s | 148,91 tokens/s | 41,35 tokens/s |
| Quadro T1000 4 GB | 128 GB/s | 79,44 tokens/s | 27,82 tokens/s |
#Las cuatro variantes una a una
- GTX 1650 (4 GB)
- El banco de pruebas no tiene una 1650, pero incluye una Quadro T1000 de 4 GB y 128 bits, con el mismo ancho de banda: puede ejecutar un 7B en Q4_0 a 27,82 tokens/s con un contexto mínimo. Ese es el límite: con 4 GB, es mejor un modelo de 2 a 3 mil millones de parámetros.
- GTX 1660 (6 GB GDDR5)
- La tarjeta del banco de pruebas: 41,35 tokens/s en generación. La más lenta de las tarjetas de 6 GB, pero suficiente para chat en Q4.
- GTX 1660 Ti (6 GB GDDR6)
- 288 GB/s: un 50 % más de ancho de banda que la 1660, por lo que se espera una mejora de la tasa de procesamiento de magnitud similar, pendiente de confirmación mediante mediciones.
- GTX 1660 Super (6 GB GDDR6)
- 336 GB/s : la mejor de la serie para un LLM, con un 75 % más de ancho de banda que la 1660.
Estas extrapolaciones se basan únicamente en el ancho de banda. Tomando el rendimiento de la 1660 (82 % de su máximo teórico), una 1660 Ti produciría alrededor de 62 tokens/s y una 1660 Super aproximadamente 72 con el mismo 7B Q4_0. Son proyecciones que deben confirmarse mediante una medición en tu tarjeta, nunca resultados.
Una trampa al comprar: existen dos GTX 1650. La versión original de 2019 utiliza GDDR5 con un bus de 128 bits, lo que supone 128 GB/s; una revisión de abril de 2020 pasa a GDDR6 a 12 Gbit/s y 192 GB/s. Para un LLM, esto supone un aumento del 50 % en la velocidad potencial con el mismo modelo. Comprueba si el anuncio indica GDDR5 o GDDR6, o consulta la ficha en GPU-Z, antes de comprar una 1650 de segunda mano.
#El contexto en 4 y 6 GB: el verdadero límite
Ollama arranca con una ventana de 4.096 tokens, modificable mediante OLLAMA_CONTEXT_LENGTH. El caché KV crece con cada token de la conversación: duplicar la ventana duplica el caché. En 6 GB, con un Granite 4.2 8B en Q4, el margen de aproximadamente 1,4 GB se consume rápidamente; en 4 GB, un modelo de 3B deja 2 GB, un margen más cómodo que con un 8B en 6 GB.
Regla práctica: en lugar de una cuantización más agresiva, reduce el tamaño del modelo o el contexto. Un modelo de 3B con un contexto largo da mejores resultados en estas tarjetas que uno de 8B que descarga parte del trabajo al procesador. Comprueba siempre con ollama ps que el modelo permanezca al 100 % en la GPU: descargar parte del modelo a la memoria principal hace caer la velocidad de generación, porque esta memoria es mucho más lenta que la de la tarjeta.
| Uso | GTX 1650 (4 GB) | GTX 1660 / Super / Ti (6 GB) |
|---|---|---|
| Chat corto, traducción, reformulación | Modelo de 2 a 3B | 8B en Q4, contexto corto |
| Autocompletado de código en el editor | Modelo de 2 a 3B, calidad limitada | Modelo de 7-8B posible |
| Resumen de documentos largos | No recomendado | Lento: lectura del prompt a 148,91 tokens/s en la 1660 |
| Búsqueda en tus documentos (RAG) | Modelo de 3B, extractos cortos | Modelo de 3-8B, extractos cortos |
#Lo que entra: 4 GB contra 6 GB
Según los valores de referencia del sitio, un modelo de 3B en Q4 ocupa alrededor de 2 GB y uno de 7-8B, alrededor de 5 GB, a lo que hay que sumar la caché KV. Con 6 GB, quedan aproximadamente 1,4 GB con un Granite 4.2 8B en Q4: suficiente para un contexto de unos pocos miles de tokens, pero no más. Con 4 GB, un modelo de 3B es el máximo razonable.
| Modelo (Q4) | Tamaño del modelo | En 4 GB | Con 6 GB |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | Con soltura | Con soltura |
| Granite 4.1 3B | 2 GB | Con soltura | Con soltura |
| Phi-4 Mini 3,8B | 3 GB | Ajustado | Con soltura |
| Granite 4.2 8B | 4,6 GB | No cabe | Margen de 1,4 GB |
| Qwen3.5 9B | 6 GB | No cabe | Excede la memoria disponible al añadir el contexto |
En la 1650, limítate a los modelos de 2 a 4 mil millones de parámetros; también es un rango adecuado para redactar borradores, traducir o clasificar. En las 1660, un modelo de 8B en Q4 es el límite: sigue siendo utilizable para chat, pero deja poco espacio para un contexto largo.
#Soporte software: ventaja clara sobre las GTX 10
Ollama requiere un controlador NVIDIA 550 o más reciente para las tarjetas recientes, frente al 570 para las tarjetas con compute capability de 5.0 a 6.2 (Pascal incluido). La lista oficial de Ollama menciona la GTX 1650 Ti, así como las RTX 20, con compute capability 7.5. Los demás modelos GTX 16 comparten la misma arquitectura Turing sin figurar individualmente en la lista: verificar en el momento de la instalación.
En cuanto a CUDA, las notas de la versión 13 indican que se ha retirado la compatibilidad con las arquitecturas anteriores a Turing (Maxwell, Volta y Pascal): Turing y, por tanto, las GTX 16 siguen siendo compatibles. Para una compra de segunda mano, este es el argumento principal a favor de una GTX 16 en lugar de una GTX 10 de precio similar.
| Punto | GTX 16 (Turing) | GTX 10 (Pascal) |
|---|---|---|
| Controlador requerido por Ollama | 550 o más reciente | 570 o más reciente |
| CUDA 13 | Compatible | Retirado |
| Flash Attention en llama.cpp | Disponible | Disponible |
#Instalar y configurar
- 01Verificar el controladorEjecuta nvidia-smi: la versión debe superar 550.
- 02Instalar OllamaSigue la guía de instalación de tu sistema, luego descarga un modelo adecuado para tu memoria.
- 03Comprobar dónde se ejecuta el modeloInicia ollama ps: la columna PROCESSOR debe mostrar 100 % GPU. Un uso compartido con el procesador indica un desbordamiento.
- 04Limitar el contextoOllama arranca con 4.096 tokens. Con 4 o 6 GB, no aumentes el contexto salvo que hayas verificado que queda espacio disponible.
Flash Attention no está reservada a las tarjetas con Tensor Cores: llama.cpp la ejecuta tanto en la GTX 1660 como en una tarjeta Pascal, y el banco de pruebas registra 154,45 tokens/s en lectura del prompt y 41,43 en generación con ella, frente a 148,91 y 41,35 sin ella. La mejora es pequeña, pero disminuye la memoria utilizada por el contexto, lo que resulta útil con 6 GB. Ollama la activa automáticamente cuando la tarjeta es compatible con ella.
- Instalar Ollama paso a paso
- Solucionar problemas de Ollama: GPU no detectada, lentitud
- Cuantizar la caché KV para ahorrar VRAM
#Veredicto: qué GTX 16 y cuándo pasar a otra cosa
| Tu situación | Recomendación |
|---|---|
| Tienes una 1660 Super o 1660 Ti | El mejor de la serie: 8B en Q4, chat fluido |
| Tienes una 1660 | Suficiente para chat; lectura de prompts lenta |
| Tienes una 1650 (4 GB) | Solo modelos de 2 a 4 mil millones de parámetros |
| Quieres leer documentos largos | Una tarjeta Ampere o más reciente lee el prompt mucho más rápido |
| Quieres un 12B o más | Cambiar de gama: buscar 12 GB o más |
Un último punto de referencia: estas tarjetas no están diseñadas para cargas pesadas, pero su potencia de diseño térmico sigue siendo modesta (120 W para la GTX 1660, según Wikipedia). Para un asistente local que responda a unas cuantas preguntas al día, esto representa una ventaja real frente a una tarjeta de 250 W.
Con un presupuesto comparable para comprar de segunda mano, la 1660 Super es una mejor opción que una GTX 1060 o 1070: misma capacidad, memoria más rápida y soporte de software durante más tiempo. Para comprar una tarjeta nueva o usarla habitualmente, una RTX 3050 o una RTX 2060 añaden núcleos Tensor y más memoria según la versión. Los precios cambian cada semana: consulta la página de precios del sitio.
- ¿Qué LLM usar en una RTX 3050?
- ¿Qué LLM usar en una RTX 2060 / 2060 Super?
- Qué modelos usar con 6 GB de VRAM, independientemente de la tarjeta
- Comparar los precios de las GPU para la IA
- Fuente: benchmark público de llama.cpp con CUDA
- Fuente: documentación de Ollama, hardware NVIDIA compatible
- Fuente: serie GeForce 16, características
- Fuente: notas de versión del CUDA Toolkit
¿Se puede ejecutar un LLM en una GTX 1660?+
¿Qué GTX 16 elegir para un LLM?+
¿Puede la GTX 1650 de 4 GB ejecutar un modelo de 7B?+
¿Las GTX 16 soportan Flash Attention?+
¿Una GTX 1660 Super es mejor que una GTX 1060 para la IA?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.