¿Qué LLM en RTX 5060 Ti (8 / 16 GB)? ?
Una RTX 5060 Ti de 16 GB mantiene en VRAM modelos de hasta 14 mil millones de parámetros (Qwen3 14B, 9,3 GB) y gpt-oss 20B (14 GB), a 41 tokens por segundo con un modelo de 14B según Hardware Corner. La versión de 8 GB se limita a modelos de 9 mil millones de parámetros o menos. Su ancho de banda de 448 GB/s es idéntico en ambas versiones; la capacidad es lo que marca la diferencia.
La RTX 5060 Ti está disponible en versiones de 8 GB y 16 GB, con la misma GPU y los mismos 448 GB/s: solo la capacidad determina qué puedes ejecutar. Esta guía presenta, para cada versión, los modelos que realmente caben, las velocidades de generación medidas por Hardware Corner, el efecto del contexto y la diferencia con las tarjetas de gamas cercanas. También sabrás cuándo optar por una tarjeta más rápida.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para esta configuración: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 5060 Ti para un LLM local: qué permiten 16 GB a 448 GB/s
Para un LLM local, una RTX 5060 Ti de 16 GB mantiene íntegramente en VRAM los modelos de hasta 14 a 20 mil millones de parámetros, pero su ancho de banda de 448 GB/s la hace entre dos y tres veces más lenta que las tarjetas de gama alta. Según la biblioteca de Ollama, Qwen3 14B pesa 9,3 GB y gpt-oss 20B, 14 GB. Hardware Corner mide 32,9 tokens por segundo en Qwen3 14B con 16.000 tokens de contexto, y 43,8 en gpt-oss 20B con 128.000 tokens. Los modelos de 27 a 32 mil millones de parámetros, de 17 GB o más, no caben. La versión de 8 GB, por su parte, se limita a modelos de 9 mil millones de parámetros o menos.
- Memoria
- 16 GB o 8 GB de GDDR7 en un bus de 128 bits, según NVIDIA; 448 GB/s de ancho de banda, según Hardware Corner.
- Consumo
- 180 W de potencia gráfica y una fuente de alimentación de 600 W requerida para el sistema, según NVIDIA. Este valor supera los 550 W que suelen circular.
- Software
- Capacidad de cómputo 12.0, compatible con Ollama con un controlador 550 o más reciente.
#8 GB o 16 GB: la única pregunta que realmente importa
Ambas versiones comparten la GPU y el ancho de banda: solo cambia la capacidad, y es esta la que determina qué puedes ejecutar. NVIDIA ofrece la 5060 Ti en versiones de 16 GB y de 8 GB; la comparación que aparece a continuación utiliza los archivos de la biblioteca de Ollama consultados el 29 de septiembre de 2026.
| Modelo | Archivo Ollama | Versión de 8 GB | Versión de 16 GB |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | Cabe, con un margen de 2,7 GB | Muy cómodo |
| Qwen 3.5 9B | 6,6 GB | Cabe, con un margen de 1,4 GB | Muy cómodo |
| Gemma 4 12B | 7,6 GB | Margen de 0,4 GB: sin contexto | Cómodo |
| Qwen3 14B | 9,3 GB | No cabe | Margen de 6,7 GB |
| gpt-oss 20B | 14 GB | No cabe | Cabe, con un margen de 2 GB |
| Devstral Small 2 24B | 15 GB | No cabe | Margen de solo 1 GB |
| Qwen 3.5 27B | 17 GB | No cabe | No cabe |
Con 8 GB, un modelo de 9 mil millones deja 1,4 GB para el contexto y el sistema: es poco, y pronto hay que recurrir a la RAM, que es más lenta. La versión de 16 GB duplica el catálogo y permite usar modelos de 12 a 20 mil millones. Para un uso habitual de LLM, la de 16 GB es la única versión que conserva un margen, aunque siga lejos de una tarjeta de 24 GB.
#Calcular tu margen antes de descargar un modelo
La regla es simple: la capacidad de la tarjeta menos el tamaño del archivo da el margen bruto, y ese margen debe cubrir la caché KV, los búferes del motor y lo que el sistema operativo utiliza para mostrar la imagen en pantalla. Con Qwen3 14B, 16 - 9,3 deja 6,7 GB; con Qwen 3.5 9B en la versión de 8 GB, 8 - 6,6 deja 1,4 GB. Cuanto menor sea el margen, más hay que reducir el contexto y cuantizar la caché. Si ollama ps muestra un reparto entre CPU y GPU, el modelo o su contexto excede la VRAM disponible y pasa en parte a la RAM: la velocidad de generación cae entonces hasta quedar limitada por la velocidad de la memoria RAM.
En la versión de 8 GB, tres hábitos evitan la mayoría de los desbordamientos. Elige un modelo de 9 mil millones o menos, cuyo archivo ocupe menos de 7 GB. Mantén un contexto reducido mientras ollama ps muestre 100 % GPU. Y cierra las aplicaciones que consumen memoria de vídeo, como el navegador o los juegos, antes de ejecutar el modelo.
#Los modelos recomendados para 16 GB
Lo recomendable es empezar con Qwen3 14B o con gpt-oss 20B. Qwen3 14B deja cerca de 7 GB para el contexto. gpt-oss 20B cabe en 14 GB porque, según Ollama, sus pesos de expertos están cuantizados en MXFP4 con 4,25 bits por parámetro, lo que le permite ejecutarse con 16 GB de memoria. Un modelo de 24 mil millones de parámetros en Q4, como Devstral Small 2 (15 GB), solo deja un GB: cabe en memoria para un intercambio corto, pero no para usarlo con un agente. Un RAG local añade un modelo de embeddings: bge-m3 ocupa 1,2 GB en Ollama, lo que suma 7,8 GB en total con Qwen 3.5 9B.
#Instalar Ollama en una RTX 5060 Ti
- 01Verificar el controladorEjecuta nvidia-smi en un terminal: el controlador debe estar en versión 550 o superior (551.61 en Windows) y la memoria total debe mostrar 16 GB, o 8 GB para la otra versión.
- 02Instalar OllamaInstala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
- 03Ejecutar un modeloEjecuta ollama run qwen3:14b en 16 GB, o ollama run qwen3.5:9b en 8 GB. La descarga se realiza una sola vez.
- 04Controlar la distribuciónEn un segundo terminal, ejecuta ollama ps: la columna Procesador debe mostrar 100 % GPU. En 8 GB, una distribución CPU/GPU significa que el modelo o el contexto supera el límite: elige un modelo más ligero.
- 05Ajustar el contextoFija el contexto con OLLAMA_CONTEXT_LENGTH y luego vuelve a ejecutar ollama ps. Si no hay suficiente margen, establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar.
#Tasas de generación medidas: el ancho de banda marca el ritmo
Los números provienen de Hardware Corner, que prueba la versión de 16 GB con llama.cpp usando contextos de 4k a 128k. No son mediciones de QuelLLM.
| Modelo (Q4_K, o MXFP4 para gpt-oss) | Contexto 4k | Contexto 32k | Contexto 128k | Lectura del prompt de 4k |
|---|---|---|---|---|
| Qwen3 8B | 69,2 | 38,9 | no medido | 2 965,1 |
| Qwen3 14B | 41,1 | 25,9 | no medido | 1 743,0 |
| gpt-oss 20B (MXFP4) | 92,1 | 73,2 | 43,8 | 3 585,2 |
La generación está limitada por el ancho de banda: el límite teórico equivale aproximadamente al ancho de banda dividido por el tamaño del modelo. Para Qwen3 14B (9,3 GB), 448 ÷ 9,3 da 48 tokens por segundo, y la medición con un contexto de 4k, de 41,1 tokens por segundo, alcanza el 85 % de ese límite. El contexto reduce la velocidad: Qwen3 14B pierde un 37 % entre 4k y 32k (de 41,1 a 25,9). gpt-oss 20B, un modelo de expertos, supera su límite aparente (448 ÷ 14 = 32) con 92,1 tokens por segundo, porque solo lee una parte de sus pesos por token.
Ollama establece el contexto por defecto según la memoria de vídeo: su documentación indica 4k tokens con menos de 24 GiB de VRAM y recomienda al menos 64.000 tokens para los agentes y la búsqueda web. La 5060 Ti entra en la franja de 4k. Según su FAQ, q8_0 reduce la memoria que ocupa la caché KV a aproximadamente la mitad de la que ocupa con f16, con una pérdida de precisión muy pequeña: es el primer ajuste que hay que activar con 16 GB y es indispensable con 8 GB.
#5060 Ti frente a otras tarjetas: la diferencia medida
| Tarjeta | Memoria | Generación relativa |
|---|---|---|
| RTX 5070 Ti | 16 GB | 176 % |
| RTX 3090 | 24 GB | 158 % |
| RTX 4070 Super | 12 GB | 113 % |
| RTX 5060 Ti | 16 GB | 100 % |
| RTX 3060 | 12 GB | 69 % |
| RTX 4060 Ti | 16 GB | 68 % |
Este gráfico muestra el compromiso de la 5060 Ti: genera casi la mitad más rápido que la 4060 Ti 16 GB (100 ÷ 68), gracias a su memoria GDDR7 (448 contra 288 GB/s), pero sigue lejos de la 5070 Ti, que ofrece la misma capacidad con un 76 % más de velocidad. En cuanto al rendimiento solo, una 4070 Super de 12 GB es más rápida, pero no cumple gpt-oss 20B. Según Hardware Corner, su relación precio/memoria la convierte en la «reina de valor» para principiantes en 2026; compárelo con el seguimiento de precios actuales.
Hardware Corner también señala que dos tarjetas de 16 GB permiten alcanzar 32 GB sin pagar lo que cuesta una tarjeta de gama alta. El reparto entre dos GPU se realiza mediante llama.cpp y su modo tensor-split, detallado en la guía multi-GPU; añade capacidad, no velocidad por tarjeta.
#Veredicto: 16 GB, 8 GB u otra tarjeta
| Situación | Decisión | Razón respaldada por cifras |
|---|---|---|
| Uso regular de LLM, presupuesto controlado | 5060 Ti 16 GB | gpt-oss 20B a 128k de contexto: 43,8 t/s |
| Quieres sobre todo un modelo de 8 a 9 mil millones | La versión de 8 GB puede ser suficiente | Margen de 1,4 GB con Qwen 3.5 9B |
| Quieres velocidad con la misma capacidad | 5070 Ti | 176 % de la velocidad de la 5060 Ti |
| Quieres un 27B denso | Tarjeta de 24 GB | Qwen 3.5 27B pesa 17 GB |
| Ya tienes una 4060 Ti 16 GB | Conservarla salvo que se necesite velocidad | 68 % de la velocidad de la 5060 Ti |
Un método de decisión se reduce a dos preguntas. ¿Cuál es el modelo más grande que deseas lanzar? Si es bajo los 9 mil millones, 8 GB es suficiente; entre 12 y 20 mil millones, se necesitan 16 GB; por encima de eso, se requiere una tarjeta de 24 GB o dos tarjetas. ¿Qué velocidad aceptas? A 40 tokens por segundo en un modelo de 14B, la lectura sigue siendo fluida; la 5070 Ti solo se justifica si generas textos largos o sirves a varias personas.
Para el fine-tuning, Unsloth indica mínimos de VRAM en QLoRA de 4 bits: 6 GB para un modelo de 8 mil millones, 8,5 GB para 14 mil millones, 22 GB para 27 mil millones. La versión de 16 GB permite, por tanto, realizar fine-tuning de un modelo de 14B, con un tamaño de lote de 1 y un contexto corto. Para los precios actuales, consulta nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana.
- Fuente: NVIDIA, especificaciones de la familia RTX 5060
- Fuente: Hardware Corner, benchmarks LLM en RTX 5060 Ti 16 GB
- Fuente: Ollama, página del modelo gpt-oss
- Fuente: documentación de Ollama, longitud de contexto
- Fuente: Unsloth, VRAM requerida para el fine-tuning
#Preguntas frecuentes
¿RTX 5060 Ti de 8 GB o 16 GB para un LLM local?+
¿Cuántos tokens por segundo en una RTX 5060 Ti?+
¿Puede la RTX 5060 Ti 16 GB ejecutar un modelo de 24 o 32 mil millones de parámetros?+
¿Qué fuente de alimentación usar para una RTX 5060 Ti?+
¿RTX 5060 Ti o RTX 4060 Ti 16 GB para los LLM?+
¿Se puede hacer un ajuste fino de un modelo en una RTX 5060 Ti de 16 GB?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.