Principiante 11 minRTX 50

¿Qué LLM en RTX 5060 Ti (8 / 16 GB)? ?

Respuesta directa

Una RTX 5060 Ti de 16 GB mantiene en VRAM modelos de hasta 14 mil millones de parámetros (Qwen3 14B, 9,3 GB) y gpt-oss 20B (14 GB), a 41 tokens por segundo con un modelo de 14B según Hardware Corner. La versión de 8 GB se limita a modelos de 9 mil millones de parámetros o menos. Su ancho de banda de 448 GB/s es idéntico en ambas versiones; la capacidad es lo que marca la diferencia.

La RTX 5060 Ti está disponible en versiones de 8 GB y 16 GB, con la misma GPU y los mismos 448 GB/s: solo la capacidad determina qué puedes ejecutar. Esta guía presenta, para cada versión, los modelos que realmente caben, las velocidades de generación medidas por Hardware Corner, el efecto del contexto y la diferencia con las tarjetas de gamas cercanas. También sabrás cuándo optar por una tarjeta más rápida.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Para esta configuración: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 5060 Ti para un LLM local: qué permiten 16 GB a 448 GB/s

Para un LLM local, una RTX 5060 Ti de 16 GB mantiene íntegramente en VRAM los modelos de hasta 14 a 20 mil millones de parámetros, pero su ancho de banda de 448 GB/s la hace entre dos y tres veces más lenta que las tarjetas de gama alta. Según la biblioteca de Ollama, Qwen3 14B pesa 9,3 GB y gpt-oss 20B, 14 GB. Hardware Corner mide 32,9 tokens por segundo en Qwen3 14B con 16.000 tokens de contexto, y 43,8 en gpt-oss 20B con 128.000 tokens. Los modelos de 27 a 32 mil millones de parámetros, de 17 GB o más, no caben. La versión de 8 GB, por su parte, se limita a modelos de 9 mil millones de parámetros o menos.

Memoria
16 GB o 8 GB de GDDR7 en un bus de 128 bits, según NVIDIA; 448 GB/s de ancho de banda, según Hardware Corner.
Consumo
180 W de potencia gráfica y una fuente de alimentación de 600 W requerida para el sistema, según NVIDIA. Este valor supera los 550 W que suelen circular.
Software
Capacidad de cómputo 12.0, compatible con Ollama con un controlador 550 o más reciente.

#8 GB o 16 GB: la única pregunta que realmente importa

Ambas versiones comparten la GPU y el ancho de banda: solo cambia la capacidad, y es esta la que determina qué puedes ejecutar. NVIDIA ofrece la 5060 Ti en versiones de 16 GB y de 8 GB; la comparación que aparece a continuación utiliza los archivos de la biblioteca de Ollama consultados el 29 de septiembre de 2026.

Lo que cabe según la versión (archivos de Ollama, Q4 salvo que se indique lo contrario)
ModeloArchivo OllamaVersión de 8 GBVersión de 16 GB
Granite 4.2 8B5,3 GBCabe, con un margen de 2,7 GBMuy cómodo
Qwen 3.5 9B6,6 GBCabe, con un margen de 1,4 GBMuy cómodo
Gemma 4 12B7,6 GBMargen de 0,4 GB: sin contextoCómodo
Qwen3 14B9,3 GBNo cabeMargen de 6,7 GB
gpt-oss 20B14 GBNo cabeCabe, con un margen de 2 GB
Devstral Small 2 24B15 GBNo cabeMargen de solo 1 GB
Qwen 3.5 27B17 GBNo cabeNo cabe

Con 8 GB, un modelo de 9 mil millones deja 1,4 GB para el contexto y el sistema: es poco, y pronto hay que recurrir a la RAM, que es más lenta. La versión de 16 GB duplica el catálogo y permite usar modelos de 12 a 20 mil millones. Para un uso habitual de LLM, la de 16 GB es la única versión que conserva un margen, aunque siga lejos de una tarjeta de 24 GB.

#Calcular tu margen antes de descargar un modelo

La regla es simple: la capacidad de la tarjeta menos el tamaño del archivo da el margen bruto, y ese margen debe cubrir la caché KV, los búferes del motor y lo que el sistema operativo utiliza para mostrar la imagen en pantalla. Con Qwen3 14B, 16 - 9,3 deja 6,7 GB; con Qwen 3.5 9B en la versión de 8 GB, 8 - 6,6 deja 1,4 GB. Cuanto menor sea el margen, más hay que reducir el contexto y cuantizar la caché. Si ollama ps muestra un reparto entre CPU y GPU, el modelo o su contexto excede la VRAM disponible y pasa en parte a la RAM: la velocidad de generación cae entonces hasta quedar limitada por la velocidad de la memoria RAM.

En la versión de 8 GB, tres hábitos evitan la mayoría de los desbordamientos. Elige un modelo de 9 mil millones o menos, cuyo archivo ocupe menos de 7 GB. Mantén un contexto reducido mientras ollama ps muestre 100 % GPU. Y cierra las aplicaciones que consumen memoria de vídeo, como el navegador o los juegos, antes de ejecutar el modelo.

#Los modelos recomendados para 16 GB

Lo recomendable es empezar con Qwen3 14B o con gpt-oss 20B. Qwen3 14B deja cerca de 7 GB para el contexto. gpt-oss 20B cabe en 14 GB porque, según Ollama, sus pesos de expertos están cuantizados en MXFP4 con 4,25 bits por parámetro, lo que le permite ejecutarse con 16 GB de memoria. Un modelo de 24 mil millones de parámetros en Q4, como Devstral Small 2 (15 GB), solo deja un GB: cabe en memoria para un intercambio corto, pero no para usarlo con un agente. Un RAG local añade un modelo de embeddings: bge-m3 ocupa 1,2 GB en Ollama, lo que suma 7,8 GB en total con Qwen 3.5 9B.

#Instalar Ollama en una RTX 5060 Ti

  1. 01
    Verificar el controlador
    Ejecuta nvidia-smi en un terminal: el controlador debe estar en versión 550 o superior (551.61 en Windows) y la memoria total debe mostrar 16 GB, o 8 GB para la otra versión.
  2. 02
    Instalar Ollama
    Instala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
  3. 03
    Ejecutar un modelo
    Ejecuta ollama run qwen3:14b en 16 GB, o ollama run qwen3.5:9b en 8 GB. La descarga se realiza una sola vez.
  4. 04
    Controlar la distribución
    En un segundo terminal, ejecuta ollama ps: la columna Procesador debe mostrar 100 % GPU. En 8 GB, una distribución CPU/GPU significa que el modelo o el contexto supera el límite: elige un modelo más ligero.
  5. 05
    Ajustar el contexto
    Fija el contexto con OLLAMA_CONTEXT_LENGTH y luego vuelve a ejecutar ollama ps. Si no hay suficiente margen, establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar.
Comandos básicos
ollama run qwen3:14b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Tasas de generación medidas: el ancho de banda marca el ritmo

Los números provienen de Hardware Corner, que prueba la versión de 16 GB con llama.cpp usando contextos de 4k a 128k. No son mediciones de QuelLLM.

Generación en RTX 5060 Ti 16 GB, tokens por segundo (Hardware Corner)
Modelo (Q4_K, o MXFP4 para gpt-oss)Contexto 4kContexto 32kContexto 128kLectura del prompt de 4k
Qwen3 8B69,238,9no medido2 965,1
Qwen3 14B41,125,9no medido1 743,0
gpt-oss 20B (MXFP4)92,173,243,83 585,2

La generación está limitada por el ancho de banda: el límite teórico equivale aproximadamente al ancho de banda dividido por el tamaño del modelo. Para Qwen3 14B (9,3 GB), 448 ÷ 9,3 da 48 tokens por segundo, y la medición con un contexto de 4k, de 41,1 tokens por segundo, alcanza el 85 % de ese límite. El contexto reduce la velocidad: Qwen3 14B pierde un 37 % entre 4k y 32k (de 41,1 a 25,9). gpt-oss 20B, un modelo de expertos, supera su límite aparente (448 ÷ 14 = 32) con 92,1 tokens por segundo, porque solo lee una parte de sus pesos por token.

Ollama establece el contexto por defecto según la memoria de vídeo: su documentación indica 4k tokens con menos de 24 GiB de VRAM y recomienda al menos 64.000 tokens para los agentes y la búsqueda web. La 5060 Ti entra en la franja de 4k. Según su FAQ, q8_0 reduce la memoria que ocupa la caché KV a aproximadamente la mitad de la que ocupa con f16, con una pérdida de precisión muy pequeña: es el primer ajuste que hay que activar con 16 GB y es indispensable con 8 GB.

#5060 Ti frente a otras tarjetas: la diferencia medida

Generación relativa por tarjeta (Hardware Corner, 5060 Ti 16 GB = 100 %)
TarjetaMemoriaGeneración relativa
RTX 5070 Ti16 GB176 %
RTX 309024 GB158 %
RTX 4070 Super12 GB113 %
RTX 5060 Ti16 GB100 %
RTX 306012 GB69 %
RTX 4060 Ti16 GB68 %

Este gráfico muestra el compromiso de la 5060 Ti: genera casi la mitad más rápido que la 4060 Ti 16 GB (100 ÷ 68), gracias a su memoria GDDR7 (448 contra 288 GB/s), pero sigue lejos de la 5070 Ti, que ofrece la misma capacidad con un 76 % más de velocidad. En cuanto al rendimiento solo, una 4070 Super de 12 GB es más rápida, pero no cumple gpt-oss 20B. Según Hardware Corner, su relación precio/memoria la convierte en la «reina de valor» para principiantes en 2026; compárelo con el seguimiento de precios actuales.

Hardware Corner también señala que dos tarjetas de 16 GB permiten alcanzar 32 GB sin pagar lo que cuesta una tarjeta de gama alta. El reparto entre dos GPU se realiza mediante llama.cpp y su modo tensor-split, detallado en la guía multi-GPU; añade capacidad, no velocidad por tarjeta.

#Veredicto: 16 GB, 8 GB u otra tarjeta

Qué decisión tomar según tu situación
SituaciónDecisiónRazón respaldada por cifras
Uso regular de LLM, presupuesto controlado5060 Ti 16 GBgpt-oss 20B a 128k de contexto: 43,8 t/s
Quieres sobre todo un modelo de 8 a 9 mil millonesLa versión de 8 GB puede ser suficienteMargen de 1,4 GB con Qwen 3.5 9B
Quieres velocidad con la misma capacidad5070 Ti176 % de la velocidad de la 5060 Ti
Quieres un 27B densoTarjeta de 24 GBQwen 3.5 27B pesa 17 GB
Ya tienes una 4060 Ti 16 GBConservarla salvo que se necesite velocidad68 % de la velocidad de la 5060 Ti

Un método de decisión se reduce a dos preguntas. ¿Cuál es el modelo más grande que deseas lanzar? Si es bajo los 9 mil millones, 8 GB es suficiente; entre 12 y 20 mil millones, se necesitan 16 GB; por encima de eso, se requiere una tarjeta de 24 GB o dos tarjetas. ¿Qué velocidad aceptas? A 40 tokens por segundo en un modelo de 14B, la lectura sigue siendo fluida; la 5070 Ti solo se justifica si generas textos largos o sirves a varias personas.

Para el fine-tuning, Unsloth indica mínimos de VRAM en QLoRA de 4 bits: 6 GB para un modelo de 8 mil millones, 8,5 GB para 14 mil millones, 22 GB para 27 mil millones. La versión de 16 GB permite, por tanto, realizar fine-tuning de un modelo de 14B, con un tamaño de lote de 1 y un contexto corto. Para los precios actuales, consulta nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana.

#Preguntas frecuentes

FAQ
¿RTX 5060 Ti de 8 GB o 16 GB para un LLM local?+
Elige la versión de 16 GB si quieres ejecutar algo distinto de un modelo de 9 mil millones de parámetros. La GPU y los 448 GB/s son iguales; solo cambia la capacidad. Con 8 GB, Qwen 3.5 9B (6,6 GB) deja solo 1,4 GB de margen; con 16 GB, gpt-oss 20B (14 GB) y Qwen3 14B (9,3 GB) caben con espacio para el contexto.
¿Cuántos tokens por segundo en una RTX 5060 Ti?+
Según Hardware Corner, la versión de 16 GB genera 41,1 tokens por segundo en Qwen3 14B con 4k de contexto, 69,2 en Qwen3 8B y 92,1 en gpt-oss 20B. El contexto ralentiza la generación: Qwen3 14B baja a 25,9 tokens por segundo con 32k. Estos valores son mediciones de terceros.
¿Puede la RTX 5060 Ti 16 GB ejecutar un modelo de 24 o 32 mil millones de parámetros?+
Un 24B en Q4 (Devstral Small 2, 15 GB) apenas cabe, con 1 GB de margen, por lo que no queda espacio para un contexto útil. Un 27B o un 32B (17 a 20 GB) no cabe. Hardware Corner indica que un 30B solo cabe en 3 bits, con una degradación notable de la calidad.
¿Qué fuente de alimentación usar para una RTX 5060 Ti?+
NVIDIA indica que se requiere una fuente de alimentación de 600 W para el sistema con una 5060 Ti, cuya potencia gráfica es de 180 W. Son los valores del fabricante para un PC completo. Una fuente de alimentación de 550 W, a menudo citada, está por debajo de esta recomendación, aunque puede ser suficiente en un PC de bajo consumo.
¿RTX 5060 Ti o RTX 4060 Ti 16 GB para los LLM?+
La 5060 Ti genera aproximadamente un 47 % más rápido, a igual capacidad de 16 GB: la 4060 Ti alcanza el 68 % de su tasa de generación según Hardware Corner, debido a un ancho de banda de 288 GB/s frente a 448. Compara la diferencia de precio antes de elegir: con un presupuesto reducido, una 4060 Ti de segunda mano sigue siendo utilizable.
¿Se puede hacer un ajuste fino de un modelo en una RTX 5060 Ti de 16 GB?+
Sí, hasta 14 mil millones en QLoRA. Según Unsloth, el mínimo absoluto es de 6 GB para un 8B y de 8,5 GB para un 14B, con un lote de 1 y un contexto corto. Un 27B requiere 22 GB y no cabe. La versión de 8 GB está limitada a un 8B o a un 9B.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.