¿Qué LLM en RTX 5060 (8 GB)? ?
La RTX 5060 combina 8 GB de GDDR7 a 448 GB/s, lo que representa un 65 % más de ancho de banda que una RTX 4060. Puede ejecutar sin problemas modelos de 3 a 9 mil millones de parámetros en Q4: Granite 4.2 8B (5,3 GB) o Qwen 3.5 9B (6,6 GB), con un límite teórico de aproximadamente 85 tokens/s en un 8B. Su límite es la capacidad: un modelo de 12B o más no cabe con un contexto útil.
La RTX 5060 es la tarjeta de 8 GB más rápida del mercado de consumo para ejecutar LLM en local, gracias a su memoria GDDR7. Pero 8 GB siguen siendo 8 GB. Esta guía cuantifica qué modelos caben, qué velocidad se puede esperar, qué ajustes de Ollama evitan superar la capacidad de memoria y cuándo una RTX 5060 Ti de 16 GB pasa a ser una mejor compra.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para esta configuración: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 5060 para un LLM local: lo que permiten 8 GB de GDDR7
Una RTX 5060 ejecuta sin problemas modelos de 3 a 9 mil millones de parámetros en Q4. Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB y Qwen 3.5 9B 6,6 GB según la biblioteca Ollama: todos caben en los 8 GB de la tarjeta, el último con un contexto corto. Un modelo de 12B, como Gemma 4 12B (7,7 a 8 GB), ya ocupa toda la memoria antes del primer token de contexto. El punto fuerte de la tarjeta es su memoria: 448 GB/s con un bus de 128 bits, frente a los 272 GB/s de la RTX 4060, un 65 % más. Para chatear, resumir o usar un pequeño RAG, la 5060 funciona con mucha soltura. Para superar los 9B, se necesita más VRAM, no más velocidad.
- Arquitectura
- Blackwell, 3 840 núcleos CUDA y Tensor Cores de 5.ª generación según NVIDIA.
- Memoria
- 8 GB de GDDR7 en un bus de 128 bits, 448 GB/s de ancho de banda
- Potencia
- 145 W de potencia gráfica total; NVIDIA indica 550 W de alimentación mínima para el ordenador completo.
- Precio de lanzamiento
- 299 dólares, lanzada el 19 de mayo de 2025 según Wikipedia.
#¿Por qué la 5060 es más rápida que la 4060 con la misma capacidad?
Durante la generación, cada token obliga a la GPU a volver a leer la mayor parte de los pesos del modelo. La velocidad máxima es, por tanto, el ancho de banda dividido por el tamaño de los pesos. La 5060 lee su memoria un 65 % más rápido que la 4060: con el mismo modelo, el límite teórico aumenta en la misma proporción. Este es el único argumento técnico que cuenta para el LLM. Los núcleos CUDA ayudan a procesar el prompt, no a generar texto, ya que la generación sigue limitada por la memoria.
| Tarjeta | Memoria | Ancho de banda | Límite con un modelo de 5,3 GB |
|---|---|---|---|
| RTX 4060 | 8 GB GDDR6 | 272 GB/s | 51 tokens/s |
| RTX 5060 | 8 GB GDDR7 | 448 GB/s | 85 tokens/s |
#Qué modelos caben en 8 GB
| Modelo | Tamaño | Margen disponible con 8 GB | Veredicto |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Cómodo, contexto largo posible |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Con holgura, contexto moderado |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Ajustado, contexto corto |
| Gemma 4 12B | 7,7 a 8,0 GB | 0 GB o menos | No cabe con un contexto útil |
Gemma 4 12B ilustra la trampa de fijarse en el tamaño del archivo: sus pesos ocupan entre 7,7 y 8 GB, pero la tarjeta también debe alojar la caché de contexto y los datos necesarios para la salida de vídeo. El modelo se carga, pero con un contexto de unos pocos miles de tokens en el mejor de los casos, y parte del modelo pasa a la RAM en cuanto una aplicación utiliza algo de VRAM. Con 8 GB, Qwen 3.5 9B o Granite 4.2 8B son opciones más seguras y dejan un margen aprovechable.
#Imágenes, visión y cuantización: dos precisiones
La biblioteca Ollama indica que Qwen 3.5 acepta texto e imágenes: un modelo de 4B o de 9B puede, por tanto, describir una captura de pantalla o leer un esquema. Las imágenes consumen contexto, lo que reduce el margen con 8 GB; elige el 4B (3,4 GB) para la visión si quieres dejar espacio libre. En cuanto a la cuantización, Q4_K_M sigue siendo un buen equilibrio con 8 GB: pasar a una cuantización más fina aumenta el tamaño de los pesos en varios cientos de megabytes, un margen que la tarjeta no tiene, sin cambios visibles para un uso habitual.
#Instalar Ollama y verificar la tarjeta
- 01Controlador NVIDIAOllama requiere un controlador NVIDIA de la versión 550 o posterior. Para una RTX 50, instala el controlador más reciente ofrecido por NVIDIA. Verifica con nvidia-smi.
- 02Instalar OllamaLa RTX 5060 figura en la lista de tarjetas compatibles (capacidad de cálculo 12.0). CUDA está integrado: no es necesario instalarlo por separado.
- 03Primer modeloInicia ollama run qwen3.5:9b (6,6 GB) o ollama run granite4.2:8b (5,3 GB) si prefieres mantener margen.
- 04ControlEjecuta ollama ps: la columna PROCESSOR debe mostrar 100 % GPU.
#Qué velocidad esperar: un límite superior, no una medición
Aquí no se presenta ninguna velocidad de generación como una medición propia. El límite máximo de generación es el ancho de banda dividido por el tamaño de los pesos. Una medición pública de terceros (LLaMA 3 8B en Q4_K_M con llama.cpp, mayo de 2024) registra 106 tokens/s en una RTX 4080 cuyo límite máximo es de 156 tokens/s, es decir, aproximadamente un 68 %. Tomando el 70 % como orden de magnitud, se obtienen las siguientes estimaciones para un contexto corto.
| Modelo (Q4) | Tamaño del modelo | Límite máximo | Estimación al 70 % |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 132 tokens/s | aproximadamente 92 tokens/s |
| Granite 4.2 8B | 5,3 GB | 85 tokens/s | aproximadamente 59 tokens/s |
| Qwen 3.5 9B | 6,6 GB | 68 tokens/s | aproximadamente 48 tokens/s |
| Gemma 4 12B | 7,7 GB | 58 tokens/s | aproximadamente 40 tokens/s, contexto muy limitado |
Todos estos límites superan ampliamente el umbral de lectura cómoda, alrededor de 15 a 20 tokens/s. La velocidad no será, por tanto, lo que limite a la 5060: será la capacidad de 8 GB.
#Ajustar Ollama para no superar los 8 GB
Ollama cuantiza la caché K/V en q8_0 para utilizar aproximadamente la mitad de la memoria que con f16, el formato predeterminado, con una pérdida de precisión muy baja según su documentación; esto requiere Flash Attention. Con 8 GB, es la medida más rentable: permite ampliar el contexto sin cambiar de modelo.
- Un solo modelo
- Carga solo un modelo a la vez; un modelo de embeddings para un RAG debe ser pequeño.
- Aplicaciones que consumen muchos recursos
- Los navegadores con aceleración por hardware, los juegos y la codificación de vídeo reservan VRAM: ciérralos antes de cargar.
- Contexto adaptado
- Cada vez que se duplica el contexto, se duplica la caché K/V: aumenta el contexto solo para la tarea que lo requiera.
- Supervisión
- nvidia-smi durante una generación larga muestra el margen real.
#Lo que se hace en la práctica con 8 GB
El criterio adecuado es la tarea solicitada, no el tamaño del modelo. Tanto un modelo 4B como uno 8B sirven para conversar o reformular un texto. Resumir documentos de unas decenas de páginas requiere un contexto de 8 000 a 16 000 tokens: con la caché K/V en q8_0, un 8B lo consigue con 8 GB. Un RAG combina un modelo de generación, un modelo de embeddings y el contexto de los fragmentos recuperados: mantén el modelo de generación por debajo de 9B. El asistente de código es el caso más exigente, porque los modelos especializados pronto superan la capacidad de la tarjeta gráfica.
| Uso | ¿Realista? | Ajuste recomendado |
|---|---|---|
| Chat diario, preguntas cortas | Sí | Granite 4.2 8B, contexto predeterminado |
| Resumen de documentos de 10 a 30 páginas | Sí, con un contexto de 8.192 a 16.384 tokens | Caché K/V en q8_0, Flash Attention |
| RAG sobre tus archivos | Sí, con un modelo de 4B a 8B | Embeddings ligeros, un solo modelo de generación |
| Asistente de código en un repositorio | Limitado | Modelo de 4B a 8B, extractos cortos |
| Modelos de 14 GB o más | No | Prever 16 GB de VRAM |
Si un modelo supera la capacidad de la memoria de la GPU, la generación no se detiene: parte de los pesos se lee desde la RAM del sistema. El síntoma es una caída brusca de la velocidad. El comando ollama ps muestra la distribución entre GPU y CPU; una línea que indica 100 % GPU es señal de un funcionamiento normal, mientras que una línea con un reparto entre GPU y CPU indica que se ha superado esa capacidad, lo que se corrige reduciendo el contexto o cambiando de modelo.
#Cuando la 5060 ya no es suficiente
Tres señales indican que se necesita más memoria. Quieres un modelo de 12B o más para una redacción de calidad. Tu contexto supera regularmente los 16 000 tokens debido a documentos largos. Cargas varios modelos al mismo tiempo: generación, embeddings y reranker. En estos casos, añadir velocidad no cambia nada: falta capacidad, y los siguientes niveles se describen en las páginas de 12 GB y 16 GB.
#5060 o 5060 Ti 16 GB: la elección que importa
La RTX 5060 Ti 16 GB utiliza la misma memoria GDDR7 con un bus de 128 bits y, por tanto, tiene el mismo ancho de banda de 448 GB/s según Wikipedia. Sus 4.608 núcleos CUDA y 16 GB de memoria son sus verdaderas diferencias. Por tanto, genera a la misma velocidad con un modelo que cabe en ambas tarjetas, pero también carga modelos de 14 GB que la 5060 no puede alojar. Los precios recomendados en el lanzamiento eran de 299 dólares para la 5060, 379 dólares para la 5060 Ti 8 GB y 429 dólares para la 5060 Ti 16 GB: por 130 dólares más, obtienes el doble de capacidad.
| Criterio | RTX 5060 | RTX 5060 Ti 16 GB |
|---|---|---|
| Memoria | 8 GB GDDR7 | 16 GB GDDR7 |
| Ancho de banda | 448 GB/s | 448 GB/s |
| Núcleos CUDA | 3 840 | 4 608 |
| Potencia gráfica | 145 W | 180 W |
| Fuente de alimentación mínima | 550 W | 600 W |
| Modelos de 14 GB (gpt-oss 20B, Mistral Small 24B) | No | Sí, con 2 GB de margen |
#Veredicto 2026
- Compra una 5060 si
- Tus modelos son de 4B a 9B, tu presupuesto es ajustado y quieres algo nuevo con garantía. Es la tarjeta de 8 GB más rápida.
- Prefiere la 5060 Ti 16 GB si
- Buscas modelos de 12B a 24B: la capacidad prima sobre la velocidad y el sobrecoste es modesto.
- Evita la 5060 si
- Tienes previsto utilizar Gemma 4 12B, gpt-oss 20B o cualquier modelo de más de 8 GB para un uso serio.
El resumen cabe en una frase: la 5060 es la tarjeta de 8 GB que se elige por su velocidad y su precio, no por su capacidad. Si tu uso cabe en 8 GB, es difícil de superar entre las tarjetas nuevas; si no cabe, ningún ajuste compensará los 8 GB que faltan, y la siguiente tarjeta de la gama es la inversión adecuada.
- Fuente: características oficiales de NVIDIA (RTX 5060 y 5060 Ti)
- Fuente: GPU NVIDIA compatibles con Ollama
- Fuente: preguntas frecuentes oficiales de Ollama (Flash Attention, caché K/V)
#Preguntas frecuentes
¿Puede la RTX 5060 ejecutar un LLM localmente?+
¿Cuántos tokens por segundo en una RTX 5060?+
¿RTX 5060 o RTX 4060 Ti de 16 GB para un LLM?+
¿Acelera el FP4 de la RTX 5060 Ollama?+
¿Qué fuente de alimentación se necesita para una RTX 5060?+
¿Se puede hacer RAG con una RTX 5060?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.