Principiante 11 minRTX 50

¿Qué LLM en RTX 5060 (8 GB)? ?

Respuesta directa

La RTX 5060 combina 8 GB de GDDR7 a 448 GB/s, lo que representa un 65 % más de ancho de banda que una RTX 4060. Puede ejecutar sin problemas modelos de 3 a 9 mil millones de parámetros en Q4: Granite 4.2 8B (5,3 GB) o Qwen 3.5 9B (6,6 GB), con un límite teórico de aproximadamente 85 tokens/s en un 8B. Su límite es la capacidad: un modelo de 12B o más no cabe con un contexto útil.

La RTX 5060 es la tarjeta de 8 GB más rápida del mercado de consumo para ejecutar LLM en local, gracias a su memoria GDDR7. Pero 8 GB siguen siendo 8 GB. Esta guía cuantifica qué modelos caben, qué velocidad se puede esperar, qué ajustes de Ollama evitan superar la capacidad de memoria y cuándo una RTX 5060 Ti de 16 GB pasa a ser una mejor compra.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Para esta configuración: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 5060 para un LLM local: lo que permiten 8 GB de GDDR7

Una RTX 5060 ejecuta sin problemas modelos de 3 a 9 mil millones de parámetros en Q4. Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB y Qwen 3.5 9B 6,6 GB según la biblioteca Ollama: todos caben en los 8 GB de la tarjeta, el último con un contexto corto. Un modelo de 12B, como Gemma 4 12B (7,7 a 8 GB), ya ocupa toda la memoria antes del primer token de contexto. El punto fuerte de la tarjeta es su memoria: 448 GB/s con un bus de 128 bits, frente a los 272 GB/s de la RTX 4060, un 65 % más. Para chatear, resumir o usar un pequeño RAG, la 5060 funciona con mucha soltura. Para superar los 9B, se necesita más VRAM, no más velocidad.

Arquitectura
Blackwell, 3 840 núcleos CUDA y Tensor Cores de 5.ª generación según NVIDIA.
Memoria
8 GB de GDDR7 en un bus de 128 bits, 448 GB/s de ancho de banda
Potencia
145 W de potencia gráfica total; NVIDIA indica 550 W de alimentación mínima para el ordenador completo.
Precio de lanzamiento
299 dólares, lanzada el 19 de mayo de 2025 según Wikipedia.

#¿Por qué la 5060 es más rápida que la 4060 con la misma capacidad?

Durante la generación, cada token obliga a la GPU a volver a leer la mayor parte de los pesos del modelo. La velocidad máxima es, por tanto, el ancho de banda dividido por el tamaño de los pesos. La 5060 lee su memoria un 65 % más rápido que la 4060: con el mismo modelo, el límite teórico aumenta en la misma proporción. Este es el único argumento técnico que cuenta para el LLM. Los núcleos CUDA ayudan a procesar el prompt, no a generar texto, ya que la generación sigue limitada por la memoria.

Tarjetas de 8 GB: ancho de banda y límite para un modelo de 5,3 GB
TarjetaMemoriaAncho de bandaLímite con un modelo de 5,3 GB
RTX 40608 GB GDDR6272 GB/s51 tokens/s
RTX 50608 GB GDDR7448 GB/s85 tokens/s

#Qué modelos caben en 8 GB

Modelos en RTX 5060 (tamaños en Ollama, solo los pesos)
ModeloTamañoMargen disponible con 8 GBVeredicto
Qwen 3.5 4B3,4 GB4,6 GBCómodo, contexto largo posible
Granite 4.2 8B5,3 GB2,7 GBCon holgura, contexto moderado
Qwen 3.5 9B6,6 GB1,4 GBAjustado, contexto corto
Gemma 4 12B7,7 a 8,0 GB0 GB o menosNo cabe con un contexto útil

Gemma 4 12B ilustra la trampa de fijarse en el tamaño del archivo: sus pesos ocupan entre 7,7 y 8 GB, pero la tarjeta también debe alojar la caché de contexto y los datos necesarios para la salida de vídeo. El modelo se carga, pero con un contexto de unos pocos miles de tokens en el mejor de los casos, y parte del modelo pasa a la RAM en cuanto una aplicación utiliza algo de VRAM. Con 8 GB, Qwen 3.5 9B o Granite 4.2 8B son opciones más seguras y dejan un margen aprovechable.

#Imágenes, visión y cuantización: dos precisiones

La biblioteca Ollama indica que Qwen 3.5 acepta texto e imágenes: un modelo de 4B o de 9B puede, por tanto, describir una captura de pantalla o leer un esquema. Las imágenes consumen contexto, lo que reduce el margen con 8 GB; elige el 4B (3,4 GB) para la visión si quieres dejar espacio libre. En cuanto a la cuantización, Q4_K_M sigue siendo un buen equilibrio con 8 GB: pasar a una cuantización más fina aumenta el tamaño de los pesos en varios cientos de megabytes, un margen que la tarjeta no tiene, sin cambios visibles para un uso habitual.

#Instalar Ollama y verificar la tarjeta

  1. 01
    Controlador NVIDIA
    Ollama requiere un controlador NVIDIA de la versión 550 o posterior. Para una RTX 50, instala el controlador más reciente ofrecido por NVIDIA. Verifica con nvidia-smi.
  2. 02
    Instalar Ollama
    La RTX 5060 figura en la lista de tarjetas compatibles (capacidad de cálculo 12.0). CUDA está integrado: no es necesario instalarlo por separado.
  3. 03
    Primer modelo
    Inicia ollama run qwen3.5:9b (6,6 GB) o ollama run granite4.2:8b (5,3 GB) si prefieres mantener margen.
  4. 04
    Control
    Ejecuta ollama ps: la columna PROCESSOR debe mostrar 100 % GPU.

#Qué velocidad esperar: un límite superior, no una medición

Aquí no se presenta ninguna velocidad de generación como una medición propia. El límite máximo de generación es el ancho de banda dividido por el tamaño de los pesos. Una medición pública de terceros (LLaMA 3 8B en Q4_K_M con llama.cpp, mayo de 2024) registra 106 tokens/s en una RTX 4080 cuyo límite máximo es de 156 tokens/s, es decir, aproximadamente un 68 %. Tomando el 70 % como orden de magnitud, se obtienen las siguientes estimaciones para un contexto corto.

Límite teórico en RTX 5060 (448 GB/s)
Modelo (Q4)Tamaño del modeloLímite máximoEstimación al 70 %
Qwen 3.5 4B3,4 GB132 tokens/saproximadamente 92 tokens/s
Granite 4.2 8B5,3 GB85 tokens/saproximadamente 59 tokens/s
Qwen 3.5 9B6,6 GB68 tokens/saproximadamente 48 tokens/s
Gemma 4 12B7,7 GB58 tokens/saproximadamente 40 tokens/s, contexto muy limitado

Todos estos límites superan ampliamente el umbral de lectura cómoda, alrededor de 15 a 20 tokens/s. La velocidad no será, por tanto, lo que limite a la 5060: será la capacidad de 8 GB.

#Ajustar Ollama para no superar los 8 GB

Ollama cuantiza la caché K/V en q8_0 para utilizar aproximadamente la mitad de la memoria que con f16, el formato predeterminado, con una pérdida de precisión muy baja según su documentación; esto requiere Flash Attention. Con 8 GB, es la medida más rentable: permite ampliar el contexto sin cambiar de modelo.

Ajustes del servidor Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=8192
ollama serve
Un solo modelo
Carga solo un modelo a la vez; un modelo de embeddings para un RAG debe ser pequeño.
Aplicaciones que consumen muchos recursos
Los navegadores con aceleración por hardware, los juegos y la codificación de vídeo reservan VRAM: ciérralos antes de cargar.
Contexto adaptado
Cada vez que se duplica el contexto, se duplica la caché K/V: aumenta el contexto solo para la tarea que lo requiera.
Supervisión
nvidia-smi durante una generación larga muestra el margen real.

#Lo que se hace en la práctica con 8 GB

El criterio adecuado es la tarea solicitada, no el tamaño del modelo. Tanto un modelo 4B como uno 8B sirven para conversar o reformular un texto. Resumir documentos de unas decenas de páginas requiere un contexto de 8 000 a 16 000 tokens: con la caché K/V en q8_0, un 8B lo consigue con 8 GB. Un RAG combina un modelo de generación, un modelo de embeddings y el contexto de los fragmentos recuperados: mantén el modelo de generación por debajo de 9B. El asistente de código es el caso más exigente, porque los modelos especializados pronto superan la capacidad de la tarjeta gráfica.

Usos en RTX 5060 (8 GB)
Uso¿Realista?Ajuste recomendado
Chat diario, preguntas cortasSíGranite 4.2 8B, contexto predeterminado
Resumen de documentos de 10 a 30 páginasSí, con un contexto de 8.192 a 16.384 tokensCaché K/V en q8_0, Flash Attention
RAG sobre tus archivosSí, con un modelo de 4B a 8BEmbeddings ligeros, un solo modelo de generación
Asistente de código en un repositorioLimitadoModelo de 4B a 8B, extractos cortos
Modelos de 14 GB o másNoPrever 16 GB de VRAM

Si un modelo supera la capacidad de la memoria de la GPU, la generación no se detiene: parte de los pesos se lee desde la RAM del sistema. El síntoma es una caída brusca de la velocidad. El comando ollama ps muestra la distribución entre GPU y CPU; una línea que indica 100 % GPU es señal de un funcionamiento normal, mientras que una línea con un reparto entre GPU y CPU indica que se ha superado esa capacidad, lo que se corrige reduciendo el contexto o cambiando de modelo.

#Cuando la 5060 ya no es suficiente

Tres señales indican que se necesita más memoria. Quieres un modelo de 12B o más para una redacción de calidad. Tu contexto supera regularmente los 16 000 tokens debido a documentos largos. Cargas varios modelos al mismo tiempo: generación, embeddings y reranker. En estos casos, añadir velocidad no cambia nada: falta capacidad, y los siguientes niveles se describen en las páginas de 12 GB y 16 GB.

#5060 o 5060 Ti 16 GB: la elección que importa

La RTX 5060 Ti 16 GB utiliza la misma memoria GDDR7 con un bus de 128 bits y, por tanto, tiene el mismo ancho de banda de 448 GB/s según Wikipedia. Sus 4.608 núcleos CUDA y 16 GB de memoria son sus verdaderas diferencias. Por tanto, genera a la misma velocidad con un modelo que cabe en ambas tarjetas, pero también carga modelos de 14 GB que la 5060 no puede alojar. Los precios recomendados en el lanzamiento eran de 299 dólares para la 5060, 379 dólares para la 5060 Ti 8 GB y 429 dólares para la 5060 Ti 16 GB: por 130 dólares más, obtienes el doble de capacidad.

RTX 5060 y RTX 5060 Ti: qué cambia para el LLM
CriterioRTX 5060RTX 5060 Ti 16 GB
Memoria8 GB GDDR716 GB GDDR7
Ancho de banda448 GB/s448 GB/s
Núcleos CUDA3 8404 608
Potencia gráfica145 W180 W
Fuente de alimentación mínima550 W600 W
Modelos de 14 GB (gpt-oss 20B, Mistral Small 24B)NoSí, con 2 GB de margen

#Veredicto 2026

Compra una 5060 si
Tus modelos son de 4B a 9B, tu presupuesto es ajustado y quieres algo nuevo con garantía. Es la tarjeta de 8 GB más rápida.
Prefiere la 5060 Ti 16 GB si
Buscas modelos de 12B a 24B: la capacidad prima sobre la velocidad y el sobrecoste es modesto.
Evita la 5060 si
Tienes previsto utilizar Gemma 4 12B, gpt-oss 20B o cualquier modelo de más de 8 GB para un uso serio.

El resumen cabe en una frase: la 5060 es la tarjeta de 8 GB que se elige por su velocidad y su precio, no por su capacidad. Si tu uso cabe en 8 GB, es difícil de superar entre las tarjetas nuevas; si no cabe, ningún ajuste compensará los 8 GB que faltan, y la siguiente tarjeta de la gama es la inversión adecuada.

#Preguntas frecuentes

FAQ
¿Puede la RTX 5060 ejecutar un LLM localmente?+
Sí, hasta aproximadamente 9 mil millones de parámetros en Q4. Granite 4.2 8B (5,3 GB) y Qwen 3.5 9B (6,6 GB) caben en sus 8 GB de VRAM. Más allá, como Gemma 4 12B (7,7 a 8 GB), ya no queda espacio para el contexto y parte del modelo pasa a la RAM del sistema.
¿Cuántos tokens por segundo en una RTX 5060?+
Aquí no se publica ninguna medición fiable. El límite teórico, calculado dividiendo el ancho de banda de 448 GB/s por el tamaño del modelo, es de aproximadamente 85 tokens/s para Granite 4.2 8B (5,3 GB), es decir, cerca de 59 tokens/s al 70 % de ese límite. Es una estimación que disminuye cuando el contexto se alarga.
¿RTX 5060 o RTX 4060 Ti de 16 GB para un LLM?+
Para modelos que caben en 8 GB, la 5060 es más rápida: 448 GB/s frente a 288 GB/s. Para modelos de 14 GB, como gpt-oss 20B, solo la 4060 Ti de 16 GB es adecuada. La elección depende, por tanto, primero del tamaño objetivo y después del precio de segunda mano de la 4060 Ti.
¿Acelera el FP4 de la RTX 5060 Ollama?+
NVIDIA destaca el FP4 en los Tensor Cores de quinta generación. Los modelos comunes de Ollama, en Q4_K_M, no están en formato FP4: no se documenta ningún beneficio de este tipo aquí. El factor que acelera la generación es el ancho de banda de 448 GB/s.
¿Qué fuente de alimentación se necesita para una RTX 5060?+
NVIDIA indica 145 W de potencia gráfica total y una fuente de alimentación de al menos 550 W para el ordenador completo. Este valor incluye el margen para el procesador y los picos de consumo. Una fuente de alimentación de calidad de 550 W es adecuada; la 5060 Ti requiere 600 W.
¿Se puede hacer RAG con una RTX 5060?+
Sí, con un modelo de generación de 4B a 8B y un modelo de embeddings ligero. Mantén solo un modelo de generación cargado, activa el caché K/V en q8_0 y limita el contexto a lo que tus extractos requieran. Más allá, la capacidad de 8 GB se vuelve el factor limitante.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.