Qué LLM usar en una RTX 4060 (8 GB) ?
Una RTX 4060 (8 GB de GDDR6, 272 GB/s) ejecuta sin problemas modelos de 3 a 9 mil millones de parámetros en Q4: Qwen 3.5 4B (3,4 GB), Granite 4.2 8B (5,3 GB) o Qwen 3.5 9B (6,6 GB). Se saturará cuando un modelo y su contexto superen los 8 GB. Su ancho de banda impone un límite teórico de aproximadamente 50 tokens/s en un 8B en Q4. Más allá, son los 12 o 16 GB los que cambian el uso, no la velocidad del GPU.
La RTX 4060 es la tarjeta de gama de entrada de la generación Ada: 8 GB de VRAM, 115 W y un precio bajo de segunda mano. Es suficiente para descubrir los LLM locales, siempre que conozcas su límite exacto. Esta guía cuantifica lo que cabe en sus 8 GB, lo que permite su ancho de banda, cómo ajustar Ollama para no superar esa capacidad y cuándo conviene pasar a una tarjeta de 12 o 16 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#La RTX 4060 para un LLM local: lo que permite
En una RTX 4060, un LLM local funciona bien siempre que el modelo, su contexto y el sistema quepan en 8 GB de VRAM. En Q4, esto cubre modelos de 3 a 9 mil millones de parámetros: Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB y Qwen 3.5 9B 6,6 GB según la biblioteca Ollama. Un 12B como Gemma 4 12B (7,7 a 8 GB) ya ocupa toda la tarjeta antes incluso de contar el contexto. El ancho de banda de 272 GB/s determina la velocidad: fija un límite teórico de alrededor de 51 tokens/s en un modelo de 5,3 GB, y en la práctica se queda por debajo. Para un asistente de chat, hacer resúmenes o un pequeño RAG, es suficiente. Para trabajar con código en un repositorio grande o realizar razonamientos largos, se queda corto.
- Arquitectura
- Ada Lovelace, 3.072 núcleos CUDA, Tensor Cores de 4ª generación, capacidad de cálculo CUDA 8.9.
- Memoria
- 8 GB de GDDR6 en un bus de 128 bits, es decir, 272 GB/s de ancho de banda (fuente: Wikipedia, tabla de GeForce serie 40).
- Consumo
- 115 W de potencia gráfica total; NVIDIA indica una alimentación mínima de 550 W para el ordenador completo.
- Interfaz
- PCIe 4.0 limitado a 8 líneas: un modelo que se carga parcialmente en la RAM del sistema pasa por un enlace estrecho, lo que penaliza aún más el offload.
- Disponibilidad
- Lanzada en 2023, la tarjeta se encuentra principalmente de segunda mano; los precios se siguen en la página dedicada.
#Qué modelos caben en 8 GB
La referencia del sitio para Q4 es sencilla: unos 0,6 GB por cada mil millones de parámetros, contando solo los pesos. Hay que añadir la caché de contexto (KV cache) y un margen para la salida de vídeo y el sistema. Ollama utiliza por defecto un contexto de 4 096 tokens, que sigue siendo ligero; con 16 000 tokens, la caché pasa a ocupar una cantidad importante de memoria. La tabla siguiente recoge los tamaños publicados por Ollama e indica el margen restante en 8 GB, sin contar todavía el contexto.
| Modelo | Tamaño en Ollama | Margen disponible con 8 GB | Veredicto |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Cómodo, contexto largo posible |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Funciona con holgura hasta aproximadamente 16.000 tokens con la caché cuantizada |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Ajustado: contexto corto, aplicaciones cerradas |
| Gemma 4 12B | 7,7 a 8,0 GB | 0 GB o menos | No cabe con un contexto útil |
| gpt-oss 20B | 14 GB | Negativo | No cabe únicamente en la VRAM |
| Mistral Small 24B | 14 GB | Negativo | No cabe únicamente en la VRAM |
Hay dos errores frecuentes. El primero: el tamaño del archivo no equivale a la memoria necesaria; hay que sumar la memoria que requiere el contexto. El segundo: un modelo que no cabe por completo en la VRAM no falla, sino que se carga parcialmente en la RAM del sistema y se ralentiza mucho. El comando ollama ps muestra la distribución: una línea con el 100 % en GPU indica que todo está bien; una línea repartida entre CPU y GPU señala que parte del modelo se ha cargado en la RAM del sistema.
#Instalar Ollama y lanzar un primer modelo
- 01Verificar el controlador NVIDIAOllama requiere un controlador NVIDIA 550 o más reciente para tarjetas con capacidad de cómputo 5.0 o superior. La RTX 4060 (capacidad 8.9) aparece explícitamente en la documentación de Ollama. Verifica la versión con nvidia-smi.
- 02Instalar OllamaSigue la guía de instalación para tu sistema. CUDA está incluido, no es necesario instalar el toolkit por separado.
- 03Iniciar un modelo adecuadoEmpieza con ollama run granite4.2:8b (5,3 GB) o ollama run qwen3.5:9b (6,6 GB). Lanza luego ollama ps en un segundo terminal.
- 04Comprobar dónde se ejecuta el modeloLa columna PROCESSOR debe mostrar 100 % GPU. De lo contrario, reduce el contexto o pasa a un modelo más pequeño.
#Qué velocidad esperar: el límite máximo, no una promesa
Aquí no hay mediciones propias y ninguna cifra de rendimiento se presenta como tal. En cambio, se puede calcular un límite teórico: el ancho de banda dividido por el tamaño de los pesos leídos en cada token. Un registro de un tercero publicado en GitHub (LLaMA 3 8B en Q4_K_M con llama.cpp, datos de mayo de 2024) indica que el rendimiento observado equivale al 68 % del límite teórico en una RTX 4080 y al 75 % en una RTX 4070 Ti. Un orden de magnitud razonable: el 70 % del límite teórico. Estos valores siguen siendo estimaciones, válidas para un contexto corto.
| Modelo (Q4) | Tamaño del modelo | Límite teórico | Estimación al 70 % |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 80 tokens/s | aproximadamente 56 tokens/s |
| Granite 4.2 8B | 5,3 GB | 51 tokens/s | aproximadamente 36 tokens/s |
| Qwen 3.5 9B | 6,6 GB | 41 tokens/s | aproximadamente 29 tokens/s |
Estas estimaciones son coherentes con el uso de un asistente de chat: la lectura es cómoda a partir de 15 a 20 tokens/s. No tienen en cuenta el contexto, que ralentiza la generación a medida que crece, ni el tiempo de procesamiento de la solicitud, que afecta al cálculo y no a la memoria.
#Ajustar Ollama para no superar los 8 GB
Los ajustes que importan son los del contexto y de la caché. Ollama cuantiza la caché K/V en q8_0 para usar aproximadamente la mitad de la memoria que con f16, con una pérdida de precisión muy pequeña según su documentación; esto requiere Flash Attention. Con 8 GB, es la opción más rentable: permite ampliar el contexto sin cambiar de modelo.
- Contexto razonable
- Aumenta el contexto a 8.192 o 16.384 tokens solo si el uso lo exige: cada duplicación del contexto duplica el caché K/V.
- Solo un modelo cargado
- En 8 GB, mantén un solo modelo en memoria; un modelo de embeddings para un RAG debe ser pequeño.
- Liberar la VRAM
- El escritorio, el navegador y los juegos reservan VRAM. Ciérralos antes de cargar y comprueba con nvidia-smi.
- Cuantización
- Mantén Q4_K_M: un modelo de 8B en Q8 (aproximadamente 8,5 GB) supera la capacidad de memoria de la tarjeta.
#Lo que la 4060 hace bien, hace mal o no hace en absoluto
El veredicto depende más del uso que de la tarjeta. Un chat corto o un resumen de unas pocas páginas se mantiene dentro de unos límites cómodos, tanto con un modelo de 4B como con uno de 8B. Un RAG requiere un modelo de generación, un modelo de embeddings y un contexto lo bastante largo para contener los fragmentos recuperados: con 8 GB, hay que elegir un modelo de generación de 4B a 8B y mantener pequeño el modelo de embeddings. El asistente de código es más exigente, ya que los modelos especializados y sus contextos de varios miles de tokens superan rápidamente la capacidad de la tarjeta.
| Uso | ¿Realista? | Ajuste recomendado |
|---|---|---|
| Chat diario, preguntas cortas | Sí | Granite 4.2 8B o Qwen 3.5 4B, contexto predeterminado |
| Resumen de documentos de 10 a 20 páginas | Sí, con un contexto de 8.192 a 16.384 | Caché K/V en q8_0, Flash Attention activada |
| RAG sobre tus archivos | Sí, modelo de 4B a 8B | Embeddings ligeros, un solo modelo de generación cargado |
| Asistente de código en un repositorio | Limitado | Modelo de 4B a 8B, fragmentos cortos, sin un repositorio entero |
| Modelo de 20B o más, incluido gpt-oss 20B | No | Prever al menos 16 GB de VRAM |
El caso de gpt-oss 20B ilustra el límite: Ollama indica 14 GB para este modelo, y su ficha especifica que la cuantización MXFP4 permite ejecutarlo a partir de 16 GB de memoria. Una tarjeta de 8 GB no entra en el rango previsto, independientemente de su velocidad.
#¿Cuándo pasar a otra tarjeta?
Tres señales indican que los 8 GB se convierten en un límite. Quieres un modelo de 12B o más, incluyendo Gemma 4 12B. Trabajas con documentos largos, donde el contexto supera 16 000 tokens. Usas un asistente de código que carga un modelo de 14 a 24 GB. En estos casos, añadir velocidad no resuelve nada: falta capacidad de memoria, y la página dedicada a 8 GB, 12 GB y 16 GB te ayuda a elegir el nivel adecuado.
#4060, 3060 12 GB, 5060: un buen equilibrio
| Tarjeta | VRAM | Ancho de banda | Lo que cambia |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 360 GB/s | Más VRAM: Gemma 4 12B cabe, pero con bus más antiguo |
| RTX 4060 | 8 GB | 272 GB/s | Consumo bajo, límite 8B-9B |
| RTX 5060 | 8 GB | 448 GB/s | Misma capacidad, límite de velocidad 65 % superior |
La RTX 3060 de 12 GB ofrece 4 GB más de memoria y un ancho de banda superior (360 GB/s según Wikipedia). De segunda mano suele costar menos: consulta /prix-gpu-ia para conocer la situación del mercado. La RTX 5060 mantiene los 8 GB, pero lee la memoria un 65 % más rápido. Si lo que necesitas ejecutar cabe en 8 GB, la 5060 es la más rápida; si supera los 8 GB, la 3060 de 12 GB o la 4060 Ti de 16 GB permiten cargar modelos que la 4060 no puede cargar.
- ¿Qué LLM usar en una RTX 3060 de 12 GB?
- ¿Qué LLM usar en una RTX 5060?
- Precios de las tarjetas gráficas para IA local
#Veredicto 2026
- Mantén tu 4060 si
- Usas modelos de 3B a 9B, un chat o un RAG ligero. Nada justifica reemplazarla mientras la memoria sea suficiente.
- No compres una 4060 para el LLM
- Si el uso principal son los LLM, una tarjeta de 12 GB o más resulta más útil, aunque para ello tengas que optar por una de segunda mano.
- Pásate a 16 GB
- Si buscas modelos de 14B a 24B, para los cuales 8 GB nunca serán suficientes.
- Fuente: características oficiales de NVIDIA (RTX 4060 y 4060 Ti)
- Fuente: preguntas frecuentes oficiales de Ollama (contexto, Flash Attention, caché K/V)
- Fuente: tamaños de los modelos Qwen 3.5 en la biblioteca Ollama
#Preguntas frecuentes
¿Puede la RTX 4060 ejecutar un LLM localmente?+
¿Cuántos tokens por segundo en una RTX 4060?+
¿RTX 4060 o RTX 3060 12 GB para un LLM?+
¿Qué fuente de alimentación se necesita para una RTX 4060?+
¿Cómo saber si mi modelo cabe en la VRAM?+
¿Se pueden aprovechar mejor los 8 GB sin cambiar de tarjeta?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.