Principiante 11 minRTX 40

Qué LLM usar en una RTX 4060 (8 GB) ?

Respuesta directa

Una RTX 4060 (8 GB de GDDR6, 272 GB/s) ejecuta sin problemas modelos de 3 a 9 mil millones de parámetros en Q4: Qwen 3.5 4B (3,4 GB), Granite 4.2 8B (5,3 GB) o Qwen 3.5 9B (6,6 GB). Se saturará cuando un modelo y su contexto superen los 8 GB. Su ancho de banda impone un límite teórico de aproximadamente 50 tokens/s en un 8B en Q4. Más allá, son los 12 o 16 GB los que cambian el uso, no la velocidad del GPU.

La RTX 4060 es la tarjeta de gama de entrada de la generación Ada: 8 GB de VRAM, 115 W y un precio bajo de segunda mano. Es suficiente para descubrir los LLM locales, siempre que conozcas su límite exacto. Esta guía cuantifica lo que cabe en sus 8 GB, lo que permite su ancho de banda, cómo ajustar Ollama para no superar esa capacidad y cuándo conviene pasar a una tarjeta de 12 o 16 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#La RTX 4060 para un LLM local: lo que permite

En una RTX 4060, un LLM local funciona bien siempre que el modelo, su contexto y el sistema quepan en 8 GB de VRAM. En Q4, esto cubre modelos de 3 a 9 mil millones de parámetros: Qwen 3.5 4B pesa 3,4 GB, Granite 4.2 8B 5,3 GB y Qwen 3.5 9B 6,6 GB según la biblioteca Ollama. Un 12B como Gemma 4 12B (7,7 a 8 GB) ya ocupa toda la tarjeta antes incluso de contar el contexto. El ancho de banda de 272 GB/s determina la velocidad: fija un límite teórico de alrededor de 51 tokens/s en un modelo de 5,3 GB, y en la práctica se queda por debajo. Para un asistente de chat, hacer resúmenes o un pequeño RAG, es suficiente. Para trabajar con código en un repositorio grande o realizar razonamientos largos, se queda corto.

Arquitectura
Ada Lovelace, 3.072 núcleos CUDA, Tensor Cores de 4ª generación, capacidad de cálculo CUDA 8.9.
Memoria
8 GB de GDDR6 en un bus de 128 bits, es decir, 272 GB/s de ancho de banda (fuente: Wikipedia, tabla de GeForce serie 40).
Consumo
115 W de potencia gráfica total; NVIDIA indica una alimentación mínima de 550 W para el ordenador completo.
Interfaz
PCIe 4.0 limitado a 8 líneas: un modelo que se carga parcialmente en la RAM del sistema pasa por un enlace estrecho, lo que penaliza aún más el offload.
Disponibilidad
Lanzada en 2023, la tarjeta se encuentra principalmente de segunda mano; los precios se siguen en la página dedicada.
!
Por qué el ancho de banda importa más que los núcleos
Durante la generación, cada token obliga a la GPU a releer la mayor parte de los pesos del modelo. La velocidad depende, por tanto, de la relación entre el ancho de banda de memoria y el tamaño de los pesos, mucho más que del número de núcleos. En este aspecto, la 4060 es la más limitada de la gama Ada para el público general: 272 GB/s, frente a 672 GB/s para una 4070 Ti Super.

#Qué modelos caben en 8 GB

La referencia del sitio para Q4 es sencilla: unos 0,6 GB por cada mil millones de parámetros, contando solo los pesos. Hay que añadir la caché de contexto (KV cache) y un margen para la salida de vídeo y el sistema. Ollama utiliza por defecto un contexto de 4 096 tokens, que sigue siendo ligero; con 16 000 tokens, la caché pasa a ocupar una cantidad importante de memoria. La tabla siguiente recoge los tamaños publicados por Ollama e indica el margen restante en 8 GB, sin contar todavía el contexto.

Modelos habituales para 8 GB de VRAM (tamaños en Ollama, solo los pesos)
ModeloTamaño en OllamaMargen disponible con 8 GBVeredicto
Qwen 3.5 4B3,4 GB4,6 GBCómodo, contexto largo posible
Granite 4.2 8B5,3 GB2,7 GBFunciona con holgura hasta aproximadamente 16.000 tokens con la caché cuantizada
Qwen 3.5 9B6,6 GB1,4 GBAjustado: contexto corto, aplicaciones cerradas
Gemma 4 12B7,7 a 8,0 GB0 GB o menosNo cabe con un contexto útil
gpt-oss 20B14 GBNegativoNo cabe únicamente en la VRAM
Mistral Small 24B14 GBNegativoNo cabe únicamente en la VRAM

Hay dos errores frecuentes. El primero: el tamaño del archivo no equivale a la memoria necesaria; hay que sumar la memoria que requiere el contexto. El segundo: un modelo que no cabe por completo en la VRAM no falla, sino que se carga parcialmente en la RAM del sistema y se ralentiza mucho. El comando ollama ps muestra la distribución: una línea con el 100 % en GPU indica que todo está bien; una línea repartida entre CPU y GPU señala que parte del modelo se ha cargado en la RAM del sistema.

#Instalar Ollama y lanzar un primer modelo

  1. 01
    Verificar el controlador NVIDIA
    Ollama requiere un controlador NVIDIA 550 o más reciente para tarjetas con capacidad de cómputo 5.0 o superior. La RTX 4060 (capacidad 8.9) aparece explícitamente en la documentación de Ollama. Verifica la versión con nvidia-smi.
  2. 02
    Instalar Ollama
    Sigue la guía de instalación para tu sistema. CUDA está incluido, no es necesario instalar el toolkit por separado.
  3. 03
    Iniciar un modelo adecuado
    Empieza con ollama run granite4.2:8b (5,3 GB) o ollama run qwen3.5:9b (6,6 GB). Lanza luego ollama ps en un segundo terminal.
  4. 04
    Comprobar dónde se ejecuta el modelo
    La columna PROCESSOR debe mostrar 100 % GPU. De lo contrario, reduce el contexto o pasa a un modelo más pequeño.

#Qué velocidad esperar: el límite máximo, no una promesa

Aquí no hay mediciones propias y ninguna cifra de rendimiento se presenta como tal. En cambio, se puede calcular un límite teórico: el ancho de banda dividido por el tamaño de los pesos leídos en cada token. Un registro de un tercero publicado en GitHub (LLaMA 3 8B en Q4_K_M con llama.cpp, datos de mayo de 2024) indica que el rendimiento observado equivale al 68 % del límite teórico en una RTX 4080 y al 75 % en una RTX 4070 Ti. Un orden de magnitud razonable: el 70 % del límite teórico. Estos valores siguen siendo estimaciones, válidas para un contexto corto.

Límite teórico de generación en RTX 4060 (272 GB/s)
Modelo (Q4)Tamaño del modeloLímite teóricoEstimación al 70 %
Qwen 3.5 4B3,4 GB80 tokens/saproximadamente 56 tokens/s
Granite 4.2 8B5,3 GB51 tokens/saproximadamente 36 tokens/s
Qwen 3.5 9B6,6 GB41 tokens/saproximadamente 29 tokens/s

Estas estimaciones son coherentes con el uso de un asistente de chat: la lectura es cómoda a partir de 15 a 20 tokens/s. No tienen en cuenta el contexto, que ralentiza la generación a medida que crece, ni el tiempo de procesamiento de la solicitud, que afecta al cálculo y no a la memoria.

#Ajustar Ollama para no superar los 8 GB

Los ajustes que importan son los del contexto y de la caché. Ollama cuantiza la caché K/V en q8_0 para usar aproximadamente la mitad de la memoria que con f16, con una pérdida de precisión muy pequeña según su documentación; esto requiere Flash Attention. Con 8 GB, es la opción más rentable: permite ampliar el contexto sin cambiar de modelo.

Ajustes del servidor Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=8192
ollama serve
Contexto razonable
Aumenta el contexto a 8.192 o 16.384 tokens solo si el uso lo exige: cada duplicación del contexto duplica el caché K/V.
Solo un modelo cargado
En 8 GB, mantén un solo modelo en memoria; un modelo de embeddings para un RAG debe ser pequeño.
Liberar la VRAM
El escritorio, el navegador y los juegos reservan VRAM. Ciérralos antes de cargar y comprueba con nvidia-smi.
Cuantización
Mantén Q4_K_M: un modelo de 8B en Q8 (aproximadamente 8,5 GB) supera la capacidad de memoria de la tarjeta.

#Lo que la 4060 hace bien, hace mal o no hace en absoluto

El veredicto depende más del uso que de la tarjeta. Un chat corto o un resumen de unas pocas páginas se mantiene dentro de unos límites cómodos, tanto con un modelo de 4B como con uno de 8B. Un RAG requiere un modelo de generación, un modelo de embeddings y un contexto lo bastante largo para contener los fragmentos recuperados: con 8 GB, hay que elegir un modelo de generación de 4B a 8B y mantener pequeño el modelo de embeddings. El asistente de código es más exigente, ya que los modelos especializados y sus contextos de varios miles de tokens superan rápidamente la capacidad de la tarjeta.

Usos habituales en RTX 4060 (8 GB)
Uso¿Realista?Ajuste recomendado
Chat diario, preguntas cortasSíGranite 4.2 8B o Qwen 3.5 4B, contexto predeterminado
Resumen de documentos de 10 a 20 páginasSí, con un contexto de 8.192 a 16.384Caché K/V en q8_0, Flash Attention activada
RAG sobre tus archivosSí, modelo de 4B a 8BEmbeddings ligeros, un solo modelo de generación cargado
Asistente de código en un repositorioLimitadoModelo de 4B a 8B, fragmentos cortos, sin un repositorio entero
Modelo de 20B o más, incluido gpt-oss 20BNoPrever al menos 16 GB de VRAM

El caso de gpt-oss 20B ilustra el límite: Ollama indica 14 GB para este modelo, y su ficha especifica que la cuantización MXFP4 permite ejecutarlo a partir de 16 GB de memoria. Una tarjeta de 8 GB no entra en el rango previsto, independientemente de su velocidad.

#¿Cuándo pasar a otra tarjeta?

Tres señales indican que los 8 GB se convierten en un límite. Quieres un modelo de 12B o más, incluyendo Gemma 4 12B. Trabajas con documentos largos, donde el contexto supera 16 000 tokens. Usas un asistente de código que carga un modelo de 14 a 24 GB. En estos casos, añadir velocidad no resuelve nada: falta capacidad de memoria, y la página dedicada a 8 GB, 12 GB y 16 GB te ayuda a elegir el nivel adecuado.

#4060, 3060 12 GB, 5060: un buen equilibrio

Tarjetas de gama de entrada: capacidad y ancho de banda
TarjetaVRAMAncho de bandaLo que cambia
RTX 3060 12 GB12 GB360 GB/sMás VRAM: Gemma 4 12B cabe, pero con bus más antiguo
RTX 40608 GB272 GB/sConsumo bajo, límite 8B-9B
RTX 50608 GB448 GB/sMisma capacidad, límite de velocidad 65 % superior

La RTX 3060 de 12 GB ofrece 4 GB más de memoria y un ancho de banda superior (360 GB/s según Wikipedia). De segunda mano suele costar menos: consulta /prix-gpu-ia para conocer la situación del mercado. La RTX 5060 mantiene los 8 GB, pero lee la memoria un 65 % más rápido. Si lo que necesitas ejecutar cabe en 8 GB, la 5060 es la más rápida; si supera los 8 GB, la 3060 de 12 GB o la 4060 Ti de 16 GB permiten cargar modelos que la 4060 no puede cargar.

#Veredicto 2026

Mantén tu 4060 si
Usas modelos de 3B a 9B, un chat o un RAG ligero. Nada justifica reemplazarla mientras la memoria sea suficiente.
No compres una 4060 para el LLM
Si el uso principal son los LLM, una tarjeta de 12 GB o más resulta más útil, aunque para ello tengas que optar por una de segunda mano.
Pásate a 16 GB
Si buscas modelos de 14B a 24B, para los cuales 8 GB nunca serán suficientes.

#Preguntas frecuentes

FAQ
¿Puede la RTX 4060 ejecutar un LLM localmente?+
Sí, hasta aproximadamente 9 mil millones de parámetros en Q4. Granite 4.2 8B (5,3 GB) y Qwen 3.5 9B (6,6 GB) caben en VRAM, con un contexto corto para el segundo. Por encima de 8 GB, Ollama descarga parte del modelo en la RAM del sistema y la generación se ralentiza considerablemente, lo que hace que los modelos de 12B y más sean poco prácticos.
¿Cuántos tokens por segundo en una RTX 4060?+
Aquí no se publica ninguna medición fiable. El límite teórico, calculado dividiendo el ancho de banda entre el tamaño del modelo, es de aproximadamente 51 tokens/s para un modelo de 5,3 GB, es decir, cerca de 36 tokens/s al 70 % de ese límite. Es una estimación, no un resultado medido, y disminuye cuando el contexto se alarga.
¿RTX 4060 o RTX 3060 12 GB para un LLM?+
Para los LLM, la 3060 de 12 GB suele ser más interesante: 4 GB más de memoria y un ancho de banda de 360 GB/s frente a 272 GB/s. Puede cargar Gemma 4 12B, que no cabe en la 4060. La 4060 mantiene la ventaja en consumo, 115 W, y en juegos.
¿Qué fuente de alimentación se necesita para una RTX 4060?+
NVIDIA indica 115 W de potencia gráfica total y recomienda una fuente de alimentación de al menos 550 W para el PC completo. Esta cifra incluye un margen para el procesador y los picos de consumo. Una fuente de alimentación de calidad de esa potencia es suficiente, ya que el LLM exige menos a la tarjeta que algunos juegos.
¿Cómo saber si mi modelo cabe en la VRAM?+
Inicia el modelo y ejecuta ollama ps en un segundo terminal: la columna PROCESSOR muestra 100 % GPU si todo está en VRAM, o una distribución CPU/GPU si parte del modelo pasa a la RAM del sistema. Monitorea también nvidia-smi durante una generación larga. Si parte del modelo pasa a la RAM del sistema, reduce el contexto o elige un modelo más pequeño.
¿Se pueden aprovechar mejor los 8 GB sin cambiar de tarjeta?+
Tres medidas ayudan: activar Flash Attention y después la caché K/V en q8_0, que reduce esta caché aproximadamente a la mitad; limitar el contexto a lo que uses; cerrar las aplicaciones que ocupan VRAM. Estas medidas permiten ampliar el contexto, no cargar un modelo más grande.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.