¿Qué LLM en RTX 3060 8 GB? ?
La RTX 3060 8 GB ejecuta modelos de 7 a 9 mil millones en Q4, como Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB), pero no los de 12B. Su particularidad: un bus de 128 bits y 240 GB/s, contra 192 bits y 360 GB/s para la 3060 12 GB, lo que la hace claramente más lenta en generación. La tabla pública de llama.cpp da 75,6 tokens/s para la 12 GB en un 7B.
Bajo el nombre RTX 3060, NVIDIA vendió dos tarjetas: la original de 12 GB y una versión de 8 GB que llegó a finales de 2022, con un bus de memoria más estrecho. Esta guía explica qué implica esto para la IA local, qué modelos caben en la versión de 8 GB, cómo evitar confundir las dos versiones al comprar y qué velocidad puedes esperar, distinguiendo lo que se ha medido de lo que no.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#RTX 3060 8 GB: qué cambia respecto a la de 12 GB
La RTX 3060 de 8 GB ejecuta modelos de 7 a 9 mil millones de parámetros en Q4: Granite 4.2 8B requiere 4,6 GB y Qwen 3.5 9B, 6 GB según el catálogo QuelLLM. Gemma 4 12B (7 GB en Q4) no cabe con suficiente margen. Las diferencias respecto a la 3060 de 12 GB son dos: 4 GB menos y un bus de 128 bits en lugar de 192. Según la prensa especializada que recogió sus especificaciones en el momento del lanzamiento, el bus más estrecho reduce el ancho de banda a 240 GB/s, un 33 % menos que los 360 GB/s de la versión de 12 GB. Para la IA local, esto importa: la generación de texto depende principalmente del ancho de banda de la memoria. No existe ninguna medición pública para la versión de 8 GB, pero se puede estimar que genera unos 50 tokens por segundo con un modelo de 7 mil millones de parámetros en Q4_0, frente a los 75,6 medidos en la versión de 12 GB.
- Chip
- La misma GA106 que la 3060 de 12 GB y la misma potencia de tarjeta de 170 W.
- Memoria
- 8 GB de GDDR6 en un bus de 128 bits, es decir, 240 GB/s, contra 12 GB, 192 bits y 360 GB/s.
- Consecuencia
- El mismo número de núcleos de cálculo, pero con menor capacidad y ancho de banda: es la memoria, no el cálculo, lo que limita la IA local.
#Modelos compatibles con 8 GB
| Modelo | Peso en Q4 | Peso en Q8 | Con 8 GB |
|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | 4,3 GB | Q8 posible, contexto cómodo |
| Granite 4.2 8B | 4,6 GB | 9 GB | Q4 cabe con margen; Q8 no cabe |
| Qwen 3.5 9B | 6 GB | 10 GB | Q4 con un contexto moderado |
| Gemma 4 12B | 7 GB | 13 GB | No cabe en memoria con contexto |
La capacidad es idéntica a la de una 3070 o una 3060 Ti, dos tarjetas de 8 GB más rápidas. Se aplican las mismas reglas: limitar los pesos a un máximo de 6 GB, reservar un gigabyte para el controlador y el contexto, y comprobar que el modelo esté íntegramente en la tarjeta. Para ello, el comando ollama ps muestra 100% GPU cuando todo está cargado en la tarjeta. Si aparece un porcentaje de CPU, parte del modelo queda fuera de la memoria de la tarjeta y la velocidad cae en picado.
#Velocidad: por qué el bus de memoria domina
La tabla colaborativa de llama.cpp (Llama 2 7B en Q4_0, archivo de 3,56 GiB) no incluye la 3060 de 8 GB, pero permite entender qué diferencia supone el bus de memoria. Indica 75,6 tokens por segundo para la 3060 de 12 GB (bus de 192 bits), 92,2 para la 3060 Ti de 8 GB (256 bits) y 63,9 para una RTX 4060 Ti de 8 GB cuyo bus es de solo 128 bits. A igual capacidad, el orden sigue la anchura del bus, con algunos matices: una tarjeta más reciente con un bus estrecho puede quedar por detrás de una más antigua con un bus ancho.
| Tarjeta | Memoria | Bus | Generación (tok/s) | Estado |
|---|---|---|---|---|
| RTX 3060 Ti | 8 GB | 256 bits | 92,2 | Medición publicada |
| RTX 3060 12 GB | 12 GB | 192 bits | 75,6 | Medición publicada |
| RTX 4060 Ti 8 GB | 8 GB | 128 bits | 63,9 | Medición publicada |
| RTX 3060 8 GB | 8 GB | 128 bits | alrededor de 47 a 50 | Estimación, no medida |
La estimación de la última línea aplica a 240 GB/s la eficiencia medida de la versión de 12 GB, que alcanza aproximadamente el 80 % de lo que permite su ancho de banda. Es una proyección y debe presentarse como tal. Aplicando una regla de tres al tamaño de los archivos, se obtienen aproximadamente 40 tokens por segundo para Granite 4.2 8B (4,6 GB) y unos treinta para Qwen 3.5 9B (6 GB), que son límites superiores teóricos. Esta velocidad permite seguir leyendo cómodamente durante una conversación, pero sitúa a la versión de 8 GB aproximadamente un tercio por debajo de la de 12 GB y más de un 40 % por debajo de la 3060 Ti.
#Trampas que evitar
- Dos tarjetas bajo un mismo nombre
- NVIDIA lista la RTX 3060 con 12 GB o 8 GB, y un bus de 192 o 128 bits. El nombre solo no dice nada: exige la capacidad en el anuncio.
- Verificación durante la instalación
- Ejecuta nvidia-smi: la de 12 GB muestra aproximadamente 12 287 MiB según los registros de llama.cpp, la de 8 GB alrededor de 7 800 MiB como su vecina la 3060 Ti.
- Precio alineado con la versión de 12 GB
- Algunos vendedores muestran el mismo precio para las dos versiones. Compara los precios usando el seguimiento semanal del sitio en lugar de basarte en un precio fijo.
- Expectativas poco realistas sobre los modelos de 12B
- Gemma 4 12B y los modelos de este tamaño no caben con contexto; el límite es de 9B en Q4.
La segunda comprobación también se aplica a un PC reutilizado: la descripción del fabricante o el nombre de la tarjeta en Windows no siempre permiten distinguir las versiones, mientras que la memoria total que muestra nvidia-smi no engaña.
#El cálculo detrás de la estimación
El principio es simple: para producir un token, la tarjeta vuelve a leer la mayor parte de los pesos del modelo. El número máximo de tokens por segundo es, por tanto, del orden del ancho de banda dividido por el tamaño del archivo. El archivo de prueba pesa 3,56 GiB, es decir, aproximadamente 3,82 GB. Para la 3060 de 12 GB, 360 GB/s divididos por 3,82 dan un límite de 94 tokens por segundo, y la medición publicada alcanza el 80 % de ese límite. Para la de 8 GB, 240 GB/s dan un límite de aproximadamente 63 tokens por segundo; aplicando el mismo rendimiento, se obtienen unos cincuenta.
| Tarjeta | Ancho de banda | Límite (GB/s ÷ 3,82 GB) | Resultado |
|---|---|---|---|
| RTX 3060 12 GB | 360 GB/s | aproximadamente 94 tok/s | 75,6 tok/s medidos (aproximadamente 80 %) |
| RTX 3060 8 GB | 240 GB/s | aproximadamente 63 tok/s | aproximadamente 50 tok/s estimados |
Este método tiene una limitación: el rendimiento varía de una tarjeta a otra, como muestran otras tarjetas de la misma tabla cuya relación entre el valor medido y el límite máximo va del 67 % al 85 %. Quédate, por tanto, con un intervalo y no con una cifra precisa. Ten en cuenta también que los resultados publicados dependen del controlador, del sistema y del fabricante de la tarjeta, incluso con el mismo chip, y realiza mediciones en tu propio equipo si la velocidad condiciona una compra.
#Qué resultados da en la práctica
Convierte la velocidad de generación en tiempo de espera. A unos 40 tokens por segundo, una respuesta de 500 tokens, es decir, una página de explicación, tarda una docena de segundos; en una 3060 de 12 GB, la misma respuesta requeriría unos ocho segundos, también como estimación teórica. Para una conversación, la diferencia es soportable: el texto se muestra más rápido de lo que lo lees. Se vuelve molesta en dos casos: los agentes que encadenan numerosas llamadas al modelo y el procesamiento por lotes de numerosos documentos, donde la diferencia se acumula.
La capacidad de 8 GB impone una limitación más estricta que la velocidad. Exige elegir entre un contexto largo y un modelo más grande, mientras que una tarjeta de 12 GB permite tener ambos. Si tu uso se limita a hacer preguntas cortas con un modelo de 8B, la de 8 GB es suficiente. Si quieres conectar el modelo a tus documentos, es mejor buscar más memoria.
- 01Comprobar el anuncioBusca la indicación 8 GB o 12 GB en el título, la descripción o las fotos de la caja. Si no se especifica, pídele esa información al vendedor.
- 02Pedir una capturaExige una captura de nvidia-smi o de la herramienta GPU-Z que muestre la memoria total y el ancho del bus.
- 03Probar al recogerlaEn el lugar de recogida, ejecuta nvidia-smi: alrededor de 12 287 MiB para la de 12 GB y de 7 800 MiB para la de 8 GB.
- 04Ejecutar un modeloCarga un modelo de 8B en Q4 con Ollama y comprueba con ollama ps que esté al 100 % en la GPU antes de cerrar la compra.
#Contexto: aprovechar 8 GB
Con 8 GB, la caché de contexto es la verdadera limitación. La documentación de Ollama indica que la caché K/V se puede cuantizar cuando Flash Attention está activada: establece OLLAMA_FLASH_ATTENTION=1 y después OLLAMA_KV_CACHE_TYPE=q8_0 antes de iniciar el servidor. Con un bus de 128 bits, la tarjeta ya tiene dificultades para ofrecer una buena velocidad; por tanto, es preferible no añadirle un contexto desmesurado. Un contexto de unos pocos miles de tokens con un 8B en Q4 es un buen equilibrio.
#¿Qué elegir en su lugar?
| Tarjeta | Memoria | Generación (tok/s) | Lo que aporta |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 (medición) | Permite ejecutar modelos de 12B y es más rápida que la versión de 8 GB |
| RTX 3060 Ti | 8 GB | 92,2 (medición) | Misma capacidad, pero mucho más rápida |
| RTX 4060 Ti 8 GB | 8 GB | 63,9 (medición) | Más reciente, pero con bus de 128 bits como la 3060 8 GB |
La elección depende de tus necesidades: para capacidad, la 3060 de 12 GB; para velocidad con modelos de 8 mil millones, la 3060 Ti. Los precios de segunda mano cambian cada semana: el seguimiento del sitio registra el precio más bajo de las tarjetas para IA local.
- Precios de las tarjetas gráficas para IA local (seguimiento semanal)
- ¿Qué LLM para RTX 3060 12 GB?
- ¿Qué LLM usar con una RTX 3060 Ti (8 GB)?
#Veredicto 2026
- Consérvala si
- Ya está en tu PC y buscas un 8 o 9B en Q4 para chat o ayuda al código, sin exigencia de velocidad.
- No compres para la IA
- Una 3060 de 12 GB aporta más por un precio que suele ser similar. Compra la de 8 GB solo si cuesta bastante menos.
- Revisa siempre la versión
- Exige que se indique la memoria en el anuncio y compruébala con nvidia-smi cuando recibas la tarjeta.
#Preguntas frecuentes
¿Cómo diferenciar la RTX 3060 de 8 GB de la de 12 GB?+
¿Cuántos tokens por segundo en una RTX 3060 de 8 GB?+
¿RTX 3060 8 GB o RTX 4060 8 GB para un LLM?+
¿Puede la RTX 3060 8 GB ejecutar Gemma 4 12B?+
¿Ollama funciona en una RTX 3060 de 8 GB?+
¿Es mejor una RTX 3060 de 12 GB?+
- Fuente: tabla de rendimiento de llama.cpp en CUDA
- Fuente: ficha NVIDIA de la RTX 3060
- Fuente: Tom's Hardware, RTX 3060 8 GB
- Fuente: Preguntas frecuentes de Ollama (ollama ps, caché K/V)
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.