¿Qué LLM en una RTX 3060 Ti (8 GB)? ?
La RTX 3060 Ti (8 GB, 448 GB/s) ejecuta modelos de 7 a 9 mil millones de parámetros en Q4 sin exceder la memoria de la GPU, como Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB). Genera 92 tokens/s en la prueba de referencia de llama.cpp, más rápido que una RTX 3060 de 12 GB (75,6), pero sus 8 GB la excluyen de modelos de 12 mil millones de parámetros. Para la IA local, su velocidad no compensa los 4 GB que le faltan.
La RTX 3060 Ti (diciembre de 2020) es claramente más rápida en juegos que la RTX 3060, pero solo tiene 8 GB de memoria. Esta guía se basa en mediciones públicas recientes para explicar qué puede ejecutar, qué le aporta Flash Attention, en qué se diferencia de la 3060 de 12 GB y cuándo conviene pasar a otra opción.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 3060 Ti vs RTX 3060: el resumen para la IA local
La RTX 3060 Ti es más rápida que la 3060 12 GB para generar texto, pero tiene 4 GB menos, y para la IA local es la capacidad la que limita. La tabla colaborativa de llama.cpp da 92,2 tokens por segundo para la 3060 Ti, frente a 75,6 para la 3060 12 GB, en un modelo de 7 mil millones en Q4_0: aproximadamente un 22 % más. Esta ventaja se debe a su bus de 256 bits, que ofrece 448 GB/s de ancho de banda frente a 360 GB/s. En cambio, con 8 GB ejecuta modelos de 7 a 9 mil millones (Granite 4.2 8B a 4,6 GB, Qwen 3.5 9B a 6 GB), pero no Gemma 4 12B (7 GB de pesos), que no deja margen para el contexto. Si tu objetivo es un 8B, la Ti es la más rápida de las dos; si buscas un 12B, está fuera de juego.
- RTX 3060 Ti
- Chip GA104, diciembre de 2020, 4 864 núcleos CUDA, 8 GB de GDDR6, bus de 256 bits, 448 GB/s.
- RTX 3060
- Chip GA106, 3.584 núcleos, 12 GB de GDDR6 en un bus de 192 bits, 360 GB/s.
- Para un LLM
- Más ancho de banda da más velocidad; menos memoria da menos modelos. Ambos efectos se compensan, pero la capacidad pesa más.
#Modelos compatibles con 8 GB
| Modelo | Peso en Q4 | Peso en Q8 | Con 8 GB |
|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | 9 GB | Q4 cabe holgadamente; Q8 no cabe |
| Qwen 3.5 9B | 6 GB | 10 GB | Q4 con contexto moderado |
| Gemma 4 12B | 7 GB | 13 GB | No cabe en memoria con contexto |
La velocidad de generación de la tarjeta no será lo que te limite: será el espacio disponible. La prueba de llama.cpp detecta 7 838 MiB de memoria en la 3060 Ti, algo menos que los 8 192 MiB nominales, y esa memoria se reparte entre los pesos, la caché de contexto y la visualización si hay una pantalla conectada. Calcula un máximo de 6 GB para los pesos si quieres mantener un contexto de varios miles de tokens.
- ¿Qué LLM para 8 GB de VRAM? (todas las tarjetas)
- Calculadora de VRAM para un modelo y un contexto dados
#Instalación y ajustes
La tarjeta figura con una capacidad de cálculo de 8.6 en la lista de Ollama, que requiere un controlador de la versión 550 o posterior. En cuanto a la alimentación, la ficha de NVIDIA indica 200 W para la tarjeta y recomienda una fuente de alimentación de 600 W para el sistema, frente a 550 W para la 3060: una fuente de 500 W, a veces citada, está por debajo de esta recomendación.
- 01Instalar el controladorInstala un controlador NVIDIA 550 o más reciente y comprueba con nvidia-smi que la tarjeta se reconoce con aproximadamente 8 GB de memoria.
- 02Instalar OllamaSigue la guía de instalación y luego inicia un modelo de 8 mil millones de parámetros en Q4 con ollama run.
- 03Activar los ajustes de memoriaInicia el servidor con OLLAMA_FLASH_ATTENTION=1 y OLLAMA_KV_CACHE_TYPE=q8_0. La documentación especifica que la caché K/V se puede cuantizar cuando Flash Attention está activada.
- 04Monitorear la memoriaDurante una larga conversación, observa nvidia-smi: si la memoria se acerca a los 7 800 MiB, reduce el contexto.
#Velocidad: generación, lectura del prompt y Flash Attention
Una medición de septiembre de 2026 publicada en la tabla de llama.cpp permite detallar el comportamiento de la 3060 Ti, con un modelo de 7 mil millones de parámetros en Q4_0 de 3,56 GiB. El ancho de banda de 448 GB/s permitiría un máximo de unos 117 tokens por segundo; la medición alcanza 92 tokens, es decir, aproximadamente el 79 % del límite. El resultado más interesante se refiere a Flash Attention.
| Medición | Sin Flash Attention | Con Flash Attention | Diferencia |
|---|---|---|---|
| Generación (128 tokens) | 92,2 tok/s | 96,5 tok/s | +5 % |
| Lectura de un prompt de 4.096 tokens | 1 897 tok/s | 2 598 tok/s | +37 % |
La velocidad de generación mejora poco, pero la lectura de un prompt largo mejora en más de un tercio, algo relevante para el RAG y los resúmenes de documentos. A este ritmo, un prompt de 10.000 tokens se lee en unos cuatro segundos, un cálculo teórico que supone una tasa de procesamiento constante. Ollama activa Flash Attention automáticamente cuando la tarjeta lo permite; puedes forzar su activación con la variable OLLAMA_FLASH_ATTENTION=1.
Para un modelo más pesado que el archivo de prueba, la regla de tres da órdenes de magnitud: 92 × 3,82 ÷ 4,6, es decir, aproximadamente 76 tokens por segundo para Granite 4.2 8B en Q4, y aproximadamente 59 para Qwen 3.5 9B (6 GB). Son límites superiores teóricos, no mediciones. Si quieres comparar tu propia tarjeta con estos valores, la herramienta llama-bench de llama.cpp reproduce la prueba: el mismo archivo Llama 2 7B en Q4_0, todas las capas en la GPU, con y sin Flash Attention. Los resultados varían según el controlador, el sistema y el fabricante de la tarjeta, incluso con el mismo chip, por lo que una diferencia de unos pocos puntos porcentuales no tiene nada de anormal. Estas velocidades superan el ritmo de lectura: la tarjeta nunca es el factor limitante al conversar.
#Documentos y RAG: dónde se consume el tiempo
Cuando consultas tus documentos, la tarjeta dedica primero tiempo a leer el prompt y luego a generar la respuesta. En la 3060 Ti, un prompt de 4.096 tokens, es decir, unas diez páginas, se lee en aproximadamente 2,2 segundos sin Flash Attention y en 1,6 segundos con ella, según las velocidades medidas por llama.cpp. La respuesta de 400 tokens requiere después unos cuatro o cinco segundos a 92 tokens por segundo en el modelo de prueba, y más tiempo en un 8B actual. Se trata de cálculos teóricos que suponen velocidades constantes, pero muestran que el tiempo de espera sigue siendo de unos pocos segundos.
La limitación del RAG con 8 GB no es, por tanto, el tiempo, sino la memoria: un contexto de varias decenas de miles de tokens satura la caché de contexto de un modelo de 8 mil millones. Dos formas de mantenerse dentro del presupuesto de memoria: reducir el número de fragmentos incluidos en el prompt y cuantizar la caché K/V en q8_0, que utiliza aproximadamente la mitad de la memoria del formato predeterminado según la documentación de Ollama.
#Cuándo pasar a otra cosa
| Tu necesidad | Memoria para los pesos | Tarjeta adecuada |
|---|---|---|
| Un 8B en Q4 (Granite 4.2 8B) | 4,6 GB | 8 GB son suficientes |
| Un 9B en Q4 con contexto medio (Qwen 3.5 9B) | 6 GB | 8 GB, al límite de lo cómodo |
| Un 8B en Q8 (Granite 4.2 8B) | 9 GB | 12 GB |
| Un 12B en Q4 (Gemma 4 12B) | 7 GB más el contexto | 12 GB |
| Un 12B en Q8 (Gemma 4 12B) | 13 GB | 16 GB |
Lee esta tabla de arriba abajo: la 3060 Ti cubre las dos primeras filas, y las tres siguientes requieren más memoria. Si tus necesidades se sitúan en la mitad inferior, está justificado cambiar de tarjeta; de lo contrario, la 3060 Ti cumple su función. Un modelo de mayor calidad pero más grande a veces es preferible a una tarjeta más rápida: a 92 tokens por segundo, la velocidad no te limita.
#3060 Ti y 3060 12 GB: gemelas solo en apariencia
| Criterio | RTX 3060 Ti | RTX 3060 12 GB |
|---|---|---|
| Memoria | 8 GB | 12 GB |
| Bus / ancho de banda | 256 bits / 448 GB/s | 192 bits / 360 GB/s |
| Generación (7B Q4_0) | 92,2 tok/s | 75,6 tok/s |
| Gemma 4 12B en Q4 (7 GB) | No cabe en memoria con el contexto | Cabe con margen |
| Fuente de alimentación recomendada para el sistema | 600 W | 550 W |
El primer impulso es elegir la tarjeta más rápida. Sin embargo, con los modelos de 8 a 9 mil millones que ambas tarjetas pueden cargar, ese 22 % más de velocidad no cambia la experiencia: en ambos casos, el texto se muestra más rápido de lo que se lee. En cambio, la 3060 de 12 GB permite acceder a toda una categoría de modelos. Por eso es la mejor opción para la IA local, a menos que tu uso se limite definitivamente a los modelos de 8 a 9B. Una precaución al comprar: NVIDIA también ha comercializado una 3060 Ti con memoria GDDR6X, que se distingue por su ficha técnica; la capacidad sigue siendo de 8 GB.
#3060 Ti y RTX 4060 Ti 8 GB
La RTX 4060 Ti de 8 GB, más reciente, registra 63,9 tokens por segundo en la misma prueba, una cifra claramente inferior a la de la 3060 Ti. La razón es su bus de 128 bits, que limita su ancho de banda pese a tener una arquitectura más eficiente. Para la generación de texto, la 3060 Ti sigue siendo, por tanto, más rápida que esta tarjeta más reciente, a igualdad de capacidad. Sus ventajas están en otros aspectos: las funciones más recientes de su arquitectura y, según las fichas de los fabricantes, un consumo más moderado, útil en una caja compacta o en una máquina que permanece encendida para ofrecer un modelo como servicio. Sin embargo, no supone una mejora de velocidad en la generación de texto ni tampoco una mayor capacidad de memoria. Si dudas entre las dos, mira la variante de 16 GB de la 4060 Ti, que ofrece el doble de memoria.
#Veredicto 2026
- Consérvala si
- Funciona y usas modelos de entre 7 y 9 mil millones de parámetros: la velocidad es más que suficiente y no cabe esperar ninguna mejora al cambiarla por otra de la misma capacidad.
- No la compres para IA si puedes acceder a una tarjeta de 12 GB
- Una 3060 de 12 GB permite usar modelos de 12 mil millones de parámetros. La diferencia de precio de segunda mano varía cada semana: consulta el seguimiento del sitio.
- Pasa a 12 o 16 GB si
- Quieres un 12B, un contexto largo o RAG sobre documentos voluminosos.
#Preguntas frecuentes
¿RTX 3060 Ti o RTX 3060 12 GB para un LLM?+
¿Puede la RTX 3060 Ti ejecutar Gemma 4 12B?+
¿Cuántos tokens por segundo en una RTX 3060 Ti?+
¿La RTX 3060 Ti es mejor que la RTX 4060 para un LLM?+
¿Qué fuente de alimentación necesito para una RTX 3060 Ti?+
¿Valdría la pena usar Flash Attention en una RTX 3060 Ti?+
- Fuente: tabla de rendimiento de llama.cpp en CUDA
- Fuente: ficha NVIDIA de la RTX 3060 y 3060 Ti
- Fuente: tarjetas NVIDIA admitidas por Ollama
- Fuente: preguntas frecuentes de Ollama (Flash Attention, caché K/V)
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.