Principiante 11 minRTX 30

¿Qué LLM en una RTX 3060 Ti (8 GB)? ?

Respuesta directa

La RTX 3060 Ti (8 GB, 448 GB/s) ejecuta modelos de 7 a 9 mil millones de parámetros en Q4 sin exceder la memoria de la GPU, como Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB). Genera 92 tokens/s en la prueba de referencia de llama.cpp, más rápido que una RTX 3060 de 12 GB (75,6), pero sus 8 GB la excluyen de modelos de 12 mil millones de parámetros. Para la IA local, su velocidad no compensa los 4 GB que le faltan.

La RTX 3060 Ti (diciembre de 2020) es claramente más rápida en juegos que la RTX 3060, pero solo tiene 8 GB de memoria. Esta guía se basa en mediciones públicas recientes para explicar qué puede ejecutar, qué le aporta Flash Attention, en qué se diferencia de la 3060 de 12 GB y cuándo conviene pasar a otra opción.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 3060 Ti vs RTX 3060: el resumen para la IA local

La RTX 3060 Ti es más rápida que la 3060 12 GB para generar texto, pero tiene 4 GB menos, y para la IA local es la capacidad la que limita. La tabla colaborativa de llama.cpp da 92,2 tokens por segundo para la 3060 Ti, frente a 75,6 para la 3060 12 GB, en un modelo de 7 mil millones en Q4_0: aproximadamente un 22 % más. Esta ventaja se debe a su bus de 256 bits, que ofrece 448 GB/s de ancho de banda frente a 360 GB/s. En cambio, con 8 GB ejecuta modelos de 7 a 9 mil millones (Granite 4.2 8B a 4,6 GB, Qwen 3.5 9B a 6 GB), pero no Gemma 4 12B (7 GB de pesos), que no deja margen para el contexto. Si tu objetivo es un 8B, la Ti es la más rápida de las dos; si buscas un 12B, está fuera de juego.

RTX 3060 Ti
Chip GA104, diciembre de 2020, 4 864 núcleos CUDA, 8 GB de GDDR6, bus de 256 bits, 448 GB/s.
RTX 3060
Chip GA106, 3.584 núcleos, 12 GB de GDDR6 en un bus de 192 bits, 360 GB/s.
Para un LLM
Más ancho de banda da más velocidad; menos memoria da menos modelos. Ambos efectos se compensan, pero la capacidad pesa más.

#Modelos compatibles con 8 GB

Modelos para una RTX 3060 Ti (peso según el catálogo QuelLLM)
ModeloPeso en Q4Peso en Q8Con 8 GB
Granite 4.2 8B4,6 GB9 GBQ4 cabe holgadamente; Q8 no cabe
Qwen 3.5 9B6 GB10 GBQ4 con contexto moderado
Gemma 4 12B7 GB13 GBNo cabe en memoria con contexto

La velocidad de generación de la tarjeta no será lo que te limite: será el espacio disponible. La prueba de llama.cpp detecta 7 838 MiB de memoria en la 3060 Ti, algo menos que los 8 192 MiB nominales, y esa memoria se reparte entre los pesos, la caché de contexto y la visualización si hay una pantalla conectada. Calcula un máximo de 6 GB para los pesos si quieres mantener un contexto de varios miles de tokens.

#Instalación y ajustes

La tarjeta figura con una capacidad de cálculo de 8.6 en la lista de Ollama, que requiere un controlador de la versión 550 o posterior. En cuanto a la alimentación, la ficha de NVIDIA indica 200 W para la tarjeta y recomienda una fuente de alimentación de 600 W para el sistema, frente a 550 W para la 3060: una fuente de 500 W, a veces citada, está por debajo de esta recomendación.

  1. 01
    Instalar el controlador
    Instala un controlador NVIDIA 550 o más reciente y comprueba con nvidia-smi que la tarjeta se reconoce con aproximadamente 8 GB de memoria.
  2. 02
    Instalar Ollama
    Sigue la guía de instalación y luego inicia un modelo de 8 mil millones de parámetros en Q4 con ollama run.
  3. 03
    Activar los ajustes de memoria
    Inicia el servidor con OLLAMA_FLASH_ATTENTION=1 y OLLAMA_KV_CACHE_TYPE=q8_0. La documentación especifica que la caché K/V se puede cuantizar cuando Flash Attention está activada.
  4. 04
    Monitorear la memoria
    Durante una larga conversación, observa nvidia-smi: si la memoria se acerca a los 7 800 MiB, reduce el contexto.
Linux: iniciar Ollama con los ajustes de memoria
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#Velocidad: generación, lectura del prompt y Flash Attention

Una medición de septiembre de 2026 publicada en la tabla de llama.cpp permite detallar el comportamiento de la 3060 Ti, con un modelo de 7 mil millones de parámetros en Q4_0 de 3,56 GiB. El ancho de banda de 448 GB/s permitiría un máximo de unos 117 tokens por segundo; la medición alcanza 92 tokens, es decir, aproximadamente el 79 % del límite. El resultado más interesante se refiere a Flash Attention.

RTX 3060 Ti, Llama 2 7B Q4_0, efecto de Flash Attention
MediciónSin Flash AttentionCon Flash AttentionDiferencia
Generación (128 tokens)92,2 tok/s96,5 tok/s+5 %
Lectura de un prompt de 4.096 tokens1 897 tok/s2 598 tok/s+37 %

La velocidad de generación mejora poco, pero la lectura de un prompt largo mejora en más de un tercio, algo relevante para el RAG y los resúmenes de documentos. A este ritmo, un prompt de 10.000 tokens se lee en unos cuatro segundos, un cálculo teórico que supone una tasa de procesamiento constante. Ollama activa Flash Attention automáticamente cuando la tarjeta lo permite; puedes forzar su activación con la variable OLLAMA_FLASH_ATTENTION=1.

Para un modelo más pesado que el archivo de prueba, la regla de tres da órdenes de magnitud: 92 × 3,82 ÷ 4,6, es decir, aproximadamente 76 tokens por segundo para Granite 4.2 8B en Q4, y aproximadamente 59 para Qwen 3.5 9B (6 GB). Son límites superiores teóricos, no mediciones. Si quieres comparar tu propia tarjeta con estos valores, la herramienta llama-bench de llama.cpp reproduce la prueba: el mismo archivo Llama 2 7B en Q4_0, todas las capas en la GPU, con y sin Flash Attention. Los resultados varían según el controlador, el sistema y el fabricante de la tarjeta, incluso con el mismo chip, por lo que una diferencia de unos pocos puntos porcentuales no tiene nada de anormal. Estas velocidades superan el ritmo de lectura: la tarjeta nunca es el factor limitante al conversar.

#Documentos y RAG: dónde se consume el tiempo

Cuando consultas tus documentos, la tarjeta dedica primero tiempo a leer el prompt y luego a generar la respuesta. En la 3060 Ti, un prompt de 4.096 tokens, es decir, unas diez páginas, se lee en aproximadamente 2,2 segundos sin Flash Attention y en 1,6 segundos con ella, según las velocidades medidas por llama.cpp. La respuesta de 400 tokens requiere después unos cuatro o cinco segundos a 92 tokens por segundo en el modelo de prueba, y más tiempo en un 8B actual. Se trata de cálculos teóricos que suponen velocidades constantes, pero muestran que el tiempo de espera sigue siendo de unos pocos segundos.

La limitación del RAG con 8 GB no es, por tanto, el tiempo, sino la memoria: un contexto de varias decenas de miles de tokens satura la caché de contexto de un modelo de 8 mil millones. Dos formas de mantenerse dentro del presupuesto de memoria: reducir el número de fragmentos incluidos en el prompt y cuantizar la caché K/V en q8_0, que utiliza aproximadamente la mitad de la memoria del formato predeterminado según la documentación de Ollama.

#Cuándo pasar a otra cosa

Lo que cada necesidad exige (peso según el catálogo QuelLLM)
Tu necesidadMemoria para los pesosTarjeta adecuada
Un 8B en Q4 (Granite 4.2 8B)4,6 GB8 GB son suficientes
Un 9B en Q4 con contexto medio (Qwen 3.5 9B)6 GB8 GB, al límite de lo cómodo
Un 8B en Q8 (Granite 4.2 8B)9 GB12 GB
Un 12B en Q4 (Gemma 4 12B)7 GB más el contexto12 GB
Un 12B en Q8 (Gemma 4 12B)13 GB16 GB

Lee esta tabla de arriba abajo: la 3060 Ti cubre las dos primeras filas, y las tres siguientes requieren más memoria. Si tus necesidades se sitúan en la mitad inferior, está justificado cambiar de tarjeta; de lo contrario, la 3060 Ti cumple su función. Un modelo de mayor calidad pero más grande a veces es preferible a una tarjeta más rápida: a 92 tokens por segundo, la velocidad no te limita.

#3060 Ti y 3060 12 GB: gemelas solo en apariencia

3060 Ti o 3060 de 12 GB para un LLM
CriterioRTX 3060 TiRTX 3060 12 GB
Memoria8 GB12 GB
Bus / ancho de banda256 bits / 448 GB/s192 bits / 360 GB/s
Generación (7B Q4_0)92,2 tok/s75,6 tok/s
Gemma 4 12B en Q4 (7 GB)No cabe en memoria con el contextoCabe con margen
Fuente de alimentación recomendada para el sistema600 W550 W

El primer impulso es elegir la tarjeta más rápida. Sin embargo, con los modelos de 8 a 9 mil millones que ambas tarjetas pueden cargar, ese 22 % más de velocidad no cambia la experiencia: en ambos casos, el texto se muestra más rápido de lo que se lee. En cambio, la 3060 de 12 GB permite acceder a toda una categoría de modelos. Por eso es la mejor opción para la IA local, a menos que tu uso se limite definitivamente a los modelos de 8 a 9B. Una precaución al comprar: NVIDIA también ha comercializado una 3060 Ti con memoria GDDR6X, que se distingue por su ficha técnica; la capacidad sigue siendo de 8 GB.

#3060 Ti y RTX 4060 Ti 8 GB

La RTX 4060 Ti de 8 GB, más reciente, registra 63,9 tokens por segundo en la misma prueba, una cifra claramente inferior a la de la 3060 Ti. La razón es su bus de 128 bits, que limita su ancho de banda pese a tener una arquitectura más eficiente. Para la generación de texto, la 3060 Ti sigue siendo, por tanto, más rápida que esta tarjeta más reciente, a igualdad de capacidad. Sus ventajas están en otros aspectos: las funciones más recientes de su arquitectura y, según las fichas de los fabricantes, un consumo más moderado, útil en una caja compacta o en una máquina que permanece encendida para ofrecer un modelo como servicio. Sin embargo, no supone una mejora de velocidad en la generación de texto ni tampoco una mayor capacidad de memoria. Si dudas entre las dos, mira la variante de 16 GB de la 4060 Ti, que ofrece el doble de memoria.

#Veredicto 2026

Consérvala si
Funciona y usas modelos de entre 7 y 9 mil millones de parámetros: la velocidad es más que suficiente y no cabe esperar ninguna mejora al cambiarla por otra de la misma capacidad.
No la compres para IA si puedes acceder a una tarjeta de 12 GB
Una 3060 de 12 GB permite usar modelos de 12 mil millones de parámetros. La diferencia de precio de segunda mano varía cada semana: consulta el seguimiento del sitio.
Pasa a 12 o 16 GB si
Quieres un 12B, un contexto largo o RAG sobre documentos voluminosos.

#Preguntas frecuentes

Preguntas frecuentes
¿RTX 3060 Ti o RTX 3060 12 GB para un LLM?+
La 3060 de 12 GB para la IA local, a pesar de su menor velocidad: 75,6 tokens por segundo frente a 92,2 de la Ti en la prueba de llama.cpp, pero con 4 GB más de memoria. Estos 4 GB permiten usar modelos de 12 mil millones de parámetros como Gemma 4 12B, que la 3060 Ti no puede cargar con contexto.
¿Puede la RTX 3060 Ti ejecutar Gemma 4 12B?+
No con comodidad. El catálogo indica 7 GB de pesos en Q4, mientras que llama.cpp solo detecta 7 838 MiB en la tarjeta, antes incluso de contar la caché de contexto y la memoria para la salida de pantalla. El modelo supera la capacidad de memoria de la tarjeta en cuanto la conversación se alarga. Quédate con Granite 4.2 8B (4,6 GB) o Qwen 3.5 9B (6 GB).
¿Cuántos tokens por segundo en una RTX 3060 Ti?+
92,2 tokens por segundo en generación y 96,5 con Flash Attention, con Llama 2 7B en Q4_0 según la tabla pública de llama.cpp. Un modelo más pesado será más lento, aproximadamente en proporción a su tamaño: calcula del orden de 60 a 75 tokens por segundo para un modelo de 8B o 9B en Q4, como estimación teórica.
¿La RTX 3060 Ti es mejor que la RTX 4060 para un LLM?+
Con la misma capacidad de memoria de 8 GB, la 3060 Ti genera más rápido: 92,2 tokens por segundo, frente a 63,9 de la RTX 4060 Ti de 8 GB, cuyo bus es de solo 128 bits. La 4060 consume menos y ofrece funciones más recientes, pero eso no supone una mejora de velocidad en la generación de texto.
¿Qué fuente de alimentación necesito para una RTX 3060 Ti?+
NVIDIA anuncia 200 W para la tarjeta y recomienda una fuente de alimentación de 600 W para el sistema, frente a 550 W para la RTX 3060. Por tanto, una fuente de alimentación de 500 W está por debajo de la recomendación del fabricante: opta por una de 600 W de buena calidad, especialmente si tu procesador consume mucho.
¿Valdría la pena usar Flash Attention en una RTX 3060 Ti?+
Sí, especialmente para prompts largos: la tabla de llama.cpp mide la lectura de 4.096 tokens a 2.598 tokens por segundo con Flash Attention contra 1.897 sin él, lo que representa un 37 % más. La generación gana aproximadamente un 5 %. Ollama la activa automáticamente cuando la tarjeta lo permite.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.