¿Qué LLM usar en una RTX 3060 de 12 GB? ?
La RTX 3060 12 GB ejecuta sin concesiones modelos de 7 a 14 mil millones de parámetros en Q4: Granite 4.2 8B (5,3 GB), Qwen3.5 9B (6,6 GB), Gemma 4 12B (7,6 GB) y Qwen3 14B (9,3 GB). Su memoria determina el tamaño del modelo y del contexto, y su ancho de banda de 360 GB/s fija el límite de velocidad: aproximadamente 50 tokens/s en un modelo de 8-9B. Por encima de 14B, se necesita un modelo MoE con ayuda de la CPU, o entre 16 y 24 GB de VRAM.
Esta guía parte de la tarjeta: lo que permiten sus 12 GB de VRAM y sus 360 GB/s, lo que han medido terceros y dónde están los límites reales (el contexto, los modelos de 27 a 32B, la segunda tarjeta). El tamaño de cada modelo procede de su página en Ollama y cada velocidad de generación se atribuye a su fuente, porque las cifras que circulan sobre esta tarjeta a menudo se contradicen.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#La RTX 3060 12 GB en cifras
La RTX 3060 de 12 GB carga íntegramente todos los modelos de 7 a 14 mil millones de parámetros en Q4: Granite 4.2 8B (5,3 GB en Ollama), Qwen3.5 9B (6,6 GB), Gemma 4 12B (7,6 GB) o Qwen3 14B (9,3 GB). No es su potencia de cálculo la que determina el límite, sino su memoria. Los 12 GB de GDDR6 fijan el tamaño máximo del modelo y de su contexto. Los 360 GB/s de ancho de banda fijan la velocidad, ya que la tarjeta vuelve a leer la mayor parte de los pesos con cada token. Las mediciones publicadas por terceros dan entre 50 y 65 tokens por segundo en un modelo de 8 a 9 mil millones de parámetros y entre 26 y 33 en un 14B, suficiente para un chat o un asistente de código. Un modelo denso de 27 a 32 mil millones de parámetros supera la capacidad de la VRAM: se necesita un MoE, una segunda tarjeta o más VRAM.
- Arquitectura
- Ampere, 3 584 núcleos CUDA, Tensor Cores de 3.ª generación (ficha NVIDIA).
- Memoria
- 12 GB de GDDR6 en un bus de 192 bits. Tom's Hardware cifra el ancho de banda máximo en 360 GB/s.
- Alimentación
- 170 W de potencia de la tarjeta; NVIDIA indica 550 W para la alimentación del sistema.
- Compatibilidad con Ollama
- Capacidad de cálculo 8.6, driver NVIDIA 550 o más reciente bajo Linux, 551.61 o más reciente bajo Windows.
- Precio
- Aquí no se indican precios, ya que cambian cada semana: ver el seguimiento de precios de GPU de IA del sitio.
#1. Qué modelos caben en 12 GB
La referencia: el tamaño del archivo, más la caché de contexto, más aproximadamente 1 GB de margen para el entorno de ejecución. La tabla muestra los pesos indicados por Ollama para los modelos que la tarjeta carga por completo y para algunos modelos de tamaño cercano que no caben. La lista completa, que abarca todas las tarjetas, se encuentra en la guía dedicada a los 12 GB de VRAM.
| Modelo (etiqueta Ollama) | Tamaño del modelo | Contexto anunciado | ¿Cabe en 12 GB? |
|---|---|---|---|
| Granite 4.2 8B (granite4.2:8b) | 5,3 GB | 128K | Sí, amplio margen |
| Qwen3.5 9B en Q4_K_M (qwen3.5:9b) | 6,6 GB | 256K | Sí, amplio margen |
| Gemma 4 12B (gemma4:12b) | 7,6 GB | 256K | Sí, aproximadamente 4 GB de margen |
| Qwen3 14B (qwen3:14b) | 9,3 GB | 40K | Sí, pero hay que limitar el contexto |
| Qwen3.5 9B en Q8_0 (qwen3.5:9b-q8_0) | 11 GB | 256K | Cabe justo: aproximadamente 1 GB de margen |
| Qwen3.5 27B (qwen3.5:27b) | 17 GB | 256K | No |
| Gemma 4 26B (gemma4:26b) | 19 GB | 256K | No |
| Mistral Small 3.2 24B (mistral-small3.2) | 15 GB | 128K | No |
Dos trampas. El número en el nombre no indica el tamaño: gemma4:e4b ocupa 9,6 GB y gemma4:e2b 7,2 GB en Ollama, es decir, más que el 12B (7,6 GB). Comprueba el tamaño antes de descargar. Además, el Q8_0 de Qwen3.5 9B cabe técnicamente, pero solo deja aproximadamente 1 GB para el contexto y los búferes: opta por el Q4_K_M de 6,6 GB, que libera más de 5 GB.
#2. Instalar Ollama y verificar que todo funcione en el GPU
- 01Comprobar el controlador NVIDIAOllama exige la versión 550 o posterior del controlador bajo Linux y la 551.61 o posterior bajo Windows. El comando nvidia-smi muestra la versión instalada y el nombre de la tarjeta.
- 02Instalar OllamaEn Windows y macOS, utiliza el instalador de ollama.com. En Linux, basta con un solo comando; la GPU NVIDIA se detecta automáticamente.
- 03Iniciar un primer modelo de 12 GBollama run gemma4:12b télécharge 7,6 Go et lance un modèle qui accepte aussi les images. Pour plus de vitesse, ollama run qwen3.5:9b pèse 6,6 Go.
- 04Comprobar dónde se ejecutaollama ps, en un segundo terminal, muestra la columna PROCESSOR. El valor esperado es 100% GPU.
#3. Las velocidades publicadas y el techo teórico
Con cada token, la tarjeta vuelve a leer los pesos activos desde la VRAM. Por tanto, el límite teórico es el ancho de banda dividido por el tamaño del modelo: 360 GB/s divididos por 5,3 GB dan aproximadamente 68 tokens/s para Granite 4.2 8B, 55 para Qwen3.5 9B (6,6 GB), 47 para Gemma 4 12B (7,6 GB) y 39 para Qwen3 14B (9,3 GB). Son límites máximos, nunca mediciones: la velocidad publicada para Qwen3.5 9B es de 49,9 tokens/s (aproximadamente el 90 % del límite) y para Qwen3 14B, de 33,4 (aproximadamente el 86 %), lo que confirma que la memoria limita la velocidad.
| Modelo y cuantización | Generación (tokens/s) | Fuente y condiciones |
|---|---|---|
| Llama 3.1 8B Instruct, Q4_K_M | 51,3 | LocalScore (proyecto Mozilla Builders) |
| Llama 3.1 8B Instruct, Q4_K_M | 64,5 | Blog Tyolab, llama.cpp, contexto 8 192, mayo 2026 |
| Llama 7B, Q4_0 (3,56 GiB) | 75,6 | Discusión de llama.cpp sobre las GPU CUDA (llama-bench, WSL2) |
| Qwen3.5 9B, Q4_K_M | 49,9 | Blog Tyolab, mismas condiciones |
| Gemma 4 12B, Q5_K_XL | aproximadamente 33 | Gemma4All, según una prueba comunitaria (llama.cpp, Flash Attention, caché KV Q8_0) |
| Qwen3 14B, Q4_K_M | 33,4 | Blog Tyolab, contexto reducido a 4.096 |
| Qwen2.5 14B Instruct, Q4_K_M | 26,6 | LocalScore |
Las diferencias en un mismo modelo (51,3 frente a 64,5 tokens/s para Llama 3.1 8B) provienen del método: software, longitud del prompt, sistema. Compara solo cifras de una misma fuente; ninguna ha sido medida por el sitio.
La generación es solo la mitad de la experiencia. LocalScore mide el procesamiento del prompt a 1 483 tokens/s en Llama 3.1 8B y a 759 tokens/s en Qwen2.5 14B. Para un documento de 10 000 tokens, hay que esperar aproximadamente 7 segundos antes de la primera respuesta en un 8B y 13 segundos en un 14B. Este procesamiento depende del cálculo, no del ancho de banda.
#4. Un modelo de 35B en 12 GB: el caso de los MoE
Un modelo MoE (mixture of experts) activa solo una fracción de sus parámetros por token. Qwen3.6 35B-A3B activa aproximadamente 3 mil millones, pero su archivo de 23 GB en Ollama no cabe en 12 GB. La solución prevista por llama.cpp es la opción --n-cpu-moe: mantiene en la RAM los pesos de los expertos de las N primeras capas y deja la atención en la GPU.
Un usuario publicó el 22 de septiembre de 2026 sus mediciones: RTX 3060 12 GB, Ryzen 5 3600, 32 GB de DDR4-3200, Qwen3.6-35B-A3B en Q4_K_M (aproximadamente 21 GB). Registra 47 tokens/s en una pregunta corta, 45 con 12.000 tokens de contexto y 37 con 45.000. Con una distribución clásica por capas, el rendimiento de la misma máquina caía a 7,1 tokens/s con 15.000 tokens (medición realizada con Qwen3-30B-A3B), frente a 25,3 tras el ajuste. Solo una de cada cuatro capas de las series Qwen3.5 y 3.6 utiliza la atención clásica: su velocidad disminuye menos cuando aumenta el contexto.
Tres salvedades: es la medición de una sola persona, con llama.cpp y no con Ollama; presupone 32 GB de RAM; y la velocidad de esa RAM importa. Su DDR4-3200 funcionaba a 2 400 por defecto, y el perfil XMP o DOCP aumentó la velocidad de generación entre un 10 y un 17 %.
El valor 26 es el del autor para su modelo: cuanto mayor sea, más VRAM se libera, pero más lenta es la generación. Busca el valor más bajo que deje aproximadamente 1 GB de VRAM libre.
#5. Contexto y caché KV
#El contexto, el primer límite al disponer de 12 GB
Ollama asigna por defecto 4096 tokens de contexto cuando hay menos de 24 GiB de VRAM, mientras que su documentación recomienda al menos 64 000 tokens para los agentes y las herramientas de código. Entre ambos valores, cada token consume memoria. Ejemplo con Qwen3 14B, cuya arquitectura está publicada: 40 capas, 8 cabezas KV y 128 dimensiones por cabeza. Por token, la caché KV de 16 bits ocupa 2 (claves y valores) × 40 × 8 × 128 × 2 bytes, es decir, 160 KiB: aproximadamente 2,4 GiB para 16 000 tokens y 3,7 GiB para 24 000.
El modelo de 9,3 GB equivale a 8,7 GiB, frente a los 12 GiB de VRAM disponibles. Con 16 000 tokens, el conjunto alcanza 11,1 GiB: queda menos de 1 GiB para los buffers del entorno de ejecución, un margen demasiado ajustado. Con 24 000 tokens, alcanza 12,3 GiB: la carga falla o parte del procesamiento pasa a la CPU. Con una caché de 8 bits, 24 000 tokens solo ocupan 1,8 GiB, es decir, 10,5 GiB en total: cabe.
#Caché KV de 8 bits y Flash Attention
Ollama activa automáticamente Flash Attention cuando el software y la tarjeta lo permiten; OLLAMA_FLASH_ATTENTION=1 lo fuerza. Es un requisito previo al caché cuantizado: con OLLAMA_KV_CACHE_TYPE=q8_0, el caché ocupa aproximadamente la mitad de la memoria del f16 con una pérdida de precisión muy baja, según la documentación. El ajuste es global: todos los modelos servidos usan el mismo tipo de caché.
#6. Dos RTX 3060 de 12 GB: 24 GB de VRAM, no dos veces más rápido
Dos tarjetas ofrecen 24 GB de VRAM, suficientes para un modelo denso de 27 a 32B en Q4: Qwen3.5 27B pesa 17 GB en Ollama. Ollama distribuye automáticamente el modelo entre todas las tarjetas cuando no cabe en una sola. En llama.cpp, la división predeterminada se hace por capas, en pipeline: estas se ejecutan una tras otra. El modo tensorial, que paraleliza el cálculo, está señalado como experimental.
La ganancia se refiere, por tanto, a la capacidad, no a la velocidad: cada token vuelve a leer todos los pesos, a 360 GB/s por tarjeta. Límite estimado para un 32B de 20 GB: 360 dividido por 20, es decir, aproximadamente 18 tokens/s. Una RTX 3090 ofrece 24 GB en una sola tarjeta a 936 GB/s según RunAIHome: el mismo modelo tiene entonces un límite de unos 47 tokens/s, es decir, 2,6 veces más. Dos tarjetas de 170 W también suponen 340 W solo para la GPU, mientras que los 550 W de NVIDIA corresponden a una sola.
Este montaje se justifica si ya posees una tarjeta y buscas alcanzar 24 GB. Si empiezas desde cero, compara primero con una sola tarjeta de 16 o 24 GB.
#7. RTX 3060 8 GB, 3060 Ti, 4060, 5060: qué cambia con 12 GB
| Tarjeta | VRAM | Memoria y bus | 8B Q4_K_M, tokens/s | Gemma 4 12B (7,6 GB) |
|---|---|---|---|---|
| RTX 3060 12 GB | 12 GB | GDDR6, 192 bits | 51,3 | Sí, con aproximadamente 4 GB de contexto |
| RTX 3060 8 GB | 8 GB | GDDR6, 128 bits | 37,0 | No en la práctica (0,4 GB de margen) |
| RTX 3060 Ti | 8 GB | GDDR6 o GDDR6X, 256 bits | 60,2 | No en la práctica |
| RTX 4060 | 8 GB | GDDR6, 128 bits | 38,1 | No en la práctica |
| RTX 5060 | 8 GB | GDDR7, 128 bits | — | No en la práctica |
| RTX 5060 Ti | 16 GB o 8 GB | GDDR7, 128 bits | 51,2 (16 GB) | Sí en la versión de 16 GB |
La 3060 8 GB no es una 3060 12 GB con menos memoria: su bus pasa de 192 a 128 bits, y Tom's Hardware indica una banda ancha de 240 GB/s frente a 360 GB/s, lo que representa un 33 % menos. LocalScore la registra a 37,0 tokens/s frente a 51,3, lo que equivale a un 28 % menos en el mismo modelo. Estas velocidades son mediciones aisladas, sin condiciones controladas: la 3060 Ti la supera, lo cual es plausible debido a su bus de 256 bits, pero sus 8 GB la excluyen de modelos con 12 o 14 mil millones de parámetros. La 5060 compensa su bus estrecho con GDDR7, sin modificar su capacidad. Solo la 5060 Ti en versión de 16 GB supera a la 3060 en VRAM
#Comprar una 3060 de 12 GB: cuándo sí y cuándo optar por otra opción
- Compra una 3060 de 12 GB si
- quieres una primera GPU para Ollama, modelos de 7 a 14B, un chat, un RAG documental o ayuda con el código, y la capacidad te importa más que la velocidad.
- Busca 16 GB si
- quieres Gemma 4 12B con un contexto largo o más margen para un 14B. La RTX 5060 Ti 16 GB es el primer escalón; la página de comparación cuantifica la diferencia.
- Busca 24 GB si
- los modelos densos de 27 a 32B son tu objetivo: una tarjeta de 24 GB evita repartir el modelo entre dos tarjetas y ofrece un ancho de banda mucho mayor.
- Evita o comprueba si
- el anuncio no especifica la memoria: la versión de 8 GB no ofrece ni la capacidad ni el ancho de banda de la de 12 GB.
- Fuente: ficha NVIDIA de las RTX 3060 y 3060 Ti
- Fuente: documentación de Ollama, longitud de contexto
- Fuente: documentación de Ollama, GPU soportados
- Fuente: llama.cpp, opciones del servidor (--n-cpu-moe, caché KV)
- Fuente: LocalScore, resultados de la RTX 3060 12 GB
#Preguntas frecuentes
¿La RTX 3060 12 GB es suficiente para un LLM local?+
¿Qué modelo lanzar primero con Ollama en una RTX 3060 de 12 GB?+
¿Cuántos tokens por segundo en una RTX 3060 de 12 GB?+
¿Se puede ejecutar un modelo de 32B o de 70B en una RTX 3060 de 12 GB?+
¿Dos RTX 3060 de 12 GB equivalen a una RTX 3090 para la IA local?+
¿RTX 3060 12 GB o RTX 4060 8 GB para un LLM?+
Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.
- Precios de las tarjetas gráficas para la IA local (actualizados dos veces por semana)
- Comparativa entre RTX 3060 de 12 GB y RTX 5060 Ti de 16 GB
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.