Principiante 14 minRTX 30

¿Qué LLM usar en una RTX 3060 de 12 GB? ?

Respuesta directa

La RTX 3060 12 GB ejecuta sin concesiones modelos de 7 a 14 mil millones de parámetros en Q4: Granite 4.2 8B (5,3 GB), Qwen3.5 9B (6,6 GB), Gemma 4 12B (7,6 GB) y Qwen3 14B (9,3 GB). Su memoria determina el tamaño del modelo y del contexto, y su ancho de banda de 360 GB/s fija el límite de velocidad: aproximadamente 50 tokens/s en un modelo de 8-9B. Por encima de 14B, se necesita un modelo MoE con ayuda de la CPU, o entre 16 y 24 GB de VRAM.

Esta guía parte de la tarjeta: lo que permiten sus 12 GB de VRAM y sus 360 GB/s, lo que han medido terceros y dónde están los límites reales (el contexto, los modelos de 27 a 32B, la segunda tarjeta). El tamaño de cada modelo procede de su página en Ollama y cada velocidad de generación se atribuye a su fuente, porque las cifras que circulan sobre esta tarjeta a menudo se contradicen.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#La RTX 3060 12 GB en cifras

La RTX 3060 de 12 GB carga íntegramente todos los modelos de 7 a 14 mil millones de parámetros en Q4: Granite 4.2 8B (5,3 GB en Ollama), Qwen3.5 9B (6,6 GB), Gemma 4 12B (7,6 GB) o Qwen3 14B (9,3 GB). No es su potencia de cálculo la que determina el límite, sino su memoria. Los 12 GB de GDDR6 fijan el tamaño máximo del modelo y de su contexto. Los 360 GB/s de ancho de banda fijan la velocidad, ya que la tarjeta vuelve a leer la mayor parte de los pesos con cada token. Las mediciones publicadas por terceros dan entre 50 y 65 tokens por segundo en un modelo de 8 a 9 mil millones de parámetros y entre 26 y 33 en un 14B, suficiente para un chat o un asistente de código. Un modelo denso de 27 a 32 mil millones de parámetros supera la capacidad de la VRAM: se necesita un MoE, una segunda tarjeta o más VRAM.

Arquitectura
Ampere, 3 584 núcleos CUDA, Tensor Cores de 3.ª generación (ficha NVIDIA).
Memoria
12 GB de GDDR6 en un bus de 192 bits. Tom's Hardware cifra el ancho de banda máximo en 360 GB/s.
Alimentación
170 W de potencia de la tarjeta; NVIDIA indica 550 W para la alimentación del sistema.
Compatibilidad con Ollama
Capacidad de cálculo 8.6, driver NVIDIA 550 o más reciente bajo Linux, 551.61 o más reciente bajo Windows.
Precio
Aquí no se indican precios, ya que cambian cada semana: ver el seguimiento de precios de GPU de IA del sitio.
→
¿Por qué 12 GB cuentan más que la velocidad de cálculo?
Las RTX 4060 y 5060 de NVIDIA incluyen 8 GB. Gemma 4 12B pesa 7,6 GB en Ollama: de los 8 GB, quedan 0,4 GB para el contexto y el runtime, es decir, nada. De 12 GB, quedan aproximadamente 4 GB. Esta diferencia de capacidad hace que la 3060 de 12 GB sea una tarjeta de IA local viable.

#1. Qué modelos caben en 12 GB

La referencia: el tamaño del archivo, más la caché de contexto, más aproximadamente 1 GB de margen para el entorno de ejecución. La tabla muestra los pesos indicados por Ollama para los modelos que la tarjeta carga por completo y para algunos modelos de tamaño cercano que no caben. La lista completa, que abarca todas las tarjetas, se encuentra en la guía dedicada a los 12 GB de VRAM.

Pesos en Ollama y si caben en 12 GB (contexto predeterminado de Ollama: 4 096 tokens)
Modelo (etiqueta Ollama)Tamaño del modeloContexto anunciado¿Cabe en 12 GB?
Granite 4.2 8B (granite4.2:8b)5,3 GB128KSí, amplio margen
Qwen3.5 9B en Q4_K_M (qwen3.5:9b)6,6 GB256KSí, amplio margen
Gemma 4 12B (gemma4:12b)7,6 GB256KSí, aproximadamente 4 GB de margen
Qwen3 14B (qwen3:14b)9,3 GB40KSí, pero hay que limitar el contexto
Qwen3.5 9B en Q8_0 (qwen3.5:9b-q8_0)11 GB256KCabe justo: aproximadamente 1 GB de margen
Qwen3.5 27B (qwen3.5:27b)17 GB256KNo
Gemma 4 26B (gemma4:26b)19 GB256KNo
Mistral Small 3.2 24B (mistral-small3.2)15 GB128KNo

Dos trampas. El número en el nombre no indica el tamaño: gemma4:e4b ocupa 9,6 GB y gemma4:e2b 7,2 GB en Ollama, es decir, más que el 12B (7,6 GB). Comprueba el tamaño antes de descargar. Además, el Q8_0 de Qwen3.5 9B cabe técnicamente, pero solo deja aproximadamente 1 GB para el contexto y los búferes: opta por el Q4_K_M de 6,6 GB, que libera más de 5 GB.

#2. Instalar Ollama y verificar que todo funcione en el GPU

  1. 01
    Comprobar el controlador NVIDIA
    Ollama exige la versión 550 o posterior del controlador bajo Linux y la 551.61 o posterior bajo Windows. El comando nvidia-smi muestra la versión instalada y el nombre de la tarjeta.
  2. 02
    Instalar Ollama
    En Windows y macOS, utiliza el instalador de ollama.com. En Linux, basta con un solo comando; la GPU NVIDIA se detecta automáticamente.
  3. 03
    Iniciar un primer modelo de 12 GB
    ollama run gemma4:12b télécharge 7,6 Go et lance un modèle qui accepte aussi les images. Pour plus de vitesse, ollama run qwen3.5:9b pèse 6,6 Go.
  4. 04
    Comprobar dónde se ejecuta
    ollama ps, en un segundo terminal, muestra la columna PROCESSOR. El valor esperado es 100% GPU.
Linux (Windows: instalador de ollama.com)
nvidia-smi
curl -fsSL https://ollama.com/install.sh | sh
ollama run gemma4:12b
ollama ps
i
Qué significa un valor distinto de 100% GPU
Si PROCESSOR indica algo distinto de 100% GPU, una parte del modelo o de la caché se ejecuta en el procesador y la tasa de generación cae en picado. Antes de concluir que la tarjeta es demasiado poco potente, reduce el contexto o cambia la caché a 8 bits (sección 5): son las dos medidas más rápidas.

#3. Las velocidades publicadas y el techo teórico

Con cada token, la tarjeta vuelve a leer los pesos activos desde la VRAM. Por tanto, el límite teórico es el ancho de banda dividido por el tamaño del modelo: 360 GB/s divididos por 5,3 GB dan aproximadamente 68 tokens/s para Granite 4.2 8B, 55 para Qwen3.5 9B (6,6 GB), 47 para Gemma 4 12B (7,6 GB) y 39 para Qwen3 14B (9,3 GB). Son límites máximos, nunca mediciones: la velocidad publicada para Qwen3.5 9B es de 49,9 tokens/s (aproximadamente el 90 % del límite) y para Qwen3 14B, de 33,4 (aproximadamente el 86 %), lo que confirma que la memoria limita la velocidad.

Velocidades de generación publicadas para la RTX 3060 de 12 GB (mediciones de terceros, no del sitio)
Modelo y cuantizaciónGeneración (tokens/s)Fuente y condiciones
Llama 3.1 8B Instruct, Q4_K_M51,3LocalScore (proyecto Mozilla Builders)
Llama 3.1 8B Instruct, Q4_K_M64,5Blog Tyolab, llama.cpp, contexto 8 192, mayo 2026
Llama 7B, Q4_0 (3,56 GiB)75,6Discusión de llama.cpp sobre las GPU CUDA (llama-bench, WSL2)
Qwen3.5 9B, Q4_K_M49,9Blog Tyolab, mismas condiciones
Gemma 4 12B, Q5_K_XLaproximadamente 33Gemma4All, según una prueba comunitaria (llama.cpp, Flash Attention, caché KV Q8_0)
Qwen3 14B, Q4_K_M33,4Blog Tyolab, contexto reducido a 4.096
Qwen2.5 14B Instruct, Q4_K_M26,6LocalScore

Las diferencias en un mismo modelo (51,3 frente a 64,5 tokens/s para Llama 3.1 8B) provienen del método: software, longitud del prompt, sistema. Compara solo cifras de una misma fuente; ninguna ha sido medida por el sitio.

La generación es solo la mitad de la experiencia. LocalScore mide el procesamiento del prompt a 1 483 tokens/s en Llama 3.1 8B y a 759 tokens/s en Qwen2.5 14B. Para un documento de 10 000 tokens, hay que esperar aproximadamente 7 segundos antes de la primera respuesta en un 8B y 13 segundos en un 14B. Este procesamiento depende del cálculo, no del ancho de banda.

#4. Un modelo de 35B en 12 GB: el caso de los MoE

Un modelo MoE (mixture of experts) activa solo una fracción de sus parámetros por token. Qwen3.6 35B-A3B activa aproximadamente 3 mil millones, pero su archivo de 23 GB en Ollama no cabe en 12 GB. La solución prevista por llama.cpp es la opción --n-cpu-moe: mantiene en la RAM los pesos de los expertos de las N primeras capas y deja la atención en la GPU.

Un usuario publicó el 22 de septiembre de 2026 sus mediciones: RTX 3060 12 GB, Ryzen 5 3600, 32 GB de DDR4-3200, Qwen3.6-35B-A3B en Q4_K_M (aproximadamente 21 GB). Registra 47 tokens/s en una pregunta corta, 45 con 12.000 tokens de contexto y 37 con 45.000. Con una distribución clásica por capas, el rendimiento de la misma máquina caía a 7,1 tokens/s con 15.000 tokens (medición realizada con Qwen3-30B-A3B), frente a 25,3 tras el ajuste. Solo una de cada cuatro capas de las series Qwen3.5 y 3.6 utiliza la atención clásica: su velocidad disminuye menos cuando aumenta el contexto.

Tres salvedades: es la medición de una sola persona, con llama.cpp y no con Ollama; presupone 32 GB de RAM; y la velocidad de esa RAM importa. Su DDR4-3200 funcionaba a 2 400 por defecto, y el perfil XMP o DOCP aumentó la velocidad de generación entre un 10 y un 17 %.

llama.cpp: expertos en CPU, atención en GPU
llama-server -m modele-moe-Q4_K_M.gguf -ngl 99 --n-cpu-moe 26 -c 32768 -ctk q8_0 -ctv q8_0

El valor 26 es el del autor para su modelo: cuanto mayor sea, más VRAM se libera, pero más lenta es la generación. Busca el valor más bajo que deje aproximadamente 1 GB de VRAM libre.

#5. Contexto y caché KV

#El contexto, el primer límite al disponer de 12 GB

Ollama asigna por defecto 4096 tokens de contexto cuando hay menos de 24 GiB de VRAM, mientras que su documentación recomienda al menos 64 000 tokens para los agentes y las herramientas de código. Entre ambos valores, cada token consume memoria. Ejemplo con Qwen3 14B, cuya arquitectura está publicada: 40 capas, 8 cabezas KV y 128 dimensiones por cabeza. Por token, la caché KV de 16 bits ocupa 2 (claves y valores) × 40 × 8 × 128 × 2 bytes, es decir, 160 KiB: aproximadamente 2,4 GiB para 16 000 tokens y 3,7 GiB para 24 000.

El modelo de 9,3 GB equivale a 8,7 GiB, frente a los 12 GiB de VRAM disponibles. Con 16 000 tokens, el conjunto alcanza 11,1 GiB: queda menos de 1 GiB para los buffers del entorno de ejecución, un margen demasiado ajustado. Con 24 000 tokens, alcanza 12,3 GiB: la carga falla o parte del procesamiento pasa a la CPU. Con una caché de 8 bits, 24 000 tokens solo ocupan 1,8 GiB, es decir, 10,5 GiB en total: cabe.

#Caché KV de 8 bits y Flash Attention

Ollama activa automáticamente Flash Attention cuando el software y la tarjeta lo permiten; OLLAMA_FLASH_ATTENTION=1 lo fuerza. Es un requisito previo al caché cuantizado: con OLLAMA_KV_CACHE_TYPE=q8_0, el caché ocupa aproximadamente la mitad de la memoria del f16 con una pérdida de precisión muy baja, según la documentación. El ajuste es global: todos los modelos servidos usan el mismo tipo de caché.

Linux: servidor Ollama con contexto de 16 000 tokens y caché KV en 8 bits
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=16000 ollama serve

#6. Dos RTX 3060 de 12 GB: 24 GB de VRAM, no dos veces más rápido

Dos tarjetas ofrecen 24 GB de VRAM, suficientes para un modelo denso de 27 a 32B en Q4: Qwen3.5 27B pesa 17 GB en Ollama. Ollama distribuye automáticamente el modelo entre todas las tarjetas cuando no cabe en una sola. En llama.cpp, la división predeterminada se hace por capas, en pipeline: estas se ejecutan una tras otra. El modo tensorial, que paraleliza el cálculo, está señalado como experimental.

La ganancia se refiere, por tanto, a la capacidad, no a la velocidad: cada token vuelve a leer todos los pesos, a 360 GB/s por tarjeta. Límite estimado para un 32B de 20 GB: 360 dividido por 20, es decir, aproximadamente 18 tokens/s. Una RTX 3090 ofrece 24 GB en una sola tarjeta a 936 GB/s según RunAIHome: el mismo modelo tiene entonces un límite de unos 47 tokens/s, es decir, 2,6 veces más. Dos tarjetas de 170 W también suponen 340 W solo para la GPU, mientras que los 550 W de NVIDIA corresponden a una sola.

Este montaje se justifica si ya posees una tarjeta y buscas alcanzar 24 GB. Si empiezas desde cero, compara primero con una sola tarjeta de 16 o 24 GB.

#7. RTX 3060 8 GB, 3060 Ti, 4060, 5060: qué cambia con 12 GB

Tarjetas NVIDIA de gama básica: memoria (fichas de NVIDIA) y generación con Llama 3.1 8B Q4_K_M (LocalScore)
TarjetaVRAMMemoria y bus8B Q4_K_M, tokens/sGemma 4 12B (7,6 GB)
RTX 3060 12 GB12 GBGDDR6, 192 bits51,3Sí, con aproximadamente 4 GB de contexto
RTX 3060 8 GB8 GBGDDR6, 128 bits37,0No en la práctica (0,4 GB de margen)
RTX 3060 Ti8 GBGDDR6 o GDDR6X, 256 bits60,2No en la práctica
RTX 40608 GBGDDR6, 128 bits38,1No en la práctica
RTX 50608 GBGDDR7, 128 bits—No en la práctica
RTX 5060 Ti16 GB o 8 GBGDDR7, 128 bits51,2 (16 GB)Sí en la versión de 16 GB

La 3060 8 GB no es una 3060 12 GB con menos memoria: su bus pasa de 192 a 128 bits, y Tom's Hardware indica una banda ancha de 240 GB/s frente a 360 GB/s, lo que representa un 33 % menos. LocalScore la registra a 37,0 tokens/s frente a 51,3, lo que equivale a un 28 % menos en el mismo modelo. Estas velocidades son mediciones aisladas, sin condiciones controladas: la 3060 Ti la supera, lo cual es plausible debido a su bus de 256 bits, pero sus 8 GB la excluyen de modelos con 12 o 14 mil millones de parámetros. La 5060 compensa su bus estrecho con GDDR7, sin modificar su capacidad. Solo la 5060 Ti en versión de 16 GB supera a la 3060 en VRAM

!
Anuncios de ocasión: «RTX 3060» no basta
Dos versiones de la 3060 coexisten, 12 GB y 8 GB, y la 3060 Ti tiene solo 8 GB. Exige la indicación de 12 GB y una captura de nvidia-smi: el comando a continuación muestra el nombre de la tarjeta y su memoria total.
Verificar la capacidad de la tarjeta
nvidia-smi --query-gpu=name,memory.total --format=csv

#Comprar una 3060 de 12 GB: cuándo sí y cuándo optar por otra opción

Compra una 3060 de 12 GB si
quieres una primera GPU para Ollama, modelos de 7 a 14B, un chat, un RAG documental o ayuda con el código, y la capacidad te importa más que la velocidad.
Busca 16 GB si
quieres Gemma 4 12B con un contexto largo o más margen para un 14B. La RTX 5060 Ti 16 GB es el primer escalón; la página de comparación cuantifica la diferencia.
Busca 24 GB si
los modelos densos de 27 a 32B son tu objetivo: una tarjeta de 24 GB evita repartir el modelo entre dos tarjetas y ofrece un ancho de banda mucho mayor.
Evita o comprueba si
el anuncio no especifica la memoria: la versión de 8 GB no ofrece ni la capacidad ni el ancho de banda de la de 12 GB.

#Preguntas frecuentes

FAQ
¿La RTX 3060 12 GB es suficiente para un LLM local?+
Sí, para modelos de 7 a 14 mil millones de parámetros, que cubren el chat, el resumen de documentos y la ayuda con el código. Sus 12 GB permiten cargar Gemma 4 12B (7,6 GB) o Qwen3 14B (9,3 GB) en Q4, con una velocidad de aproximadamente 33 tokens por segundo para ambos modelos según las mediciones publicadas. No es suficiente para un modelo denso de 27 a 32 mil millones de parámetros.
¿Qué modelo lanzar primero con Ollama en una RTX 3060 de 12 GB?+
Empieza por ollama run gemma4:12b: 7,6 GB, contexto anunciado de 256K, imágenes aceptadas, aproximadamente 4 GB de margen en la tarjeta. Para priorizar la velocidad, ollama run qwen3.5:9b pesa 6,6 GB y alcanza cerca de 50 tokens/s según una medición publicada. Verifica después con ollama ps que la columna PROCESSOR muestre 100% GPU.
¿Cuántos tokens por segundo en una RTX 3060 de 12 GB?+
Las mediciones publicadas dan 51 a 65 tokens/s en Llama 3.1 8B en Q4_K_M, aproximadamente 50 en Qwen3.5 9B y 26 a 33 en un 14B. El límite teórico se obtiene dividiendo el ancho de banda de 360 GB/s por el tamaño del modelo en GB: 47 tokens/s para Gemma 4 12B. Estos valores varían según el software, el contexto y el procesador.
¿Se puede ejecutar un modelo de 32B o de 70B en una RTX 3060 de 12 GB?+
Un modelo denso de 32B en Q4 (19 a 20 GB de pesos) no cabe: parte se carga en la RAM y la velocidad se desploma. Un 70B (unos 40 GB) es aún peor: se leen alrededor de 29 GB en RAM a un máximo de 51 GB/s (DDR4-3200 de doble canal), lo que limita la velocidad a unos 1,7 tokens/s. Los MoE como Qwen3.6 35B-A3B son una excepción, con 32 GB de RAM y llama.cpp.
¿Dos RTX 3060 de 12 GB equivalen a una RTX 3090 para la IA local?+
En capacidad, sí: 24 GB de VRAM en total, suficiente para un modelo de 32B en Q4. En velocidad, no: llama.cpp divide por defecto el modelo en capas ejecutadas secuencialmente, y cada token vuelve a leer los pesos a 360 GB/s. Una 3090 ofrece 936 GB/s según RunAIHome, lo que representa un límite 2,6 veces más alto.
¿RTX 3060 12 GB o RTX 4060 8 GB para un LLM?+
La 3060 12 GB: 12 GB contra 8 GB deciden el tamaño de los modelos, y Gemma 4 12B (7,6 GB) no deja margen en 8 GB. La 4060 consume menos, con 115 W de potencia de tarjeta contra 170 W según NVIDIA, pero no es el criterio decisivo para un LLM.

Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.