Principiante 11 minPor VRAM

¿Qué LLM para 12 GB de VRAM? ?

Respuesta directa

Con 12 GB de VRAM, elige un modelo de 12 a 14 mil millones de parámetros en Q4 (Gemma 4 12B: 7 GB, Qwen 3 14B: 9 GB) o un modelo de 9B en Q8 (10 GB), con 1 a 3 GB de margen para el contexto. Los modelos de 20 a 24 mil millones requieren 16 GB, y los de 27 a 35 mil millones necesitan 24 GB.

Doce gigabytes de VRAM permiten ejecutar modelos de 12 a 14 mil millones de parámetros con margen. Esta guía explica qué modelos caben, qué tarjetas tienen realmente 12 GB, cómo distribuir la memoria para un RAG local y cuándo pasar a 16 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Para pasar a 16 GB de VRAM: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#12 GB de VRAM: el umbral en el que los 14 mil millones se vuelven posibles

Con 12 GB de VRAM, puedes ejecutar modelos de 12 a 14 mil millones de parámetros en Q4 con un margen considerable para el contexto, o un 9B en Q8. Según el catálogo QuelLLM, un Gemma 4 12B en Q4 pesa 7 GB, un Qwen 3 14B en Q4 pesa 9 GB, un Qwen 3.5 9B en Q8 pesa 10 GB. El umbral de 12 GB es aquel en el que dejas atrás los modelos de 8 a 9 mil millones, más limitados en razonamiento y calidad de redacción, sin llegar aún a los 24 mil millones, que requieren 16 GB. Lo que queda fuera de alcance: los modelos de 27 a 35 mil millones de parámetros, entre 16 y 21 GB en Q4.

Lo que cabe en 12 GB (tamaños de los modelos del catálogo QuelLLM)
ModeloQ4Q5Q8Con 12 GB
Qwen 3.5 9B6 GB7 GB10 GBQ8 posible, contexto corto
Gemma 4 12B7 GB9 GB13 GBQ4 o Q5; Q8 supera el límite
Mistral Nemo 12B7 GB9 GB13 GBQ4 o Q5; Q8 supera el límite
Qwen 3 14B9 GB11 GB16 GBQ4 cómodo, Q5 ajustado
Mistral Small 24B14 GB17 GB26 GBNo

Cómo leer esta tabla: añade al tamaño de los pesos la caché KV y aproximadamente un gigabyte de margen. Un Qwen 3 14B en Q4 (9 GB) deja así aproximadamente 2 GB para el contexto; un Qwen 3.5 9B en Q8 (10 GB) solo deja uno, lo que limita el contexto. Antes de continuar, una corrección: una versión anterior de esta guía describía como holgado el uso del 9B en Q8 con 12 GB; el catálogo indica que los pesos ocupan 10 GB, por lo que el margen es estrecho.

#Tarjetas de 12 GB: las que realmente los tienen

Muchas familias de tarjetas tienen versiones con distintas capacidades; el nombre por sí solo no basta. NVIDIA indica, para su familia RTX 4070, 16 GB para la 4070 Ti Super y 12 GB para las 4070 Ti, 4070 Super y 4070. La RTX 5070 ofrece 12 GB de GDDR7 en un bus de 192 bits, mientras que la 5070 Ti tiene 16. La RTX 3060 está disponible en versiones de 12 GB y de 8 GB, y la de 12 GB es la más interesante para la IA local. En cuanto a AMD, la guía de la RX 7700 XT la clasifica en este rango.

Tarjetas de 12 GB y guías dedicadas
TarjetaCapacidadGuide
RTX 3060 (versión 12 GB)12 GB GDDR6LLM en RTX 3060 12 GB
RTX 4070, 4070 Super, 4070 Ti12 GB GDDR6X o GDDR6LLM en RTX 4070
RTX 507012 GB GDDR7, 192 bitsLLM en RTX 5070
RX 7700 XT12 GB (ver la guía)LLM en RX 7700 XT

Para comparar, la capacidad es el criterio principal y el ancho de banda el segundo: a igual capacidad, cuanto más rápida sea la memoria, más fluida será la generación. Los precios cambian cada semana; el seguimiento de precios del sitio muestra el coste por gigabyte de VRAM de las tarjetas de 12 GB y de 16 GB, lo que permite saber si el nivel superior justifica su sobreprecio.

#¿Qué modelos elegir con 12 GB según el uso?

Un punto de partida por uso
UsoModelo y cuantizaciónTamaño del modeloLo que hay que saber
Conversación general en francésMistral Nemo 12B Q59 GBEtiquetado como francés en el catálogo; 3 GB de margen
Razonamiento y redacciónQwen 3 14B Q49 GBAproximadamente 2 GB para el contexto
Multimodal (imágenes)Gemma 4 12B Q47 GBEl módulo de imagen consume memoria adicional
Calidad máxima de un 9BQwen 3.5 9B Q810 GBContexto limitado a unos miles de tokens
Velocidad y ligerezaGranite 4.2 8B Q56 GBDeja 5 GB para un embedder o un contexto largo

Para el código, los modelos especializados más capaces del catálogo superan los 12 GB: Devstral Small 2 24B pesa 14 GB en Q4 y Qwen3-Coder 30B-A3B, 19 GB. Con 12 GB, quédate con un modelo generalista de entre 12 y 14 mil millones de parámetros o con Qwen 2.5 Coder 14B, para el que el catálogo indica 9 GB en Q4. En las guías relacionadas se comparan estos modelos con 8 y 16 GB de VRAM.

→
Un criterio simple para elegir la cuantización
Mantén al menos 2 GB libres además de la memoria que ocupan los pesos si usas un contexto de más de 8 000 tokens. Si el margen es menor, baja un nivel de cuantización (de Q8 a Q5, de Q5 a Q4) en lugar de reducir el contexto: la pérdida de calidad de Q5 es pequeña para un uso habitual.

#Velocidad: cálculo que hay que hacer uno mismo

Con 12 GB, como con cualquier otra capacidad, la velocidad de generación está limitada por el ancho de banda de la memoria de la tarjeta dividido por el tamaño de los pesos leídos en cada token. Cada fabricante publica esta cifra en la ficha técnica de la tarjeta, en GB/s. Basta con dividirla por el tamaño del modelo para obtener un límite teórico, que la velocidad real nunca alcanza por completo. La tabla muestra este límite para un ancho de banda de 100 GB/s; multiplícalo por la cifra de tu tarjeta.

Límite teórico por tramo de 100 GB/s de ancho de banda
Modelo en Q4Pesos leídosLímite por cada 100 GB/sEjemplo para 300 GB/s
Granite 4.2 8B4,6 GB≈ 22 tokens/s≈ 65 tokens/s
Gemma 4 12B7 GB≈ 14 tokens/s≈ 43 tokens/s
Qwen 3 14B9 GB≈ 11 tokens/s≈ 33 tokens/s
Qwen 3.5 9B en Q810 GB10 tokens/s30 tokens/s

Este límite explica por qué una cuantización más fina ralentiza la generación: pasar de Q4 a Q8 casi duplica el volumen de pesos que se lee. También explica por qué dos tarjetas de igual capacidad pueden diferir: el bus de memoria importa. NVIDIA indica 192 bits para la RTX 5070 de 12 GB y 256 bits para la 5070 Ti de 16 GB. No publicamos cifras de tokens por segundo para cada tarjeta porque no disponemos de una fuente comparable; para tu hardware, ollama run con la opción --verbose muestra la velocidad real.

#Verificar que un modelo quepa en la memoria antes de adoptarlo

  1. 01
    Consultar el tamaño en el catálogo
    Abre la ficha del modelo en el catálogo QuelLLM y anota el tamaño de la cuantización deseada.
  2. 02
    Añadir margen
    Añade aproximadamente 1 GB para el sistema y de 1 a 3 GB para la caché KV según el contexto que quieras utilizar. El total debe mantenerse por debajo de 12 GB.
  3. 03
    Iniciar y medir
    Carga el modelo, haz una pregunta, luego escribe ollama ps: la columna PROCESSOR debe mostrar 100 % GPU.
  4. 04
    Ajustar si es necesario
    Reduce el contexto, cuantiza la caché KV o baja un nivel de cuantización, en ese orden.

#RAG local con 12 GB: cómo distribuir la memoria

Un RAG local reúne tres componentes: un modelo de embeddings que indexa tus documentos, opcionalmente un reranker que reordena los pasajes y el LLM que redacta. Los dos primeros son mucho más pequeños que el LLM y pueden ejecutarse en la GPU o en el procesador, a tu elección. El presupuesto de memoria se calcula sumando los tres y dejando después un margen para la caché KV: el contexto del LLM crece con el número de pasajes que le envías.

Tres distribuciones posibles
EstrategiaUbicaciónVentajaLímite
Todo en la GPULLM 8B en Q5 (6 GB) + embedder + rerankerRespuestas rápidasPoco margen para un contexto largo
Embedder en la CPULLM de 12B en Q4 (7 GB) en GPULibera VRAM para el contextoIndexación más lenta
Indexación y luego apagadoEmbedder lanzado solo durante la indexaciónVRAM completamente libre despuésDos pasos que hay que gestionar

La segunda estrategia suele ser la mejor: la indexación es un trabajo en segundo plano que no necesita GPU, mientras que la generación de respuestas aprovecha plenamente la VRAM. Un embedder funciona en segundo plano durante la indexación y luego entra en reposo; con la CPU, la indexación de una carpeta de documentos tarda más tiempo, pero solo se realiza una vez. No indicamos tamaños para los embedders aquí; consulta las guías sobre embeddings y sobre RAG local para conocer los valores de cada modelo.

#Lo que 12 GB no permiten

Modelos de 24 mil millones
Mistral Small 24B pesa 14 GB en Q4 según el catálogo: supera la memoria disponible. Para 24 mil millones de parámetros, se necesitan 16 GB.
Modelos densos de 27 a 32 mil millones
Qwen 3.8 27B y sus similares pesan 16 GB en Q4; busca 24 GB.
MoE de 30 a 35 mil millones
Qwen 3.6 35B-A3B pesa 21 GB, GLM 4.7 Flash 19 GB y Qwen3-Coder 30B-A3B 19 GB: quedan fuera de alcance con 12 GB, aunque solo lean 3 mil millones de parámetros activos, porque todo el modelo debe residir en memoria.
Contexto largo en un 14B
Un Qwen 3 14B en Q4 deja aproximadamente 2 GB: no cuentes con decenas de miles de tokens sin aplicar cuantización a la caché KV.

Ollama permite cuantizar la caché KV para ahorrar espacio: según su documentación, OLLAMA_KV_CACHE_TYPE=q8_0 utiliza aproximadamente la mitad de la memoria que el formato f16 predeterminado, siempre que Flash Attention esté activado. La guía sobre la caché KV detalla este ajuste, y la ventana de contexto predeterminada de Ollama, de 4 096 tokens, se modifica con OLLAMA_CONTEXT_LENGTH.

Contexto de 16k y caché KV en q8_0 para un 14B
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=16384 ollama serve
ollama ps

#12 GB o 16 GB: la opción adecuada para ti

Decidir entre 12 y 16 GB
Tu necesidad¿Bastan 12 GB?Por qué
Chat, traducción y resumen con un modelo de entre 9B y 14BSíQ4 o Q5, con contexto
RAG ligero con un modelo de embeddings ejecutado en la CPUSíLLM de 7 a 9 GB en GPU
Modelos de 20 a 24 mil millones (gpt-oss 20B, Mistral Small 24B)NoEntre 13 y 14 GB de pesos en Q4
Agentes de código con contexto largoNoEl contexto y los pesos superan los 12 GB
Presupuesto ajustado, uso ocasionalSíEl coste adicional no aporta nada si los modelos de 20 a 24 mil millones no te sirven

#Preguntas frecuentes

Preguntas frecuentes
¿Cuál es el mejor LLM para 12 GB de VRAM?+
Un modelo de 12 a 14 mil millones en Q4 o Q5, como Gemma 4 12B (7 GB en Q4), Mistral Nemo 12B o Qwen 3 14B (9 GB), según el catálogo QuelLLM. Dejan margen para el contexto. Un Qwen 3.5 9B en Q8 (10 GB) ofrece la mejor precisión de un 9B, con un contexto más corto.
¿12 GB de VRAM son suficientes en 2026?+
Sí para el chat, la traducción, el resumen y un RAG ligero con modelos de hasta 14 mil millones de parámetros. No para modelos de 20 a 24 mil millones, que pesan entre 13 y 14 GB en Q4, ni para los de 27 a 35 mil millones, entre 16 y 21 GB. Estos últimos requieren entre 16 y 24 GB.
¿Se puede ejecutar un 14B en 12 GB?+
Sí, en Q4: Qwen 3 14B pesa 9 GB según el catálogo, lo que deja aproximadamente 2 GB para la caché KV y el sistema. La Q5 (11 GB) deja demasiado poco margen; la Q8 (16 GB) es imposible. Verifica con ollama ps que el modelo esté al 100 % en la GPU.
¿12 GB o 16 GB para los LLM?+
Elige 16 GB si quieres modelos de 20 a 24 mil millones de parámetros, como gpt-oss 20B (13 GB) o Mistral Small 24B (14 GB), con algo de contexto. Quédate con 12 GB si te bastan modelos de 9 a 14 mil millones de parámetros. Compara el precio por gigabyte en el seguimiento de precios del sitio.
¿Qué tarjeta de 12 GB elegir?+
Comprueba primero la capacidad: la RTX 3060 existe en versiones de 12 y 8 GB, y la 4070 Ti Super tiene 16 GB. Entre las tarjetas de 12 GB, la RTX 3060 es la más asequible, y la RTX 4070 y la 5070 son las más rápidas. Puedes consultar el precio del día en el seguimiento de precios del sitio.
¿Caben los modelos MoE de 30 mil millones en 12 GB?+
No. Un modelo MoE solo lee parte de sus pesos en cada token, pero debe cargarse completo: Qwen3-Coder 30B-A3B pesa 19 GB y Qwen 3.6 35B-A3B 21 GB en Q4. Con 12 GB, parte pasaría al procesador y la velocidad disminuiría drásticamente.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.