¿Qué LLM para 12 GB de VRAM? ?
Con 12 GB de VRAM, elige un modelo de 12 a 14 mil millones de parámetros en Q4 (Gemma 4 12B: 7 GB, Qwen 3 14B: 9 GB) o un modelo de 9B en Q8 (10 GB), con 1 a 3 GB de margen para el contexto. Los modelos de 20 a 24 mil millones requieren 16 GB, y los de 27 a 35 mil millones necesitan 24 GB.
Doce gigabytes de VRAM permiten ejecutar modelos de 12 a 14 mil millones de parámetros con margen. Esta guía explica qué modelos caben, qué tarjetas tienen realmente 12 GB, cómo distribuir la memoria para un RAG local y cuándo pasar a 16 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para pasar a 16 GB de VRAM: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#12 GB de VRAM: el umbral en el que los 14 mil millones se vuelven posibles
Con 12 GB de VRAM, puedes ejecutar modelos de 12 a 14 mil millones de parámetros en Q4 con un margen considerable para el contexto, o un 9B en Q8. Según el catálogo QuelLLM, un Gemma 4 12B en Q4 pesa 7 GB, un Qwen 3 14B en Q4 pesa 9 GB, un Qwen 3.5 9B en Q8 pesa 10 GB. El umbral de 12 GB es aquel en el que dejas atrás los modelos de 8 a 9 mil millones, más limitados en razonamiento y calidad de redacción, sin llegar aún a los 24 mil millones, que requieren 16 GB. Lo que queda fuera de alcance: los modelos de 27 a 35 mil millones de parámetros, entre 16 y 21 GB en Q4.
| Modelo | Q4 | Q5 | Q8 | Con 12 GB |
|---|---|---|---|---|
| Qwen 3.5 9B | 6 GB | 7 GB | 10 GB | Q8 posible, contexto corto |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | Q4 o Q5; Q8 supera el límite |
| Mistral Nemo 12B | 7 GB | 9 GB | 13 GB | Q4 o Q5; Q8 supera el límite |
| Qwen 3 14B | 9 GB | 11 GB | 16 GB | Q4 cómodo, Q5 ajustado |
| Mistral Small 24B | 14 GB | 17 GB | 26 GB | No |
Cómo leer esta tabla: añade al tamaño de los pesos la caché KV y aproximadamente un gigabyte de margen. Un Qwen 3 14B en Q4 (9 GB) deja así aproximadamente 2 GB para el contexto; un Qwen 3.5 9B en Q8 (10 GB) solo deja uno, lo que limita el contexto. Antes de continuar, una corrección: una versión anterior de esta guía describía como holgado el uso del 9B en Q8 con 12 GB; el catálogo indica que los pesos ocupan 10 GB, por lo que el margen es estrecho.
#Tarjetas de 12 GB: las que realmente los tienen
Muchas familias de tarjetas tienen versiones con distintas capacidades; el nombre por sí solo no basta. NVIDIA indica, para su familia RTX 4070, 16 GB para la 4070 Ti Super y 12 GB para las 4070 Ti, 4070 Super y 4070. La RTX 5070 ofrece 12 GB de GDDR7 en un bus de 192 bits, mientras que la 5070 Ti tiene 16. La RTX 3060 está disponible en versiones de 12 GB y de 8 GB, y la de 12 GB es la más interesante para la IA local. En cuanto a AMD, la guía de la RX 7700 XT la clasifica en este rango.
| Tarjeta | Capacidad | Guide |
|---|---|---|
| RTX 3060 (versión 12 GB) | 12 GB GDDR6 | LLM en RTX 3060 12 GB |
| RTX 4070, 4070 Super, 4070 Ti | 12 GB GDDR6X o GDDR6 | LLM en RTX 4070 |
| RTX 5070 | 12 GB GDDR7, 192 bits | LLM en RTX 5070 |
| RX 7700 XT | 12 GB (ver la guía) | LLM en RX 7700 XT |
Para comparar, la capacidad es el criterio principal y el ancho de banda el segundo: a igual capacidad, cuanto más rápida sea la memoria, más fluida será la generación. Los precios cambian cada semana; el seguimiento de precios del sitio muestra el coste por gigabyte de VRAM de las tarjetas de 12 GB y de 16 GB, lo que permite saber si el nivel superior justifica su sobreprecio.
#¿Qué modelos elegir con 12 GB según el uso?
| Uso | Modelo y cuantización | Tamaño del modelo | Lo que hay que saber |
|---|---|---|---|
| Conversación general en francés | Mistral Nemo 12B Q5 | 9 GB | Etiquetado como francés en el catálogo; 3 GB de margen |
| Razonamiento y redacción | Qwen 3 14B Q4 | 9 GB | Aproximadamente 2 GB para el contexto |
| Multimodal (imágenes) | Gemma 4 12B Q4 | 7 GB | El módulo de imagen consume memoria adicional |
| Calidad máxima de un 9B | Qwen 3.5 9B Q8 | 10 GB | Contexto limitado a unos miles de tokens |
| Velocidad y ligereza | Granite 4.2 8B Q5 | 6 GB | Deja 5 GB para un embedder o un contexto largo |
Para el código, los modelos especializados más capaces del catálogo superan los 12 GB: Devstral Small 2 24B pesa 14 GB en Q4 y Qwen3-Coder 30B-A3B, 19 GB. Con 12 GB, quédate con un modelo generalista de entre 12 y 14 mil millones de parámetros o con Qwen 2.5 Coder 14B, para el que el catálogo indica 9 GB en Q4. En las guías relacionadas se comparan estos modelos con 8 y 16 GB de VRAM.
#Velocidad: cálculo que hay que hacer uno mismo
Con 12 GB, como con cualquier otra capacidad, la velocidad de generación está limitada por el ancho de banda de la memoria de la tarjeta dividido por el tamaño de los pesos leídos en cada token. Cada fabricante publica esta cifra en la ficha técnica de la tarjeta, en GB/s. Basta con dividirla por el tamaño del modelo para obtener un límite teórico, que la velocidad real nunca alcanza por completo. La tabla muestra este límite para un ancho de banda de 100 GB/s; multiplícalo por la cifra de tu tarjeta.
| Modelo en Q4 | Pesos leídos | Límite por cada 100 GB/s | Ejemplo para 300 GB/s |
|---|---|---|---|
| Granite 4.2 8B | 4,6 GB | ≈ 22 tokens/s | ≈ 65 tokens/s |
| Gemma 4 12B | 7 GB | ≈ 14 tokens/s | ≈ 43 tokens/s |
| Qwen 3 14B | 9 GB | ≈ 11 tokens/s | ≈ 33 tokens/s |
| Qwen 3.5 9B en Q8 | 10 GB | 10 tokens/s | 30 tokens/s |
Este límite explica por qué una cuantización más fina ralentiza la generación: pasar de Q4 a Q8 casi duplica el volumen de pesos que se lee. También explica por qué dos tarjetas de igual capacidad pueden diferir: el bus de memoria importa. NVIDIA indica 192 bits para la RTX 5070 de 12 GB y 256 bits para la 5070 Ti de 16 GB. No publicamos cifras de tokens por segundo para cada tarjeta porque no disponemos de una fuente comparable; para tu hardware, ollama run con la opción --verbose muestra la velocidad real.
#Verificar que un modelo quepa en la memoria antes de adoptarlo
- 01Consultar el tamaño en el catálogoAbre la ficha del modelo en el catálogo QuelLLM y anota el tamaño de la cuantización deseada.
- 02Añadir margenAñade aproximadamente 1 GB para el sistema y de 1 a 3 GB para la caché KV según el contexto que quieras utilizar. El total debe mantenerse por debajo de 12 GB.
- 03Iniciar y medirCarga el modelo, haz una pregunta, luego escribe ollama ps: la columna PROCESSOR debe mostrar 100 % GPU.
- 04Ajustar si es necesarioReduce el contexto, cuantiza la caché KV o baja un nivel de cuantización, en ese orden.
#RAG local con 12 GB: cómo distribuir la memoria
Un RAG local reúne tres componentes: un modelo de embeddings que indexa tus documentos, opcionalmente un reranker que reordena los pasajes y el LLM que redacta. Los dos primeros son mucho más pequeños que el LLM y pueden ejecutarse en la GPU o en el procesador, a tu elección. El presupuesto de memoria se calcula sumando los tres y dejando después un margen para la caché KV: el contexto del LLM crece con el número de pasajes que le envías.
| Estrategia | Ubicación | Ventaja | Límite |
|---|---|---|---|
| Todo en la GPU | LLM 8B en Q5 (6 GB) + embedder + reranker | Respuestas rápidas | Poco margen para un contexto largo |
| Embedder en la CPU | LLM de 12B en Q4 (7 GB) en GPU | Libera VRAM para el contexto | Indexación más lenta |
| Indexación y luego apagado | Embedder lanzado solo durante la indexación | VRAM completamente libre después | Dos pasos que hay que gestionar |
La segunda estrategia suele ser la mejor: la indexación es un trabajo en segundo plano que no necesita GPU, mientras que la generación de respuestas aprovecha plenamente la VRAM. Un embedder funciona en segundo plano durante la indexación y luego entra en reposo; con la CPU, la indexación de una carpeta de documentos tarda más tiempo, pero solo se realiza una vez. No indicamos tamaños para los embedders aquí; consulta las guías sobre embeddings y sobre RAG local para conocer los valores de cada modelo.
#Lo que 12 GB no permiten
- Modelos de 24 mil millones
- Mistral Small 24B pesa 14 GB en Q4 según el catálogo: supera la memoria disponible. Para 24 mil millones de parámetros, se necesitan 16 GB.
- Modelos densos de 27 a 32 mil millones
- Qwen 3.8 27B y sus similares pesan 16 GB en Q4; busca 24 GB.
- MoE de 30 a 35 mil millones
- Qwen 3.6 35B-A3B pesa 21 GB, GLM 4.7 Flash 19 GB y Qwen3-Coder 30B-A3B 19 GB: quedan fuera de alcance con 12 GB, aunque solo lean 3 mil millones de parámetros activos, porque todo el modelo debe residir en memoria.
- Contexto largo en un 14B
- Un Qwen 3 14B en Q4 deja aproximadamente 2 GB: no cuentes con decenas de miles de tokens sin aplicar cuantización a la caché KV.
Ollama permite cuantizar la caché KV para ahorrar espacio: según su documentación, OLLAMA_KV_CACHE_TYPE=q8_0 utiliza aproximadamente la mitad de la memoria que el formato f16 predeterminado, siempre que Flash Attention esté activado. La guía sobre la caché KV detalla este ajuste, y la ventana de contexto predeterminada de Ollama, de 4 096 tokens, se modifica con OLLAMA_CONTEXT_LENGTH.
#12 GB o 16 GB: la opción adecuada para ti
| Tu necesidad | ¿Bastan 12 GB? | Por qué |
|---|---|---|
| Chat, traducción y resumen con un modelo de entre 9B y 14B | Sí | Q4 o Q5, con contexto |
| RAG ligero con un modelo de embeddings ejecutado en la CPU | Sí | LLM de 7 a 9 GB en GPU |
| Modelos de 20 a 24 mil millones (gpt-oss 20B, Mistral Small 24B) | No | Entre 13 y 14 GB de pesos en Q4 |
| Agentes de código con contexto largo | No | El contexto y los pesos superan los 12 GB |
| Presupuesto ajustado, uso ocasional | Sí | El coste adicional no aporta nada si los modelos de 20 a 24 mil millones no te sirven |
- ¿Qué LLM para 16 GB de VRAM?
- ¿Qué LLM para 8 GB de VRAM?
- LLM en RTX 3060 12 GB
- Cuantizar la caché KV para ahorrar VRAM
- RAG local: introducción
- Precios de las tarjetas gráficas para IA local
- Fuente: Preguntas frecuentes de Ollama (contexto, caché KV)
- Fuente: ficha NVIDIA de la familia RTX 4070
- Fuente: ficha NVIDIA de la familia RTX 5070
- Catálogo QuelLLM de modelos (tamaños en VRAM)
#Preguntas frecuentes
¿Cuál es el mejor LLM para 12 GB de VRAM?+
¿12 GB de VRAM son suficientes en 2026?+
¿Se puede ejecutar un 14B en 12 GB?+
¿12 GB o 16 GB para los LLM?+
¿Qué tarjeta de 12 GB elegir?+
¿Caben los modelos MoE de 30 mil millones en 12 GB?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.