¿Qué LLM para 6 GB de VRAM? ?
Con 6 GB de VRAM, un modelo de 4 mil millones de parámetros en Q4 o Q5 cabe holgadamente con un contexto de varios miles de tokens. Un 7-8B en Q4 (de 4,6 a 5,2 GB) todavía se puede cargar, pero sin margen: el contexto y la memoria reservada por el controlador hacen que parte del modelo pase a ejecutarse en el procesador. Otro punto que sorprende: en las tarjetas de 6 GB, es el ancho de banda de la memoria, no su capacidad, lo que determina la velocidad, y puede variar hasta el doble.
Los 6 GB son la capacidad de memoria de la GTX 1660, la RTX 2060 y la RTX 3050 de 6 GB. Bastan para un verdadero asistente local, siempre que elijas el modelo adecuado y tengas en cuenta la memoria utilizada por otros componentes además del modelo. Esta página indica qué modelos caben, qué tarjeta de 6 GB es más rápida que otra, cómo comprobar que un modelo se mantiene en la tarjeta y qué cambiaría con 12 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para pasar a 16 GB de VRAM: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#Lo que permiten 6 GB: el cálculo completo de memoria
La VRAM no contiene solo los pesos. También aloja la caché de contexto, que crece con la conversación, los búferes de cálculo del motor y, en Windows, parte de los recursos destinados a la visualización y al navegador. En una tarjeta de 6 GB, se puede contar con unos 5 a 5,5 GB para el modelo y su caché; el resto lo ocupa el sistema. La referencia del sitio para los pesos en Q4 es 3B ≈ 2 GB, 7-8B ≈ 5 GB.
| Modelo | Pesos Q4 | Margen disponible de los 5,5 GB | Veredicto |
|---|---|---|---|
| Gemma 4 2B | 1,2 GB | 4,3 GB | Margen muy amplio, respuestas cortas y rápidas |
| Qwen 3.5 4B | 2,3 GB | 3,2 GB | Uso cómodo, contexto de varios miles de tokens |
| Phi-4 Mini 3.8B | 3 GB | 2,5 GB | Cómodo |
| Granite 4.2 8B | 4,6 GB | 0,9 GB | Muy justo: contexto muy corto |
| Qwen 3 8B (Ollama) | 5,2 GB | 0,3 GB | Supera la memoria disponible en cuanto se alarga el contexto |
| Qwen 3.5 9B | 6 GB | negativo | No cabe |
Los tamaños provienen del catálogo QuelLLM y de la biblioteca Ollama. La columna «margen» es una estimación: supone 5,5 GB utilizables, lo que depende de tu sistema y de tus aplicaciones. Por tanto, un modelo de 8B es posible sobre el papel, pero te deja menos de un gigabyte para la caché: el ajuste del contexto determina si la experiencia es fluida o si algunas capas pasan a ejecutarse en el procesador.
#Tres tarjetas de 6 GB, tres velocidades: el ancho de banda
La velocidad de generación está limitada por el ancho de banda de la memoria, dividido por el tamaño de los pesos leídos en cada token. Por tanto, dos tarjetas de 6 GB no son equivalentes. Según la tabla de Wikipedia sobre la generación GeForce 20, la RTX 2060 6 GB ofrece 336 GB/s en un bus de 192 bits. La RTX 3050 6 GB, más reciente, solo tiene un bus de 96 bits (NVIDIA) y 168 GB/s según la misma enciclopedia: la mitad.
| Tarjeta de 6 GB | Ancho de banda | Modelo de 2,3 GB (4B Q4) | Modelo de 4,6 GB (8B Q4) |
|---|---|---|---|
| RTX 2060 6 GB | 336 GB/s | aproximadamente 146 t/s | aproximadamente 73 t/s |
| RTX 3050 6 GB | 168 GB/s | aproximadamente 73 t/s | aproximadamente 37 t/s |
Estos límites nunca se alcanzan, y no tenemos una medida que citar para estas tarjetas: el porcentaje real depende del motor, del contexto y de la tarjeta. Pero la relación de 2 a 1 se mantiene. Para la IA local, una RTX 2060 de segunda mano es así más rápida que una RTX 3050 de 6 GB nueva aunque sea más antigua, y la nueva tarjeta solo tiene ventaja en eficiencia energética y funciones recientes. Para las GTX 1660, la variante cuenta: verifica la referencia exacta, ya que la memoria y el bus varían según el modelo.
- ¿Qué LLM usar en una RTX 2060?
- ¿Qué LLM usar en una RTX 3050?
- ¿Qué LLM usar en una GTX 1650 / 1660?
- ¿Qué LLM en GTX 1060?
#El modelo adecuado para cada uso con 6 GB
- Chat, preguntas, redacción
- Un modelo de 3 a 4B como Qwen 3.5 4B o Phi-4 Mini: respuestas correctas y rápidas, contexto cómodo. Para una calidad de francés superior, prueba el 8B en Q4 con un contexto reducido.
- Código
- Un pequeño modelo de código de 3 a 7B para el autocompletado, un modelo generalista de 4B para explicar. No esperes un agente de código fiable de ese tamaño.
- RAG y documentos
- Un modelo de 4B y un modelo de embedding ligero: todo cabe en memoria. El contexto es el factor limitante: envía fragmentos cortos.
- Visión y audio
- Los modelos multimodales ligeros existen, pero el codificador de imágenes consume memoria además del modelo: prueba con un modelo de 2 a 4B.
Una trampa frecuente: los MoE como Qwen3-Coder 30B-A3B solo activan 3 mil millones de parámetros, lo que lleva a creer que cabrían en 6 GB. No es así: todos los expertos deben estar en memoria y el archivo ocupa 19 GB. La única forma de usarlos es mantener los expertos en el procesador, lo que exige mucha memoria RAM y reduce mucho la velocidad. La guía sobre los MoE explica el principio.
#El modo híbrido de GPU y procesador: útil, pero no mágico
Cuando un modelo supera la capacidad de la tarjeta, Ollama y llama.cpp pueden colocar parte de las capas en el procesador. Esto permite cargar un 9B en 6 GB, pero la velocidad cae por escalones: las capas que permanecen en la RAM se leen a la velocidad de la memoria del sistema, una fracción de la velocidad de la tarjeta. Para los MoE, llama.cpp ofrece una opción, --n-cpu-moe, que mantiene en el procesador los expertos de ciertas capas y deja en la tarjeta lo que suele concentrar la mayor carga. Un usuario del repositorio llama.cpp informa de aproximadamente 20 tokens por segundo con gpt-oss-20b y todos los expertos en el procesador, en una máquina con DDR4-3200 de doble canal, mientras libera la mayor parte de la VRAM.
Este testimonio demuestra que el enfoque funciona, no que se adapte a tu máquina. Requiere 32 GB de memoria RAM para un modelo de este tamaño, y su velocidad depende del ancho de banda de esta memoria. Para un uso habitual con 6 GB, un modelo de 4B alojado íntegramente en la tarjeta sigue siendo más sencillo y más rápido.
#Cinco ajustes que importan con 6 GB
- 01Limitar el contextoLa FAQ de Ollama indica una ventana por defecto de 4.096 tokens, ajustable. Con 6 GB, auméntala por etapas (6.000, 8.000) y vigila la memoria: cada incremento añade más caché.
- 02Cuantizar la caché K/VCon Flash Attention activado, OLLAMA_KV_CACHE_TYPE=q8_0 reduce aproximadamente a la mitad la memoria de la caché en comparación con f16, según las preguntas frecuentes de Ollama. Es la primera medida para ganar margen.
- 03Cerrar lo que consume VRAMUn navegador con aceleración por hardware, un juego, un programa de edición de vídeo: cada uno consume memoria. Con 6 GB, un solo uso de la GPU a la vez.
- 04Verificar con ollama psLa columna Processor indica dónde se ha cargado el modelo: el objetivo es 100 % GPU. Cualquier reparto entre CPU y GPU indica un desbordamiento y una velocidad más baja.
- 05Elegir la cuantizaciónQ4_K_M es un buen equilibrio; en un 4B, puedes subir a Q5 o Q6 para mejorar la calidad, ya que hay margen. La guía de cuantización detalla las diferencias.
Estas variables se definen en el entorno del servicio Ollama (systemd en Linux, variables del sistema en Windows, launchctl en macOS). La guía de solución de errores de GPU de Ollama detalla qué hay que revisar cuando un modelo no se carga en la tarjeta.
- Cuantizar la caché KV
- Elegir tu cuantización
- Solucionar errores de GPU de Ollama
- Explicación de los modelos MoE
#Diagnóstico: por qué la generación se ralentiza en una tarjeta de 6 GB
En una tarjeta de 6 GB, una ralentización brusca casi siempre tiene la misma causa: una parte del modelo o de la caché ha salido de la tarjeta. La tabla siguiente relaciona el síntoma observado con la causa probable y con la medida que conviene probar primero.
| Síntoma | Causa probable | A probar |
|---|---|---|
| Respuestas fluidas al principio, muy lentas después de unos pocos intercambios | El caché de contexto ha llenado la VRAM y algunas capas pasan al procesador | Reducir el contexto, cuantizar la caché en q8_0, reiniciar la conversación |
| El modelo se carga, pero ollama ps muestra una distribución CPU/GPU | El modelo y su contexto superan la memoria disponible | Elegir un modelo más pequeño o una cuantización más ligera |
| Velocidad dividida por dos después de abrir un navegador o un juego | Estas aplicaciones ocupan VRAM | Desactivar la aceleración por hardware del navegador; usar la GPU para una sola tarea a la vez |
| Mensaje de error de memoria al cargar | El controlador reserva memoria y el modelo no cabe | Verificar el controlador, liberar la tarjeta, probar un modelo de 4B |
| Velocidad decepcionante en una tarjeta reciente con un bus estrecho | El ancho de banda es bajo (RTX 3050 6 GB: bus de 96 bits) | Elegir un modelo más pequeño en lugar de esperar una mejora del software |
Un último punto sobre la calidad: cuanto más pequeño es un modelo, más errores comete en tareas que requieren conocimientos precisos o un razonamiento prolongado. Con 6 GB, es mejor usar el modelo para lo que hace bien (reformular, resumir un texto proporcionado, responder a partir de fragmentos que le das, clasificar, extraer campos) que para responder de memoria a preguntas factuales. Proporcionar el texto fuente en la conversación, en lugar de depender de lo que el modelo «sabe», es la práctica que da mejores resultados con un modelo pequeño y sigue siendo compatible con un contexto corto.
#Pasar a 8 o 12 GB: lo que cada nivel desbloquea
El salto más rentable es pasar de 6 a 12 GB. Con 12 GB, un 8-9B en Q4 (5 a 6 GB) cabe con un contexto largo, y un 14B en Q4 (alrededor de 9 GB) se vuelve posible. Con 8 GB, un 8B por fin cabe con margen, pero un 14B sigue fuera de alcance. No busques un precio en esta página: cambian cada semana, y el seguimiento del sitio registra el más bajo para cada tarjeta.
| VRAM | Modelos que funcionan con holgura | Lo que cambia |
|---|---|---|
| 6 GB | 3-4B, 8B con contexto corto | Un asistente local aceptable |
| 8 GB | 8B con contexto medio | Más margen, Q5 posible |
| 12 GB | 8-9B con contexto largo, 14B en Q4 | Una experiencia realmente cómoda para el chat y el RAG |
| 16 GB | 14B en Q5, 24B en Q3-Q4 con poco margen | Modelos de mayor calidad |
- Seguimiento de precios de tarjetas gráficas para IA local
- ¿Qué LLM para 8 GB de VRAM?
- ¿Qué LLM para 12 GB de VRAM?
- Fuente: biblioteca Ollama, Qwen3
- Fuente: FAQ oficial de Ollama
- Fuente: discusión de llama.cpp sobre gpt-oss y --n-cpu-moe
#Preguntas frecuentes
¿Cuál es el mejor LLM para 6 GB de VRAM?+
¿Qué velocidad se puede esperar con 6 GB de VRAM?+
¿Se puede ejecutar Qwen 3.5 9B en 6 GB?+
¿RTX 2060 6 GB o RTX 3050 6 GB para la IA local?+
¿Son 6 GB suficientes para un RAG local?+
¿Puede un modelo MoE de 30B funcionar con 6 GB?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.