Principiante 11 minPor VRAM

¿Qué LLM para 6 GB de VRAM? ?

Respuesta directa

Con 6 GB de VRAM, un modelo de 4 mil millones de parámetros en Q4 o Q5 cabe holgadamente con un contexto de varios miles de tokens. Un 7-8B en Q4 (de 4,6 a 5,2 GB) todavía se puede cargar, pero sin margen: el contexto y la memoria reservada por el controlador hacen que parte del modelo pase a ejecutarse en el procesador. Otro punto que sorprende: en las tarjetas de 6 GB, es el ancho de banda de la memoria, no su capacidad, lo que determina la velocidad, y puede variar hasta el doble.

Los 6 GB son la capacidad de memoria de la GTX 1660, la RTX 2060 y la RTX 3050 de 6 GB. Bastan para un verdadero asistente local, siempre que elijas el modelo adecuado y tengas en cuenta la memoria utilizada por otros componentes además del modelo. Esta página indica qué modelos caben, qué tarjeta de 6 GB es más rápida que otra, cómo comprobar que un modelo se mantiene en la tarjeta y qué cambiaría con 12 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Para pasar a 16 GB de VRAM: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#Lo que permiten 6 GB: el cálculo completo de memoria

La VRAM no contiene solo los pesos. También aloja la caché de contexto, que crece con la conversación, los búferes de cálculo del motor y, en Windows, parte de los recursos destinados a la visualización y al navegador. En una tarjeta de 6 GB, se puede contar con unos 5 a 5,5 GB para el modelo y su caché; el resto lo ocupa el sistema. La referencia del sitio para los pesos en Q4 es 3B ≈ 2 GB, 7-8B ≈ 5 GB.

Lo que cabe en 6 GB (peso en Q4, sin contar el contexto)
ModeloPesos Q4Margen disponible de los 5,5 GBVeredicto
Gemma 4 2B1,2 GB4,3 GBMargen muy amplio, respuestas cortas y rápidas
Qwen 3.5 4B2,3 GB3,2 GBUso cómodo, contexto de varios miles de tokens
Phi-4 Mini 3.8B3 GB2,5 GBCómodo
Granite 4.2 8B4,6 GB0,9 GBMuy justo: contexto muy corto
Qwen 3 8B (Ollama)5,2 GB0,3 GBSupera la memoria disponible en cuanto se alarga el contexto
Qwen 3.5 9B6 GBnegativoNo cabe

Los tamaños provienen del catálogo QuelLLM y de la biblioteca Ollama. La columna «margen» es una estimación: supone 5,5 GB utilizables, lo que depende de tu sistema y de tus aplicaciones. Por tanto, un modelo de 8B es posible sobre el papel, pero te deja menos de un gigabyte para la caché: el ajuste del contexto determina si la experiencia es fluida o si algunas capas pasan a ejecutarse en el procesador.

#Tres tarjetas de 6 GB, tres velocidades: el ancho de banda

La velocidad de generación está limitada por el ancho de banda de la memoria, dividido por el tamaño de los pesos leídos en cada token. Por tanto, dos tarjetas de 6 GB no son equivalentes. Según la tabla de Wikipedia sobre la generación GeForce 20, la RTX 2060 6 GB ofrece 336 GB/s en un bus de 192 bits. La RTX 3050 6 GB, más reciente, solo tiene un bus de 96 bits (NVIDIA) y 168 GB/s según la misma enciclopedia: la mitad.

Límite teórico de generación según la tarjeta (ancho de banda ÷ peso)
Tarjeta de 6 GBAncho de bandaModelo de 2,3 GB (4B Q4)Modelo de 4,6 GB (8B Q4)
RTX 2060 6 GB336 GB/saproximadamente 146 t/saproximadamente 73 t/s
RTX 3050 6 GB168 GB/saproximadamente 73 t/saproximadamente 37 t/s

Estos límites nunca se alcanzan, y no tenemos una medida que citar para estas tarjetas: el porcentaje real depende del motor, del contexto y de la tarjeta. Pero la relación de 2 a 1 se mantiene. Para la IA local, una RTX 2060 de segunda mano es así más rápida que una RTX 3050 de 6 GB nueva aunque sea más antigua, y la nueva tarjeta solo tiene ventaja en eficiencia energética y funciones recientes. Para las GTX 1660, la variante cuenta: verifica la referencia exacta, ya que la memoria y el bus varían según el modelo.

#El modelo adecuado para cada uso con 6 GB

Chat, preguntas, redacción
Un modelo de 3 a 4B como Qwen 3.5 4B o Phi-4 Mini: respuestas correctas y rápidas, contexto cómodo. Para una calidad de francés superior, prueba el 8B en Q4 con un contexto reducido.
Código
Un pequeño modelo de código de 3 a 7B para el autocompletado, un modelo generalista de 4B para explicar. No esperes un agente de código fiable de ese tamaño.
RAG y documentos
Un modelo de 4B y un modelo de embedding ligero: todo cabe en memoria. El contexto es el factor limitante: envía fragmentos cortos.
Visión y audio
Los modelos multimodales ligeros existen, pero el codificador de imágenes consume memoria además del modelo: prueba con un modelo de 2 a 4B.

Una trampa frecuente: los MoE como Qwen3-Coder 30B-A3B solo activan 3 mil millones de parámetros, lo que lleva a creer que cabrían en 6 GB. No es así: todos los expertos deben estar en memoria y el archivo ocupa 19 GB. La única forma de usarlos es mantener los expertos en el procesador, lo que exige mucha memoria RAM y reduce mucho la velocidad. La guía sobre los MoE explica el principio.

#El modo híbrido de GPU y procesador: útil, pero no mágico

Cuando un modelo supera la capacidad de la tarjeta, Ollama y llama.cpp pueden colocar parte de las capas en el procesador. Esto permite cargar un 9B en 6 GB, pero la velocidad cae por escalones: las capas que permanecen en la RAM se leen a la velocidad de la memoria del sistema, una fracción de la velocidad de la tarjeta. Para los MoE, llama.cpp ofrece una opción, --n-cpu-moe, que mantiene en el procesador los expertos de ciertas capas y deja en la tarjeta lo que suele concentrar la mayor carga. Un usuario del repositorio llama.cpp informa de aproximadamente 20 tokens por segundo con gpt-oss-20b y todos los expertos en el procesador, en una máquina con DDR4-3200 de doble canal, mientras libera la mayor parte de la VRAM.

Este testimonio demuestra que el enfoque funciona, no que se adapte a tu máquina. Requiere 32 GB de memoria RAM para un modelo de este tamaño, y su velocidad depende del ancho de banda de esta memoria. Para un uso habitual con 6 GB, un modelo de 4B alojado íntegramente en la tarjeta sigue siendo más sencillo y más rápido.

#Cinco ajustes que importan con 6 GB

  1. 01
    Limitar el contexto
    La FAQ de Ollama indica una ventana por defecto de 4.096 tokens, ajustable. Con 6 GB, auméntala por etapas (6.000, 8.000) y vigila la memoria: cada incremento añade más caché.
  2. 02
    Cuantizar la caché K/V
    Con Flash Attention activado, OLLAMA_KV_CACHE_TYPE=q8_0 reduce aproximadamente a la mitad la memoria de la caché en comparación con f16, según las preguntas frecuentes de Ollama. Es la primera medida para ganar margen.
  3. 03
    Cerrar lo que consume VRAM
    Un navegador con aceleración por hardware, un juego, un programa de edición de vídeo: cada uno consume memoria. Con 6 GB, un solo uso de la GPU a la vez.
  4. 04
    Verificar con ollama ps
    La columna Processor indica dónde se ha cargado el modelo: el objetivo es 100 % GPU. Cualquier reparto entre CPU y GPU indica un desbordamiento y una velocidad más baja.
  5. 05
    Elegir la cuantización
    Q4_K_M es un buen equilibrio; en un 4B, puedes subir a Q5 o Q6 para mejorar la calidad, ya que hay margen. La guía de cuantización detalla las diferencias.
Ajustes para una tarjeta de 6 GB (configurarlos y después reiniciar Ollama)
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q8_0
OLLAMA_CONTEXT_LENGTH=6144

Estas variables se definen en el entorno del servicio Ollama (systemd en Linux, variables del sistema en Windows, launchctl en macOS). La guía de solución de errores de GPU de Ollama detalla qué hay que revisar cuando un modelo no se carga en la tarjeta.

#Diagnóstico: por qué la generación se ralentiza en una tarjeta de 6 GB

En una tarjeta de 6 GB, una ralentización brusca casi siempre tiene la misma causa: una parte del modelo o de la caché ha salido de la tarjeta. La tabla siguiente relaciona el síntoma observado con la causa probable y con la medida que conviene probar primero.

Síntomas comunes y soluciones
SíntomaCausa probableA probar
Respuestas fluidas al principio, muy lentas después de unos pocos intercambiosEl caché de contexto ha llenado la VRAM y algunas capas pasan al procesadorReducir el contexto, cuantizar la caché en q8_0, reiniciar la conversación
El modelo se carga, pero ollama ps muestra una distribución CPU/GPUEl modelo y su contexto superan la memoria disponibleElegir un modelo más pequeño o una cuantización más ligera
Velocidad dividida por dos después de abrir un navegador o un juegoEstas aplicaciones ocupan VRAMDesactivar la aceleración por hardware del navegador; usar la GPU para una sola tarea a la vez
Mensaje de error de memoria al cargarEl controlador reserva memoria y el modelo no cabeVerificar el controlador, liberar la tarjeta, probar un modelo de 4B
Velocidad decepcionante en una tarjeta reciente con un bus estrechoEl ancho de banda es bajo (RTX 3050 6 GB: bus de 96 bits)Elegir un modelo más pequeño en lugar de esperar una mejora del software

Un último punto sobre la calidad: cuanto más pequeño es un modelo, más errores comete en tareas que requieren conocimientos precisos o un razonamiento prolongado. Con 6 GB, es mejor usar el modelo para lo que hace bien (reformular, resumir un texto proporcionado, responder a partir de fragmentos que le das, clasificar, extraer campos) que para responder de memoria a preguntas factuales. Proporcionar el texto fuente en la conversación, en lugar de depender de lo que el modelo «sabe», es la práctica que da mejores resultados con un modelo pequeño y sigue siendo compatible con un contexto corto.

#Pasar a 8 o 12 GB: lo que cada nivel desbloquea

El salto más rentable es pasar de 6 a 12 GB. Con 12 GB, un 8-9B en Q4 (5 a 6 GB) cabe con un contexto largo, y un 14B en Q4 (alrededor de 9 GB) se vuelve posible. Con 8 GB, un 8B por fin cabe con margen, pero un 14B sigue fuera de alcance. No busques un precio en esta página: cambian cada semana, y el seguimiento del sitio registra el más bajo para cada tarjeta.

Lo que permite cada nivel de VRAM
VRAMModelos que funcionan con holguraLo que cambia
6 GB3-4B, 8B con contexto cortoUn asistente local aceptable
8 GB8B con contexto medioMás margen, Q5 posible
12 GB8-9B con contexto largo, 14B en Q4Una experiencia realmente cómoda para el chat y el RAG
16 GB14B en Q5, 24B en Q3-Q4 con poco margenModelos de mayor calidad

#Preguntas frecuentes

FAQ
¿Cuál es el mejor LLM para 6 GB de VRAM?+
Un modelo de 3 a 4 mil millones de parámetros en Q4 o Q5, como Qwen 3.5 4B (2,3 GB) o Phi-4 Mini: cabe con un contexto amplio. Un 8B en Q4 (Granite 4.2 8B, 4,6 GB) es posible con un contexto muy corto, con el riesgo de que parte de la ejecución pase al procesador.
¿Qué velocidad se puede esperar con 6 GB de VRAM?+
Depende principalmente del ancho de banda de la tarjeta: 336 GB/s para una RTX 2060, 168 GB/s para una RTX 3050 de 6 GB. Un modelo de 2,3 GB tiene un límite teórico de 146 t/s en la primera y 73 t/s en la segunda; las velocidades reales son más bajas. No tenemos mediciones que citar.
¿Se puede ejecutar Qwen 3.5 9B en 6 GB?+
No cabe por completo en la tarjeta: pesa aproximadamente 6 GB en Q4 en el catálogo QuelLLM, es decir, ocupa toda la memoria de la tarjeta sin dejar espacio para la caché. En modo híbrido entre GPU y procesador, se carga, pero funciona lentamente. Un modelo de 4B o de 8B con un contexto corto es una mejor opción.
¿RTX 2060 6 GB o RTX 3050 6 GB para la IA local?+
La RTX 2060: su ancho de banda de 336 GB/s es el doble del de la RTX 3050 6 GB (168 GB/s), y ese ancho de banda determina la velocidad de generación. La RTX 3050 6 GB solo la supera por su consumo y la generación de su arquitectura, no por su rendimiento.
¿Son 6 GB suficientes para un RAG local?+
Sí, para un RAG sencillo: un modelo de embedding ligero y un modelo de 4B caben juntos en la memoria. El factor limitante es la longitud del contexto, que crece con el número de fragmentos enviados al modelo. Limítalos a unos pocos fragmentos cortos y cuantiza la caché K/V.
¿Puede un modelo MoE de 30B funcionar con 6 GB?+
Solo manteniendo los expertos en el procesador, y en ese caso hace falta mucha memoria RAM: el archivo de Qwen3-Coder 30B-A3B pesa 19 GB. A pesar de sus 3 mil millones de parámetros activos, no cabe en la tarjeta. Es una opción avanzada, no la configuración predeterminada.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.