Principiante 11 minRTX 30

Qué LLM usar en una RTX 3050 (6 / 8 GB) ?

Respuesta directa

Una RTX 3050 ejecuta sin problemas los pequeños modelos de 3 a 4 mil millones de parámetros en Q4, como Granite 4.1 3B (2 GB) o Qwen 3.5 4B (2,3 GB). Un modelo de 8B en Q4 (Granite 4.2 8B, 4,6 GB) cabe en la versión de 8 GB y va muy justo en la de 6 GB. La tabla pública de llama.cpp indica 37 tokens/s para la versión de 6 GB con un modelo de 7B en Q4_0.

La RTX 3050 existe en dos versiones de escritorio muy diferentes: la de 8 GB de 2022 y la de 6 GB de 2024, que tiene menos núcleos, un bus más estrecho y un consumo de 70 W. Esta guía separa lo medido de lo estimado, indica qué modelos caben en cada versión y explica cómo sacar el máximo partido a una tarjeta de 6 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#La RTX 3050 en 2026: qué puede ejecutar

Una RTX 3050 ejecuta con holgura modelos de 3 a 4 mil millones de parámetros con cuantización Q4. Según el catálogo QuelLLM, Granite 4.1 3B ocupa 2 GB y Qwen 3.5 4B, 2,3 GB: caben tanto en los 6 como en los 8 GB, con espacio para el contexto. Un modelo de 8 mil millones como Granite 4.2 8B (4,6 GB en Q4) cabe en la versión de 8 GB y va al límite en la de 6 GB, que solo expone 5 804 MiB a llama.cpp. Un 9B como Qwen 3.5 9B (6 GB de pesos) no cabe en ninguna de las dos sin desplazar parte del modelo a la RAM del sistema. En cuanto a velocidad, el único resultado público corresponde a una versión de 6 GB: 37 tokens por segundo con un modelo de 7 mil millones en Q4_0. Es aceptable para conversar, pero la tarjeta llega a su límite en cuanto aumenta el tamaño del modelo.

#RTX 3050 6 GB o 8 GB: dos tarjetas diferentes

NVIDIA vendió dos productos con el mismo nombre. Las mediciones no se pueden mezclar: la de 6 GB es más lenta a igualdad de memoria porque su bus de 96 bits limita el ancho de banda a 168 GB/s, frente a los 224 GB/s de la de 8 GB.

RTX 3050: las dos versiones
CriterioRTX 3050 8 GBRTX 3050 6 GB
Núcleos CUDA2 5602 304
Bus de memoria / ancho de banda128 bits / 224 GB/s96 bits / 168 GB/s
Potencia de la tarjeta130 W70 W
Fuente de alimentación del sistema recomendada por NVIDIA550 W300 W
Generación en Llama 2 7B Q4_0No publicada (estimada entre 45 y 50 tok/s)37,4 tok/s (medida publicada)

La cifra estimada para la versión de 8 GB se obtiene aplicando a los 224 GB/s la relación entre la medición y el máximo teórico de la versión de 6 GB, que alcanza aproximadamente el 85 % de lo que permite su ancho de banda. Es una proyección y no debe citarse como un resultado. Su consumo de 70 W hace que la versión de 6 GB sea interesante para un PC antiguo con una fuente de alimentación de capacidad limitada; además, la ficha de NVIDIA no indica ningún conector de alimentación adicional para esta versión.

#Modelos compatibles según la memoria

¿Qué modelos se pueden ejecutar en una RTX 3050 (peso según el catálogo QuelLLM)?
ModeloPeso en Q4RTX 3050 6 GBRTX 3050 8 GB
Granite 4.1 3B2 GBMuy cómodoMuy cómodo
Qwen 3.5 4B2,3 GB (Q8: 4,3 GB)Con margen en Q4, justo en Q8Con holgura, Q8 posible
Granite 4.2 8B4,6 GBLímite: contexto muy cortoCorrecto, contexto moderado
Qwen 3.5 9B6 GBNo cabeMuy justo, contexto corto

La regla a seguir es dejar al menos un gigabyte libre para el contexto y el sistema. En la tarjeta de 6 GB, la memoria realmente disponible para llama.cpp es de 5 804 MiB, es decir, algo menos de 5,7 GB: un modelo de 4,6 GB es, por tanto, viable, pero el contexto deberá mantenerse corto. En la tarjeta de 8 GB, el mismo modelo deja cerca de tres gigabytes de margen. La guía sobre los 6 GB de VRAM detalla los modelos que funcionan con holgura en esa capacidad.

#Velocidad: mediciones y estimaciones

En julio de 2026 se añadió a la tabla colaborativa de llama.cpp una medición realizada con una RTX 3050 de 6 GB: 37,39 tokens por segundo en generación con Llama 2 7B en Q4_0, un archivo de 3,56 GiB. Con Flash Attention, el valor pasa a 38,51. Este resultado merece dos lecturas. Primero, alcanza aproximadamente el 85 % de lo que permite el ancho de banda de 168 GB/s, lo que supone un buen rendimiento: la tarjeta está limitada por su memoria, no por sus núcleos. Segundo, la velocidad disminuye cuando la generación se alarga: baja a 33,52 tokens por segundo al generar 2 048 tokens, lo que representa aproximadamente un 10 % menos.

Se puede extrapolar a otros modelos mediante una regla de tres basada en el tamaño del archivo. Son límites superiores teóricos, calculados a partir de la medición de la versión de 6 GB, y no resultados publicados.

Estimación para la RTX 3050 de 6 GB (regla de tres a partir de la medición de 37,4 tok/s)
ModeloPeso en Q4Velocidad estimada
Granite 4.1 3B2 GBaproximadamente 70 tokens/s
Qwen 3.5 4B2,3 GBaproximadamente 60 tokens/s
Granite 4.2 8B4,6 GBaproximadamente 30 tokens/s

Como referencia, la RTX 3060 de 12 GB genera 75,6 tokens por segundo en la misma prueba: el doble que la 3050 de 6 GB. Con un modelo de 8 mil millones de parámetros, la diferencia se nota claramente, ya que la 3050 de 6 GB baja a unos 30 tokens por segundo según una estimación teórica, lo que sigue siendo legible, pero es más lento que la lectura.

#Consejos para aprovechar 6 GB

  1. 01
    Elegir un modelo de 4 mil millones o menos
    Qwen 3.5 4B o Granite 4.1 3B en Q4 dejan entre 3 y 4 GB de margen, lo que permite un contexto cómodo y una velocidad de generación claramente superior.
  2. 02
    Liberar la memoria de vídeo
    Cierra el navegador, los juegos y todo lo que use la tarjeta: con 6 GB, cada gigabyte ocupado por otra aplicación reduce la memoria disponible para el contexto.
  3. 03
    Cuantizar la caché K/V
    La documentación de Ollama especifica que la caché K/V se puede cuantizar cuando Flash Attention está activada. Define OLLAMA_FLASH_ATTENTION=1 y luego OLLAMA_KV_CACHE_TYPE=q8_0 antes de iniciar el servidor.
  4. 04
    Comprobar la carga
    Después de un primer prompt, ejecuta ollama ps: la columna Processor debe mostrar 100% GPU. De lo contrario, parte del modelo queda fuera de la VRAM y la velocidad se desploma.
Linux: caché K/V cuantizada
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#Identificar la versión que tienes

Ambas tarjetas llevan el mismo nombre y los anuncios de segunda mano no siempre especifican la memoria. Varios indicios permiten distinguirlas sin abrir el PC. La ficha de NVIDIA distingue la potencia de la tarjeta: 130 W para la versión de 8 GB, 70 W para la de 6 GB, con una fuente de alimentación recomendada para el sistema de 550 W frente a 300 W. Una tarjeta sin conector de alimentación externa es, por lo tanto, muy probablemente una de 6 GB, aunque algunos modelos de otros fabricantes pueden incluir uno. Una vez instalada la tarjeta, el comando nvidia-smi muestra la memoria total: un valor cercano a 6 000 MiB indica la versión de menor capacidad, y un valor próximo a 8 000 MiB, la de mayor capacidad. De hecho, la prueba de llama.cpp con la versión de 6 GB registró 5 804 MiB utilizables, un poco menos que la capacidad nominal.

Mostrar la memoria de la tarjeta
nvidia-smi --query-gpu=name,memory.total --format=csv

Esta comprobación evita una confusión costosa: pagar por una tarjeta de 8 GB y recibir una de 6 GB cambia lo que puedes ejecutar, ya que Granite 4.2 8B apenas resulta viable en esta última. Pide siempre una captura de nvidia-smi antes de comprar y rechaza el anuncio que no especifique la memoria. Haz lo mismo con una tarjeta ya instalada en un PC recuperado: el nombre que muestra Windows no basta para distinguir las dos versiones.

#El contexto: hasta dónde llegar con 6 GB

La tabla de llama.cpp muestra que la tasa de generación de la 3050 de 6 GB disminuye un 10 % entre 128 y 2.048 tokens generados. El segundo efecto afecta a la memoria: la caché de contexto consume VRAM en proporción a la longitud de la conversación. En una tarjeta de 6 GB con un modelo de 4 mil millones de parámetros en Q4 (2,3 GB), quedan más de 3 GB para la caché, lo que permite contextos de varios miles de tokens sin dificultad. Con un 8B de 4,6 GB, solo queda aproximadamente un gigabyte: el contexto se convierte en el factor limitante mucho antes que la velocidad.

Dos hábitos evitan malas sorpresas. Primero, limita deliberadamente la ventana de contexto a lo que necesitas, en lugar de dejar que un modelo que anuncia cientos de miles de tokens de contexto reserve una parte innecesaria. Después, si trabajas con documentos largos, divídelos: resumir tres textos de dos mil tokens consume menos memoria que resumir uno solo de seis mil. La guía sobre la ventana de contexto explica en detalle estos compromisos.

#¿Para qué sirve realmente una RTX 3050 para la IA local?

Con un modelo de 3 a 4 mil millones en Q4, basta para tareas específicas: resumir un texto, reformular, clasificar mensajes, responder preguntas simples sobre un documento corto o autocompletar código. No resulta adecuada para conversaciones largas con un modelo de 8B, para RAG con documentos voluminosos ni para tareas de razonamiento que requieren los modelos más capaces. La barrera no es solo la velocidad: los modelos pequeños cometen más errores y pierden el hilo más rápido. Por tanto, cuenta con tener que verificar sus respuestas en temas importantes y no les encargues decisiones con consecuencias importantes sin revisión humana.

Si buscas ante todo descubrir la IA local a bajo costo, esta tarjeta cumple esa función. Si quieres un asistente para el día a día, un 8B con 8 GB de memoria es el mínimo, y 12 GB ofrecen un margen que a menudo resulta asequible gracias a los precios de segunda mano.

#Veredicto 2026

Uso limitado a modelos pequeños
Con 6 GB, limítate a modelos de 4 mil millones de parámetros o menos. Con 8 GB, un modelo de 8B en Q4 funciona con un contexto moderado.
Opta por una tarjeta de 12 GB
La 3060 de 12 GB duplica la tasa de generación medida y permite usar modelos de 12 mil millones de parámetros. La diferencia de precio de segunda mano varía cada semana: consulta el seguimiento.
Al comprar
Elige la 3050 solo si ya está en tu PC o si tu presupuesto es muy ajustado. Comprueba la versión, de 6 u 8 GB: los anuncios no siempre lo especifican.

#Preguntas frecuentes

Preguntas frecuentes
¿Puede la RTX 3050 ejecutar un LLM?+
Sí, para modelos pequeños. Un modelo de 3 o 4B en Q4, como Granite 4.1 3B (2 GB) o Qwen 3.5 4B (2,3 GB), cabe con facilidad. La tabla pública de llama.cpp registra 37 tokens por segundo para la versión de 6 GB con un modelo de 7B en Q4_0. Los modelos de 8 mil millones de parámetros o más están al límite.
¿RTX 3050 de 6 GB o 8 GB para la IA local?+
Elige la de 8 GB si la diferencia de precio es razonable. La de 6 GB tiene 2.304 núcleos frente a 2.560, un bus de 96 bits frente a 128 y un ancho de banda de 168 GB/s frente a 224, lo que la hace más lenta con la misma cantidad de memoria. Su consumo de 70 W es, en cambio, una ventaja para un PC con una fuente de alimentación limitada.
¿Qué modelo elegir en una RTX 3050 de 6 GB?+
Un modelo de 4 mil millones o menos en Q4: Qwen 3.5 4B (2,3 GB) o Granite 4.1 3B (2 GB) dejan margen para el contexto. Granite 4.2 8B (4,6 GB) es posible, pero con un contexto corto, ya que la tarjeta solo ofrece 5.804 MiB de memoria. Qwen 3.5 9B (6 GB) no cabe.
¿Cuántos tokens por segundo en una RTX 3050?+
Para la versión de 6 GB, la tabla pública de llama.cpp indica 37,4 tokens por segundo con un modelo de 7B en Q4_0, y 33,5 con 2.048 tokens generados. Un modelo más ligero será más rápido: aproximadamente 60 tokens por segundo con un modelo de 4B, según una estimación teórica. No existen mediciones públicas para la versión de 8 GB.
¿RTX 3050 o RTX 3060 12 GB para un LLM?+
La 3060 12 GB, sin dudarlo si el presupuesto lo permite: genera 75,6 tokens por segundo frente a 37,4 de la 3050 6 GB en la misma prueba, y sus 12 GB permiten modelos de 12 mil millones. La 3050 solo tiene interés si ya está instalada o si el presupuesto es muy limitado.
¿Ollama funciona en una RTX 3050?+
Sí. Ollama incluye la RTX 3050 entre las tarjetas con capacidad de cálculo 8.6 y solo requiere un controlador 550 o más reciente. Después de la primera carga, comprueba con ollama ps que el modelo esté al 100 % en la GPU: con 6 GB, un modelo demasiado grande pasa rápidamente a ejecutarse en parte en la RAM.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.