Principiante 11 minRTX 30

¿Qué LLM en RTX 3070 / 3070 Ti (8 GB)? ?

Respuesta directa

Una RTX 3070 o 3070 Ti ofrece 8 GB de VRAM: mantiene en VRAM los modelos de hasta 8 a 9 mil millones de parámetros en Q4 (Granite 4.2 8B ocupa 5,3 GB y Qwen 3.5 9B, 6,6 GB), pero no los de 12 mil millones o más. La 3070 Ti, con 608 GB/s frente a 448, genera más rápido con la misma capacidad. No hay mediciones publicadas: las velocidades de generación son estimaciones.

Con 8 GB, la RTX 3070 y la 3070 Ti siguen siendo tarjetas adecuadas para un modelo de 8 mil millones de parámetros, pero la capacidad es su límite. Esta guía presenta los modelos que realmente caben, con su tamaño exacto, velocidades estimadas a partir del ancho de banda, los límites del contexto y la diferencia con las tarjetas de gamas cercanas. También sabrás cuándo pasar a 12 o 16 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 3070 y 3070 Ti para un LLM local: lo que permiten 8 GB

Para un LLM local, una RTX 3070 o una 3070 Ti vale por sus 8 GB de VRAM, y esta capacidad fija todo: los modelos hasta 8 a 9 mil millones de parámetros en Q4 caben, los de 12 mil millones o más no. Según la biblioteca Ollama, Granite 4.2 8B pesa 5,3 GB, Qwen3 8B 5,2 GB y Qwen 3.5 9B 6,6 GB; Qwen3 14B (9,3 GB) y gpt-oss 20B (14 GB) superan la tarjeta. La 3070 Ti, a 608 GB/s contra 448 para la 3070, genera más rápido pero con la misma capacidad.

Memoria
8 GB en un bus de 256 bits: GDDR6 a 448 GB/s para la 3070, GDDR6X a 608 GB/s para la 3070 Ti, según la tabla de Wikipedia y NVIDIA.
Cálculo
5 888 núcleos CUDA para la 3070 y 6 144 para la 3070 Ti, según Wikipedia.
Consumo
220 W de potencia gráfica y una fuente de alimentación de 650 W requerida para la 3070; 290 W y 750 W para la 3070 Ti, según NVIDIA. Es más que los 550 W que a veces se citan.

#Los modelos que caben en 8 GB

Los pesos corresponden a los archivos de la biblioteca Ollama, consultados el 29 de septiembre de 2026. El margen es lo que queda de los 8 GB antes de contar el contexto, la caché y los búferes del motor; también debe cubrir la visualización si la tarjeta controla tu pantalla.

Modelos para RTX 3070 / 3070 Ti (archivos Ollama, Q4 a menos que se indique)
ModeloArchivo OllamaMargen brutoVeredicto
Qwen 3.5 4B3,4 GB4,6 GBMuy cómodo, contexto largo posible
Qwen3 8B5,2 GB2,8 GBCómodo
Granite 4.2 8B5,3 GB2,7 GBCómodo
Qwen 3.5 9B6,6 GB1,4 GBCabe, pero hay que limitar el contexto
Gemma 4 12B7,6 GB0,4 GBSin margen: no hay contexto útil
Qwen3 14B9,3 GBFaltan 1,3 GBNo cabe
gpt-oss 20B14 GBFaltan 6 GBNo cabe

El punto de partida más seguro es un modelo de 8 mil millones: Granite 4.2 8B o Qwen3 8B dejan cerca de 3 GB para el contexto. Qwen 3.5 9B es el límite superior en la práctica: 1,4 GB de margen son suficientes para una conversación corta, no para un documento largo. Un RAG local añade un modelo de embeddings: bge-m3 pesa 1,2 GB en Ollama, lo que suma 6,5 GB en total con Granite 4.2 8B, y quedan 1,5 GB para el resto.

#Instalar Ollama en una RTX 3070

  1. 01
    Verificar el controlador
    Ejecuta nvidia-smi en un terminal: el controlador debe estar en versión 550 o superior (551.61 en Windows) y la memoria total debe mostrar aproximadamente 8 GB.
  2. 02
    Instalar Ollama
    Instala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
  3. 03
    Ejecutar un modelo
    Ejecuta ollama run granite4.2:8b: la descarga de 5,3 GB se realiza una sola vez.
  4. 04
    Controlar la distribución
    En un segundo terminal, ejecuta ollama ps: la columna Processeur debe mostrar 100 % GPU. Una distribución CPU/GPU significa que parte del modelo o del contexto se carga en la memoria RAM.
  5. 05
    Ajustar el contexto
    Fija el contexto con OLLAMA_CONTEXT_LENGTH y luego vuelve a ejecutar ollama ps. Establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar el servidor para ahorrar VRAM.
Comandos básicos
ollama run granite4.2:8b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Velocidades: lo que cabe esperar del ancho de banda

Ningún sitio de referencia de pruebas de rendimiento publica mediciones para la RTX 3070: los valores que figuran a continuación son, por tanto, estimaciones, no mediciones. El método se basa en el hecho de que la generación está limitada por el ancho de banda: el límite máximo teórico equivale aproximadamente al ancho de banda dividido por el tamaño del modelo. Para Granite 4.2 8B (5,3 GB), 448 ÷ 5,3 da 85 tokens por segundo en la 3070 y 608 ÷ 5,3 da 115 en la 3070 Ti. Para Qwen 3.5 9B (6,6 GB), los límites máximos son 68 y 92.

La clasificación comunitaria de llama.cpp permite convertir estos límites en órdenes de magnitud. Con Llama 2 7B Q4_0, una RTX 3060 Ti de 8 GB, tarjeta con bus de 256 bits similar a la 3070, genera 92,23 tokens por segundo sin Flash Attention y 96,50 con ella. Una RTX 3060 de 12 GB, con un ancho de banda de 360 GB/s, genera 75,57 y 76,92: la relación (1,22) sigue la de los anchos de banda (448 ÷ 360 = 1,24). Una 3070 debería, por tanto, ofrecer velocidades similares a las de la 3060 Ti, alrededor de 90 a 95 tokens por segundo con un 7B, y una 3070 Ti aproximadamente un 35 % más, es decir, de 120 a 130. Son estimaciones.

Estimación de la generación, en tokens por segundo (límite máximo teórico, RTX 3070 / 3070 Ti)
ModeloArchivo OllamaLímite 3070 (448 GB/s)Límite 3070 Ti (608 GB/s)
Qwen 3.5 4B3,4 GB132179
Granite 4.2 8B5,3 GB85115
Qwen 3.5 9B6,6 GB6892
Gemma 4 12B7,6 GB5980

Las tasas reales de generación rondan el 70 al 80 % de estos límites en las tarjetas medidas en otras fuentes: calcula, por tanto, entre 55 y 65 tokens por segundo para Granite 4.2 8B en una 3070. Sea cual sea el valor exacto, estas velocidades superan la velocidad de lectura humana: la limitación de la 3070 es la capacidad, no la velocidad.

#Los límites de los 8 GB: contexto, RAG y grandes modelos

Ollama ajusta el contexto por defecto según la memoria de vídeo: su documentación indica 4k tokens con menos de 24 GiB de VRAM y recomienda al menos 64.000 tokens para agentes, búsqueda web y herramientas de código. Con 8 GB, intentar alcanzar 64.000 tokens con un modelo de 8 mil millones de parámetros no es realista: la caché KV, que almacena las claves y los valores de atención de cada token, consume el margen disponible. Según las preguntas frecuentes de Ollama, la cuantización q8_0 de la caché reduce su consumo de memoria a aproximadamente la mitad del de f16, con una pérdida de precisión muy pequeña: es el primer ajuste que hay que activar.

Modelos de 12 a 24 mil millones
Gemma 4 12B (7,6 GB) no deja espacio para el contexto; Qwen3 14B (9,3 GB) y gpt-oss 20B (14 GB) no caben. Parte de estos modelos pasa a la memoria RAM y la velocidad cae.
Contexto largo
Con Qwen 3.5 9B, los 1,4 GB de margen se agotan rápidamente: mantén un contexto de unos pocos miles de tokens y vigila ollama ps.
RAG en múltiples etapas
Granite 4.2 8B y bge-m3 ocupan 6,5 GB: añadir un reranker o un segundo modelo supera la memoria disponible.
Fine-tuning
Según Unsloth, el mínimo absoluto en QLoRA 4 bits es de 3,5 GB para 3 mil millones y de 6 GB para 8 mil millones: un modelo de 8B apenas cabe, con un lote de 1 y un contexto corto.

Un método sencillo para mantenerse por debajo de los 8 GB consiste en tres ajustes. Primero, elige un modelo cuyo archivo deje al menos 2 GB de margen: Granite 4.2 8B o Qwen3 8B. Después, activa la caché cuantizada en q8_0 y Flash Attention, que el repositorio oficial de Flash Attention indica que es compatible con las GPU Ampere como la 3070. Por último, aumenta el contexto por etapas, de 4.000 a 8.000 y luego a 16.000 tokens, volviendo a ejecutar ollama ps en cada etapa: en cuanto aparezca una parte de la carga en la CPU, vuelve al nivel anterior. Esta progresión evita descubrir el límite en plena conversación.

#3070 frente a otras tarjetas de 8 a 16 GB

Tarjetas similares para un LLM local (NVIDIA, Hardware Corner)
TarjetaMemoriaAncho de bandaLo que cambia
RTX 30708 GB GDDR6448 GB/sModelos de 8 a 9 mil millones
RTX 3070 Ti8 GB GDDR6X608 GB/sMisma capacidad, generación más rápida
RTX 3060 12 GB12 GB GDDR6360 GB/sAñade modelos de 12 a 14 mil millones
RTX 4060 Ti 16 GB16 GB288 GB/sPermite usar también gpt-oss 20B, pero es más lenta

Esta tabla pone de manifiesto el compromiso entre capacidad y velocidad. La 3060 de 12 GB tiene un ancho de banda un 20 % menor que la 3070, pero 4 GB más: admite Qwen3 14B (9,3 GB), que no cabe en la 3070. La 4060 Ti de 16 GB añade la categoría de modelos de 20 mil millones de parámetros, con un ancho de banda de 288 GB/s que la hace más lenta con los modelos pequeños. Para un LLM, la capacidad prima sobre la velocidad cuando el modelo que quieres ejecutar supera los 7,5 GB.

#Veredicto: mantener, reemplazar o no comprar

Qué decisión tomar según tu situación
SituaciónDecisiónRazón respaldada por cifras
Ya tienes una 3070 y buscas un 8BMantenerlaGranite 4.2 8B : 5,3 GB, aproximadamente 60 t/s estimados
Quieres un modelo de 12B a 14BPasar a 12 o 16 GBQwen3 14B pesa 9,3 GB, la 3070 tiene 8 GB
Quieres un 20B o un contexto largoTarjeta de 16 GB o másgpt-oss 20B pesa 14 GB
Estás dudando entre 3070 y 3070 TiElige la más barataMisma capacidad, 608 contra 448 GB/s
Buscas una tarjeta para empezarComparar con una 3060 de 12 GBMás memoria con un ancho de banda similar

La 3070 es una tarjeta aceptable para un modelo de 8 mil millones, sin más. Sigue siendo útil para iniciarse: Ollama es compatible con ella y un modelo de 8 mil millones responde más rápido de lo que se tarda en leer. No es adecuada si piensas usar agentes de código o documentos largos, que necesitan un contexto para el que los 8 GB no dejan espacio. Si ya la tienes, basta para descubrir los LLM locales. Si eliges una tarjeta solo para este uso, empieza por la capacidad: es mejor un modelo más grande que quepa que uno pequeño más rápido. Para conocer los precios del día, consulta nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana.

#Preguntas frecuentes

FAQ
¿Qué LLM ejecutar en una RTX 3070?+
Empieza con Granite 4.2 8B (5,3 GB) o Qwen3 8B (5,2 GB): dejan casi 3 GB para el contexto. Qwen 3.5 9B (6,6 GB) es el límite superior, con 1,4 GB de margen. Por encima de 9 mil millones de parámetros en Q4, parte del modelo pasa a la RAM del sistema.
¿Puede la RTX 3070 ejecutar un modelo de 14 o 24 mil millones de parámetros?+
No. Qwen3 14B pesa 9,3 GB en Ollama, es decir, 1,3 GB más que la capacidad de la tarjeta, y los modelos de 24 mil millones de parámetros (15 GB) o gpt-oss 20B (14 GB) requieren casi el doble. Parte de estos modelos se descarga en la memoria RAM y la velocidad cae. Se necesitan al menos 12 GB para un modelo de 14B.
¿RTX 3070 o RTX 3060 12 GB para un LLM?+
Para un LLM, la 3060 de 12 GB es a menudo la mejor opción: 4 GB adicionales permiten ejecutar Qwen3 14B (9,3 GB). La 3070 tiene 448 GB/s de ancho de banda contra 360: teóricamente genera aproximadamente un cuarto más rápido, pero con 8 GB se limita a modelos de 8 a 9 mil millones.
¿Qué diferencia hay entre 3070 y 3070 Ti para un LLM?+
Misma capacidad de 8 GB, pero la 3070 Ti tiene memoria GDDR6X a 608 GB/s contra 448 GB/s en GDDR6, lo que representa un 36 % más de ancho de banda. En teoría, la generación, limitada por el ancho de banda, mejora en la misma proporción. La Ti consume 290 W contra 220 W según NVIDIA.
¿Qué fuente de alimentación se necesita para una RTX 3070 Ti?+
NVIDIA indica que se requiere una fuente de alimentación de 750 W para el sistema con una 3070 Ti (290 W de potencia gráfica) y de 650 W con una 3070 (220 W). Son los valores del fabricante para un PC completo: una fuente de alimentación de 550 W está por debajo de esta recomendación, aunque puede bastar en un PC de bajo consumo.
¿Se puede hacer un ajuste fino de un modelo en una RTX 3070?+
Sí, con QLoRA en modelos pequeños. Según Unsloth, el mínimo absoluto es de 3,5 GB para un 3B y de 6 GB para un 8B: con 8 GB, un 8B apenas cabe, con un lote de 1 y contexto corto. Un 14B requiere 8,5 GB y no cabe.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.