¿Qué LLM en RTX 3070 / 3070 Ti (8 GB)? ?
Una RTX 3070 o 3070 Ti ofrece 8 GB de VRAM: mantiene en VRAM los modelos de hasta 8 a 9 mil millones de parámetros en Q4 (Granite 4.2 8B ocupa 5,3 GB y Qwen 3.5 9B, 6,6 GB), pero no los de 12 mil millones o más. La 3070 Ti, con 608 GB/s frente a 448, genera más rápido con la misma capacidad. No hay mediciones publicadas: las velocidades de generación son estimaciones.
Con 8 GB, la RTX 3070 y la 3070 Ti siguen siendo tarjetas adecuadas para un modelo de 8 mil millones de parámetros, pero la capacidad es su límite. Esta guía presenta los modelos que realmente caben, con su tamaño exacto, velocidades estimadas a partir del ancho de banda, los límites del contexto y la diferencia con las tarjetas de gamas cercanas. También sabrás cuándo pasar a 12 o 16 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5060 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 3070 y 3070 Ti para un LLM local: lo que permiten 8 GB
Para un LLM local, una RTX 3070 o una 3070 Ti vale por sus 8 GB de VRAM, y esta capacidad fija todo: los modelos hasta 8 a 9 mil millones de parámetros en Q4 caben, los de 12 mil millones o más no. Según la biblioteca Ollama, Granite 4.2 8B pesa 5,3 GB, Qwen3 8B 5,2 GB y Qwen 3.5 9B 6,6 GB; Qwen3 14B (9,3 GB) y gpt-oss 20B (14 GB) superan la tarjeta. La 3070 Ti, a 608 GB/s contra 448 para la 3070, genera más rápido pero con la misma capacidad.
- Memoria
- 8 GB en un bus de 256 bits: GDDR6 a 448 GB/s para la 3070, GDDR6X a 608 GB/s para la 3070 Ti, según la tabla de Wikipedia y NVIDIA.
- Cálculo
- 5 888 núcleos CUDA para la 3070 y 6 144 para la 3070 Ti, según Wikipedia.
- Consumo
- 220 W de potencia gráfica y una fuente de alimentación de 650 W requerida para la 3070; 290 W y 750 W para la 3070 Ti, según NVIDIA. Es más que los 550 W que a veces se citan.
#Los modelos que caben en 8 GB
Los pesos corresponden a los archivos de la biblioteca Ollama, consultados el 29 de septiembre de 2026. El margen es lo que queda de los 8 GB antes de contar el contexto, la caché y los búferes del motor; también debe cubrir la visualización si la tarjeta controla tu pantalla.
| Modelo | Archivo Ollama | Margen bruto | Veredicto |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Muy cómodo, contexto largo posible |
| Qwen3 8B | 5,2 GB | 2,8 GB | Cómodo |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Cómodo |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Cabe, pero hay que limitar el contexto |
| Gemma 4 12B | 7,6 GB | 0,4 GB | Sin margen: no hay contexto útil |
| Qwen3 14B | 9,3 GB | Faltan 1,3 GB | No cabe |
| gpt-oss 20B | 14 GB | Faltan 6 GB | No cabe |
El punto de partida más seguro es un modelo de 8 mil millones: Granite 4.2 8B o Qwen3 8B dejan cerca de 3 GB para el contexto. Qwen 3.5 9B es el límite superior en la práctica: 1,4 GB de margen son suficientes para una conversación corta, no para un documento largo. Un RAG local añade un modelo de embeddings: bge-m3 pesa 1,2 GB en Ollama, lo que suma 6,5 GB en total con Granite 4.2 8B, y quedan 1,5 GB para el resto.
#Instalar Ollama en una RTX 3070
- 01Verificar el controladorEjecuta nvidia-smi en un terminal: el controlador debe estar en versión 550 o superior (551.61 en Windows) y la memoria total debe mostrar aproximadamente 8 GB.
- 02Instalar OllamaInstala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
- 03Ejecutar un modeloEjecuta ollama run granite4.2:8b: la descarga de 5,3 GB se realiza una sola vez.
- 04Controlar la distribuciónEn un segundo terminal, ejecuta ollama ps: la columna Processeur debe mostrar 100 % GPU. Una distribución CPU/GPU significa que parte del modelo o del contexto se carga en la memoria RAM.
- 05Ajustar el contextoFija el contexto con OLLAMA_CONTEXT_LENGTH y luego vuelve a ejecutar ollama ps. Establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar el servidor para ahorrar VRAM.
#Velocidades: lo que cabe esperar del ancho de banda
Ningún sitio de referencia de pruebas de rendimiento publica mediciones para la RTX 3070: los valores que figuran a continuación son, por tanto, estimaciones, no mediciones. El método se basa en el hecho de que la generación está limitada por el ancho de banda: el límite máximo teórico equivale aproximadamente al ancho de banda dividido por el tamaño del modelo. Para Granite 4.2 8B (5,3 GB), 448 ÷ 5,3 da 85 tokens por segundo en la 3070 y 608 ÷ 5,3 da 115 en la 3070 Ti. Para Qwen 3.5 9B (6,6 GB), los límites máximos son 68 y 92.
La clasificación comunitaria de llama.cpp permite convertir estos límites en órdenes de magnitud. Con Llama 2 7B Q4_0, una RTX 3060 Ti de 8 GB, tarjeta con bus de 256 bits similar a la 3070, genera 92,23 tokens por segundo sin Flash Attention y 96,50 con ella. Una RTX 3060 de 12 GB, con un ancho de banda de 360 GB/s, genera 75,57 y 76,92: la relación (1,22) sigue la de los anchos de banda (448 ÷ 360 = 1,24). Una 3070 debería, por tanto, ofrecer velocidades similares a las de la 3060 Ti, alrededor de 90 a 95 tokens por segundo con un 7B, y una 3070 Ti aproximadamente un 35 % más, es decir, de 120 a 130. Son estimaciones.
| Modelo | Archivo Ollama | Límite 3070 (448 GB/s) | Límite 3070 Ti (608 GB/s) |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 132 | 179 |
| Granite 4.2 8B | 5,3 GB | 85 | 115 |
| Qwen 3.5 9B | 6,6 GB | 68 | 92 |
| Gemma 4 12B | 7,6 GB | 59 | 80 |
Las tasas reales de generación rondan el 70 al 80 % de estos límites en las tarjetas medidas en otras fuentes: calcula, por tanto, entre 55 y 65 tokens por segundo para Granite 4.2 8B en una 3070. Sea cual sea el valor exacto, estas velocidades superan la velocidad de lectura humana: la limitación de la 3070 es la capacidad, no la velocidad.
#Los límites de los 8 GB: contexto, RAG y grandes modelos
Ollama ajusta el contexto por defecto según la memoria de vídeo: su documentación indica 4k tokens con menos de 24 GiB de VRAM y recomienda al menos 64.000 tokens para agentes, búsqueda web y herramientas de código. Con 8 GB, intentar alcanzar 64.000 tokens con un modelo de 8 mil millones de parámetros no es realista: la caché KV, que almacena las claves y los valores de atención de cada token, consume el margen disponible. Según las preguntas frecuentes de Ollama, la cuantización q8_0 de la caché reduce su consumo de memoria a aproximadamente la mitad del de f16, con una pérdida de precisión muy pequeña: es el primer ajuste que hay que activar.
- Modelos de 12 a 24 mil millones
- Gemma 4 12B (7,6 GB) no deja espacio para el contexto; Qwen3 14B (9,3 GB) y gpt-oss 20B (14 GB) no caben. Parte de estos modelos pasa a la memoria RAM y la velocidad cae.
- Contexto largo
- Con Qwen 3.5 9B, los 1,4 GB de margen se agotan rápidamente: mantén un contexto de unos pocos miles de tokens y vigila ollama ps.
- RAG en múltiples etapas
- Granite 4.2 8B y bge-m3 ocupan 6,5 GB: añadir un reranker o un segundo modelo supera la memoria disponible.
- Fine-tuning
- Según Unsloth, el mínimo absoluto en QLoRA 4 bits es de 3,5 GB para 3 mil millones y de 6 GB para 8 mil millones: un modelo de 8B apenas cabe, con un lote de 1 y un contexto corto.
Un método sencillo para mantenerse por debajo de los 8 GB consiste en tres ajustes. Primero, elige un modelo cuyo archivo deje al menos 2 GB de margen: Granite 4.2 8B o Qwen3 8B. Después, activa la caché cuantizada en q8_0 y Flash Attention, que el repositorio oficial de Flash Attention indica que es compatible con las GPU Ampere como la 3070. Por último, aumenta el contexto por etapas, de 4.000 a 8.000 y luego a 16.000 tokens, volviendo a ejecutar ollama ps en cada etapa: en cuanto aparezca una parte de la carga en la CPU, vuelve al nivel anterior. Esta progresión evita descubrir el límite en plena conversación.
#3070 frente a otras tarjetas de 8 a 16 GB
| Tarjeta | Memoria | Ancho de banda | Lo que cambia |
|---|---|---|---|
| RTX 3070 | 8 GB GDDR6 | 448 GB/s | Modelos de 8 a 9 mil millones |
| RTX 3070 Ti | 8 GB GDDR6X | 608 GB/s | Misma capacidad, generación más rápida |
| RTX 3060 12 GB | 12 GB GDDR6 | 360 GB/s | Añade modelos de 12 a 14 mil millones |
| RTX 4060 Ti 16 GB | 16 GB | 288 GB/s | Permite usar también gpt-oss 20B, pero es más lenta |
Esta tabla pone de manifiesto el compromiso entre capacidad y velocidad. La 3060 de 12 GB tiene un ancho de banda un 20 % menor que la 3070, pero 4 GB más: admite Qwen3 14B (9,3 GB), que no cabe en la 3070. La 4060 Ti de 16 GB añade la categoría de modelos de 20 mil millones de parámetros, con un ancho de banda de 288 GB/s que la hace más lenta con los modelos pequeños. Para un LLM, la capacidad prima sobre la velocidad cuando el modelo que quieres ejecutar supera los 7,5 GB.
#Veredicto: mantener, reemplazar o no comprar
| Situación | Decisión | Razón respaldada por cifras |
|---|---|---|
| Ya tienes una 3070 y buscas un 8B | Mantenerla | Granite 4.2 8B : 5,3 GB, aproximadamente 60 t/s estimados |
| Quieres un modelo de 12B a 14B | Pasar a 12 o 16 GB | Qwen3 14B pesa 9,3 GB, la 3070 tiene 8 GB |
| Quieres un 20B o un contexto largo | Tarjeta de 16 GB o más | gpt-oss 20B pesa 14 GB |
| Estás dudando entre 3070 y 3070 Ti | Elige la más barata | Misma capacidad, 608 contra 448 GB/s |
| Buscas una tarjeta para empezar | Comparar con una 3060 de 12 GB | Más memoria con un ancho de banda similar |
La 3070 es una tarjeta aceptable para un modelo de 8 mil millones, sin más. Sigue siendo útil para iniciarse: Ollama es compatible con ella y un modelo de 8 mil millones responde más rápido de lo que se tarda en leer. No es adecuada si piensas usar agentes de código o documentos largos, que necesitan un contexto para el que los 8 GB no dejan espacio. Si ya la tienes, basta para descubrir los LLM locales. Si eliges una tarjeta solo para este uso, empieza por la capacidad: es mejor un modelo más grande que quepa que uno pequeño más rápido. Para conocer los precios del día, consulta nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana.
- Fuente: NVIDIA, especificaciones de RTX 3070 y 3070 Ti
- Fuente: clasificación comunitaria de llama.cpp con CUDA
- Fuente: documentación de Ollama, longitud de contexto
- Fuente: Preguntas frecuentes de Ollama, Flash Attention y caché KV
- Fuente: Unsloth, VRAM requerida para el fine-tuning
#Preguntas frecuentes
¿Qué LLM ejecutar en una RTX 3070?+
¿Puede la RTX 3070 ejecutar un modelo de 14 o 24 mil millones de parámetros?+
¿RTX 3070 o RTX 3060 12 GB para un LLM?+
¿Qué diferencia hay entre 3070 y 3070 Ti para un LLM?+
¿Qué fuente de alimentación se necesita para una RTX 3070 Ti?+
¿Se puede hacer un ajuste fino de un modelo en una RTX 3070?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.