¿Qué LLM en RTX 4070 / 4070 Super / 4070 Ti (12 GB)? ?
Una RTX 4070, 4070 Super o 4070 Ti ofrece 12 GB de VRAM y 504 GB/s de ancho de banda: suficiente para ejecutar en Q4 modelos hasta de 14 mil millones de parámetros (Qwen 3.5 9B, Gemma 4 12B, Qwen3 14B), no para los de 24 a 27 mil millones. Las tres tarjetas generan casi a la misma velocidad, ya que su memoria es idéntica; solo cambia la lectura de prompts largos.
Las tres tarjetas de la familia RTX 4070 comparten la misma memoria, pero no la misma potencia de cálculo, y esta diferencia importa menos de lo que se piensa para un LLM. Esta guía presenta los modelos que realmente caben en 12 GB con su tamaño exacto, la memoria que debes reservar para el contexto, las tasas de procesamiento medidas por terceros y el procedimiento para los modelos demasiado grandes. También sabrás qué variante buscar de segunda mano y cuándo pasar a 16 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5070 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 4070 y LLM local: lo que permiten 12 GB
Para un LLM local, el valor de una RTX 4070 reside ante todo en sus 12 GB de memoria y sus 504 GB/s de ancho de banda: estas dos cifras determinan qué cabe y a qué velocidad funciona. Los modelos de 7 a 14 mil millones de parámetros en Q4 caben íntegramente en la VRAM: según la biblioteca de Ollama, Qwen 3.5 9B pesa 6,6 GB, Gemma 4 12B 7,6 GB y Qwen3 14B 9,3 GB. Hardware Corner mide 71 tokens por segundo con Qwen3 8B y 42 con Qwen3 14B, con un contexto de 4.000 tokens en una RTX 4070. Los modelos de 24 a 27 mil millones de parámetros, como Mistral Small 24B (14 GB) o Qwen 3.8 27B (18 GB), no caben: parte del modelo pasa a la RAM y la velocidad cae. Las variantes Super y Ti no añaden ancho de banda.
- Lanzamientos
- 4070 Ti el 5 de enero de 2023, 4070 el 13 de abril de 2023, 4070 Super el 17 de enero de 2024, según Wikipedia.
- Memoria
- 12 GB de GDDR6X, bus de 192 bits a 21 Gbit/s: 192 × 21 ÷ 8 = 504 GB/s, valor registrado por Puget Systems para las tres tarjetas.
- Núcleos CUDA
- 5 888 para la 4070, 7 168 para la Super, 7 680 para la Ti, según NVIDIA.
- Consumo
- 200, 220 y 285 W de potencia gráfica; alimentación requerida de 650, 650 y 700 W, según NVIDIA.
#4070, Super o Ti: misma memoria, distinta capacidad de cálculo
| Tarjeta | Núcleos CUDA | Ancho de banda | FP16 (TFLOPS) | Potencia gráfica | Alimentación requerida |
|---|---|---|---|---|---|
| RTX 4070 | 5 888 | 504 GB/s | 29,15 | 200 W | 650 W |
| RTX 4070 Super | 7 168 | 504 GB/s | 35,48 | 220 W | 650 W |
| RTX 4070 Ti | 7 680 | 504 GB/s | 40,09 | 285 W | 700 W |
Para generar un token, la GPU vuelve a leer todos los pesos activos del modelo: la velocidad de generación está limitada por el ancho de banda de la memoria, no por el número de núcleos. Las tres tarjetas tienen el mismo ancho de banda: 504,2 GB/s. Puget midió Phi-3-mini en GGUF de 4 bits con llama.cpp: la diferencia del 25 % entre la 4070 y la 4070 Ti durante la lectura del prompt se convierte, durante la generación, en resultados casi idénticos. Hardware Corner, con otros modelos, sitúa la Super en el 114 % y la Ti en el 116 % del rendimiento de la 4070. La diferencia real va, por tanto, de casi nula a alrededor del 15 %, mientras que el número de núcleos CUDA aumenta entre un 22 % y un 30 %.
El cálculo sirve para leer el prompt, la fase que precede a la primera palabra. En FP16, según Puget, la Super ofrece un 22 % más de TFLOPS que la 4070 y un 38 % más que la Ti. Esto cuenta para un RAG, un documento largo o un agente de código que envía prompts grandes: el retraso antes de la respuesta disminuye. Un chat corto no lo aprovecha mucho.
#Los modelos que caben en 12 GB
Los tamaños corresponden a los archivos de la biblioteca de Ollama consultados el 29 de septiembre de 2026. El margen es lo que queda de los 12 GB antes de contar el contexto, la caché y los búferes del motor.
| Modelo | Archivo Ollama | Margen bruto | Para qué uso |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 6,7 GB | RAG y llamadas a herramientas, 128K de contexto, Apache 2.0 |
| Qwen 3.5 9B (Q4_K_M) | 6,6 GB | 5,4 GB | Polivalente, texto e imagen, Apache 2.0 |
| Gemma 4 12B (Q4_K_M) | 7,6 GB | 4,4 GB | Texto, imagen, audio; versión QAT de 7,2 GB |
| Qwen3 14B | 9,3 GB | 2,7 GB | El modelo denso más grande que se puede ejecutar cómodamente |
| Qwen 3.5 9B (Q8_0) | 11 GB | 1 GB | Evitar: margen demasiado pequeño para el contexto y los buffers |
Qwen 3.5 9B es el punto de partida más seguro. Gemma 4 12B, con 11,95 mil millones de parámetros según Google, toma el relevo si también quieres sonido e imagen. Granite 4.2 8B es adecuado para la búsqueda documental, donde IBM destaca el RAG y la llamada a herramientas. Qwen3 14B es el límite superior: 2,7 GB de margen son suficientes para unos pocos miles de tokens de contexto. El Q8_0 de Qwen 3.5 9B solo deja un GB: el contexto, los búferes y la memoria ocupada por Windows pueden hacer que se desborde.
Un RAG local agrega un modelo de embeddings: bge-m3 pesa 1,2 GB en Ollama, es decir, 6,5 GB en total con Granite 4.2 8B y 8,8 GB con Gemma 4 12B.
#El contexto: la memoria que queda después del modelo
Ollama ajusta el contexto según la memoria de vídeo: su documentación indica 4k tokens por defecto con menos de 24 GiB de VRAM y recomienda al menos 64.000 tokens para agentes, herramientas de código y búsqueda web. Una RTX 4070 entra en la franja de 4k: un agente iniciado con los ajustes por defecto pierde su historial mucho antes de que se llene la memoria de la tarjeta. Aumentar el contexto consume VRAM en forma de caché KV, que almacena las claves y los valores de atención de cada token ya leído.
Su tamaño se calcula así: 2 (claves y valores) × capas de atención completa × cabezas KV × dimensión de una cabeza × bytes por valor × número de tokens. Según su ficha en Hugging Face, Qwen 3.5 9B solo tiene 8 capas de atención completa de un total de 32, con 4 cabezas KV de dimensión 256. Gemma 4 12B combina capas con una ventana deslizante de 1.024 tokens y capas globales con claves y valores unificados. Su caché ocupa mucho menos que la de un transformador clásico.
| Modelo | 8.000 tokens | 32 000 tokens | 128 000 tokens |
|---|---|---|---|
| Qwen 3.5 9B | 0,25 | 1,0 | 4,0 |
| Gemma 4 12B | 0,4 | 0,6 à 0,8 | 1,3 à 2,3 |
| Transformador clásico (32 capas, 8 cabezas KV de dimensión 128, ejemplo) | 1,0 | 4,0 | 16,0 |
Son estimaciones teóricas, no mediciones: no tienen en cuenta los búferes de cálculo, el estado de las capas DeltaNet ni el codificador de imágenes, y el intervalo de Gemma se debe a la incertidumbre sobre el uso compartido de claves y valores. Qwen 3.5 9B (6,6 GB) con 32.000 tokens deja aproximadamente 4,4 GB; con 128.000 tokens, solo la caché alcanza los 4 GiB y el conjunto roza los 12 GB. Comprueba el resultado real con ollama ps.
La siguiente opción es la cuantización de la caché: según las preguntas frecuentes de Ollama, q8_0 utiliza aproximadamente la mitad de la memoria de f16 con una pérdida de precisión muy pequeña y requiere Flash Attention, que Ollama activa automáticamente cuando la tarjeta y el modelo son compatibles con ella. Un contexto largo también ralentiza la generación: Hardware Corner pasa de 71 a 52 y luego a 38 tokens por segundo con contextos de 4k, 16k y 32k, respectivamente, con Qwen3 8B.
#Instalar Ollama y verificar que el modelo cabe
En Windows, Ollama requiere un controlador NVIDIA 551.61 o más reciente según su documentación, y la familia 4070 figura entre las tarjetas compatibles. El procedimiento instala un modelo y verifica que esté funcionando al 100 % en la tarjeta.
- 01Verificar el controladorAbre la aplicación NVIDIA o ejecuta nvidia-smi en un terminal: el controlador debe estar en versión 551.61 o más reciente.
- 02Instalar OllamaDescarga la aplicación para Windows desde el sitio de Ollama. La API local escucha luego en http://localhost:11434.
- 03Ejecutar un modeloAbre un terminal y ejecuta ollama run qwen3.5:9b. La descarga de 6,6 GB se realiza una sola vez.
- 04Comprobar la distribución de la memoriaEn un segundo terminal, ejecuta ollama ps. La columna Procesador debe mostrar 100 % GPU. Una distribución del tipo 48 % / 52 % CPU/GPU significa que parte del modelo se carga en la memoria RAM.
- 05Ajustar el contexto y el cachéAumenta el contexto en los ajustes de la aplicación Ollama o con OLLAMA_CONTEXT_LENGTH y, después, vuelve a ejecutar ollama ps. Si no hay margen suficiente, establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar el servidor.
- Instalar Ollama en Windows 11: guía completa
- Solucionar problemas de Ollama: GPU no detectada, lentitud, errores de memoria
#Velocidades medidas por terceros y techo teórico
QuelLLM no publica aquí mediciones propias: cada velocidad proviene de una fuente externa, con su modelo y su contexto. Hardware Corner midió una RTX 4070 en marzo de 2026; XDA publicó en junio de 2026 un ensayo sobre una 4070 Ti.
| Fuente | Tarjeta | Modelo | Contexto | Generación | Lectura del prompt |
|---|---|---|---|---|---|
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 4k | 71,2 | 3 564 |
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 16k | 52,1 | 2 064 |
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 32k | 38,1 | 1 117 |
| Hardware Corner | RTX 4070 | Qwen3 14B Q4_K | 4k | 42,5 | 2 100 |
| Hardware Corner | RTX 4070 | Qwen3 14B Q4_K | 16k | 32,7 | 1 356 |
| XDA | RTX 4070 Ti | Qwen 3.5 9B (Ollama) | no especificado | 65 à 67 | no especificado |
Un límite teórico ayuda a evaluar estas cifras: la generación no puede superar el ancho de banda dividido por el tamaño del modelo. Para Qwen3 8B (5,2 GB en Ollama), 504 ÷ 5,2 da aproximadamente 97 tokens por segundo; la medición a 4k, de 71,2, alcanza el 73 % de ese límite. Qwen3 14B (9,3 GB) tiene un límite de 54 y una medición de 42,5, es decir, el 78 %. XDA registra entre 65 y 67 en Qwen 3.5 9B (límite de 76), es decir, entre el 85 y el 88 %. Para Gemma 4 12B (7,6 GB, límite de 66), este rango del 73 al 88 % da entre 48 y 58 tokens por segundo: una estimación, no una medición.
| Tarjeta | Ancho de banda | Generación (t/s) |
|---|---|---|
| RTX 4060 Ti 8 GB | 288 GB/s | 64,03 |
| RTX 5070 12 GB | 672 GB/s | 128,21 |
| RTX 4070 Ti Super 16 GB | 672 GB/s | 132,85 |
| RTX 3080 10 GB | 760 GB/s | 139,95 |
Estas líneas provienen de la clasificación comunitaria de llama.cpp, donde no aparece ninguna RTX 4070. La velocidad de generación depende del ancho de banda: dos tarjetas con 672 GB/s, una de 12 GB y otra de 16 GB, van aproximadamente a la misma velocidad; la 4060 Ti, con 288 GB/s, va a la mitad de velocidad. Por regla de tres, una 4070 con 504 GB/s daría aproximadamente 99 tokens por segundo con este modelo de 3,56 GiB: una estimación, no una medición.
#Más allá de 12 GB: Qwen 3.8, Mistral Small, gpt-oss
Qwen 3.8 solo está disponible en la biblioteca de Ollama con 27 mil millones de parámetros y ocupa 18 GB en Q4_K_M: supera en 6 GB la memoria de una RTX 4070 y se repartiría entre la tarjeta y la memoria RAM. Como es denso, cada token vuelve a leer todos los pesos. Con 11 GB en la tarjeta a 504 GB/s y 7 GB en RAM a 60 GB/s (hipótesis para una DDR5 de doble canal), un token requiere 22 ms en la GPU y 117 ms en la RAM: el límite cae a unos 7 tokens por segundo, frente a los 76 de Qwen 3.5 9B.
| Modelo | Archivo Ollama | Excedente | Naturaleza | Opción posible |
|---|---|---|---|---|
| Mistral Small 24B | 14 GB | 2 GB | Dense | No recomendado: denso |
| gpt-oss 20B | 14 GB | 2 GB | MoE, 3,6 mil millones activos | Expertos transferidos fuera de la GPU (llama.cpp) |
| Gemma 4 26B | 19 GB | 7 GB | MoE (A4B) | Ídem, medirlo por cuenta propia |
| Qwen 3.8 27B | 18 GB | 6 GB | Dense | No: demasiado lento |
Los modelos con expertos se prestan mejor a descargar parte del modelo en la RAM del sistema. gpt-oss 20B cuenta con 21 mil millones de parámetros, de los cuales 3,6 mil millones están activos por token, según su ficha. La opción --n-cpu-moe de llama.cpp mantiene en la RAM los expertos de las primeras N capas, mientras que la atención y la caché permanecen en la tarjeta. La guía oficial de llama.cpp para gpt-oss da un ejemplo con una RTX 2060 de 8 GB: 16 capas de expertos en la CPU para 32.000 tokens de contexto. Con 12 GB, reduce N por etapas hasta que se produzca un error de memoria y luego vuelve a subirlo una etapa.
No hemos encontrado ninguna medición con una fuente que la respalde de este método en una RTX 4070: la velocidad de generación depende de tu RAM y de N, y debes medirla tú mismo. Un usuario informó en agosto de 2025 de aproximadamente 10 tokens por segundo con gpt-oss 20B en una RTX 4070 en Ollama, con un reparto automático del 47 % en CPU y el 53 % en GPU; la versión y el ajuste pueden haber cambiado desde entonces.
#Veredicto: qué 4070 y cuándo pasar a 16 GB
| Situación | Decisión | Razón respaldada por cifras |
|---|---|---|
| Ya tienes una 4070, Super o Ti | Conservarla para los modelos de 7 a 14 mil millones | Mismo ancho de banda, diferencia en la generación del 0 al 16 % |
| Chat, asistente, programación sencilla | La 4070 básica es suficiente | Generación condicionada por el ancho de banda |
| RAG, documentos grandes, agentes | La Super o, en su defecto, la Ti | +22 % y +38 % de TFLOPS FP16 |
| Quieres un modelo de 24B íntegramente en la VRAM (14 GB) | Pasar a 16 GB (4070 Ti Super) | 16 GB y 672 GB/s |
| Quieres ir más rápido con 12 GB | Una RTX 5070 | 672 GB/s contra 504, lo que representa un 33 % más |
La RTX 5070 mejora la velocidad, no la capacidad: NVIDIA la equipa con 12 GB de GDDR7 en un bus de 192 bits, lo que supone 672 GB/s a 28 Gbit/s frente a los 504 de la 4070. Para que quepa un modelo más grande, lo que cuenta son los 16 GB. Las guías de la 5070 y de la 4070 Ti Super detallan cada caso.
Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.
- Fuente: NVIDIA, especificaciones de la familia RTX 4070
- Fuente: Puget Systems, rendimiento de LLM en GPU de consumo
- Fuente: documentación de Ollama, longitud de contexto
- Fuente: Preguntas frecuentes de Ollama, Flash Attention y caché KV
- Fuente: guía llama.cpp para ejecutar gpt-oss
#Preguntas frecuentes
¿Qué modelo instalar en una RTX 4070?+
¿Qwen 3.8 funciona en una RTX 4070?+
RTX 4070, 4070 Super o 4070 Ti: ¿cuál para un LLM local?+
¿Siguen siendo suficientes 12 GB para un LLM en 2026?+
¿Qué fuente de alimentación se necesita para una RTX 4070 Super?+
¿RTX 4070 o RTX 3080 de 10 GB para los LLM?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.