Intermedio 14 minRTX 40

¿Qué LLM en RTX 4070 / 4070 Super / 4070 Ti (12 GB)? ?

Respuesta directa

Una RTX 4070, 4070 Super o 4070 Ti ofrece 12 GB de VRAM y 504 GB/s de ancho de banda: suficiente para ejecutar en Q4 modelos hasta de 14 mil millones de parámetros (Qwen 3.5 9B, Gemma 4 12B, Qwen3 14B), no para los de 24 a 27 mil millones. Las tres tarjetas generan casi a la misma velocidad, ya que su memoria es idéntica; solo cambia la lectura de prompts largos.

Las tres tarjetas de la familia RTX 4070 comparten la misma memoria, pero no la misma potencia de cálculo, y esta diferencia importa menos de lo que se piensa para un LLM. Esta guía presenta los modelos que realmente caben en 12 GB con su tamaño exacto, la memoria que debes reservar para el contexto, las tasas de procesamiento medidas por terceros y el procedimiento para los modelos demasiado grandes. También sabrás qué variante buscar de segunda mano y cuándo pasar a 16 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5070 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 4070 y LLM local: lo que permiten 12 GB

Para un LLM local, el valor de una RTX 4070 reside ante todo en sus 12 GB de memoria y sus 504 GB/s de ancho de banda: estas dos cifras determinan qué cabe y a qué velocidad funciona. Los modelos de 7 a 14 mil millones de parámetros en Q4 caben íntegramente en la VRAM: según la biblioteca de Ollama, Qwen 3.5 9B pesa 6,6 GB, Gemma 4 12B 7,6 GB y Qwen3 14B 9,3 GB. Hardware Corner mide 71 tokens por segundo con Qwen3 8B y 42 con Qwen3 14B, con un contexto de 4.000 tokens en una RTX 4070. Los modelos de 24 a 27 mil millones de parámetros, como Mistral Small 24B (14 GB) o Qwen 3.8 27B (18 GB), no caben: parte del modelo pasa a la RAM y la velocidad cae. Las variantes Super y Ti no añaden ancho de banda.

Lanzamientos
4070 Ti el 5 de enero de 2023, 4070 el 13 de abril de 2023, 4070 Super el 17 de enero de 2024, según Wikipedia.
Memoria
12 GB de GDDR6X, bus de 192 bits a 21 Gbit/s: 192 × 21 ÷ 8 = 504 GB/s, valor registrado por Puget Systems para las tres tarjetas.
Núcleos CUDA
5 888 para la 4070, 7 168 para la Super, 7 680 para la Ti, según NVIDIA.
Consumo
200, 220 y 285 W de potencia gráfica; alimentación requerida de 650, 650 y 700 W, según NVIDIA.
!
Controla la referencia de memoria de una 4070 de segunda mano
Desde agosto de 2024, también existe una RTX 4070 con GDDR6 a 20 Gbit/s en lugar de GDDR6X, según Wikipedia. En el mismo bus de 192 bits, esto da 480 GB/s en lugar de 504, es decir, un 5 % menos. Pide la referencia exacta.

#4070, Super o Ti: misma memoria, distinta capacidad de cálculo

Comparativa de las tres RTX 4070 de 12 GB (NVIDIA, Puget Systems)
TarjetaNúcleos CUDAAncho de bandaFP16 (TFLOPS)Potencia gráficaAlimentación requerida
RTX 40705 888504 GB/s29,15200 W650 W
RTX 4070 Super7 168504 GB/s35,48220 W650 W
RTX 4070 Ti7 680504 GB/s40,09285 W700 W

Para generar un token, la GPU vuelve a leer todos los pesos activos del modelo: la velocidad de generación está limitada por el ancho de banda de la memoria, no por el número de núcleos. Las tres tarjetas tienen el mismo ancho de banda: 504,2 GB/s. Puget midió Phi-3-mini en GGUF de 4 bits con llama.cpp: la diferencia del 25 % entre la 4070 y la 4070 Ti durante la lectura del prompt se convierte, durante la generación, en resultados casi idénticos. Hardware Corner, con otros modelos, sitúa la Super en el 114 % y la Ti en el 116 % del rendimiento de la 4070. La diferencia real va, por tanto, de casi nula a alrededor del 15 %, mientras que el número de núcleos CUDA aumenta entre un 22 % y un 30 %.

El cálculo sirve para leer el prompt, la fase que precede a la primera palabra. En FP16, según Puget, la Super ofrece un 22 % más de TFLOPS que la 4070 y un 38 % más que la Ti. Esto cuenta para un RAG, un documento largo o un agente de código que envía prompts grandes: el retraso antes de la respuesta disminuye. Un chat corto no lo aprovecha mucho.

→
La Ti se justifica raramente
Consume 285 W frente a los 220 W de la Super, un 30 % más, a cambio de solo 2 puntos más en generación según Hardware Corner, y es la más antigua de las tres. A precios similares, la Super es la mejor compra de la familia.

#Los modelos que caben en 12 GB

Los tamaños corresponden a los archivos de la biblioteca de Ollama consultados el 29 de septiembre de 2026. El margen es lo que queda de los 12 GB antes de contar el contexto, la caché y los búferes del motor.

Modelos que se pueden probar en RTX 4070, Super o Ti (archivos Ollama)
ModeloArchivo OllamaMargen brutoPara qué uso
Granite 4.2 8B5,3 GB6,7 GBRAG y llamadas a herramientas, 128K de contexto, Apache 2.0
Qwen 3.5 9B (Q4_K_M)6,6 GB5,4 GBPolivalente, texto e imagen, Apache 2.0
Gemma 4 12B (Q4_K_M)7,6 GB4,4 GBTexto, imagen, audio; versión QAT de 7,2 GB
Qwen3 14B9,3 GB2,7 GBEl modelo denso más grande que se puede ejecutar cómodamente
Qwen 3.5 9B (Q8_0)11 GB1 GBEvitar: margen demasiado pequeño para el contexto y los buffers

Qwen 3.5 9B es el punto de partida más seguro. Gemma 4 12B, con 11,95 mil millones de parámetros según Google, toma el relevo si también quieres sonido e imagen. Granite 4.2 8B es adecuado para la búsqueda documental, donde IBM destaca el RAG y la llamada a herramientas. Qwen3 14B es el límite superior: 2,7 GB de margen son suficientes para unos pocos miles de tokens de contexto. El Q8_0 de Qwen 3.5 9B solo deja un GB: el contexto, los búferes y la memoria ocupada por Windows pueden hacer que se desborde.

Un RAG local agrega un modelo de embeddings: bge-m3 pesa 1,2 GB en Ollama, es decir, 6,5 GB en total con Granite 4.2 8B y 8,8 GB con Gemma 4 12B.

#El contexto: la memoria que queda después del modelo

Ollama ajusta el contexto según la memoria de vídeo: su documentación indica 4k tokens por defecto con menos de 24 GiB de VRAM y recomienda al menos 64.000 tokens para agentes, herramientas de código y búsqueda web. Una RTX 4070 entra en la franja de 4k: un agente iniciado con los ajustes por defecto pierde su historial mucho antes de que se llene la memoria de la tarjeta. Aumentar el contexto consume VRAM en forma de caché KV, que almacena las claves y los valores de atención de cada token ya leído.

Su tamaño se calcula así: 2 (claves y valores) × capas de atención completa × cabezas KV × dimensión de una cabeza × bytes por valor × número de tokens. Según su ficha en Hugging Face, Qwen 3.5 9B solo tiene 8 capas de atención completa de un total de 32, con 4 cabezas KV de dimensión 256. Gemma 4 12B combina capas con una ventana deslizante de 1.024 tokens y capas globales con claves y valores unificados. Su caché ocupa mucho menos que la de un transformador clásico.

Tamaño estimado de la caché KV en f16 (GiB), calculado a partir de la configuración publicada
Modelo8.000 tokens32 000 tokens128 000 tokens
Qwen 3.5 9B0,251,04,0
Gemma 4 12B0,40,6 à 0,81,3 à 2,3
Transformador clásico (32 capas, 8 cabezas KV de dimensión 128, ejemplo)1,04,016,0

Son estimaciones teóricas, no mediciones: no tienen en cuenta los búferes de cálculo, el estado de las capas DeltaNet ni el codificador de imágenes, y el intervalo de Gemma se debe a la incertidumbre sobre el uso compartido de claves y valores. Qwen 3.5 9B (6,6 GB) con 32.000 tokens deja aproximadamente 4,4 GB; con 128.000 tokens, solo la caché alcanza los 4 GiB y el conjunto roza los 12 GB. Comprueba el resultado real con ollama ps.

La siguiente opción es la cuantización de la caché: según las preguntas frecuentes de Ollama, q8_0 utiliza aproximadamente la mitad de la memoria de f16 con una pérdida de precisión muy pequeña y requiere Flash Attention, que Ollama activa automáticamente cuando la tarjeta y el modelo son compatibles con ella. Un contexto largo también ralentiza la generación: Hardware Corner pasa de 71 a 52 y luego a 38 tokens por segundo con contextos de 4k, 16k y 32k, respectivamente, con Qwen3 8B.

#Instalar Ollama y verificar que el modelo cabe

En Windows, Ollama requiere un controlador NVIDIA 551.61 o más reciente según su documentación, y la familia 4070 figura entre las tarjetas compatibles. El procedimiento instala un modelo y verifica que esté funcionando al 100 % en la tarjeta.

  1. 01
    Verificar el controlador
    Abre la aplicación NVIDIA o ejecuta nvidia-smi en un terminal: el controlador debe estar en versión 551.61 o más reciente.
  2. 02
    Instalar Ollama
    Descarga la aplicación para Windows desde el sitio de Ollama. La API local escucha luego en http://localhost:11434.
  3. 03
    Ejecutar un modelo
    Abre un terminal y ejecuta ollama run qwen3.5:9b. La descarga de 6,6 GB se realiza una sola vez.
  4. 04
    Comprobar la distribución de la memoria
    En un segundo terminal, ejecuta ollama ps. La columna Procesador debe mostrar 100 % GPU. Una distribución del tipo 48 % / 52 % CPU/GPU significa que parte del modelo se carga en la memoria RAM.
  5. 05
    Ajustar el contexto y el caché
    Aumenta el contexto en los ajustes de la aplicación Ollama o con OLLAMA_CONTEXT_LENGTH y, después, vuelve a ejecutar ollama ps. Si no hay margen suficiente, establece OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar el servidor.
Comandos básicos
ollama run qwen3.5:9b
ollama run gemma4:12b
ollama ps

# Exemple de la documentation Ollama pour fixer le contexte à 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Velocidades medidas por terceros y techo teórico

QuelLLM no publica aquí mediciones propias: cada velocidad proviene de una fuente externa, con su modelo y su contexto. Hardware Corner midió una RTX 4070 en marzo de 2026; XDA publicó en junio de 2026 un ensayo sobre una 4070 Ti.

Velocidades publicadas en RTX 4070 y 4070 Ti (tokens por segundo)
FuenteTarjetaModeloContextoGeneraciónLectura del prompt
Hardware CornerRTX 4070Qwen3 8B Q4_K4k71,23 564
Hardware CornerRTX 4070Qwen3 8B Q4_K16k52,12 064
Hardware CornerRTX 4070Qwen3 8B Q4_K32k38,11 117
Hardware CornerRTX 4070Qwen3 14B Q4_K4k42,52 100
Hardware CornerRTX 4070Qwen3 14B Q4_K16k32,71 356
XDARTX 4070 TiQwen 3.5 9B (Ollama)no especificado65 à 67no especificado

Un límite teórico ayuda a evaluar estas cifras: la generación no puede superar el ancho de banda dividido por el tamaño del modelo. Para Qwen3 8B (5,2 GB en Ollama), 504 ÷ 5,2 da aproximadamente 97 tokens por segundo; la medición a 4k, de 71,2, alcanza el 73 % de ese límite. Qwen3 14B (9,3 GB) tiene un límite de 54 y una medición de 42,5, es decir, el 78 %. XDA registra entre 65 y 67 en Qwen 3.5 9B (límite de 76), es decir, entre el 85 y el 88 %. Para Gemma 4 12B (7,6 GB, límite de 66), este rango del 73 al 88 % da entre 48 y 58 tokens por segundo: una estimación, no una medición.

Generación en llama.cpp según el ancho de banda (Llama 2 7B Q4_0, prueba tg128, Flash Attention activada)
TarjetaAncho de bandaGeneración (t/s)
RTX 4060 Ti 8 GB288 GB/s64,03
RTX 5070 12 GB672 GB/s128,21
RTX 4070 Ti Super 16 GB672 GB/s132,85
RTX 3080 10 GB760 GB/s139,95

Estas líneas provienen de la clasificación comunitaria de llama.cpp, donde no aparece ninguna RTX 4070. La velocidad de generación depende del ancho de banda: dos tarjetas con 672 GB/s, una de 12 GB y otra de 16 GB, van aproximadamente a la misma velocidad; la 4060 Ti, con 288 GB/s, va a la mitad de velocidad. Por regla de tres, una 4070 con 504 GB/s daría aproximadamente 99 tokens por segundo con este modelo de 3,56 GiB: una estimación, no una medición.

#Más allá de 12 GB: Qwen 3.8, Mistral Small, gpt-oss

Qwen 3.8 solo está disponible en la biblioteca de Ollama con 27 mil millones de parámetros y ocupa 18 GB en Q4_K_M: supera en 6 GB la memoria de una RTX 4070 y se repartiría entre la tarjeta y la memoria RAM. Como es denso, cada token vuelve a leer todos los pesos. Con 11 GB en la tarjeta a 504 GB/s y 7 GB en RAM a 60 GB/s (hipótesis para una DDR5 de doble canal), un token requiere 22 ms en la GPU y 117 ms en la RAM: el límite cae a unos 7 tokens por segundo, frente a los 76 de Qwen 3.5 9B.

Modelos que superan los 12 GB (archivos de Ollama)
ModeloArchivo OllamaExcedenteNaturalezaOpción posible
Mistral Small 24B14 GB2 GBDenseNo recomendado: denso
gpt-oss 20B14 GB2 GBMoE, 3,6 mil millones activosExpertos transferidos fuera de la GPU (llama.cpp)
Gemma 4 26B19 GB7 GBMoE (A4B)Ídem, medirlo por cuenta propia
Qwen 3.8 27B18 GB6 GBDenseNo: demasiado lento

Los modelos con expertos se prestan mejor a descargar parte del modelo en la RAM del sistema. gpt-oss 20B cuenta con 21 mil millones de parámetros, de los cuales 3,6 mil millones están activos por token, según su ficha. La opción --n-cpu-moe de llama.cpp mantiene en la RAM los expertos de las primeras N capas, mientras que la atención y la caché permanecen en la tarjeta. La guía oficial de llama.cpp para gpt-oss da un ejemplo con una RTX 2060 de 8 GB: 16 capas de expertos en la CPU para 32.000 tokens de contexto. Con 12 GB, reduce N por etapas hasta que se produzca un error de memoria y luego vuelve a subirlo una etapa.

Ejemplo de la guía de llama.cpp (tarjeta de 8 GB): ajusta --n-cpu-moe
llama-server -hf ggml-org/gpt-oss-20b-GGUF --ctx-size 32768 --jinja -ub 2048 -b 2048 --n-cpu-moe 16

No hemos encontrado ninguna medición con una fuente que la respalde de este método en una RTX 4070: la velocidad de generación depende de tu RAM y de N, y debes medirla tú mismo. Un usuario informó en agosto de 2025 de aproximadamente 10 tokens por segundo con gpt-oss 20B en una RTX 4070 en Ollama, con un reparto automático del 47 % en CPU y el 53 % en GPU; la versión y el ajuste pueden haber cambiado desde entonces.

i
El fine-tuning QLoRA cabe en 12 GB
Según Unsloth, el mínimo absoluto de VRAM en QLoRA 4 bits es de 6 GB para 8 mil millones de parámetros y de 8,5 GB para 14 mil millones: un 14B sigue siendo viable en una 4070, con un lote de 1 y un contexto corto.

#Veredicto: qué 4070 y cuándo pasar a 16 GB

Qué decisión tomar según tu situación
SituaciónDecisiónRazón respaldada por cifras
Ya tienes una 4070, Super o TiConservarla para los modelos de 7 a 14 mil millonesMismo ancho de banda, diferencia en la generación del 0 al 16 %
Chat, asistente, programación sencillaLa 4070 básica es suficienteGeneración condicionada por el ancho de banda
RAG, documentos grandes, agentesLa Super o, en su defecto, la Ti+22 % y +38 % de TFLOPS FP16
Quieres un modelo de 24B íntegramente en la VRAM (14 GB)Pasar a 16 GB (4070 Ti Super)16 GB y 672 GB/s
Quieres ir más rápido con 12 GBUna RTX 5070672 GB/s contra 504, lo que representa un 33 % más

La RTX 5070 mejora la velocidad, no la capacidad: NVIDIA la equipa con 12 GB de GDDR7 en un bus de 192 bits, lo que supone 672 GB/s a 28 Gbit/s frente a los 504 de la 4070. Para que quepa un modelo más grande, lo que cuenta son los 16 GB. Las guías de la 5070 y de la 4070 Ti Super detallan cada caso.

Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.

#Preguntas frecuentes

¿Qué modelo instalar en una RTX 4070?+
Empieza con Qwen 3.5 9B: su archivo de Ollama de 6,6 GB deja más de 5 GB de margen para el contexto y admite texto e imágenes. Gemma 4 12B, con 7,6 GB, añade audio. Qwen3 14B, con 9,3 GB, es el modelo más grande que aún se puede ejecutar con holgura. Por encima de 14 mil millones de parámetros en Q4, parte del modelo pasa a la memoria RAM.
¿Qwen 3.8 funciona en una RTX 4070?+
No con comodidad. Qwen 3.8 solo existe con 27 mil millones de parámetros y ocupa 18 GB en Q4_K_M en Ollama, es decir, 6 GB más de lo que tiene la tarjeta. Repartido entre VRAM y RAM, su velocidad máxima teórica ronda los 7 tokens por segundo. Con 12 GB, elige Qwen 3.5 9B o Gemma 4 12B.
RTX 4070, 4070 Super o 4070 Ti: ¿cuál para un LLM local?+
Para la generación de texto, son casi iguales: misma memoria de 12 GB, mismo ancho de banda de 504 GB/s, diferencia entre un 0 % y un 16 % según las mediciones citadas. La Super vale su costo adicional si envías prompts largos, ya que los lee más rápido. La Ti consume 285 W para una mejora mínima.
¿Siguen siendo suficientes 12 GB para un LLM en 2026?+
Sí para los modelos de 7 a 14 mil millones de parámetros, que cubren el chat, las tareas sencillas de programación y el RAG. No para los de 24 a 27 mil millones en Q4, que pesan entre 14 y 18 GB: un modelo de 24B alojado íntegramente en la VRAM requiere 16 GB. Los modelos con descarga de expertos a la RAM siguen siendo una opción.
¿Qué fuente de alimentación se necesita para una RTX 4070 Super?+
NVIDIA indica que se requiere una fuente de alimentación de 650 W para la 4070 y la 4070 Super, y de 700 W para la 4070 Ti, con 220 W de potencia gráfica para la Super. Son los valores del fabricante para un PC completo: una fuente de alimentación de 550 W queda fuera de esta recomendación, aunque puede ser suficiente en un PC de bajo consumo.
¿RTX 4070 o RTX 3080 de 10 GB para los LLM?+
La 3080 de 10 GB tiene un bus de 320 bits y 760 GB/s de ancho de banda, frente a los 504 de la 4070: genera más rápido siempre que el modelo quepa en sus 10 GB. La 4070 ofrece 2 GB más, lo que importa para Gemma 4 12B o Qwen3 14B. Todo depende del tamaño del modelo que quieras utilizar.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.