Intermedio 11 minRTX 40

¿Qué LLM en RTX 4070 Ti Super (16 GB)? ?

Respuesta directa

La RTX 4070 Ti Super es una tarjeta con 16 GB de GDDR6X y un ancho de banda de 672 GB/s: carga en VRAM Gemma 4 12B (7,7 a 8 GB), gpt-oss 20B, Mistral Small 24B (14 GB cada uno) y cualquier modelo de hasta unos 14 GB. Es la única tarjeta de la familia 4070 que supera los 12 GB, y su ancho de banda es más del doble que el de una RTX 4060 Ti de 16 GB. Su límite teórico alcanza alrededor de 127 tokens/s con un modelo de 5,3 GB.

Cuando buscas un LLM local para una RTX 4070, encuentras cuatro tarjetas que se parecen: 4070, 4070 Super, 4070 Ti y 4070 Ti Super. Solo una ofrece 16 GB. Esta guía explica lo que permiten esta capacidad y este bus de 256 bits, lo que queda fuera de alcance y cómo se compara la tarjeta con una RTX 4080 Super o una RTX 5070 Ti.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: RTX 5070 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 4070 Ti Super para un LLM local: lo que permiten 16 GB

Una RTX 4070 Ti Super ejecuta sin problemas modelos de 4B a 24B en Q4. Tiene 16 GB de GDDR6X en un bus de 256 bits, lo que equivale a 672 GB/s, y 8.448 núcleos CUDA según NVIDIA. Esta combinación la sitúa por encima de todas las tarjetas de 8 y 12 GB: Gemma 4 12B cabe con un amplio margen para el contexto, gpt-oss 20B y Mistral Small 24B, cada uno de 14 GB, caben en la VRAM con aproximadamente 2 GB de margen, y un modelo de 5 a 8 GB funciona cerca del límite de su ancho de banda. Lo que no cabe es el siguiente nivel: Qwen 3.5 27B pesa 17 GB y supera la capacidad de la tarjeta. La 4070 Ti Super, por tanto, no es una tarjeta para modelos de 30B, sino una de las más equilibradas para todo lo que está por debajo.

Arquitectura
Ada Lovelace, chip AD103, el mismo que la RTX 4080 pero con menos unidades activas.
Memoria
16 GB de GDDR6X, bus de 256 bits, ancho de banda de 672 GB/s según Wikipedia.
Cálculo
8 448 núcleos CUDA según la página de producto NVIDIA, Tensor Cores de 4.ª generación.
Potencia
285 W de potencia gráfica total; NVIDIA indica 700 W de alimentación mínima para todo el ordenador.

#4070, 4070 Super, 4070 Ti, 4070 Ti Super: ¿cuál elegir para un LLM?

Las cuatro tarjetas comparten el nombre de la gama, pero no ofrecen lo mismo para los LLM. Tres de ellas están limitadas a 12 GB de VRAM; solo la Ti Super alcanza los 16 GB y cuenta con un bus de 256 bits. Para la IA local, esta diferencia pesa más que la potencia de cálculo bruta: determina qué modelos admite la tarjeta.

Familia RTX 4070: lo que importa para el LLM (fuente NVIDIA)
TarjetaMemoriaBusNúcleos CUDAPotencia
RTX 4070 Ti Super16 GB GDDR6X256 bits8 448285 W
RTX 4070 Ti12 GB GDDR6X192 bits7 680285 W
RTX 4070 Super12 GB GDDR6X192 bits7 168220 W
RTX 407012 GB GDDR6 o GDDR6X192 bits5 888200 W

La RTX 4070 Ti ofrece 504 GB/s según Wikipedia, frente a los 672 GB/s de la Ti Super. Si tu búsqueda era sobre una RTX 4070 clásica, la página dedicada trata la variante de 12 GB. Un punto común a todas: los modelos de 12B caben, mientras que los de 14 GB o más requieren 16 GB.

#Qué modelos caben en 16 GB

Modelos en RTX 4070 Ti Super (tamaños en Ollama, solo los pesos)
ModeloTamañoMargen con 16 GBVeredicto
Granite 4.2 8B5,3 GB10,7 GBMuy amplio: contexto largo
Gemma 4 12B7,7 a 8,0 GB8 GBCómodo
gpt-oss 20B14 GB2 GBCabe, pero hay que vigilar el contexto
Mistral Small 24B14 GB2 GBCabe, pero hay que vigilar el contexto
Devstral Small 2 24B15 GB1 GBCabe por muy poco, contexto muy corto
Qwen 3.5 27B17 GBNegativoNo cabe

Los modelos de 14 y 15 GB dejan poco espacio para la caché de contexto: Ollama usa por defecto 4 096 tokens, que sí caben, pero 16 000 tokens exigen cuantizar la caché K/V. Devstral Small 2, un modelo de código, está al límite: con 15 GB, apenas queda espacio para el contexto. Para código, Mistral Small 24B o un modelo más pequeño con un contexto más largo es una mejor opción con 16 GB.

#Lo que queda fuera del alcance de los 16 GB

Tres familias de modelos superan la capacidad de la tarjeta. Los modelos de 27B a 35B en Q4: Qwen 3.5 27B pesa 17 GB y Qwen 3.5 35B, 24 GB según Ollama; Gemma 4 26B pesa entre 16 y 19 GB. Los modelos de 70B, cuyos pesos por sí solos rondan los 40 GB según la referencia del sitio. Y los modelos de contexto largo utilizados al máximo: un modelo de 8 GB con una capacidad de contexto anunciada de 256 000 tokens nunca cabrá con una caché completa. Para estos casos, pasa a 24 GB de VRAM, a un Mac con memoria unificada o a una máquina dedicada: la página dedicada al hardware compara estas opciones.

#Instalar y comprobar la carga en VRAM

  1. 01
    Controlador
    Ollama requiere un controlador NVIDIA 550 o más reciente para las tarjetas GeForce recientes. Verifica tu versión con nvidia-smi.
  2. 02
    Instalación
    Instala Ollama en tu sistema, sin instalar CUDA por separado.
  3. 03
    Primer test
    Inicia ollama run mistral-small para un primer modelo que utilice los 16 GB, luego ollama ps.
  4. 04
    Control
    La columna PROCESSOR debe mostrar 100 % GPU; de lo contrario, reduce el contexto.
Contexto largo con 16 GB (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

La caché K/V en q8_0 utiliza aproximadamente la mitad de la memoria que en f16, el formato predeterminado, y requiere Flash Attention. Esta configuración permite que un modelo de 14 GB trabaje con un contexto de 16 000 tokens en 16 GB.

#Qué velocidad esperar: límites y mediciones de terceros

Aquí no se presenta ninguna velocidad de generación como una medición propia. El límite de generación es el ancho de banda dividido por el tamaño de los pesos. Una medición pública de un tercero (LLaMA 3 8B en Q4_K_M con llama.cpp, mayo de 2024) registra 106 tokens/s en una RTX 4080 de 716,8 GB/s, es decir, aproximadamente un 68 % de su límite, y un 75 % en una RTX 4070 Ti. El ancho de banda de la 4070 Ti Super es similar al de la 4080, por lo que su velocidad de generación también es del mismo orden de magnitud. La tabla aplica un 70 % al límite.

Límite teórico en RTX 4070 Ti Super (672 GB/s)
ModeloTamaño del modeloLímite máximoEstimación al 70 %
Granite 4.2 8B5,3 GB127 tokens/saproximadamente 89 tokens/s
Qwen 3.5 9B6,6 GB102 tokens/saproximadamente 71 tokens/s
Gemma 4 12B7,7 GB87 tokens/saproximadamente 61 tokens/s
Mistral Small 24B14 GB48 tokens/saproximadamente 34 tokens/s

gpt-oss 20B es un modelo de expertos: solo lee una parte de sus pesos por token, por lo que su velocidad supera la de un modelo denso de 14 GB. Aquí no se reproduce ninguna cifra respaldada por una fuente. Recuerda sobre todo que la tarjeta pasa de ser rápida con un 8B a ofrecer un rendimiento aceptable con un 24B.

#4070 Ti Super frente a la 4080 Super y a la 5070 Ti

Tarjetas de 16 GB para comparar
TarjetaVRAMAncho de bandaNota
RTX 4070 Ti Super16 GB GDDR6X672 GB/sMismo chip AD103 que la 4080
RTX 4080 Super16 GB GDDR6X736 GB/sAproximadamente un 10 % más de ancho de banda
RTX 5070 Ti16 GB GDDR7896 GB/s33 % más de ancho de banda

Las tres tarjetas ofrecen 16 GB: la capacidad es la misma, por lo tanto, la lista de modelos también. Solo cambia la velocidad de generación, proporcionalmente al ancho de banda. La 4080 Super gana aproximadamente un 10 %; la 5070 Ti, aproximadamente un tercio. En el mercado de segunda mano, la diferencia de precio cuenta más que estas diferencias de velocidad: consulta el seguimiento de precios para comparar. Una 4070 Ti Super de segunda mano a buen precio sigue siendo una excelente opción; una 5070 Ti nueva se justifica por la garantía y la velocidad.

#Usos que aprovechan los 16 GB

Los 16 GB cambian sobre todo lo que se puede ejecutar al mismo tiempo. Un RAG local combina un modelo de generación, un modelo de embeddings y un contexto lo bastante largo para contener los fragmentos recuperados: con Gemma 4 12B (7,7 a 8 GB) y un pequeño modelo de embeddings, el conjunto cabe con varios gigabytes de margen. A un asistente de código le basta con un modelo de 8B a 12B y un contexto de 16.000 tokens, sin ninguna restricción. Un modelo de 14 GB como Mistral Small 24B ocupa casi toda la tarjeta: se convierte en una opción exclusiva, no en un modelo entre otros.

Tres configuraciones típicas con 16 GB
UsoConfiguraciónEspacio restante
RAG personalGemma 4 12B y modelo de embeddings ligeroAlrededor de 7 GB para el contexto
Asistente de códigoModelo de 8B, contexto de 16 000 tokens, caché q8_0Alrededor de 9 GB
Chat de máxima calidadMistral Small 24B soloAproximadamente 2 GB, contexto corto

Un detalle que puede causar problemas en el uso compartido: en Ollama, varias solicitudes en paralelo al mismo modelo aumentan proporcionalmente el tamaño del contexto reservado. Atender a tres compañeros con un modelo de 14 GB puede, por tanto, superar la capacidad de memoria de la tarjeta, aunque con un solo usuario funcione sin dificultad. Con 16 GB, limita el paralelismo o elige un modelo más ligero para el uso compartido.

#Comprar una 4070 Ti Super de ocasión: lo que hay que verificar

La tarjeta salió en enero de 2024: la mayoría de las unidades de segunda mano tienen menos de tres años, pero nada garantiza cómo se han utilizado anteriormente. Los precios cambian cada semana: consulta el seguimiento de precios en lugar de una cifra fija en esta guía. Antes de comprar, comprueba que nvidia-smi muestre realmente 16 GB de memoria, ejecuta un modelo de 14 GB y vigila la temperatura durante una generación larga, y escucha los ventiladores. Pide la factura y la garantía restante del fabricante: a menudo se transfieren junto con la tarjeta.

#Veredicto 2026

Consérvala si
Tus modelos caben en 16 GB. Nada justifica reemplazarla antes de necesitar 24 GB.
Cómprala de segunda mano si
El precio es significativamente inferior al de una 5070 Ti nueva. Revisa la garantía restante, la temperatura y el ruido de los ventiladores.
Busca 24 GB si
Quieres Qwen 3.5 27B o más: ningún ajuste hará que 17 GB entren en 16 GB con contexto, y una tarjeta de 24 GB evita tener que comprar de nuevo.

#Preguntas frecuentes

FAQ
¿Puede la RTX 4070 Ti Super ejecutar Mistral Small 24B?+
Sí: el modelo pesa 14 GB según Ollama, la tarjeta tiene 16 GB. Quedan aproximadamente 2 GB para el contexto y el sistema. El contexto por defecto de 4.096 tokens funciona; para 16.000 tokens, activa Flash Attention y la caché K/V en q8_0 para reducir el uso de memoria de la caché aproximadamente a la mitad.
¿Qué diferencia hay entre RTX 4070 Ti y 4070 Ti Super para un LLM?+
La Ti Super tiene 16 GB de memoria en un bus de 256 bits, y la Ti solo 12 GB en un bus de 192 bits. El ancho de banda pasa de 504 GB/s a 672 GB/s según Wikipedia. Para un LLM, la capacidad es lo que más importa: la Ti Super carga modelos de 14 GB que la Ti no puede alojar.
¿RTX 4070 Ti Super o RTX 5070 Ti?+
Ambas tienen 16 GB, por lo que pueden ejecutar los mismos modelos. La 5070 Ti lee su memoria a 896 GB/s frente a 672 GB/s, es decir, aproximadamente un tercio más. Es más rápida y nueva, con garantía; la 4070 Ti Super se justifica principalmente si su precio de segunda mano es claramente inferior.
¿RTX 4070 Ti Super o 4080 para un LLM?+
Ambas tienen 16 GB de VRAM. La 4080 Super tiene 736 GB/s de ancho de banda frente a 672 GB/s, aproximadamente un 10 % más, y la 4080 clásica tiene 716,8 GB/s. Para un LLM, la diferencia es modesta: la diferencia de precio en el mercado de segunda mano debe determinar tu elección, no la ficha técnica.
¿Qué fuente de alimentación se necesita para una RTX 4070 Ti Super?+
NVIDIA indica 285 W de potencia gráfica total y una fuente de alimentación de al menos 700 W para el PC completo. Una fuente de alimentación de calidad de 750 W deja un margen cómodo. Revisa también los conectores: la tarjeta requiere dos cables PCIe de 8 pines o un cable PCIe Gen 5 de 300 W o más.
¿Se puede ejecutar Qwen 3.5 27B en una RTX 4070 Ti Super?+
No completamente en VRAM: el modelo pesa 17 GB según Ollama, la tarjeta tiene 16 GB. Una parte se leería desde la RAM del sistema, lo que ralentiza significativamente la generación. Para este modelo, busca 24 GB de VRAM; con 16 GB, elige un modelo de 14 GB o menos.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.