¿Qué LLM en RTX 4070 Ti Super (16 GB)? ?
La RTX 4070 Ti Super es una tarjeta con 16 GB de GDDR6X y un ancho de banda de 672 GB/s: carga en VRAM Gemma 4 12B (7,7 a 8 GB), gpt-oss 20B, Mistral Small 24B (14 GB cada uno) y cualquier modelo de hasta unos 14 GB. Es la única tarjeta de la familia 4070 que supera los 12 GB, y su ancho de banda es más del doble que el de una RTX 4060 Ti de 16 GB. Su límite teórico alcanza alrededor de 127 tokens/s con un modelo de 5,3 GB.
Cuando buscas un LLM local para una RTX 4070, encuentras cuatro tarjetas que se parecen: 4070, 4070 Super, 4070 Ti y 4070 Ti Super. Solo una ofrece 16 GB. Esta guía explica lo que permiten esta capacidad y este bus de 256 bits, lo que queda fuera de alcance y cómo se compara la tarjeta con una RTX 4080 Super o una RTX 5070 Ti.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: RTX 5070 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 4070 Ti Super para un LLM local: lo que permiten 16 GB
Una RTX 4070 Ti Super ejecuta sin problemas modelos de 4B a 24B en Q4. Tiene 16 GB de GDDR6X en un bus de 256 bits, lo que equivale a 672 GB/s, y 8.448 núcleos CUDA según NVIDIA. Esta combinación la sitúa por encima de todas las tarjetas de 8 y 12 GB: Gemma 4 12B cabe con un amplio margen para el contexto, gpt-oss 20B y Mistral Small 24B, cada uno de 14 GB, caben en la VRAM con aproximadamente 2 GB de margen, y un modelo de 5 a 8 GB funciona cerca del límite de su ancho de banda. Lo que no cabe es el siguiente nivel: Qwen 3.5 27B pesa 17 GB y supera la capacidad de la tarjeta. La 4070 Ti Super, por tanto, no es una tarjeta para modelos de 30B, sino una de las más equilibradas para todo lo que está por debajo.
- Arquitectura
- Ada Lovelace, chip AD103, el mismo que la RTX 4080 pero con menos unidades activas.
- Memoria
- 16 GB de GDDR6X, bus de 256 bits, ancho de banda de 672 GB/s según Wikipedia.
- Cálculo
- 8 448 núcleos CUDA según la página de producto NVIDIA, Tensor Cores de 4.ª generación.
- Potencia
- 285 W de potencia gráfica total; NVIDIA indica 700 W de alimentación mínima para todo el ordenador.
#4070, 4070 Super, 4070 Ti, 4070 Ti Super: ¿cuál elegir para un LLM?
Las cuatro tarjetas comparten el nombre de la gama, pero no ofrecen lo mismo para los LLM. Tres de ellas están limitadas a 12 GB de VRAM; solo la Ti Super alcanza los 16 GB y cuenta con un bus de 256 bits. Para la IA local, esta diferencia pesa más que la potencia de cálculo bruta: determina qué modelos admite la tarjeta.
| Tarjeta | Memoria | Bus | Núcleos CUDA | Potencia |
|---|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 256 bits | 8 448 | 285 W |
| RTX 4070 Ti | 12 GB GDDR6X | 192 bits | 7 680 | 285 W |
| RTX 4070 Super | 12 GB GDDR6X | 192 bits | 7 168 | 220 W |
| RTX 4070 | 12 GB GDDR6 o GDDR6X | 192 bits | 5 888 | 200 W |
La RTX 4070 Ti ofrece 504 GB/s según Wikipedia, frente a los 672 GB/s de la Ti Super. Si tu búsqueda era sobre una RTX 4070 clásica, la página dedicada trata la variante de 12 GB. Un punto común a todas: los modelos de 12B caben, mientras que los de 14 GB o más requieren 16 GB.
#Qué modelos caben en 16 GB
| Modelo | Tamaño | Margen con 16 GB | Veredicto |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 10,7 GB | Muy amplio: contexto largo |
| Gemma 4 12B | 7,7 a 8,0 GB | 8 GB | Cómodo |
| gpt-oss 20B | 14 GB | 2 GB | Cabe, pero hay que vigilar el contexto |
| Mistral Small 24B | 14 GB | 2 GB | Cabe, pero hay que vigilar el contexto |
| Devstral Small 2 24B | 15 GB | 1 GB | Cabe por muy poco, contexto muy corto |
| Qwen 3.5 27B | 17 GB | Negativo | No cabe |
Los modelos de 14 y 15 GB dejan poco espacio para la caché de contexto: Ollama usa por defecto 4 096 tokens, que sí caben, pero 16 000 tokens exigen cuantizar la caché K/V. Devstral Small 2, un modelo de código, está al límite: con 15 GB, apenas queda espacio para el contexto. Para código, Mistral Small 24B o un modelo más pequeño con un contexto más largo es una mejor opción con 16 GB.
#Lo que queda fuera del alcance de los 16 GB
Tres familias de modelos superan la capacidad de la tarjeta. Los modelos de 27B a 35B en Q4: Qwen 3.5 27B pesa 17 GB y Qwen 3.5 35B, 24 GB según Ollama; Gemma 4 26B pesa entre 16 y 19 GB. Los modelos de 70B, cuyos pesos por sí solos rondan los 40 GB según la referencia del sitio. Y los modelos de contexto largo utilizados al máximo: un modelo de 8 GB con una capacidad de contexto anunciada de 256 000 tokens nunca cabrá con una caché completa. Para estos casos, pasa a 24 GB de VRAM, a un Mac con memoria unificada o a una máquina dedicada: la página dedicada al hardware compara estas opciones.
#Instalar y comprobar la carga en VRAM
- 01ControladorOllama requiere un controlador NVIDIA 550 o más reciente para las tarjetas GeForce recientes. Verifica tu versión con nvidia-smi.
- 02InstalaciónInstala Ollama en tu sistema, sin instalar CUDA por separado.
- 03Primer testInicia ollama run mistral-small para un primer modelo que utilice los 16 GB, luego ollama ps.
- 04ControlLa columna PROCESSOR debe mostrar 100 % GPU; de lo contrario, reduce el contexto.
La caché K/V en q8_0 utiliza aproximadamente la mitad de la memoria que en f16, el formato predeterminado, y requiere Flash Attention. Esta configuración permite que un modelo de 14 GB trabaje con un contexto de 16 000 tokens en 16 GB.
#Qué velocidad esperar: límites y mediciones de terceros
Aquí no se presenta ninguna velocidad de generación como una medición propia. El límite de generación es el ancho de banda dividido por el tamaño de los pesos. Una medición pública de un tercero (LLaMA 3 8B en Q4_K_M con llama.cpp, mayo de 2024) registra 106 tokens/s en una RTX 4080 de 716,8 GB/s, es decir, aproximadamente un 68 % de su límite, y un 75 % en una RTX 4070 Ti. El ancho de banda de la 4070 Ti Super es similar al de la 4080, por lo que su velocidad de generación también es del mismo orden de magnitud. La tabla aplica un 70 % al límite.
| Modelo | Tamaño del modelo | Límite máximo | Estimación al 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 127 tokens/s | aproximadamente 89 tokens/s |
| Qwen 3.5 9B | 6,6 GB | 102 tokens/s | aproximadamente 71 tokens/s |
| Gemma 4 12B | 7,7 GB | 87 tokens/s | aproximadamente 61 tokens/s |
| Mistral Small 24B | 14 GB | 48 tokens/s | aproximadamente 34 tokens/s |
gpt-oss 20B es un modelo de expertos: solo lee una parte de sus pesos por token, por lo que su velocidad supera la de un modelo denso de 14 GB. Aquí no se reproduce ninguna cifra respaldada por una fuente. Recuerda sobre todo que la tarjeta pasa de ser rápida con un 8B a ofrecer un rendimiento aceptable con un 24B.
#4070 Ti Super frente a la 4080 Super y a la 5070 Ti
| Tarjeta | VRAM | Ancho de banda | Nota |
|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 672 GB/s | Mismo chip AD103 que la 4080 |
| RTX 4080 Super | 16 GB GDDR6X | 736 GB/s | Aproximadamente un 10 % más de ancho de banda |
| RTX 5070 Ti | 16 GB GDDR7 | 896 GB/s | 33 % más de ancho de banda |
Las tres tarjetas ofrecen 16 GB: la capacidad es la misma, por lo tanto, la lista de modelos también. Solo cambia la velocidad de generación, proporcionalmente al ancho de banda. La 4080 Super gana aproximadamente un 10 %; la 5070 Ti, aproximadamente un tercio. En el mercado de segunda mano, la diferencia de precio cuenta más que estas diferencias de velocidad: consulta el seguimiento de precios para comparar. Una 4070 Ti Super de segunda mano a buen precio sigue siendo una excelente opción; una 5070 Ti nueva se justifica por la garantía y la velocidad.
- ¿Qué LLM en RTX 4080 y 4080 Super?
- ¿Qué LLM en RTX 5070 Ti?
- Precios de las tarjetas gráficas para IA local
#Usos que aprovechan los 16 GB
Los 16 GB cambian sobre todo lo que se puede ejecutar al mismo tiempo. Un RAG local combina un modelo de generación, un modelo de embeddings y un contexto lo bastante largo para contener los fragmentos recuperados: con Gemma 4 12B (7,7 a 8 GB) y un pequeño modelo de embeddings, el conjunto cabe con varios gigabytes de margen. A un asistente de código le basta con un modelo de 8B a 12B y un contexto de 16.000 tokens, sin ninguna restricción. Un modelo de 14 GB como Mistral Small 24B ocupa casi toda la tarjeta: se convierte en una opción exclusiva, no en un modelo entre otros.
| Uso | Configuración | Espacio restante |
|---|---|---|
| RAG personal | Gemma 4 12B y modelo de embeddings ligero | Alrededor de 7 GB para el contexto |
| Asistente de código | Modelo de 8B, contexto de 16 000 tokens, caché q8_0 | Alrededor de 9 GB |
| Chat de máxima calidad | Mistral Small 24B solo | Aproximadamente 2 GB, contexto corto |
Un detalle que puede causar problemas en el uso compartido: en Ollama, varias solicitudes en paralelo al mismo modelo aumentan proporcionalmente el tamaño del contexto reservado. Atender a tres compañeros con un modelo de 14 GB puede, por tanto, superar la capacidad de memoria de la tarjeta, aunque con un solo usuario funcione sin dificultad. Con 16 GB, limita el paralelismo o elige un modelo más ligero para el uso compartido.
#Comprar una 4070 Ti Super de ocasión: lo que hay que verificar
La tarjeta salió en enero de 2024: la mayoría de las unidades de segunda mano tienen menos de tres años, pero nada garantiza cómo se han utilizado anteriormente. Los precios cambian cada semana: consulta el seguimiento de precios en lugar de una cifra fija en esta guía. Antes de comprar, comprueba que nvidia-smi muestre realmente 16 GB de memoria, ejecuta un modelo de 14 GB y vigila la temperatura durante una generación larga, y escucha los ventiladores. Pide la factura y la garantía restante del fabricante: a menudo se transfieren junto con la tarjeta.
#Veredicto 2026
- Consérvala si
- Tus modelos caben en 16 GB. Nada justifica reemplazarla antes de necesitar 24 GB.
- Cómprala de segunda mano si
- El precio es significativamente inferior al de una 5070 Ti nueva. Revisa la garantía restante, la temperatura y el ruido de los ventiladores.
- Busca 24 GB si
- Quieres Qwen 3.5 27B o más: ningún ajuste hará que 17 GB entren en 16 GB con contexto, y una tarjeta de 24 GB evita tener que comprar de nuevo.
- Fuente: características oficiales NVIDIA (familia RTX 4070)
- Fuente: preguntas frecuentes oficiales de Ollama (Flash Attention, caché K/V)
- Fuente: tamaño de Mistral Small en la biblioteca Ollama
#Preguntas frecuentes
¿Puede la RTX 4070 Ti Super ejecutar Mistral Small 24B?+
¿Qué diferencia hay entre RTX 4070 Ti y 4070 Ti Super para un LLM?+
¿RTX 4070 Ti Super o RTX 5070 Ti?+
¿RTX 4070 Ti Super o 4080 para un LLM?+
¿Qué fuente de alimentación se necesita para una RTX 4070 Ti Super?+
¿Se puede ejecutar Qwen 3.5 27B en una RTX 4070 Ti Super?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.