Intermedio 11 minRTX 50

¿Qué LLM en RTX 5070 Ti (16 GB) ?

La RTX 5070 Ti (febrero de 2025) es probablemente la mejor tarjeta de 2025 para la IA local orientada al gran público. 16 GB de VRAM GDDR7, 896 GB/s de ancho de banda, 8.960 núcleos CUDA: ejecuta Granite 4.2 8B a ~50 tokens/segundo y Mistral Small 24B Q4 con holgura, por ≈ 1.400 € a finales de septiembre de 2026, es decir, ≈ 450 € menos que una 5080. Esta guía detalla por qué es el punto de equilibrio ideal en 2026 y qué modelos instalar.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Para esta configuración: RTX 5070 Ti 16 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#La RTX 5070 Ti, punto óptimo de 16 GB

Arquitectura
Blackwell GB203 (mismo die que la 5080, más CUs desactivadas).
VRAM
16 GB GDDR7 a 28 Gbps, bus de 256 bits. Ancho de banda de 896 GB/s.
Núcleos CUDA
8 960. Tensor Cores de 5.ª generación, soporte nativo de FP4.
TDP
300 W. Fuente de alimentación de 750 W recomendada.
Precio MSRP
884 € en el lanzamiento. ≈ 1 400 € a finales de septiembre de 2026 (modelos personalizados).
→
¿Por qué es el punto ideal?
Los mismos 16 GB de GDDR7 que una 5080 y el 93 % de su ancho de banda, pero por ≈ 450 € menos. En la IA local, donde predominan la VRAM y el ancho de banda de memoria, la diferencia de CUs solo supone una pérdida de velocidad del 8-12 %, frente a una diferencia de precio del 30 %.

#1. Modelos LLM compatibles

Modelos recomendados — RTX 5070 Ti 16 GB
ModeloQuantVRAM del modeloTokens/secUso
Granite 4.2 8BQ4_K_M4,6 GB45-55Chat instantáneo
Gemma 4 12BQ4_K_M7 GB25-31Chat/RAG diario
Qwen 3.5 9BQ4_K_M6 GB25-31Asistente de código en VS Code
gpt-oss 20BQ4_K_M13 GB50-61Chat + RAG + FR
Qwen 3.5 9BQ8_011 GB18-22Calidad máxima / razonamiento
Devstral Small 2 24BQ4_K_M14 GB14-17Chat de calidad
Mistral Small 24BQ4_K_M14 GB28-35Polivalente prémium
Qwen 3.6 35B-A3BQ3_K_M~15 GB22-28RAG avanzado, MoE rápido (offload ligero)

#2. Instalación (Ollama + CUDA)

  1. 01
    Drivers NVIDIA 570+
    Necesarios para Blackwell. GeForce Experience en Windows, apt install nvidia-driver-570 en Ubuntu.
  2. 02
    Ollama
    Instalador estándar desde ollama.com, CUDA integrado. ollama run granite4.2:8b para una prueba inmediata.
  3. 03
    Verificación
    nvidia-smi debe mostrar RTX 5070 Ti, 16376 MiB. ollama ps durante una conversación: PROCESSOR 100% GPU.
Configuración completa de Linux
sudo apt update
sudo apt install nvidia-driver-570
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run mistral-small

#3. Velocidad por cuantización (órdenes de magnitud)

RTX 5070 Ti — tokens/sec (órdenes de magnitud), Ollama reciente, batch 1, Ryzen 9 7900X
ModeloQ4_K_MQ5_K_MQ6_KQ8_0
Granite 4.2 8B50 t/s46 t/s42 t/s34 t/s
Qwen 3.5 9B30 t/s28 t/s26 t/s22 t/s
Gemma 4 12B28 t/s26 t/s24 t/s20 t/s
Mistral Small 24B32 t/s28 t/s——
Devstral 24B16 t/s14 t/s——

#4. Optimizaciones Blackwell

Flash Attention 3
Activo por defecto, +10-14 % en contextos 4k+. Visible en los logs de llama.cpp.
KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0. Permite 32k de contexto en Granite 4.2 8B en ~5-6 GB en lugar de 8.
NVFP4 preparado para el futuro
Hardware disponible pero poco aprovechado en 2026. En 12 a 18 meses, Ollama admitirá FP4 → se espera un aumento del 40 % en la velocidad.
Undervolt
250 W en lugar de 300 W (a través de MSI Afterburner -80 mV): -1 % de rendimiento en LLM, -5 °C, gabinete más silencioso.

#5. 5070 Ti vs 4070 Ti Super vs 5080

Las tres tarjetas prémium de 16 GB
Criterio5070 Ti4070 Ti Super5080
VRAM16 GB GDDR716 GB GDDR6X16 GB GDDR7
Ancho de banda896 GB/s672 GB/s960 GB/s
Granite 4.2 8B Q450 t/s42 t/s56 t/s
Gemma 4 12B Q428 t/s23 t/s32 t/s
Precio 2026≈ 1 400 € al final de septiembre de 2026de segunda mano, precio variable≈ 1 850 € a finales de septiembre de 2026
Rendimiento por euro en LLM★★★★★★★★★★★★

#Veredicto de compra 2026

Mejor opción de LLM para el público general en 2026
Para quien, a finales de septiembre de 2026, tiene un presupuesto de aproximadamente 1.400 € para una GPU y quiere usar LLM en serio sin recurrir a una 5090. Supera con creces a la 5080 en rendimiento por euro.
¿Actualizar desde una 4070 Ti Super?
+20 % de velocidad en LLM, +33 % de ancho de banda. No es imprescindible si ya funciona, pero puede justificarse si vendes la 4070 Ti Super a un precio de segunda mano variable.
vs RTX 4090 de segunda mano
La 4090 de segunda mano (con un precio variable) mantiene la ventaja para los modelos de 70B (24 GB de VRAM). Si no necesitas esa capacidad, la 5070 Ti ofrece un rendimiento con LLM de 14B casi equivalente por bastante menos dinero.

#Preguntas frecuentes

¿RTX 5070 Ti o RTX 5080 para LLM?+
5070 Ti sin dudarlo si tu presupuesto es < 1 700 €. Pierdes ~10 % de velocidad en Granite 4.2 8B (50 vs 56 tok/s) a cambio de ahorrar ≈ 450 €. Misma VRAM (16 GB), misma generación, misma memoria GDDR7. La 5080 se justifica para un uso mixto de juegos en 4K + LLM si quieres lo mejor.
¿Puede la RTX 5070 Ti 16 GB ejecutar Mistral Small 24B?+
Sí, en Q4_K_M (14 GB) a 28-35 tokens/segundo. Es el modelo multifuncional que aprovecha mejor sus 16 GB. En Q5_K_M (17 GB), ligero offload pero aún utilizable a 20-25 tok/s.
¿Cuál es la diferencia entre RTX 4070 Ti Super y RTX 5070 Ti?+
Misma VRAM (16 GB) pero GDDR7 en lugar de GDDR6X → +33 % de ancho de banda. Resultado LLM: +20-25 % de tokens por segundo. Precio similar al lanzamiento, pero la 4070 Ti Super se encuentra más barata de ocasión (~750 € frente a 950 € nueva).
¿Se puede hacer QLoRA en RTX 5070 Ti 16 GB?+
Sí, cómodamente con modelos de 7B-8B (se requieren 10-12 GB con un tamaño de lote de 4 y un contexto de 2048). Para modelos de 14B con QLoRA, la memoria va justa, pero es viable con unsloth. Para modelos de 24B con QLoRA: imposible, se necesitan 20 GB o más.
¿Una fuente de alimentación de 650 W es suficiente para una RTX 5070 Ti?+
Sí, con un CPU ≤ 150 W (Ryzen 7600/7700, Core i5). TDP 300 W GPU + 150 W CPU + 50 W sistema = 500 W nominal, 650 W ofrecen margen. Si CPU ≥ 180 W (9950X, 14900K), busca 750 W.
¿La RTX 5070 Ti soporta FP4 / NVFP4?+
Sí, los Tensor Cores 5ª generación Blackwell gestionan FP4 de forma nativa. En 2026, Ollama y llama.cpp aún no los aprovechan — eso vendrá. A través de TensorRT-LLM 0.18+ o vLLM 0.7+, ya se observa un incremento de +30-40 % respecto a Q4_K_M en modelos cuantificados en NVFP4.
Vengo de una RTX 3080 de 10 GB, ¿el upgrade vale la pena?+
Sí, salto generacional enorme. +60 % de VRAM (10 → 16 GB — abre los 14B-24B), +3× la banda ancha (760 → 896 GB/s después de inflación GDDR7), +2× la velocidad bruta. Si usas un LLM diariamente, este es el upgrade más rentable de 2026.

Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.