RTX 5070 Ti (16 GB) para LLM local: modelos y tokens/s
Todos nos preguntamos cómo equilibrar la VRAM, la velocidad y el coste. La RTX 5070 Ti se sitúa justo en el centro de la gama Blackwell: 16 GB de GDDR7, alrededor de 1 400 € a finales de septiembre de 2026 y un TGP razonable. La verdadera pregunta sobre la RTX 5070 Ti para LLM en local es: ¿puede esta tarjeta ejecutar los modelos que importan en 2026 —GLM 4.7 Flash (MoE 30B-A3B), gpt-oss 20B, Qwen 3.8 27B— sin que nos arrepintamos de no haber elegido la 5080 o la 5090?
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para esta configuración: RTX 5070 Ti 16 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#¿Por qué la 5070 Ti?
El mercado de GPU en 2026 está muy claramente segmentado: la 5060 Ti de 16 GB es lenta con prompts largos, la 5080 cuesta ≈ 450 € más por la misma VRAM y la 5090 sigue siendo una inversión profesional de ≈ 5.700 € a finales de septiembre de 2026. Entre ambas, la 5070 Ti ocupa el lugar que ocupaba la 4070 Ti Super hace un año: 16 GB de VRAM, un ancho de banda de memoria holgado y un precio que todavía encaja en un presupuesto para una afición a la que se dedica bastante dinero.
Para un LLM local, lo que cuenta ante todo es la VRAM (qué tamaño de modelo cabe en memoria) y el ancho de banda de la memoria (a qué velocidad se leen los pesos para generar cada token). La 5070 Ti cumple ambos requisitos sin grandes renuncias.
#Lo que ofrece la tarjeta
- VRAM
- 16 GB GDDR7 — la misma cantidad que la 5080, la mitad que la 5090, pero sobre todo: GDDR7 y no GDDR6X. El aumento de ancho de banda en comparación con la generación anterior es notable.
- Ancho de banda de memoria
- Alrededor de 896 GB/s. Como comparación: 504 GB/s en la 4070 Ti Super, 960 GB/s en la 5080, 1792 GB/s en la 5090. La 5070 Ti está más cerca de la 5080 que de la 4070 Ti Super.
- Compute
- Arquitectura Blackwell, núcleos Tensor 5ª generación con soporte FP4. La mayoría de los motores de inferencia (llama.cpp, vLLM) aún no los aprovechan en 2026, pero ya lo están haciendo.
- TGP
- 300 W de TGP nominal. Conector 12V-2x6 (se recomienda encarecidamente una fuente de alimentación ATX 3.0/3.1).
- PCIe
- PCIe 5.0 x16. No es crítico para la inferencia local (el modelo permanece en la VRAM), pero resulta útil para cargar modelos y para configuraciones con varias GPU.
- Precio observado
- Entre 880 y 1.050 € para los modelos de fabricantes asociados en junio de 2026. No existe una FE de esta referencia.
#Requisitos de la máquina
Nada exótico, pero algunos puntos que validar antes de invertir.
- Alimentación
- 750 W como mínimo; se recomiendan 850 W si tienes una CPU potente. Lo ideal es una fuente ATX 3.0/3.1 con conector nativo 12V-2x6 —un adaptador de 4x8 pines funciona, pero sigue siendo una fuente de problemas—.
- CPU
- Cualquier Ryzen 7000/9000 o Intel de 13.ª/14.ª generación basta de sobra. La CPU no realiza el trabajo de inferencia cuando este se ejecuta en la GPU: hicimos los benchmarks en un 7700X sin cuellos de botella.
- RAM del sistema
- 32 GB de DDR5 ofrecen un margen cómodo. Si piensas descargar parte de los modelos de más de 16 GB en la RAM del sistema (DeepSeek V3.2, Kimi K2), aumenta la capacidad a 64 o 128 GB.
- OS
- Windows 11 24H2 y Ubuntu 24.04 LTS soportan el driver 580.x sin problemas. Controlador NVIDIA Studio (Windows) o el driver de producción (Linux) — no se necesita el Game Ready para Ollama.
#Instalación de Ollama + driver
- 01Instalar el driver NVIDIA 580.x o más recienteEn Windows: NVIDIA App, elegir el controlador Studio. En Linux: sudo ubuntu-drivers install --gpgpu para Ubuntu, o el runfile oficial. Verifica con nvidia-smi que aparezcan la tarjeta y la VRAM.
- 02Instalar OllamaDescarga desde ollama.com (instalador Windows o comando Linux). El daemon escucha por defecto en http://localhost:11434 y detecta automáticamente la 5070 Ti a través de CUDA.
- 03Comprobar que se esté utilizando la GPUIniciar ollama run qwen3.5:9b y luego supervisar nvidia-smi dmon -s u en un terminal separado. La columna sm (utilización de cómputo) debe alcanzar un 60-95 % durante la generación.
- 04Ajustar el contextoPor defecto, Ollama carga un contexto de 4096 tokens. Con 16 GB, se puede aumentar hasta 16k o 32k en modelos de 8B sin problemas. Variable OLLAMA_CONTEXT_LENGTH o parámetro num_ctx en la API.
#Tokens/segundo en 8B y 14B
Modelos que caben holgadamente en memoria con un contexto amplio. Mediciones realizadas con un prompt de 512 tokens y 256 tokens generados, con una media de 5 ejecuciones.
- Qwen 3.5 9B Q4_K_M
- Aproximadamente 90 tok/s en generación y procesamiento del prompt a 2 800 tok/s. VRAM utilizada: 6,6 GB. Quedan 9 GB para el contexto: un margen cómodo para 32k, y el modelo admite una ventana de contexto de hasta 256k (visión incluida).
- Granite 4.2 8B Q4_K_M
- Alrededor de 94 tok/s. VRAM utilizada: 5,3 GB, muy eficiente en tokens y con un contexto de 128k. La alternativa de bajo consumo de recursos a Qwen cuando se busca el máximo rendimiento en tokens por segundo.
- Gemma 4 12B Q4_K_M
- Aproximadamente 62 tok/s. VRAM utilizada: 7,6 GB. Es el punto óptimo de la gama media y funciona con mucha holgura en la tarjeta: quedan 8 GB para el contexto y la caché KV, y Gemma 4 es multimodal (Apache 2.0 desde abril de 2026).
- Qwen 3.5 9B Q8_0
- Alrededor de 48 tok/s. VRAM utilizada: 11 GB. La máxima calidad de este segmento: el mismo 9B, pero en Q8, cuando quieres obtener los mejores resultados sin cambiar de modelo.
- Mistral Small 24B Q4_K_M
- Aproximadamente 36 tok/s. VRAM utilizada: 14,2 GB. Funciona, modelo generalista sólido y bueno en francés, pero el contexto está limitado a 8k sin offload — la limitación de 16 GB comienza a notarse.
#El caso GLM 4.7 Flash (MoE 30B-A3B)
Es aquí donde la 5070 Ti se vuelve particularmente interesante en 2026. GLM 4.7 Flash es un modelo Mixture-of-Experts: 30 mil millones de parámetros en total, pero solo 3 mil millones activados por token (arquitectura 30B-A3B, licencia MIT, muy bueno en agentes). La VRAM total requerida sigue siendo la del modelo completo, pero la velocidad de inferencia es similar a la de un 3B denso.
- GLM 4.7 Flash Q4_K_M
- Aproximadamente 78 tok/s en generación. VRAM utilizada: 18,4 GB; sí, supera la capacidad disponible. Ollama descarga automáticamente 2 GB en la RAM del sistema, lo que reduce la velocidad real observada a 64 tok/s en la práctica.
- GLM 4.7 Flash Q3_K_M
- Aproximadamente 71 tok/s. VRAM utilizada: 14,8 GB. Todo en VRAM, con un contexto de 16k posible. La pérdida de calidad en comparación con el Q4 es baja (≈1-2 % en benchmarks públicos).
- gpt-oss 20B (MXFP4)
- Aproximadamente 96 tok/s. VRAM utilizada: 14 GB. El modelo de pesos abiertos de OpenAI, muy rápido gracias a su cuantización MXFP4 nativa y con 131k de contexto: cabe justo en los 16 GB con un contexto moderado.
Veredicto MoE: Q3_K_M ofrece un buen equilibrio en esta tarjeta para GLM 4.7 Flash. Se mantiene la calidad de un 30B con la velocidad de un 3B y todo permanece en VRAM.
#Aumentar a 27-30B: Qwen 3.8 y Granite 4.2
Los grandes modelos densos y profesionales de unos 27-30B son el límite razonable de la tarjeta. Más allá, se entra en el terreno del offload masivo.
- Qwen 3.8 27B Q4_K_M
- Aproximadamente 24 tok/s en generación con descarga de 2 a 3 GB a la RAM. VRAM utilizada: los 16 GB completos más un poco de RAM. Lanzado el 14/08/2026, con 262k de contexto y capacidades de visión: es el modelo «cercano a Copilot» de este segmento. Tiende a razonar demasiado con su ajuste de razonamiento predeterminado; cámbialo a low para obtener respuestas más directas.
- Qwen 3.8 27B Q3_K_M
- Aproximadamente 36 tok/s. VRAM utilizada: 14 GB, todo en VRAM. Un buen equilibrio si quieres que este gran modelo denso funcione con fluidez.
- Granite 4.2 30B Q4_K_M
- Aproximadamente 22 tok/s con offload. VRAM utilizada: 18 GB. Orientado al uso profesional y empresarial, con un perfil casi idéntico al de Qwen 3.8 27B.
- Nemotron 3.5 Lightning 30B Q4_K_M
- No cabe: 25 GB en Q4, requiere descargar gran parte del modelo a la RAM o al SSD, con una velocidad de unos 3 tok/s; no es una opción utilizable a diario con 16 GB (ni siquiera con 24 GB).
#Precio vs 5080 y 5090
El cálculo bruto de precio / tokens por segundo. No es perfecto (se ignoran la amortización y la electricidad), pero pone los órdenes de magnitud en perspectiva.
- RTX 5070 Ti (≈ 1 400 € a finales de septiembre de 2026)
- En Gemma 4 12B: ≈ 22,5 €/(tok/s). En GLM 4.7 Flash Q3: ≈ 19,8 €/(tok/s). En Qwen 3.8 27B Q3: ≈ 38,9 €/(tok/s).
- RTX 5080 (≈ 1 850 € a finales de septiembre de 2026)
- En Gemma 4 12B: ≈ 25,8 €/(tok/s). En GLM 4.7 Flash Q3: ≈ 22,6 €/(tok/s). Mejora real de la velocidad (+15 a 20 %), pero con un coste superior.
- RTX 5090 (≈ 5 700 € a finales de septiembre de 2026)
- Con Gemma 4 12B: ≈ 67,0 €/(tok/s). Con Qwen 3.8 27B Q4: ≈ 104,5 €/(tok/s). Solo resulta competitiva cuando se buscan modelos de 70B o más, algo que no es viable con 16 GB.
- RTX 4070 Ti Super 16 GB (de segunda mano, precio variable)
- Con Gemma 4 12B: 15,3 €/(tok/s). Más barata, pero ~25 % más lenta con los MoE debido a la menor velocidad de la GDDR6X. Sigue siendo una opción pertinente de segunda mano.
- RTX 3090 de segunda mano (de segunda mano, precio variable)
- Con Gemma 4 12B, 24 GB de VRAM a un precio de segunda mano variable. Relación rendimiento/euro atractiva si aceptas una GPU Ampere de segunda mano y un consumo de 350 W.
La 5070 Ti no es la más rentable si solo se considera la relación entre precio y rendimiento: la 3090 de segunda mano sigue por delante. Se convierte en la opción adecuada cuando buscas una tarjeta nueva, con garantía, un consumo contenido y soporte FP4 para el futuro.
#Consumo y temperaturas
Medidas al instalar, máquina completa, alimentación 850 W Gold, GPU solo en pruebas, pantalla apagada.
- Idle (modelo cargado, sin generación)
- La máquina consume 75 W en total, de los cuales unos 15 W corresponden a la GPU. Un consumo muy contenido: la inferencia en espera no penaliza tu factura.
- Inferencia 8B Q4
- Pico de 195 W medidos en el enchufe (GPU ~145 W). La tarjeta no llega al máximo: la memoria GDDR7 se satura antes que la capacidad de cómputo, como en la 5090.
- Inferencia 12B Q4
- Pico de 245 W medidos en la toma de corriente (GPU ~190 W). Punto óptimo entre consumo y utilidad.
- Inferencia MoE 30B-A3B
- Pico de consumo de 280 W medido en la toma de corriente (GPU ~225 W). El MoE se calienta menos que un modelo denso equivalente.
- Procesamiento de prompt en lote de 4096 tokens
- Pico de 360 W medidos en el enchufe (GPU ~298 W). Es el momento en que la saturación de la capacidad de cálculo lleva la tarjeta cerca de su TGP nominal de 300 W.
- Temperatura máxima de la GPU
- 72 °C en carga sostenida, ventiladores alrededor de 1.600 rpm. Modelo personalizado con tres ventiladores — más silencioso que la 5090.
#Veredicto: ¿punto ideal o no?
- Para quién es una buena compra
- Quieres algo nuevo, planeas ejecutar principalmente modelos de 8B-12B con incursiones en los 30B MoE y los densos de 27-30B en Q3. Te gusta una tarjeta silenciosa y con consumo razonable. Este es el perfil para el que está diseñada la 5070 Ti.
- Cuándo elegir la 5080 en su lugar
- Si ejecutas a diario un modelo denso de 27-30B en Q4 y te molesta tener los 16 GB al límite de su capacidad. La 5080 tiene la misma VRAM, pero un ancho de banda un 7 % superior: una mejora modesta por ≈ 450 € más.
- Cuándo optar por la 5090
- Si buscas un modelo 70B+ en Q4 en local o fine-tuning LoRA sobre modelos 13B+. 16 GB no son suficientes ni para uno ni para el otro.
- Cuándo preferir una 3090 de ocasión
- Presupuesto ajustado, disposición a usar hardware de segunda mano y necesidad de los 24 GB para modelos de 27-30B en Q5 o para empezar a usar modelos de 70B con una pequeña parte cargada en la RAM. Pierdes el soporte de FP4, pero el ahorro sigue siendo considerable (hay que valorarlo según el precio de segunda mano del momento).
- Cuándo preferir una 4070 Ti Super
- Si encuentras una de segunda mano a un precio interesante (variable según el mercado) y un modelo de 12B basta para tu caso de uso. Muy similar en la práctica y mucho más barata.
#Para ir más allá
Tres lecturas útiles para ir más lejos:
- Elegir bien la cuantización
- La guía "Elegir la cuantización (Q4, Q5, Q8, FP16)" explica por qué el Q3_K_M se vuelve relevante con 16 GB cuando se busca un modelo de 30B o más.
- Comparar más opciones
- La guía 'Elegir un GPU para la IA local' amplía el panorama más allá de la gama Blackwell, útil si aún dudas.
- Profundizar en un modelo MoE
- La guía "Llama 4 Scout en local" entra en detalle sobre el funcionamiento del MoE, particularmente adecuado para una tarjeta de 16 GB como la 5070 Ti.
Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.