¿Qué GPU para un LLM local? RTX 4070 a 5090, Mac (2026)
Para un LLM local, el criterio número 1 es la VRAM (no la potencia bruta en juegos), luego los tokens/segundo y después el consumo. Una RTX 3090 de segunda mano (24 GB de VRAM) puede superar a una RTX 4070 nueva para la IA local gracias a su mayor memoria, a pesar de tener una arquitectura más antigua.
La tarjeta gráfica es el componente que más cambia tu experiencia de IA local. Pero no buscas la misma GPU que alguien que juega a videojuegos: lo que importa para un LLM es la VRAM, luego los tokens por segundo y después el consumo. Esta guía aclara las ofertas de 2026 (NVIDIA, AMD, Apple Silicon, Intel Arc), ofrece configuraciones reales por presupuesto y explica por qué una RTX 3090 de segunda mano puede superar a una 4070 nueva.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Mac mini M5 Pro (24 GB / 512 GB).
¿Por qué esta elección? Nuestra ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#La VRAM, reina absoluta
Un LLM debe caber en la VRAM para funcionar a plena velocidad. En cuanto parte del modelo pasa a la RAM del sistema, la velocidad se reduce en un factor de 10. El tamaño de los modelos que podrás ejecutar está determinado por la VRAM, NO por la potencia bruta de la GPU.
- 8 GB
- Qwen 3.5 9B (6,6 GB). Uso cómodo, contexto largo limitado por la memoria. Gama básica.
- 12 GB
- Qwen 3.5 9B en Q8 (11 GB) cabe con holgura; un 24B en Q4 también cabe. Punto óptimo en relación calidad/precio.
- 16 GB
- un 24B (Devstral, Mistral Small) que funciona con holgura, gpt-oss 20B o un 27B en Q4 que cabe. Muy buen equilibrio.
- 24 GB
- Qwen 3.8 27B (18 GB), que cabe holgadamente, los MoE para código 30B-A3B, un 35B en Q4.
- 48 GB +
- Ejecución holgada de un 70B en Q4, fine-tuning LoRA posible, múltiples modelos en paralelo.
#Determinar tus necesidades
- Chat ocasional, tareas simples
- Qwen 3.5 9B = ~7 GB de VRAM bastan. RTX 4060 Ti 16 GB, RTX 3060 12 GB, Arc A770 16 GB.
- Desarrollo (autocompletado + chat)
- Qwen2.5-Coder 7B base para el autocompletado FIM + Devstral 24B para el chat, trabajando en conjunto. Se recomiendan 16-20 GB.
- RAG pro, documentos largos
- Contexto de 32k+ que consume 4-6 GB de VRAM adicionales. Busca al menos 16 GB.
- Fine-tuning, experimentación
- 24 GB (RTX 3090/4090) mínimo. Para un verdadero fine-tune completo de un 7B, busca 48 GB (A6000, RTX 6000 Ada).
- Atender a un equipo de 10 personas
- Una RTX 4090 o A6000 por sí sola, o 2× RTX 4090 con paralelismo tensorial para un 70B.
#NVIDIA — opciones 2026
- RTX 3060 de 12 GB (~250 €)
- La opción económica. CUDA, 12 GB de VRAM, rendimiento adecuado para 7B y 13B en Q4. Recomendada como tarjeta de gama de entrada.
- RTX 4060 Ti 16 GB (~450 €)
- Ideal para LLM: 16 GB de VRAM, bajo consumo (160 W). Menos potente que una 3090 en rendimiento puro, pero consume menos energía.
- RTX 4070 Super 12 GB (~600 €)
- Excelente en capacidad de cálculo, pero los 12 GB limitan. Bien si también juegas.
- RTX 3090 24 GB (~700 € de ocasión)
- ⭐ La mejor relación VRAM/€ del mercado. Lleva 2 años en el mercado, pero sus 24 GB hacen milagros. Consumo elevado (350 W).
- RTX 4090 24 GB (de ocasión, precio variable)
- La mejor GPU de consumo de 2023-2025. Rendimiento + 24 GB. Pocas existencias en 2026; prioridad a la RTX 5090.
- RTX 5080 16 GB / 5090 32 GB (≈ 1 500 a 1 850 € / ≈ 5 700 € a finales de septiembre de 2026)
- Generación 2025. 5090 = 32 GB de VRAM, el sueño de los usuarios de LLM.
- RTX A6000 48 GB (pro, ~4500 €)
- 48 GB de VRAM para modelos de 70B en Q6 o para el ajuste fino de un modelo de 13B. Para profesionales que amortizan la inversión.
#AMD — ponerse al día con ROCm
- RX 7600 XT 16 GB (~350 €)
- Tarjeta de gama de entrada de AMD. 16 GB de VRAM por el precio de una 3060. ROCm oficial.
- RX 7800 XT 16 GB (~550 €)
- Equivalente a 4070 en rendimiento, ROCm estable, excelente relación rendimiento/precio.
- RX 7900 XTX 24 GB (~900 €)
- 24 GB por mucho menos que una 3090 de segunda mano. Para quienes aceptan la complejidad de ROCm.
- RX 9070 XT 16 GB (≈ 1 070 € a finales de septiembre de 2026)
- Nueva generación RDNA 4 (2025). Aún pendiente de evaluación en cuanto a ROCm.
#Apple Silicon — caso especial
Los Mac de la serie M no tienen una GPU dedicada, sino memoria unificada: toda la RAM es accesible para la GPU. Un Mac de 64 GB puede asignar 48 GB a un LLM, suficiente para ejecutar un modelo de 70B.
- Mac mini M6 16 GB (1 049 €)
- Mínimo utilizable (el Mac mini M4 ya no se vende nuevo). Un 7B funciona bien. Consumo ridículo (20 W en inferencia).
- Mac mini M5 Pro 24 GB (1 999 €, 48-64 GB en configuración Apple)
- Excelente relación calidad/precio para LLM (reemplaza al M4 Pro). Con 48 GB, unos 36 GB asignados a la GPU: un modelo de 32B en Q6 cabe holgadamente.
- MacBook Pro M4 Max 64 GB (~4000 €)
- Portátil + LLM 70B Q4. Equivalente en ergonomía a un ordenador de sobremesa con RTX 4090, con movilidad añadida.
- Mac Studio M5 Ultra 96 GB (a partir de 6 599 €, precio de Apple a finales de septiembre de 2026)
- Lo mejor. Aproximadamente 72 GB utilizables por los LLM de un total de 96 GB, y más en las versiones con más memoria. Puede ejecutar los modelos de pesos abiertos más grandes del momento en Q8, o varios Qwen 3.8 27B en paralelo.
#Intel Arc — una alternativa a base de apaños
- Arc A770 16 GB (~300 €)
- 16 GB de VRAM por 300 €. Rendimiento bruto por debajo de los NVIDIA/AMD equivalentes pero relación VRAM/€ imbatible.
- Arc B580 12 GB (≈ 430 € a finales de septiembre de 2026)
- Nueva generación Battlemage. Rendimiento mejorado considerablemente. Prometedor.
#Presupuestos concretos
- 300 € — solo para empezar
- RTX 3060 de 12 GB de ocasión, o bien Arc A770 de 16 GB. Puedes ejecutar modelos de 7B-13B sin problemas.
- 700 € — el punto ideal
- RTX 3090 de 24 GB de ocasión. Mejor relación VRAM/€. Puede ejecutar cualquier modelo de 32B y los de 70B en Q4.
- 1500 € — confort profesional
- RTX 5070 Ti 16 GB nueva (≈ 1 250 a 1 400 €) para añadir a un PC que ya tiene 64 GB de RAM.
- 3000 € — estación de trabajo para LLM
- PC completo con RTX 5080 16 GB (≈ 1 500 a 1 850 € por tarjeta) O Mac Studio M5 Max 36 GB (2 999 €). Para cargar un 70B: mini-PC Ryzen AI Max+ 395 128 GB (≈ 3 300 €, hasta 4 000 € según el modelo). Coherente para un desarrollador que lo hace todos los días.
- 6 600 € o más — la gama más alta
- Mac Studio M5 Ultra (96 GB o más, desde 6 599 €) O PC con 2× RTX 5090 (≈ 11 400 € por las dos tarjetas, a finales de septiembre de 2026). Servidor LLM para un equipo pequeño.
#¿Comprar nuevo o de segunda mano?
- Nuevo
- Garantía, última generación, soporte de drivers a largo plazo. Para una inversión profesional amortizable en 3 a 5 años.
- Segunda mano (RTX 3090, 4090)
- Ahorro del 30-40 %. Las tarjetas orientadas a LLM no han sufrido tanto como las tarjetas de minería (la mayoría ha pasado pocas horas bajo carga).
- Comprobaciones al comprar de segunda mano
- Prueba de carga de 24 h en inferencia, monitorización de la temperatura (no debe superar los 80 °C), sin almohadillas térmicas reemplazadas, preferiblemente con la factura original.
- Compra profesional
- RTX A6000 o L40 nuevas. Garantía de 3 años, precios profesionales, rendimiento idéntico al de las tarjetas de consumo. Para quienes amortizan la inversión.
Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.