Principiante 12 minGPU

¿Qué GPU para un LLM local? RTX 4070 a 5090, Mac (2026)

Respuesta directa

Para un LLM local, el criterio número 1 es la VRAM (no la potencia bruta en juegos), luego los tokens/segundo y después el consumo. Una RTX 3090 de segunda mano (24 GB de VRAM) puede superar a una RTX 4070 nueva para la IA local gracias a su mayor memoria, a pesar de tener una arquitectura más antigua.

La tarjeta gráfica es el componente que más cambia tu experiencia de IA local. Pero no buscas la misma GPU que alguien que juega a videojuegos: lo que importa para un LLM es la VRAM, luego los tokens por segundo y después el consumo. Esta guía aclara las ofertas de 2026 (NVIDIA, AMD, Apple Silicon, Intel Arc), ofrece configuraciones reales por presupuesto y explica por qué una RTX 3090 de segunda mano puede superar a una 4070 nueva.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: Mac mini M5 Pro (24 GB / 512 GB).

¿Por qué esta elección? Nuestra ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#La VRAM, reina absoluta

Un LLM debe caber en la VRAM para funcionar a plena velocidad. En cuanto parte del modelo pasa a la RAM del sistema, la velocidad se reduce en un factor de 10. El tamaño de los modelos que podrás ejecutar está determinado por la VRAM, NO por la potencia bruta de la GPU.

8 GB
Qwen 3.5 9B (6,6 GB). Uso cómodo, contexto largo limitado por la memoria. Gama básica.
12 GB
Qwen 3.5 9B en Q8 (11 GB) cabe con holgura; un 24B en Q4 también cabe. Punto óptimo en relación calidad/precio.
16 GB
un 24B (Devstral, Mistral Small) que funciona con holgura, gpt-oss 20B o un 27B en Q4 que cabe. Muy buen equilibrio.
24 GB
Qwen 3.8 27B (18 GB), que cabe holgadamente, los MoE para código 30B-A3B, un 35B en Q4.
48 GB +
Ejecución holgada de un 70B en Q4, fine-tuning LoRA posible, múltiples modelos en paralelo.
→
Regla de oro
A igual presupuesto, siempre elige la tarjeta gráfica con más VRAM, incluso si los tokens/segundo brutos son ligeramente inferiores. Una 3090 de 24 GB de segunda mano supera a una 4070 de 12 GB nueva para los LLM, a pesar del salto de generación.

#Determinar tus necesidades

Chat ocasional, tareas simples
Qwen 3.5 9B = ~7 GB de VRAM bastan. RTX 4060 Ti 16 GB, RTX 3060 12 GB, Arc A770 16 GB.
Desarrollo (autocompletado + chat)
Qwen2.5-Coder 7B base para el autocompletado FIM + Devstral 24B para el chat, trabajando en conjunto. Se recomiendan 16-20 GB.
RAG pro, documentos largos
Contexto de 32k+ que consume 4-6 GB de VRAM adicionales. Busca al menos 16 GB.
Fine-tuning, experimentación
24 GB (RTX 3090/4090) mínimo. Para un verdadero fine-tune completo de un 7B, busca 48 GB (A6000, RTX 6000 Ada).
Atender a un equipo de 10 personas
Una RTX 4090 o A6000 por sí sola, o 2× RTX 4090 con paralelismo tensorial para un 70B.

#NVIDIA — opciones 2026

RTX 3060 de 12 GB (~250 €)
La opción económica. CUDA, 12 GB de VRAM, rendimiento adecuado para 7B y 13B en Q4. Recomendada como tarjeta de gama de entrada.
RTX 4060 Ti 16 GB (~450 €)
Ideal para LLM: 16 GB de VRAM, bajo consumo (160 W). Menos potente que una 3090 en rendimiento puro, pero consume menos energía.
RTX 4070 Super 12 GB (~600 €)
Excelente en capacidad de cálculo, pero los 12 GB limitan. Bien si también juegas.
RTX 3090 24 GB (~700 € de ocasión)
⭐ La mejor relación VRAM/€ del mercado. Lleva 2 años en el mercado, pero sus 24 GB hacen milagros. Consumo elevado (350 W).
RTX 4090 24 GB (de ocasión, precio variable)
La mejor GPU de consumo de 2023-2025. Rendimiento + 24 GB. Pocas existencias en 2026; prioridad a la RTX 5090.
RTX 5080 16 GB / 5090 32 GB (≈ 1 500 a 1 850 € / ≈ 5 700 € a finales de septiembre de 2026)
Generación 2025. 5090 = 32 GB de VRAM, el sueño de los usuarios de LLM.
RTX A6000 48 GB (pro, ~4500 €)
48 GB de VRAM para modelos de 70B en Q6 o para el ajuste fino de un modelo de 13B. Para profesionales que amortizan la inversión.

#AMD — ponerse al día con ROCm

RX 7600 XT 16 GB (~350 €)
Tarjeta de gama de entrada de AMD. 16 GB de VRAM por el precio de una 3060. ROCm oficial.
RX 7800 XT 16 GB (~550 €)
Equivalente a 4070 en rendimiento, ROCm estable, excelente relación rendimiento/precio.
RX 7900 XTX 24 GB (~900 €)
24 GB por mucho menos que una 3090 de segunda mano. Para quienes aceptan la complejidad de ROCm.
RX 9070 XT 16 GB (≈ 1 070 € a finales de septiembre de 2026)
Nueva generación RDNA 4 (2025). Aún pendiente de evaluación en cuanto a ROCm.
!
ROCm: todavía menos fluido que CUDA
En 2026, ROCm funciona para la inferencia de LLM, pero sigue siendo menos universal que CUDA. Algunos casos especiales (cuantizaciones poco habituales, backends recientes) no funcionan. Hay que armarse de paciencia.

#Apple Silicon — caso especial

Los Mac de la serie M no tienen una GPU dedicada, sino memoria unificada: toda la RAM es accesible para la GPU. Un Mac de 64 GB puede asignar 48 GB a un LLM, suficiente para ejecutar un modelo de 70B.

Mac mini M6 16 GB (1 049 €)
Mínimo utilizable (el Mac mini M4 ya no se vende nuevo). Un 7B funciona bien. Consumo ridículo (20 W en inferencia).
Mac mini M5 Pro 24 GB (1 999 €, 48-64 GB en configuración Apple)
Excelente relación calidad/precio para LLM (reemplaza al M4 Pro). Con 48 GB, unos 36 GB asignados a la GPU: un modelo de 32B en Q6 cabe holgadamente.
MacBook Pro M4 Max 64 GB (~4000 €)
Portátil + LLM 70B Q4. Equivalente en ergonomía a un ordenador de sobremesa con RTX 4090, con movilidad añadida.
Mac Studio M5 Ultra 96 GB (a partir de 6 599 €, precio de Apple a finales de septiembre de 2026)
Lo mejor. Aproximadamente 72 GB utilizables por los LLM de un total de 96 GB, y más en las versiones con más memoria. Puede ejecutar los modelos de pesos abiertos más grandes del momento en Q8, o varios Qwen 3.8 27B en paralelo.
→
Mac = estación de trabajo completa para LLM
Un Mac Studio Ultra consume menos electricidad que un PC para juegos y no hace ruido. Para un despacho o una oficina en casa, es una solución coherente, mientras que montar un PC con una 4090 requiere una caja, una fuente de alimentación de 1000 W y refrigeración.

#Intel Arc — una alternativa a base de apaños

Arc A770 16 GB (~300 €)
16 GB de VRAM por 300 €. Rendimiento bruto por debajo de los NVIDIA/AMD equivalentes pero relación VRAM/€ imbatible.
Arc B580 12 GB (≈ 430 € a finales de septiembre de 2026)
Nueva generación Battlemage. Rendimiento mejorado considerablemente. Prometedor.
i
A través de Vulkan
llama.cpp compilado con Vulkan funciona muy bien en Arc. oneAPI también es una opción. Menos documentado que NVIDIA pero la comunidad crece.

#Presupuestos concretos

300 € — solo para empezar
RTX 3060 de 12 GB de ocasión, o bien Arc A770 de 16 GB. Puedes ejecutar modelos de 7B-13B sin problemas.
700 € — el punto ideal
RTX 3090 de 24 GB de ocasión. Mejor relación VRAM/€. Puede ejecutar cualquier modelo de 32B y los de 70B en Q4.
1500 € — confort profesional
RTX 5070 Ti 16 GB nueva (≈ 1 250 a 1 400 €) para añadir a un PC que ya tiene 64 GB de RAM.
3000 € — estación de trabajo para LLM
PC completo con RTX 5080 16 GB (≈ 1 500 a 1 850 € por tarjeta) O Mac Studio M5 Max 36 GB (2 999 €). Para cargar un 70B: mini-PC Ryzen AI Max+ 395 128 GB (≈ 3 300 €, hasta 4 000 € según el modelo). Coherente para un desarrollador que lo hace todos los días.
6 600 € o más — la gama más alta
Mac Studio M5 Ultra (96 GB o más, desde 6 599 €) O PC con 2× RTX 5090 (≈ 11 400 € por las dos tarjetas, a finales de septiembre de 2026). Servidor LLM para un equipo pequeño.

#¿Comprar nuevo o de segunda mano?

Nuevo
Garantía, última generación, soporte de drivers a largo plazo. Para una inversión profesional amortizable en 3 a 5 años.
Segunda mano (RTX 3090, 4090)
Ahorro del 30-40 %. Las tarjetas orientadas a LLM no han sufrido tanto como las tarjetas de minería (la mayoría ha pasado pocas horas bajo carga).
Comprobaciones al comprar de segunda mano
Prueba de carga de 24 h en inferencia, monitorización de la temperatura (no debe superar los 80 °C), sin almohadillas térmicas reemplazadas, preferiblemente con la factura original.
Compra profesional
RTX A6000 o L40 nuevas. Garantía de 3 años, precios profesionales, rendimiento idéntico al de las tarjetas de consumo. Para quienes amortizan la inversión.

Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.