Mejor GPU para IA local por menos de 2000 € en 2026
Elegir el mejor GPU para la IA por menos de 2000 euros consiste fundamentalmente en equilibrar la VRAM disponible, el ancho de banda de la memoria y la compatibilidad con los frameworks de inferencia de código abierto. En 2026, la RTX 4090, la RTX 5090 y la RX 7900 XTX ocupan posiciones muy diferentes en este segmento, cada una con sus propios compromisos para ejecutar LLM en local. Este artículo detalla las especificaciones clave de cada GPU, los modelos del catálogo accesibles según la configuración, el rendimiento esperado por cuantización y responde a las preguntas más frecuentes antes de la compra.
¿Por qué la VRAM es la métrica determinante para los LLM locales?
A diferencia de los usos en videojuegos o renderizado 3D, la ejecución local de un LLM depende en gran medida de la capacidad de memoria de video. La VRAM determina qué cuantización se puede utilizar y en qué medida el modelo debe transferirse a la RAM del sistema.
Las cuantizaciones más comunes a través de llama.cpp, el motor de inferencia de referencia para la inferencia local, son:
- Q4_K_M : compromiso calidad/tamaño dominante, aproximadamente 4,5 bits por parámetro
- Q5_K_M : ligera mejora de calidad, aproximadamente 5,5 bits por parámetro
- Q8_0 : precisión cercana a la nativa, aproximadamente 8 bits por parámetro
- FP16 : 16 bits por parámetro, reservado para configuraciones multi-GPU con varios cientos de GB de VRAM
Para entender todos los impactos de la cuantización, consulta el guía de cuantización de los LLM del sitio.
Como referencia sobre los modelos indexados en el catálogo quelllm.fr :
- Qwen 2.5 72B Instruct — ~42 GB en Q4, 72B parámetros: supera la VRAM de un solo GPU por menos de 2.000 €
- Llama 4 Scout 109B — ~65 GB en Q4, 109B parámetros: requiere un offload masivo a la CPU
- gpt-oss 120B — ~70 GB en Q4, 117B parámetros: misma conclusión
La consecuencia directa: con un solo GPU por debajo de 2.000 €, todos los modelos del catálogo (mínimo 71B de parámetros) se ejecutan en modo offload parcial hacia la RAM del sistema, lo que reduce los tokens/segundo de forma proporcional a la cantidad trasladada.
Las GPU disponibles por menos de 2.000 € en 2026
Aquí tienes las tarjetas gráficas relevantes para la inferencia local de LLM en este rango de precios (precios observados en Francia a mediados de 2026, que deben confirmarse según los distribuidores y las fluctuaciones del mercado):
NVIDIA GeForce RTX 4090 - VRAM : 24 GB GDDR6X - Ancho de banda de memoria : 1 008 GB/s - Precio orientativo : 1 400–1 700 € - Compatibilidad : CUDA nativo, llama.cpp, vLLM, Ollama, ExLlamaV2 - Punto fuerte : ecosistema más amplio, documentación comunitaria abundante
NVIDIA GeForce RTX 5090 - VRAM : 32 GB GDDR7 - Ancho de banda de memoria : estimado ~1 790 GB/s - Precio orientativo : 1 900–2 200 € según el distribuidor (en el límite del presupuesto previsto) - Compatibilidad : CUDA nativo, arquitectura Blackwell compatible con versiones recientes de llama.cpp - Punto fuerte : 8 GB adicionales en comparación con la RTX 4090, reducción del offload CPU en modelos de 70B
AMD Radeon RX 7900 XTX - VRAM : 24 GB GDDR6 - Ancho de banda de memoria : 960 GB/s - Precio orientativo : 800–1 050 € - Compatibilidad : ROCm 6.x, llama.cpp mediante backend HIP, Ollama - Punto fuerte : mejor relación VRAM/precio del segmento, viable si tu stack soporta ROCm
NVIDIA GeForce RTX 3090 (mercado secundario) - VRAM : 24 GB GDDR6X - Precio orientativo : 600–850 € - Punto fuerte : misma capacidad de VRAM que la RTX 4090 a precio reducido - Punto débil : ancho de banda ligeramente inferior (~936 GB/s), arquitectura más antigua (Ampere)
NVIDIA GeForce RTX 5080 - VRAM : 16 GB GDDR7 - Precio orientativo : 900–1 100 € - Punto débil : 16 GB insuficientes para los modelos 70B incluso en Q3_K_M — no recomendado para los LLM del catálogo
Para una comparación detallada de los dos líderes del segmento, ver la página RTX 4090 vs RTX 5090 para los LLM.
RTX 4090 vs RTX 5090: el análisis para los LLM
La RTX 5090 aporta 8 GB adicionales de VRAM y un ancho de banda significativamente mayor. Para los LLM, esto se traduce en tres beneficios concretos:
Reducción del offload a la CPU : con 32 GB de VRAM, trasladas menos capas a la RAM del sistema para un modelo de 70B en Q4 (~42 GB requeridos). En Q3_K_M, la huella de memoria de un modelo de 72B baja a unos 30–32 GB (estimación), lo que puede permitir una ejecución completamente en VRAM según la implementación.
Más tokens por segundo : menos offload significa menos cuello de botella en el bus PCIe (limitado a ~32 GB/s en PCIe 5.0 x16, frente a los 1 008 GB/s de ancho de banda interno de la RTX 4090). La diferencia se percibe directamente en la velocidad de inferencia.
Costo adicional : entre 400 y 700 € más según el distribuidor. Si la RTX 5090 baja de 2.000 €, los 32 GB justifican el costo adicional. De lo contrario, la RTX 4090 sigue siendo la opción más coherente.
La RX 7900 XTX merece una mención especial para presupuestos inferiores a 1.050 €: 24 GB de VRAM con soporte ROCm en constante mejora. La compatibilidad aún no es tan fluida como la de CUDA en todas las herramientas (especialmente vLLM), pero llama.cpp mediante HIP funciona correctamente para la inferencia local estándar.
Las especificaciones oficiales de la serie RTX 50 están disponibles en la página de producto NVIDIA.
Modelos accesibles con una GPU de menos de 2.000 € (offload incluido)
Esto es lo que resulta viable según el catálogo quelllm.fr, con una GPU de 24–32 GB de VRAM combinada con 64–128 GB de RAM DDR5 del sistema:
Modelos 70B — la clase de referencia con offload parcial
- Qwen 2.5 72B Instruct — 72B de parámetros, licencia Qwen, ~42 GB en Q4. Con 24 GB de VRAM, aproximadamente 18 GB se transfieren a la RAM. Velocidad estimada: 4–9 tokens/segundo según el ancho de banda de la RAM y el número de capas transferidas.
- Llama 3.1 70B LatamGPT SFT — 71B parámetros, licencia Llama 3.1 Community, ~41 GB Q4. Necesidades similares, ligeramente más compacto.
- Qwen3-Coder-Next 80B-A3B — 80B parámetros, ~48 GB Q4, licencia Apache 2.0. Requiere más offload pero es adecuado para tareas de generación de código.
- Hunyuan-A13B Instruct — 80B parámetros, ~48 GB Q4, licencia Tencent Hunyuan. Arquitectura MoE con 13B parámetros activos — la carga de cálculo efectiva se reduce aunque la huella de memoria permanezca igual.
Lo que sigue fuera de alcance con una sola GPU
- DeepSeek R1 671B — ~400 GB Q4: requiere un mínimo de 10 GPUs de este rango en paralelo, o un servidor NVLink dedicado.
- Llama 4 Maverick 400B — ~240 GB Q4: fuera de alcance en configuración de una GPU.
- Qwen 3 235B-A22B — ~142 GB en Q4: no se puede ejecutar en una sola GPU, pero el comparativa Qwen 3 235B vs Llama 4 Scout detalla las diferencias para configuraciones multi-GPU.
Para identificar los modelos filtrados según tu VRAM disponible, utiliza directamente el configurador quelllm.fr.
Rendimiento esperado: tokens/segundo según el GPU
Los números a continuación son estimadas a partir de los benchmarks comunitarios compilados en los issues y discusiones del repositorio llama.cpp en GitHub y del clasificación Open LLM de Hugging Face. Varían según la RAM del sistema, la versión del motor de inferencia y la configuración PCIe.
Para un modelo 70B en Q4_K_M (aproximadamente 42 GB), offload parcial:
- RTX 5090 (32 GB) : velocidad estimada de 10–18 tokens/s, offload mínimo (~10 GB en CPU)
- RTX 4090 (24 GB) : velocidad estimada de 4–9 tokens/s, con ~18 GB descargados a RAM DDR5 rápida
- RX 7900 XTX (24 GB) : estimación de 3–7 tokens/segundo mediante ROCm/HIP, por confirmar según la versión del controlador
- RTX 3090 (24 GB) : velocidad estimada de 3–6 tokens/segundo, con un ancho de banda ligeramente inferior
Para un modelo de 70B en Q3_K_M (tamaño estimado: ~30–32 GB), cercano al límite de la RTX 5090:
- RTX 5090 (32 GB) : estimado entre 20 y 30 tokens/segundo si el modelo cabe completamente en VRAM
Estos números ilustran la importancia crítica de la ancho de banda de memoria interna : eliminar el offload a la CPU multiplica la velocidad de inferencia por un factor de entre dos y cuatro en comparación con un offload parcial.
Licencias de modelos: lo que cambia según el uso
La VRAM disponible determina qué modelos son accesibles y, por tanto, qué licencias se aplican a tu despliegue. Recordatorio de las licencias de los modelos de la clase 70–120B del catálogo:
- Apache 2.0 – uso comercial libre, redistribución autorizada: Mixtral 8x22B Instruct (~82 GB Q4), Qwen3-Coder-Next 80B-A3B (~48 GB Q4), gpt-oss 120B (~70 GB Q4)
- MIT — licencia muy permisiva, uso comercial libre: dots.llm1 Instruct (~85 GB Q4), Mistral Medium 3.5 128B (~74 GB Q4, Modified MIT)
- Llama Community — uso comercial bajo condiciones (MAU < 700M para las entidades afectadas) : Llama 4 Scout 109B (~65 GB Q4)
- Qwen License — uso comercial permitido según las condiciones de Alibaba: Qwen 2.5 72B Instruct (~42 GB Q4)
Para cualquier proyecto con finalidad comercial, revisa siempre las condiciones exactas en la ficha de cada modelo antes del despliegue. Las licencias Apache 2.0 y MIT ofrecen la máxima flexibilidad.
FAQ
P: ¿Se puede ejecutar un modelo de 70B en una RTX 4090?
Sí, con un offload parcial hacia la RAM del sistema. La RTX 4090 dispone de 24 GB de VRAM; un modelo como el Qwen 2.5 72B Instruct, que requiere ~42 GB en Q4, transfiere aproximadamente 18 GB a la RAM DDR5. La velocidad de inferencia se sitúa en torno a 4–9 tokens/seg (estimación), lo que sigue siendo viable para un uso interactivo que no sea en tiempo real, siempre que se disponga de al menos 64 GB de RAM del sistema y de una CPU con suficiente ancho de banda de memoria.
P: ¿La RTX 5090 entra en un presupuesto de 2 000 € en Francia?
Se encuentra en el límite: entre 1.900 y 2.200 € según los distribuidores a mediados de 2026. Si la encuentras por debajo de 2.000 €, sus 32 GB de VRAM y su ancho de banda superior al de la RTX 4090 reducen significativamente la descarga de trabajo a la CPU en los modelos 70B, lo que mejora la velocidad de inferencia. De lo contrario, la RTX 4090 sigue siendo la opción más accesible y con mejor soporte en el ecosistema de herramientas locales.
P: ¿AMD RX 7900 XTX o NVIDIA RTX 4090 para LLM locales?
La RX 7900 XTX ofrece 24 GB de VRAM por 800–1.050 €, es decir, 600–700 € menos que la RTX 4090. A cambio, el ecosistema ROCm es menos maduro que CUDA: vLLM y algunos backends requieren configuración manual, y el rendimiento mediante HIP sigue siendo inferior al de CUDA en la práctica. Para un uso estándar de llama.cpp y Ollama, la RX 7900 XTX funciona correctamente. Para un stack más complejo o el despliegue de aplicaciones, la RTX 4090 simplifica la implementación.
P: ¿Qué cantidad de RAM del sistema hay que prever además de la GPU?
Para el offload de modelos de 70B en Q4, 64 GB de RAM DDR5 representan un mínimo razonable. 128 GB permiten mantener margen para el sistema operativo y otros procesos paralelos. El ancho de banda de la RAM (DDR5 de doble canal a alta frecuencia) influye directamente en la velocidad de inferencia durante el offload: una DDR5-6000 de doble canal aporta una mejora perceptible en comparación con una DDR4-3200.
P: ¿Puede la RTX 5080 (16 GB) ejecutar los modelos del catálogo?
No. 16 GB de VRAM no bastan para ejecutar ninguno de los modelos del catálogo (mínimo 71B de parámetros). Incluso en Q3_K_M, un modelo de 70B requiere aproximadamente 30–32 GB (estimado). La RTX 5080 es adecuada para modelos de 7–34B, que no figuran en este catálogo centrado en LLM de gran tamaño. Consulta nuestra guía de GPU de gama alta para LLM para configuraciones multi-GPU a mayor escala.
P: ¿La cuantización Q4 degrada significativamente la calidad de las respuestas?
La cuantización Q4_K_M conserva esencialmente las capacidades de un modelo en comparación con FP16 en la mayoría de tareas de comprensión y generación de texto. Las degradaciones más notables aparecen en tareas de razonamiento matemático complejo y generación de código preciso, donde Q5_K_M o Q8_0 son preferibles si la VRAM lo permite. Las cuantizaciones Q3 y inferiores muestran pérdidas más visibles y se deben reservar a casos en los que la VRAM sea el factor limitante absoluto.
Conclusión
En 2026, el mejor GPU para la IA por menos de 2000 euros es la RTX 4090 por la madurez de su software, sus 24 GB de VRAM GDDR6X y su ecosistema CUDA sin complicaciones. Si tu presupuesto alcanza el límite superior y la RTX 5090 está disponible por menos de 2 000 €, los 32 GB justifican el coste adicional al reducir la parte del modelo que se ejecuta en la CPU. La RX 7900 XTX sigue siendo la alternativa más convincente por debajo de 1 050 €. Para encontrar los modelos compatibles con tu configuración exacta, utiliza el configurador quelllm.fr o recorre todo el catálogo de los 249 LLM indexados.
El hardware para ejecutar un LLM localmente
Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:
Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.