¿Cuánto cuesta un servidor GPU para LLM? Compra, alquiler, API
El costo de un servidor GPU para LLM no se reduce al precio de una tarjeta gráfica. Comprar una máquina dedicada, alquilarla a un proveedor de alojamiento o hacer llamadas a una API en la nube implica perfiles de gasto radicalmente diferentes: una inversión inicial elevada frente a una factura mensual, un costo fijo frente a un costo variable. Esta guía presenta los órdenes de magnitud de 2026, el umbral de rentabilidad del autoalojamiento frente al uso de una API y configuraciones típicas para cada presupuesto.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Las 3 opciones y sus perfiles de costo
Antes de hablar de números, hay que entender que el costo de un servidor GPU para LLM se divide en tres modelos económicos muy diferentes. La elección adecuada no depende solo de tu presupuesto, sino principalmente de tu volumen de uso y de la sensibilidad de tus datos.
- Compra (CAPEX)
- Inviertes una cantidad importante de una sola vez para ser propietario de la máquina. Después, el coste marginal es casi nulo (electricidad). Rentable si la usas mucho y durante mucho tiempo.
- Alquiler (OPEX mensual)
- Un servidor GPU dedicado o una VM en un proveedor de hosting, facturado por mes o por hora. Sin inversión, pero con factura recurrente mientras la máquina esté en funcionamiento.
- API en la nube (gasto operativo por token)
- No gestionas ninguna máquina, pagas por consumo (por millón de tokens). No hay costo fijo, pero el precio sube linealmente con el uso.
#Comprar una máquina dedicada
La compra es el modelo clásico de autoalojamiento: una máquina en tu casa o en tu sala técnica, que amortizas en un plazo de 2 a 4 años. El costo se concentra en la GPU, que a menudo representa más de la mitad del presupuesto total de la máquina.
- GPU de entrada — RTX 3060 12 GB
- Aproximadamente 300 € de segunda mano. Ejecuta modelos 7B–14B en Q4 de forma cómoda. El costo de entrada para un LLM local serio.
- GPU versátil — RTX 4070 / 4080 16 GB
- 700 a 1.200 €. Modelos de 14B que funcionan con fluidez, modelos de 32B en Q4 con algo de margen (19 GB de VRAM en la 4080… justo al límite).
- GPU de gama alta — RTX 4090 24 GB
- De 1 600 a 2 000 €. Ejecuta con mucha comodidad un 32B Q4 (≈19 GB) y un 70B con cuantización agresiva. La referencia para estaciones de trabajo.
- Memoria unificada — Mac Studio / M4 Pro 48–128 GB
- 2.000 a 6.000 €. La VRAM unificada permite cargar modelos de 70B, incluso mayores, sin necesidad de varias GPU. Silencioso y de bajo consumo eléctrico.
A esto se añade el resto de la máquina: placa base, CPU, de 32 a 64 GB de RAM, una fuente de alimentación potente (750 W+ para una 4090) y una caja ventilada. Calcula entre 500 y 900 € para una base de PC adecuada que acompañe a la GPU. Una estación de trabajo completa con GPU capaz de ejecutar modelos de 32B cuesta, por tanto, entre 2.500 y 3.500 €, todo incluido.
#Alquilar un servidor GPU en un proveedor de hosting
La renta evita la inversión inicial y el problema de la obsolescencia. Dos subcategorías: el servidor GPU dedicado mensual (reservas la máquina de forma continua) y el GPU por hora tipo nube (pagas solo por las horas de inferencia).
- GPU dedicada con alquiler mensual — proveedor de alojamiento francés
- En OVHcloud o Scaleway, un servidor con GPU dedicada se alquila desde unos cientos hasta más de mil euros al mes según la tarjeta (L4, L40S, H100). Datos alojados en Francia, argumento de soberanía y RGPD.
- GPU por horas — instancias spot en la nube
- En plataformas como RunPod, Vast.ai o Lambda, una GPU se alquila por entre 0,20 y 3 €/h según la tarjeta. Ideal para tareas puntuales por lotes o fine-tuning, no para uso 24/7.
- VM con GPU en una nube generalista
- AWS, GCP y Azure cobran las instancias GPU por hora, a menudo a un precio más alto que los proveedores especializados, pero con el ecosistema y el SLA de un gran proveedor de servicios en la nube.
Regla simple: para una carga intermitente (unas horas al día, procesamiento por lotes, experimentación), el alquiler por horas resulta más rentable. Para un servicio que debe responder continuamente, el alquiler mensual de una GPU dedicada o la compra resultan más rentables a partir del segundo o tercer mes.
#Pasar por una API en la nube
La API es la opción sin servidor: no compras ni alquilas GPUs, pagas por cada token consumido. Es la opción más razonable al inicio cuando el volumen es bajo o impredecible, porque el costo fijo es nulo.
- Modelo de facturación
- Precio por millón de tokens de entrada y salida. Los tokens de salida suelen costar más que los de entrada.
- Ventaja
- Sin mantenimiento, sin obsolescencia, acceso inmediato a modelos de 100B+ imposibles de ejecutar en una estación de trabajo.
- Desventaja en cuanto al coste
- El precio sube linealmente con el uso. Un pipeline que procese 100.000 documentos al día transforma una API «barata» en una factura mensual de cuatro cifras.
- Desventaja en materia de privacidad
- Tus prompts abandonan tu infraestructura. Inaceptable para datos sensibles (salud, jurídico, código propietario) sin contrato y sin nube dedicada adecuada.
#El umbral de rentabilidad del autoalojamiento frente a la API
Es el cálculo central. Una GPU comprada es un costo fijo; una API es un costo variable. Existe, por tanto, un volumen de tokens a partir del cual tener tu propio servidor resulta más barato que pagar por uso. Por debajo de este umbral, gana la API; por encima, se amortiza el autoalojamiento.
La idea: una RTX 4090 de 1.800 € amortizada en 3 años supone aproximadamente 50 €/mes de hardware, más la electricidad. Si tu gasto en la API supera este importe cada mes, la compra se vuelve rentable, a menudo a partir de unos pocos millones de tokens diarios con un uso recurrente. Para un uso ocasional de unas pocas consultas al día, la API sigue siendo imbatible.
- Bajo volumen, datos no sensibles
- API. El costo fijo de un servidor no se justifica para unos miles de tokens al día.
- Volumen elevado y recurrente
- Compra. La GPU se amortiza en unos pocos meses y el coste marginal por consulta baja a casi cero.
- Datos sensibles, independientemente del volumen
- Autoalojamiento (compra o alquiler en Francia). La confidencialidad determina la elección incluso antes de calcular el coste.
- Pico puntual de demanda o fine-tuning
- Alquiler por horas. Solo se paga por la potencia durante la operación.
#Configuración típica por presupuesto
Aquí tienes tres perfiles de máquinas autogestionadas que corresponden a tres niveles de presupuesto y ambición. Los rangos de precios son aproximaciones de 2026, con todo el hardware incluido.
- 01Estación de trabajo con GPU — 2.500 a 3.500 €Una RTX 4090 de 24 GB (o una RTX 3090 de ocasión para dividir el precio por dos) en un PC con 64 GB de RAM. Ejecuta cómodamente un 32B Q4 (≈19 GB de VRAM) y un 70B con cuantización agresiva. La referencia para un desarrollador o un equipo pequeño.
- 02Servidor GPU dedicado — 4.000 a 8.000 € o alquiler mensualUna tarjeta profesional (L40S de 48 GB, o 2× RTX 4090 en tensor-split) en un chasis de rack pensado para funcionar 24/7 y atender a varios usuarios a través de Open WebUI. Se puede comprar o alquilar a un proveedor de alojamiento francés si no quieres gestionar el hardware.
- 03Mini-PC con memoria unificada — 700 a 6.000 €Un Mac mini M4 (a partir de ~700 €) para un servidor de inferencia silencioso y de bajo consumo, o un Mac Studio M5 Ultra (96 GB o más, 512 GB anunciados para finales de octubre de 2026) para ejecutar modelos de 70B–123B sin múltiples GPU. Consumo eléctrico ínfimo frente a una GPU NVIDIA.
#Los costos ocultos que no se deben olvidar
El precio de compra es solo la parte visible. Tres partidas de gastos recurrentes se subestiman sistemáticamente en el presupuesto de un servidor GPU para LLM.
- Electricidad
- Una RTX 4090 consume hasta 450 W en carga. En inferencia casi continua, esto representa decenas de euros al mes según el precio del kWh. Un Mac con memoria unificada consume una fracción de eso — un argumento real para el uso 24/7.
- Mantenimiento y disponibilidad
- Un servidor que debe responder continuamente requiere supervisión, actualizaciones y gestión de fallos. Es tiempo humano, invisible en la factura pero real.
- Obsolescencia
- Una GPU pierde valor y los modelos evolucionan rápido. Amortizarla en 3 años es razonable, pero, dado que un modelo de 14B de 2026 supera a uno de 70B de 2024, la carrera por mejorar el hardware no siempre es necesaria: a veces basta un modelo más reciente y más pequeño.
- Refrigeración y ruido
- Una GPU de gama alta se calienta y hace ruido. En un espacio profesional, prever la ventilación del local; en un puesto de trabajo, el confort acústico importa.
#Para ir más allá
Tres guías relacionadas para afinar tu decisión: la guía de elección de GPU detalla los compromisos entre VRAM, presupuesto y rendimiento tarjeta por tarjeta; la calculadora de costes cuantifica con precisión tu umbral de rentabilidad del autoalojamiento frente a las API; y la guía de configuración de PC con 32 GB de VRAM enumera los componentes concretos de una máquina capaz de ejecutar modelos de 32B.
- Elegir tu GPU para IA local
- La guía de compra de 2026: RTX 4070 vs 4090 vs Mac M-Max, decisiones entre VRAM y presupuesto.
- Calculadora de costos de LLM
- Calcula el umbral a partir del cual te conviene pasar del autoalojamiento a una API, o viceversa, según tu volumen de tokens.
- Configuración de PC para IA: presupuesto para 32 GB de VRAM
- La selección de componentes para armar una máquina capaz de ejecutar modelos de 32B localmente.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.