Principiante 9 minPresupuesto

¿Cuánto cuesta un servidor GPU para LLM? Compra, alquiler, API

El costo de un servidor GPU para LLM no se reduce al precio de una tarjeta gráfica. Comprar una máquina dedicada, alquilarla a un proveedor de alojamiento o hacer llamadas a una API en la nube implica perfiles de gasto radicalmente diferentes: una inversión inicial elevada frente a una factura mensual, un costo fijo frente a un costo variable. Esta guía presenta los órdenes de magnitud de 2026, el umbral de rentabilidad del autoalojamiento frente al uso de una API y configuraciones típicas para cada presupuesto.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-07-13·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Las 3 opciones y sus perfiles de costo

Antes de hablar de números, hay que entender que el costo de un servidor GPU para LLM se divide en tres modelos económicos muy diferentes. La elección adecuada no depende solo de tu presupuesto, sino principalmente de tu volumen de uso y de la sensibilidad de tus datos.

Compra (CAPEX)
Inviertes una cantidad importante de una sola vez para ser propietario de la máquina. Después, el coste marginal es casi nulo (electricidad). Rentable si la usas mucho y durante mucho tiempo.
Alquiler (OPEX mensual)
Un servidor GPU dedicado o una VM en un proveedor de hosting, facturado por mes o por hora. Sin inversión, pero con factura recurrente mientras la máquina esté en funcionamiento.
API en la nube (gasto operativo por token)
No gestionas ninguna máquina, pagas por consumo (por millón de tokens). No hay costo fijo, pero el precio sube linealmente con el uso.
i
La verdadera pregunta
«¿Cuánto cuesta un servidor GPU para LLM?» no tiene una respuesta única. La pregunta útil es: ¿a partir de qué volumen mi uso justifica comprar en lugar de pagar por uso? Es un cálculo de umbral, no un precio de catálogo.

#Comprar una máquina dedicada

La compra es el modelo clásico de autoalojamiento: una máquina en tu casa o en tu sala técnica, que amortizas en un plazo de 2 a 4 años. El costo se concentra en la GPU, que a menudo representa más de la mitad del presupuesto total de la máquina.

GPU de entrada — RTX 3060 12 GB
Aproximadamente 300 € de segunda mano. Ejecuta modelos 7B–14B en Q4 de forma cómoda. El costo de entrada para un LLM local serio.
GPU versátil — RTX 4070 / 4080 16 GB
700 a 1.200 €. Modelos de 14B que funcionan con fluidez, modelos de 32B en Q4 con algo de margen (19 GB de VRAM en la 4080… justo al límite).
GPU de gama alta — RTX 4090 24 GB
De 1 600 a 2 000 €. Ejecuta con mucha comodidad un 32B Q4 (≈19 GB) y un 70B con cuantización agresiva. La referencia para estaciones de trabajo.
Memoria unificada — Mac Studio / M4 Pro 48–128 GB
2.000 a 6.000 €. La VRAM unificada permite cargar modelos de 70B, incluso mayores, sin necesidad de varias GPU. Silencioso y de bajo consumo eléctrico.

A esto se añade el resto de la máquina: placa base, CPU, de 32 a 64 GB de RAM, una fuente de alimentación potente (750 W+ para una 4090) y una caja ventilada. Calcula entre 500 y 900 € para una base de PC adecuada que acompañe a la GPU. Una estación de trabajo completa con GPU capaz de ejecutar modelos de 32B cuesta, por tanto, entre 2.500 y 3.500 €, todo incluido.

→
El mercado de segunda mano desploma los precios
El mercado de GPUs usadas (RTX 3090 de 24 GB alrededor de 700 €, RTX 3060 de 12 GB alrededor de 250 €) cambia completamente la ecuación. Una RTX 3090 usada ofrece 24 GB de VRAM por la tercera parte del precio de una RTX 4090 usada, a costa de un consumo eléctrico más elevado.

#Alquilar un servidor GPU en un proveedor de hosting

La renta evita la inversión inicial y el problema de la obsolescencia. Dos subcategorías: el servidor GPU dedicado mensual (reservas la máquina de forma continua) y el GPU por hora tipo nube (pagas solo por las horas de inferencia).

GPU dedicada con alquiler mensual — proveedor de alojamiento francés
En OVHcloud o Scaleway, un servidor con GPU dedicada se alquila desde unos cientos hasta más de mil euros al mes según la tarjeta (L4, L40S, H100). Datos alojados en Francia, argumento de soberanía y RGPD.
GPU por horas — instancias spot en la nube
En plataformas como RunPod, Vast.ai o Lambda, una GPU se alquila por entre 0,20 y 3 €/h según la tarjeta. Ideal para tareas puntuales por lotes o fine-tuning, no para uso 24/7.
VM con GPU en una nube generalista
AWS, GCP y Azure cobran las instancias GPU por hora, a menudo a un precio más alto que los proveedores especializados, pero con el ecosistema y el SLA de un gran proveedor de servicios en la nube.
!
La trampa de alquilar para funcionar las 24 horas, los 7 días de la semana
Alquilar una GPU por horas para un servicio que funciona permanentemente combina lo peor de ambos mundos: una GPU de 1,5 €/h que se deja encendida continuamente cuesta más de 1.000 €/mes, lo que equivale a comprar una RTX 4090 cada 6 semanas. El alquiler por horas solo tiene sentido para cargas intermitentes.

Regla simple: para una carga intermitente (unas horas al día, procesamiento por lotes, experimentación), el alquiler por horas resulta más rentable. Para un servicio que debe responder continuamente, el alquiler mensual de una GPU dedicada o la compra resultan más rentables a partir del segundo o tercer mes.

#Pasar por una API en la nube

La API es la opción sin servidor: no compras ni alquilas GPUs, pagas por cada token consumido. Es la opción más razonable al inicio cuando el volumen es bajo o impredecible, porque el costo fijo es nulo.

Modelo de facturación
Precio por millón de tokens de entrada y salida. Los tokens de salida suelen costar más que los de entrada.
Ventaja
Sin mantenimiento, sin obsolescencia, acceso inmediato a modelos de 100B+ imposibles de ejecutar en una estación de trabajo.
Desventaja en cuanto al coste
El precio sube linealmente con el uso. Un pipeline que procese 100.000 documentos al día transforma una API «barata» en una factura mensual de cuatro cifras.
Desventaja en materia de privacidad
Tus prompts abandonan tu infraestructura. Inaceptable para datos sensibles (salud, jurídico, código propietario) sin contrato y sin nube dedicada adecuada.
i
API autoalojada vs API propietaria
Ten cuidado de no confundir la API de un proveedor propietario (datos enviados a un tercero) con una API compatible con OpenAI que expones tú mismo desde Ollama o vLLM en tu propio servidor. La segunda ofrece la comodidad de una API sin el coste por token ni la fuga de datos.

#El umbral de rentabilidad del autoalojamiento frente a la API

Es el cálculo central. Una GPU comprada es un costo fijo; una API es un costo variable. Existe, por tanto, un volumen de tokens a partir del cual tener tu propio servidor resulta más barato que pagar por uso. Por debajo de este umbral, gana la API; por encima, se amortiza el autoalojamiento.

La idea: una RTX 4090 de 1.800 € amortizada en 3 años supone aproximadamente 50 €/mes de hardware, más la electricidad. Si tu gasto en la API supera este importe cada mes, la compra se vuelve rentable, a menudo a partir de unos pocos millones de tokens diarios con un uso recurrente. Para un uso ocasional de unas pocas consultas al día, la API sigue siendo imbatible.

→
Usa la calculadora
En lugar de estimar a ojo, el calculador de costo LLM del sitio calcula con precisión tu umbral de cambio: introduce tu volumen de tokens, el precio de la API que tengas en mente y el costo del hardware, y te dice a partir de qué punto el autoalojamiento se vuelve rentable.
Bajo volumen, datos no sensibles
API. El costo fijo de un servidor no se justifica para unos miles de tokens al día.
Volumen elevado y recurrente
Compra. La GPU se amortiza en unos pocos meses y el coste marginal por consulta baja a casi cero.
Datos sensibles, independientemente del volumen
Autoalojamiento (compra o alquiler en Francia). La confidencialidad determina la elección incluso antes de calcular el coste.
Pico puntual de demanda o fine-tuning
Alquiler por horas. Solo se paga por la potencia durante la operación.

#Configuración típica por presupuesto

Aquí tienes tres perfiles de máquinas autogestionadas que corresponden a tres niveles de presupuesto y ambición. Los rangos de precios son aproximaciones de 2026, con todo el hardware incluido.

  1. 01
    Estación de trabajo con GPU — 2.500 a 3.500 €
    Una RTX 4090 de 24 GB (o una RTX 3090 de ocasión para dividir el precio por dos) en un PC con 64 GB de RAM. Ejecuta cómodamente un 32B Q4 (≈19 GB de VRAM) y un 70B con cuantización agresiva. La referencia para un desarrollador o un equipo pequeño.
  2. 02
    Servidor GPU dedicado — 4.000 a 8.000 € o alquiler mensual
    Una tarjeta profesional (L40S de 48 GB, o 2× RTX 4090 en tensor-split) en un chasis de rack pensado para funcionar 24/7 y atender a varios usuarios a través de Open WebUI. Se puede comprar o alquilar a un proveedor de alojamiento francés si no quieres gestionar el hardware.
  3. 03
    Mini-PC con memoria unificada — 700 a 6.000 €
    Un Mac mini M4 (a partir de ~700 €) para un servidor de inferencia silencioso y de bajo consumo, o un Mac Studio M5 Ultra (96 GB o más, 512 GB anunciados para finales de octubre de 2026) para ejecutar modelos de 70B–123B sin múltiples GPU. Consumo eléctrico ínfimo frente a una GPU NVIDIA.
i
VRAM y tamaño del modelo
Memoria en Q4: un 7B cabe en ~5 GB, un 14B en ~9 GB, un 32B en ~19 GB, un 70B en ~40 GB. Es la VRAM (o la memoria unificada en Mac) la que limita el tamaño del modelo, no la potencia de cálculo bruta. Elige el GPU por su VRAM antes que nada.

#Los costos ocultos que no se deben olvidar

El precio de compra es solo la parte visible. Tres partidas de gastos recurrentes se subestiman sistemáticamente en el presupuesto de un servidor GPU para LLM.

Electricidad
Una RTX 4090 consume hasta 450 W en carga. En inferencia casi continua, esto representa decenas de euros al mes según el precio del kWh. Un Mac con memoria unificada consume una fracción de eso — un argumento real para el uso 24/7.
Mantenimiento y disponibilidad
Un servidor que debe responder continuamente requiere supervisión, actualizaciones y gestión de fallos. Es tiempo humano, invisible en la factura pero real.
Obsolescencia
Una GPU pierde valor y los modelos evolucionan rápido. Amortizarla en 3 años es razonable, pero, dado que un modelo de 14B de 2026 supera a uno de 70B de 2024, la carrera por mejorar el hardware no siempre es necesaria: a veces basta un modelo más reciente y más pequeño.
Refrigeración y ruido
Una GPU de gama alta se calienta y hace ruido. En un espacio profesional, prever la ventilación del local; en un puesto de trabajo, el confort acústico importa.
!
El costo total de propiedad
Compara siempre el coste total de propiedad (TCO) durante el periodo de amortización, no el precio de compra. Una GPU NVIDIA más barata al comprarla, pero con un elevado consumo eléctrico, puede costar más durante 3 años de funcionamiento las 24 horas del día, los 7 días de la semana, que un Mac más caro pero de bajo consumo. Incluye la electricidad y el mantenimiento en el cálculo.

#Para ir más allá

Tres guías relacionadas para afinar tu decisión: la guía de elección de GPU detalla los compromisos entre VRAM, presupuesto y rendimiento tarjeta por tarjeta; la calculadora de costes cuantifica con precisión tu umbral de rentabilidad del autoalojamiento frente a las API; y la guía de configuración de PC con 32 GB de VRAM enumera los componentes concretos de una máquina capaz de ejecutar modelos de 32B.

Elegir tu GPU para IA local
La guía de compra de 2026: RTX 4070 vs 4090 vs Mac M-Max, decisiones entre VRAM y presupuesto.
Calculadora de costos de LLM
Calcula el umbral a partir del cual te conviene pasar del autoalojamiento a una API, o viceversa, según tu volumen de tokens.
Configuración de PC para IA: presupuesto para 32 GB de VRAM
La selección de componentes para armar una máquina capaz de ejecutar modelos de 32B localmente.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.