Modelo de costo · actualizado en 2026
El costo de las API de IA ¿va a disparar tu presupuesto?
Los proveedores de API en la nube consumen una parte enorme de sus ingresos. Aquí tienes el cálculo para saber si su próxima subida de precios también disparará tu presupuesto.
coût_mensuel_2026 = R × (T_in × P_in + (T_out + T_raisonnement) × P_out)coût_mensuel_2027 = coût_mensuel_2026 × (1 + r)^Δmois
Calcular mi factura de API y el punto de equilibrio
Introduce tu volumen mensual: la herramienta calcula la factura actual, la de dentro de 12 y 24 meses según el escenario de subida, y el plazo de amortización de una configuración local.
La subida oculta que nadie anuncia
Los precios anunciados por token han bajado en general desde 2023. Pero dos cosas han cambiado entre bastidores: los tokens de razonamiento se facturan como tokens de salida, y pueden representar varias veces la longitud de la respuesta visible; el ruteo por defecto deriva silenciosamente las consultas «difíciles» hacia modelos de razonamiento más caros. Una reseña publicada por TechAhead en abril de 2026 señala así precios de la API de OpenAI «hasta 4× más altos en ciertas regiones» entre marzo de 2025 y enero de 2026, a pesar de las reducciones de los precios de catálogo.
Una factura realista en 2026
| Carga de trabajo | Tokens visibles/petición | Tokens de razonamiento/petición | Costo/petición (GPT-5) |
|---|---|---|---|
| Clasificador de atención al cliente | 120 in / 40 out | 180 | 0,0021 € |
| agente de revisión de código (1 archivo) | 2 400 in / 600 out | 4 800 | 0,050 € |
| Agente de investigación en múltiples pasos | 8 000 in / 1 200 out | 22 000 | 0,213 € |
| RAG jurídico de contexto largo | 62.000 in / 1.500 out | 9 000 | 0,161 € |
Cálculo al precio público de GPT-5 (1,25 $ por millón de tokens de entrada, 10 $ de salida, razonamiento facturado como salida), convertido a 0,88 € por 1 $ (septiembre 2026).
Con 50.000 ejecuciones de agente al mes — un despliegue modesto para el segmento de empresas medianas —, la partida «agente de investigación» por sí sola alcanza alrededor de 10 600 €/mes.
Umbral de rentabilidad frente al despliegue local
La verdadera pregunta no es «¿un modelo local iguala a una API de vanguardia en MMLU?», sino «¿puede gestionar el 70 % de mi tráfico de forma aceptable y cuánto cuesta la migración?». Tres despliegues de referencia, amortizados en 24 meses, con la electricidad incluida (0,20 €/kWh, 60 % de utilización). El umbral compara este coste mensual únicamente con el precio de los tokens de salida de GPT-5 (≈ 8,80 € por millón de tokens):
| Configuración | Modelo | Coste del hardware | Costo mensual | Rentable desde |
|---|---|---|---|---|
| RTX 5090 32 GB (añadida a un PC existente) | Qwen 3 32B Q4_K_M | ≈ 5 000 € | ≈ 265 € | ~30M tokens de salida/mes |
| 2 × RTX 5090 (sin NVLink, modelo distribuido) | Qwen 2.5 72B Q4_K_M | ≈ 10 000 € | ≈ 520 € | ~59M tokens de salida/mes |
| Mac Studio M5 Ultra 96 GB | gpt-oss 120B | ≈ 6 600 € | ≈ 300 € | ~34 M de tokens de salida/mes |
Precios de hardware registrados en septiembre de 2026 (RTX 5090 entre ≈ 5 000 y 5 600 € según el vendedor, Mac Studio M5 Ultra de 96 GB a 6 599 €). Las RTX 5090 no tienen NVLink: dos tarjetas comparten el modelo a través del bus PCIe.
Para el ejemplo anterior (50 000 ejecuciones, ~1,16 mil millones de tokens de salida y razonamiento por mes, ≈ 10 600 €/mes), el umbral de rentabilidad se supera con creces. Pero una sola GPU no es suficiente para producir ese volumen: se necesitan varias tarjetas que procesen las solicitudes por lotes (vLLM), y parte del tráfico permanecerá en la API.
El enrutador híbrido: el mejor de los dos mundos
- Nivel 1 (local, 60-75 % del tráfico): clasificación, extracción, autocompletado de código, síntesis RAG con un contexto inferior a 32K.
- Nivel 2 (API de gama media, 15-25 %): modelos ligeros para razonamiento moderado, con costo controlado.
- Nivel 3 (API de modelos de frontera, 5-15 %): solo las consultas que realmente requieren razonamiento avanzado, filtradas por un clasificador barato.
Si el 70 % de las consultas se procesan localmente, la factura de API baja aproximadamente un 70 %, menos el costo del hardware — siempre que la calidad siga siendo aceptable en esas consultas, lo cual se verifica mediante un test sobre tu propio tráfico.
Veredicto
| Gasto mensual actual en API | Recomendación | Por qué |
|---|---|---|
| < 400 € | Seguir usando la API | El coste de la ingeniería de migración supera el ahorro obtenido en 24 meses |
| 400 - 1 800 € | Optimizar los prompts, limitar el razonamiento | La caché de prompts, el procesamiento por lotes (-50 %) y un esfuerzo de razonamiento limitado reducen la factura sin salir de la API |
| 1 800 - 8 000 € | Híbrido: nivel 1 local + nivel 3 API | Una GPU de gama alta se amortiza en unos meses si la mayor parte del tráfico se procesa en local |
| > 8 000 € | Migrar agresivamente | La evolución de los costes deja de ser sostenible más allá de los 12 meses |
Preguntas frecuentes
¿Los precios de las API subirán realmente o seguirán bajando?
Los precios de catálogo por token han bajado en general desde 2023. Pero el coste por respuesta útil puede subir, porque los tokens de razonamiento se facturan como tokens de salida. Una revisión publicada por TechAhead en abril de 2026 señala precios de la API de OpenAI «hasta 4 veces más altos en ciertas regiones» entre marzo de 2025 y enero de 2026. Calcula tu presupuesto a partir del coste que hayas medido por solicitud, no solo del precio de catálogo.
¿Basta una sola GPU de gama alta (32 GB) para reemplazar una API de un modelo de frontera?
Para buena parte del tráfico habitual (código, clasificación, RAG con menos de 32K de contexto), a menudo sí: un modelo de 32B cuantizado en Q4_K_M genera varias decenas de tokens/s en una RTX 5090. La parte realmente reemplazable depende de tus tareas y se comprueba con tu propio tráfico. Para el razonamiento más avanzado y los contextos muy largos, sigue siendo necesario un enrutador híbrido que recurra a una API de modelos de vanguardia.
¿Qué tasa de inflación usar en el modelo?
No existe un número oficial: r es una hipótesis de escenario. Como ejemplo, r = 0,06 al mes duplica la factura en un año. Prueba también r = 0 (precios estables) y un valor negativo, que corresponde a la caída de los precios de catálogo observada desde 2023.
¿El fine-tuning es una alternativa a pasar a la ejecución local?
El fine-tuning con un proveedor en la nube reduce el costo por token del modelo ajustado, pero a menudo aumenta el gasto total porque los equipos usan ese costo unitario más bajo para justificar más llamadas. También genera dependencia del proveedor. El fine-tuning LoRA de un modelo local (Qwen3 o Llama) aporta ahorros duraderos.