Herramienta 02 · Coste LLM

Calculadora de costo LLM — API frente a alojamiento propio

¿Cuánto te cuesta realmente ChatGPT, Claude, Gemini o DeepSeek al mes? ¿A partir de qué volumen resulta rentable una RTX 5090 o un Mac mini M5 Pro? Introduce tu consumo y te lo decimos.

Tu consumo mensual

Referencia: 10M de tokens de entrada + 2,5M de tokens de salida = ~5.000 conversaciones de duración media con Claude (1.500 tokens de entrada + 500 de salida por conversación). Ajusta según tu uso.

Modos avanzados

Activa las optimizaciones que se apliquen a tu uso. No todos los modelos admiten todos los modos: ver las notas de la tabla.

Costo mensual a través de API (8 fournisseurs)

Haz clic en las etiquetas para activar/desactivar los modelos.
ModeloVendorInputOutputTotal/moisNotas
Mistral Small 4★ Más baratoMistral$1.5$1.52.6 €Alojado en la UE, precio bajo
DeepSeek V4.1 FlashDeepSeek$3.0$3.05.3 €-50 % fuera de horarios pico
GPT-5 miniOpenAI$2.5$5.06.6 €Modelo pequeño, buen ratio calidad/precio
Gemini 3.8 FlashGoogle$7.5$9.414.8 €Último Flash (precio garantizado hasta el 31/12/2026)
Claude Haiku 4.5Anthropic$10.0$12.519.8 €Muy rápido, multimodal
Claude Sonnet 5Anthropic$20.0$25.039.6 €Contexto 1M, mejor relación calidad/costo de Anthropic
Claude Opus 5.5Anthropic$40.0$50.079.2 €Contexto 1M, caché al 5 % del precio
GPT-6 AstraOpenAI$100$125198 €Gama alta de OpenAI (sept. 2026)

Coste mensual del autoalojamiento (4 configs)

Hardware amortizado en 24 meses + electricidad (0.20 €/kWh). Capacity = tok/s estimado × 4h/día × 30 d; advertencia si no es suficiente para 12.5M tokens solicitados.
HardwareVRAMCompra TTCAmort./moisElectricidad/mesTotal/moisCapacidad de tokens/mesModelos compatibles
RTX 5070 Ti 16 GB (en un PC existente)★ Más barato16 GB1 300 €54.2 €21.1 €75.3 €19.4M
~45 tok/s
14B con holgura, 24B en Q4 muy justo
Mac mini M5 Pro 24 GB⚠ subdimensionado24 GB1 999 €83.3 €2.8 €86.1 €8.6M
~20 tok/s
hasta 14B (≈ 16 GB utilizables de los 24)
Mac Studio M5 Max 36 GB36 GB2 999 €125 €4.1 €129 €15.1M
~35 tok/s
hasta modelos ~32B en Q4 (≈ 27 GB utilizables)
RTX 5090 32 GB (en un PC existente)32 GB5 000 €208 €31.2 €240 €34.6M
~80 tok/s
hasta 32B en Q4-Q6 (sin 70B)

Veredicto

Comparación personalizable — cambia las opciones a continuación.
API para comparar
Mistral Small 4
2.6 €/mois
API más barata ★. No hay que comprar hardware; el escalado es instantáneo.
Hardware para comparar
RTX 5070 Ti 16 GB (en un PC existente)
75.3 €/mois (amorti)
Tokens locales, datos privados, latencia en ms.
Punto de equilibrio del autoalojamiento
Jamás (a este volumen)
Con tu volumen actual, Mistral Small 4 (2.6 €/mes) cuesta menos que el gasto en electricidad de RTX 5070 Ti 16 GB (en un PC existente) por sí solo. Aumenta el consumo o cambia el hardware/API de arriba.
Si es para programar
El mismo cálculo, versión Copilot

¿Estás haciendo este cálculo para sustituir GitHub Copilot o Cursor? En local, el coste es 0 €/mes y tu código nunca se envía a la nube. La guía « Copiloto de código local » te da la configuración completa (Ollama + Cline + Aider, configuraciones listas) para empezar en 30 minutos y te dice con franqueza dónde los modelos locales no sustituyen a los de la nube.

Ver el kit →

¿Local o suscripción a ChatGPT / Claude?

Compara el coste de tus suscripciones con el de una máquina local compartida por el equipo.

Suscripciones
63.4 €
por mes, impuestos incluidos
Máquina local
85.1 €
por mes durante 24 meses
Reembolsada en
32,5 meses
ahorro en 3 años: 217 €

Suscripciones: precios públicos consultados el 28/09/2026 (sin impuestos, convertidos a 0,88 € por 1 $ y con un IVA del 20 % añadido). Máquina: precio de compra amortizado en 24 meses + electricidad a 0,20 €/kWh. Un modelo local de 14B a 32B no reemplaza a los modelos más potentes en tareas difíciles, ni a la búsqueda web ni a la generación de imágenes incluidas en las suscripciones. Más allá de unos pocos usuarios simultáneos, se necesita una tarjeta más potente.

¿Cuánto cuesta un servidor GPU para ejecutar un LLM?

Dos formas de tener «tu propio» servidor GPU: comprarlo o alquilarlo por horas. Para un uso de unas pocas horas al día, el alquiler suele costar menos durante el primer año; para un uso continuo, la compra se amortiza rápidamente. Y una máquina en tu casa no envía ningún dato al exterior.

Comprar: costo mensual durante 24 meses

MáquinaPrecioAmortizaciónElectricidad (4 h/día)Total por mesHasta (Q4)
RTX 5070 Ti 16 GB (ordenador existente)1 300 €54 €9 €≈ 63 €14B
Mac mini M5 Pro 24 GB1 999 €83 €2 €≈ 85 €14B
Mac Studio M5 Max 36 GB2 999 €125 €3 €≈ 128 €32B
RTX 5090 32 GB (PC existente)≈ 5 000 €208 €16 €≈ 224 €32B

Electricidad: potencia bajo carga × 4 h × 30 días a 0,20 €/kWh, con la máquina apagada el resto del tiempo. Precios registrados en septiembre de 2026.

Alquilar: precio por hora

Servidor alquiladoMemoria GPUPrecio por hora4 horas al día24 horas sobre 24
Scaleway L4 (París)24 GB0,79 € sin IVA≈ 95 €≈ 577 €
RunPod RTX 509032 GB0,61 à 0,87 €73 à 104 €443 à 636 €
RunPod A10080 GB1,05 à 1,40 €126 à 168 €764 à 1 021 €
RunPod H10080 GB1,75 à 3,07 €210 à 369 €1 278 à 2 242 €

Tarifas públicas recogidas el 28/09/2026 en scaleway.com y runpod.io (RunPod: rango entre la oferta comunitaria y la oferta segura, dólares convertidos a 0,88 €). 4 h al día = 120 h al mes; 24 h/24 = 730 h.

¿Cuál elegir?

  • Unas pocas horas al día : una RTX 5090 alquilada cuesta 73-104 € al mes, menos que la amortización de una tarjeta comprada por ≈ 5.000 €.
  • De forma continua : una RTX 5090 alquilada 24 h sobre 24 cuesta entre 443 y 636 € al mes; comprada ≈ 5.000 €, se amortiza en 9 a 14 meses, electricidad incluida (≈ 95 € al mes de forma continua).
  • Datos sensibles : una máquina en tu casa no transmite nada; al alquilar, prefiere un proveedor europeo.

Metodología y supuestos

Esta calculadora da una estimación aproximada, no un presupuesto contable. Las hipótesis que aparecen a continuación se explicitan deliberadamente para que puedas evaluar qué hace que la estimación se aparte de tu caso real.

Precios de la API

  • Tarifas públicas consultadas el 28/09/2026 en USD/M tokens, fuentes: developers.openai.com/api/docs/pricing, platform.claude.com/docs/en/about-claude/pricing, ai.google.dev/gemini-api/docs/pricing, api-docs.deepseek.com, mistral.ai/pricing.
  • Conversión USD→EUR al tipo de cambio de 0,88 (septiembre de 2026, puede variar ±5 % según el día).
  • Costo adicional por contexto largo (OpenAI, Gemini por encima de 200k tokens) NO aplicado — la calculadora utiliza un solo precio por modelo.
  • Caché (precio reducido específico de cada modelo, entre el 2 % y el 10 % del precio de entrada) aplicada únicamente si está activado el interruptor "Cache prompts". De lo contrario, se ignora.
  • Modo de lote (50 % de descuento en OpenAI/Anthropic/Google/Mistral, demora de 24 h), aplicado únicamente si el interruptor "Modo de lote" está activado.
  • Precio DeepSeek fuera de horarios pico (-50 %) aplicado únicamente si el interruptor correspondiente está activado.

Precios del autoalojamiento

  • Precio de compra = precios con IVA en Francia registrados en septiembre de 2026 (activa «IVA recuperable» para ver los precios sin IVA, -16,67%). Las tarjetas gráficas presuponen que ya tienes un ordenador.
  • Potencia en reposo/bajo carga = sistema COMPLETO (PC: fuente de alimentación+CPU+RAM+SSD+GPU; Mac: todo en uno). Fuentes: reseñas de TomsHardware/AnandTech, Apple Power Analyzer, mediciones de la comunidad pcpartpicker.
  • Capacidad de tokens/mes = tok/s estimado × horas activas × 30 días. tok/s estimado con una carga de trabajo mixta (modelo que cabe holgadamente + modelo cercano al límite de VRAM).
  • NO contado: mantenimiento (~1 h/mes ≈ 30-50 € equivalentes al coste de un profesional freelance), ancho de banda de internet, depreciación pura del equipo revendido, defectos/RMA.
  • Opción «PC encendido las 24 horas» activada = consumo en reposo (24h - heures_actives) × idleW. Desactivada = PC apagado fuera de las horas activas (0 W en reposo).

Límites importantes

  • Calidad diferente : Llama 3.3 70B local ≠ GPT-5 en razonamiento complejo / multimodal. El punto de equilibrio supone equivalencia funcional, lo que puede sobreestimar la rentabilidad del autoalojamiento para ciertos casos de uso.
  • Disponibilidad : self-hosted requiere que la máquina esté encendida para procesar las consultas. API = siempre disponible, escalado instantáneo.
  • Latencia : self-hosted = ms (local) ; API = 200-2000 ms según proveedor + región.
  • Datos / RGPD : autoalojamiento = ningún dato enviado a terceros. API de EE. UU. (OpenAI/Anthropic/Google) = datos que salen del territorio de la UE. Mistral alojado en la UE = cumplimiento del RGPD de forma nativa.
  • Para profundizar: Comparador de modelos · configurador de GPU · catálogo de 250 LLM · Servidor MCP quelllm.