Calculadora de costo LLM — API frente a alojamiento propio
¿Cuánto te cuesta realmente ChatGPT, Claude, Gemini o DeepSeek al mes? ¿A partir de qué volumen resulta rentable una RTX 5090 o un Mac mini M5 Pro? Introduce tu consumo y te lo decimos.
Tu consumo mensual
Modos avanzados
Activa las optimizaciones que se apliquen a tu uso. No todos los modelos admiten todos los modos: ver las notas de la tabla.
Costo mensual a través de API (8 fournisseurs)
| Modelo | Vendor | Input | Output | Total/mois | Notas |
|---|---|---|---|---|---|
| Mistral Small 4★ Más barato | Mistral | $1.5 | $1.5 | 2.6 € | Alojado en la UE, precio bajo |
| DeepSeek V4.1 Flash | DeepSeek | $3.0 | $3.0 | 5.3 € | -50 % fuera de horarios pico |
| GPT-5 mini | OpenAI | $2.5 | $5.0 | 6.6 € | Modelo pequeño, buen ratio calidad/precio |
| Gemini 3.8 Flash | $7.5 | $9.4 | 14.8 € | Último Flash (precio garantizado hasta el 31/12/2026) | |
| Claude Haiku 4.5 | Anthropic | $10.0 | $12.5 | 19.8 € | Muy rápido, multimodal |
| Claude Sonnet 5 | Anthropic | $20.0 | $25.0 | 39.6 € | Contexto 1M, mejor relación calidad/costo de Anthropic |
| Claude Opus 5.5 | Anthropic | $40.0 | $50.0 | 79.2 € | Contexto 1M, caché al 5 % del precio |
| GPT-6 Astra | OpenAI | $100 | $125 | 198 € | Gama alta de OpenAI (sept. 2026) |
Coste mensual del autoalojamiento (4 configs)
| Hardware | VRAM | Compra TTC | Amort./mois | Electricidad/mes | Total/mois | Capacidad de tokens/mes | Modelos compatibles |
|---|---|---|---|---|---|---|---|
| RTX 5070 Ti 16 GB (en un PC existente)★ Más barato | 16 GB | 1 300 € | 54.2 € | 21.1 € | 75.3 € | 19.4M ~45 tok/s | 14B con holgura, 24B en Q4 muy justo |
| Mac mini M5 Pro 24 GB⚠ subdimensionado | 24 GB | 1 999 € | 83.3 € | 2.8 € | 86.1 € | 8.6M ~20 tok/s | hasta 14B (≈ 16 GB utilizables de los 24) |
| Mac Studio M5 Max 36 GB | 36 GB | 2 999 € | 125 € | 4.1 € | 129 € | 15.1M ~35 tok/s | hasta modelos ~32B en Q4 (≈ 27 GB utilizables) |
| RTX 5090 32 GB (en un PC existente) | 32 GB | 5 000 € | 208 € | 31.2 € | 240 € | 34.6M ~80 tok/s | hasta 32B en Q4-Q6 (sin 70B) |
Veredicto
¿Estás haciendo este cálculo para sustituir GitHub Copilot o Cursor? En local, el coste es 0 €/mes y tu código nunca se envía a la nube. La guía « Copiloto de código local » te da la configuración completa (Ollama + Cline + Aider, configuraciones listas) para empezar en 30 minutos y te dice con franqueza dónde los modelos locales no sustituyen a los de la nube.
Ver el kit →¿Local o suscripción a ChatGPT / Claude?
Compara el coste de tus suscripciones con el de una máquina local compartida por el equipo.
Suscripciones: precios públicos consultados el 28/09/2026 (sin impuestos, convertidos a 0,88 € por 1 $ y con un IVA del 20 % añadido). Máquina: precio de compra amortizado en 24 meses + electricidad a 0,20 €/kWh. Un modelo local de 14B a 32B no reemplaza a los modelos más potentes en tareas difíciles, ni a la búsqueda web ni a la generación de imágenes incluidas en las suscripciones. Más allá de unos pocos usuarios simultáneos, se necesita una tarjeta más potente.
¿Cuánto cuesta un servidor GPU para ejecutar un LLM?
Dos formas de tener «tu propio» servidor GPU: comprarlo o alquilarlo por horas. Para un uso de unas pocas horas al día, el alquiler suele costar menos durante el primer año; para un uso continuo, la compra se amortiza rápidamente. Y una máquina en tu casa no envía ningún dato al exterior.
Comprar: costo mensual durante 24 meses
| Máquina | Precio | Amortización | Electricidad (4 h/día) | Total por mes | Hasta (Q4) |
|---|---|---|---|---|---|
| RTX 5070 Ti 16 GB (ordenador existente) | 1 300 € | 54 € | 9 € | ≈ 63 € | 14B |
| Mac mini M5 Pro 24 GB | 1 999 € | 83 € | 2 € | ≈ 85 € | 14B |
| Mac Studio M5 Max 36 GB | 2 999 € | 125 € | 3 € | ≈ 128 € | 32B |
| RTX 5090 32 GB (PC existente) | ≈ 5 000 € | 208 € | 16 € | ≈ 224 € | 32B |
Electricidad: potencia bajo carga × 4 h × 30 días a 0,20 €/kWh, con la máquina apagada el resto del tiempo. Precios registrados en septiembre de 2026.
Alquilar: precio por hora
| Servidor alquilado | Memoria GPU | Precio por hora | 4 horas al día | 24 horas sobre 24 |
|---|---|---|---|---|
| Scaleway L4 (París) | 24 GB | 0,79 € sin IVA | ≈ 95 € | ≈ 577 € |
| RunPod RTX 5090 | 32 GB | 0,61 à 0,87 € | 73 à 104 € | 443 à 636 € |
| RunPod A100 | 80 GB | 1,05 à 1,40 € | 126 à 168 € | 764 à 1 021 € |
| RunPod H100 | 80 GB | 1,75 à 3,07 € | 210 à 369 € | 1 278 à 2 242 € |
Tarifas públicas recogidas el 28/09/2026 en scaleway.com y runpod.io (RunPod: rango entre la oferta comunitaria y la oferta segura, dólares convertidos a 0,88 €). 4 h al día = 120 h al mes; 24 h/24 = 730 h.
¿Cuál elegir?
- Unas pocas horas al día : una RTX 5090 alquilada cuesta 73-104 € al mes, menos que la amortización de una tarjeta comprada por ≈ 5.000 €.
- De forma continua : una RTX 5090 alquilada 24 h sobre 24 cuesta entre 443 y 636 € al mes; comprada ≈ 5.000 €, se amortiza en 9 a 14 meses, electricidad incluida (≈ 95 € al mes de forma continua).
- Datos sensibles : una máquina en tu casa no transmite nada; al alquilar, prefiere un proveedor europeo.
Metodología y supuestos
Esta calculadora da una estimación aproximada, no un presupuesto contable. Las hipótesis que aparecen a continuación se explicitan deliberadamente para que puedas evaluar qué hace que la estimación se aparte de tu caso real.
Precios de la API
- Tarifas públicas consultadas el 28/09/2026 en USD/M tokens, fuentes: developers.openai.com/api/docs/pricing, platform.claude.com/docs/en/about-claude/pricing, ai.google.dev/gemini-api/docs/pricing, api-docs.deepseek.com, mistral.ai/pricing.
- Conversión USD→EUR al tipo de cambio de 0,88 (septiembre de 2026, puede variar ±5 % según el día).
- Costo adicional por contexto largo (OpenAI, Gemini por encima de 200k tokens) NO aplicado — la calculadora utiliza un solo precio por modelo.
- Caché (precio reducido específico de cada modelo, entre el 2 % y el 10 % del precio de entrada) aplicada únicamente si está activado el interruptor "Cache prompts". De lo contrario, se ignora.
- Modo de lote (50 % de descuento en OpenAI/Anthropic/Google/Mistral, demora de 24 h), aplicado únicamente si el interruptor "Modo de lote" está activado.
- Precio DeepSeek fuera de horarios pico (-50 %) aplicado únicamente si el interruptor correspondiente está activado.
Precios del autoalojamiento
- Precio de compra = precios con IVA en Francia registrados en septiembre de 2026 (activa «IVA recuperable» para ver los precios sin IVA, -16,67%). Las tarjetas gráficas presuponen que ya tienes un ordenador.
- Potencia en reposo/bajo carga = sistema COMPLETO (PC: fuente de alimentación+CPU+RAM+SSD+GPU; Mac: todo en uno). Fuentes: reseñas de TomsHardware/AnandTech, Apple Power Analyzer, mediciones de la comunidad pcpartpicker.
- Capacidad de tokens/mes = tok/s estimado × horas activas × 30 días. tok/s estimado con una carga de trabajo mixta (modelo que cabe holgadamente + modelo cercano al límite de VRAM).
- NO contado: mantenimiento (~1 h/mes ≈ 30-50 € equivalentes al coste de un profesional freelance), ancho de banda de internet, depreciación pura del equipo revendido, defectos/RMA.
- Opción «PC encendido las 24 horas» activada = consumo en reposo (24h - heures_actives) × idleW. Desactivada = PC apagado fuera de las horas activas (0 W en reposo).
Límites importantes
- Calidad diferente : Llama 3.3 70B local ≠ GPT-5 en razonamiento complejo / multimodal. El punto de equilibrio supone equivalencia funcional, lo que puede sobreestimar la rentabilidad del autoalojamiento para ciertos casos de uso.
- Disponibilidad : self-hosted requiere que la máquina esté encendida para procesar las consultas. API = siempre disponible, escalado instantáneo.
- Latencia : self-hosted = ms (local) ; API = 200-2000 ms según proveedor + región.
- Datos / RGPD : autoalojamiento = ningún dato enviado a terceros. API de EE. UU. (OpenAI/Anthropic/Google) = datos que salen del territorio de la UE. Mistral alojado en la UE = cumplimiento del RGPD de forma nativa.
- Para profundizar: Comparador de modelos · configurador de GPU · catálogo de 250 LLM · Servidor MCP quelllm.