Calculadora de Coste de Servidor LLM

Estima el coste eléctrico de ejecutar un servidor LLM local. Compara perfiles GPU autoalojados con una API en la nube, con resultados en vivo.

Parámetros

Presets de GPU
$/kWh
W
tok/s
tok/s
tok
%
tok
sol

Resultados

Coste / Hora $0.00 Operación continua
Por Solicitud $0.00 0s · tiempo medio
Coste Mensual $0.00 30 días
Coste / 1M Entrada (realista) $0.00 con caché
Entrada tok/kWh 0 eficiencia de prompt
Salida tok/kWh 0 eficiencia de decodificación
Coste / 1M Entrada (sin caché) $0.00 peor caso
Coste / 1M Entrada (todo en caché) $0.00 mejor caso
Coste / 1M Salida $0.00 solo decodificación
Coste Diario $0.00 a tu tasa de solicitudes

Escenario Realista

Escenario fijo de operación continua: 60k entrada, 50k en caché, 2k salida, 90% de actividad (21,6 h/día). Usa tu consumo, coste de energía y velocidades actuales.

Diario (90% actividad) $0.00
Mensual $0.00
Por Solicitud $0.00 0s
Máx. Solicitudes / Día 0
Entrada tok/kWh 0
Salida tok/kWh 0

Comparación con API en la Nube

Compara cada perfil autoalojado con una API en la nube para el escenario fijo (60k entrada / 50k en caché / 2k salida, 90% de actividad).

API de referencia: $0,25/1M entrada · $0,02/1M en caché · $1,20/1M salida

Comparación con API en la Nube
Perfil Consumo Velocidad (ent/sal) Por Solicitud Mensual (auto) Mensual (API) Ahorro

Eficiencia Energética

Eficiencia Energética
Perfil Entrada tok/kWh Salida tok/kWh
Cómo Funciona

La calculadora convierte el consumo de tu GPU y las velocidades de procesamiento de tokens en costes eléctricos usando las fórmulas siguientes.

Supuestos: los tokens en caché se procesan en 1/100 del tiempo de los no cacheados (acertado en caché KV). El escenario usa 90% de actividad (21,6 h/día) como estimación de peor caso de operación continua.

Coste por hora
cost_per_hour = power_w / 1000 * energy_cost
División de tokens (cacheados vs no cacheados)
cached_tokens = input_tokens * cache_rate / 100
uncached_tokens = input_tokens - cached_tokens
Tiempo de procesamiento del prompt
prompt_time = uncached_tokens / prompt_speed + cached_tokens / (prompt_speed * 100)
Tiempo total de solicitud
request_time = prompt_time + output_tokens / decode_speed
Coste por solicitud
cost_per_request = cost_per_hour * request_time / 3600
Coste por 1M tokens de entrada
cost_per_1m_input = cost_per_hour * (1_000_000 / prompt_speed) / 3600
cost_per_1m_input_cached = cost_per_hour * (1_000_000 / (prompt_speed * 100)) / 3600
Coste diario
daily_cost = cost_per_request * requests_per_day
Coste mensual
monthly_cost = daily_cost * 30
Coste diario del escenario
scenario_daily = cost_per_hour * 21.6  (90% uptime)

Cuándo Usar Esta Calculadora

Esta calculadora ayuda a desarrolladores, aficionados a la IA y escritores técnicos a estimar el coste eléctrico real de autoalojar un LLM local y compararlo con el precio de una API en la nube.

  • Estimar el Coste de Mi Propio Servidor

    Introduce el consumo de tu GPU, las velocidades de tokens y los tamaños típicos de prompt/salida para ver el coste eléctrico real por hora, por solicitud y por mes.

  • Cargar un Preset de GPU

    Haz clic en un preset (RTX 4070 Ti Super, RTX 5090, RTX 5090 eco) para rellenar valores realistas de consumo y velocidad, y ajústalos a partir de ahí.

  • Comparar Autoalojado vs. API en la Nube

    Mira una tabla y un gráfico que comparan tu configuración y los presets con una API en la nube para entender los ahorros o pérdidas mensuales de autoalojar.

  • Modelar un Escenario Realista de Operación Continua

    Obtén una estimación de peor caso de operación continua (60k entrada / 50k en caché / 2k salida, 90% de actividad) independiente de tus entradas por solicitud.

  • Entender las Fórmulas

    Expande la sección 'Cómo funciona' para ver las fórmulas exactas de coste y el supuesto de caché KV, para que puedas citar la metodología.

Preguntas Frecuentes

¿Qué estima esta calculadora?
El coste eléctrico de ejecutar un servidor LLM local, basado en el consumo de tu GPU, las velocidades de tokens y el tamaño típico de solicitud.
¿Cómo se tratan los tokens en caché?
Se asume que los tokens en caché (acertado en caché KV) se procesan en 1/100 del tiempo de los no cacheados, por lo que cuestan mucho menos.
¿Qué hacen los presets?
Rellenan el consumo y las velocidades de prompt/decodificación para GPUs comunes para que puedas empezar con valores realistas y ajustarlos.
¿Cómo se calcula la comparación con la API en la nube?
Pon precio al mismo escenario fijo (60k entrada, 50k en caché, 2k salida) a las tarifas de referencia de la API y compara el coste mensual con cada perfil autoalojado.
¿Se envía mi datos a algún sitio?
No. Todos los cálculos se ejecutan en tu navegador y nada se sube ni se almacena.