Calculadora de Coste de Servidor LLM
Estima el coste eléctrico de ejecutar un servidor LLM local. Compara perfiles GPU autoalojados con una API en la nube, con resultados en vivo.
Parámetros
Resultados
Escenario Realista
Escenario fijo de operación continua: 60k entrada, 50k en caché, 2k salida, 90% de actividad (21,6 h/día). Usa tu consumo, coste de energía y velocidades actuales.
Comparación con API en la Nube
Compara cada perfil autoalojado con una API en la nube para el escenario fijo (60k entrada / 50k en caché / 2k salida, 90% de actividad).
API de referencia: $0,25/1M entrada · $0,02/1M en caché · $1,20/1M salida
| Perfil | Consumo | Velocidad (ent/sal) | Por Solicitud | Mensual (auto) | Mensual (API) | Ahorro |
|---|
Eficiencia Energética
| Perfil | Entrada tok/kWh | Salida tok/kWh |
|---|
Cómo Funciona
La calculadora convierte el consumo de tu GPU y las velocidades de procesamiento de tokens en costes eléctricos usando las fórmulas siguientes.
Supuestos: los tokens en caché se procesan en 1/100 del tiempo de los no cacheados (acertado en caché KV). El escenario usa 90% de actividad (21,6 h/día) como estimación de peor caso de operación continua.
Coste por hora cost_per_hour = power_w / 1000 * energy_cost División de tokens (cacheados vs no cacheados) cached_tokens = input_tokens * cache_rate / 100 uncached_tokens = input_tokens - cached_tokens Tiempo de procesamiento del prompt prompt_time = uncached_tokens / prompt_speed + cached_tokens / (prompt_speed * 100) Tiempo total de solicitud request_time = prompt_time + output_tokens / decode_speed Coste por solicitud cost_per_request = cost_per_hour * request_time / 3600 Coste por 1M tokens de entrada cost_per_1m_input = cost_per_hour * (1_000_000 / prompt_speed) / 3600 cost_per_1m_input_cached = cost_per_hour * (1_000_000 / (prompt_speed * 100)) / 3600 Coste diario daily_cost = cost_per_request * requests_per_day Coste mensual monthly_cost = daily_cost * 30 Coste diario del escenario scenario_daily = cost_per_hour * 21.6 (90% uptime)
Cuándo Usar Esta Calculadora
Esta calculadora ayuda a desarrolladores, aficionados a la IA y escritores técnicos a estimar el coste eléctrico real de autoalojar un LLM local y compararlo con el precio de una API en la nube.
-
Estimar el Coste de Mi Propio Servidor
Introduce el consumo de tu GPU, las velocidades de tokens y los tamaños típicos de prompt/salida para ver el coste eléctrico real por hora, por solicitud y por mes.
-
Cargar un Preset de GPU
Haz clic en un preset (RTX 4070 Ti Super, RTX 5090, RTX 5090 eco) para rellenar valores realistas de consumo y velocidad, y ajústalos a partir de ahí.
-
Comparar Autoalojado vs. API en la Nube
Mira una tabla y un gráfico que comparan tu configuración y los presets con una API en la nube para entender los ahorros o pérdidas mensuales de autoalojar.
-
Modelar un Escenario Realista de Operación Continua
Obtén una estimación de peor caso de operación continua (60k entrada / 50k en caché / 2k salida, 90% de actividad) independiente de tus entradas por solicitud.
-
Entender las Fórmulas
Expande la sección 'Cómo funciona' para ver las fórmulas exactas de coste y el supuesto de caché KV, para que puedas citar la metodología.
Preguntas Frecuentes
- ¿Qué estima esta calculadora?
- El coste eléctrico de ejecutar un servidor LLM local, basado en el consumo de tu GPU, las velocidades de tokens y el tamaño típico de solicitud.
- ¿Cómo se tratan los tokens en caché?
- Se asume que los tokens en caché (acertado en caché KV) se procesan en 1/100 del tiempo de los no cacheados, por lo que cuestan mucho menos.
- ¿Qué hacen los presets?
- Rellenan el consumo y las velocidades de prompt/decodificación para GPUs comunes para que puedas empezar con valores realistas y ajustarlos.
- ¿Cómo se calcula la comparación con la API en la nube?
- Pon precio al mismo escenario fijo (60k entrada, 50k en caché, 2k salida) a las tarifas de referencia de la API y compara el coste mensual con cada perfil autoalojado.
- ¿Se envía mi datos a algún sitio?
- No. Todos los cálculos se ejecutan en tu navegador y nada se sube ni se almacena.
Ayuda de la Calculadora de Coste LLM
Cómo Usar
- Ajusta los parámetros usando los deslizadores o escribe valores exactos en los campos numéricos
- Opcionalmente, haz clic en un preset de GPU para cargar valores realistas de consumo y velocidad
- Revisa los resultados en vivo: coste por hora, por solicitud, por millón de tokens, diario y mensual
- Compara tu configuración con la API en la nube en la tabla y el gráfico de comparación
Características
- Recálculo en vivo con cada cambio de entrada
- Presets de GPU para tarjetas comunes
- Comparación con API en la nube con desglose de ahorros
- 100% en el cliente — ningún dato sale de tu navegador
Consejos
- Usa la sección 'Cómo Funciona' para ver las fórmulas exactas detrás de cada número.
- La tasa de acierto en caché tiene un gran impacto en el coste de entrada — incluso un 50% de caché reduce el coste de entrada a la mitad.
- Haz clic en Restablecer en cualquier momento para volver a los valores predeterminados y empezar de nuevo.