Kalkulator kosztów serwera LLM

Oszacuj koszt energii elektrycznej uruchamiania lokalnego serwera LLM. Porównaj profile GPU self-hosted z API w chmurze, z wynikami na żywo.

Parametry

Presety GPU
$/kWh
W
tok/s
tok/s
tok
%
tok
żąd

Wyniki

Koszt / Godzina $0.00 Ciągła praca
Na żądanie $0.00 0s · średni czas
Koszt miesięczny $0.00 30 dni
Koszt / 1M wejścia (realistycznie) $0.00 z cache
Wejście tok/kWh 0 skuteczność promptu
Wyjście tok/kWh 0 skuteczność dekodowania
Koszt / 1M wejścia (bez cache) $0.00 najgorszy przypadek
Koszt / 1M wejścia (całość w cache) $0.00 najlepszy przypadek
Koszt / 1M wyjścia $0.00 tylko dekodowanie
Koszt dzienny $0.00 przy Twoim tempie żądań

Realistyczny scenariusz

Stały scenariusz ciągłej pracy: 60k wejścia, 50k w cache, 2k wyjścia, 90% czasu pracy (21,6 h/dobę). Używa Twojego aktualnego poboru mocy, ceny energii i prędkości.

Dziennie (90% pracy) $0.00
Miesięcznie $0.00
Na żądanie $0.00 0s
Maks. żądań / dzień 0
Wejście tok/kWh 0
Wyjście tok/kWh 0

Porównanie z API w chmurze

Porównuje każdy profil self-hosted z API w chmurze dla stałego scenariusza (60k wejścia / 50k w cache / 2k wyjścia, 90% czasu pracy).

API referencyjne: $0,25/1M wejścia · $0,02/1M w cache · $1,20/1M wyjścia

Porównanie z API w chmurze
Profil Moc Prędkość (wej/wyj) Na żądanie Miesięcznie (self) Miesięcznie (API) Oszczędność

Skuteczność energetyczna

Skuteczność energetyczna
Profil Wejście tok/kWh Wyjście tok/kWh
Jak to działa

Kalkulator przekłada pobór mocy GPU i prędkości przetwarzania tokenów na koszty energii elektrycznej, używając poniższych formuł.

Założenia: tokeny w cache są przetwarzane w 1/100 czasu tokenów spoza cache (trafienie w cache KV). Scenariusz używa 90% czasu pracy (21,6 h/dobę) jako szacunku najgorszego przypadku ciągłej pracy.

Koszt na godzinę
cost_per_hour = power_w / 1000 * energy_cost
Podział tokenów (w cache vs spoza cache)
cached_tokens = input_tokens * cache_rate / 100
uncached_tokens = input_tokens - cached_tokens
Czas przetwarzania promptu
prompt_time = uncached_tokens / prompt_speed + cached_tokens / (prompt_speed * 100)
Całkowity czas żądania
request_time = prompt_time + output_tokens / decode_speed
Koszt na żądanie
cost_per_request = cost_per_hour * request_time / 3600
Koszt na 1M tokenów wejścia
cost_per_1m_input = cost_per_hour * (1_000_000 / prompt_speed) / 3600
cost_per_1m_input_cached = cost_per_hour * (1_000_000 / (prompt_speed * 100)) / 3600
Koszt dzienny
daily_cost = cost_per_request * requests_per_day
Koszt miesięczny
monthly_cost = daily_cost * 30
Koszt dzienny scenariusza
scenario_daily = cost_per_hour * 21.6  (90% uptime)

Kiedy używać tego kalkulatora

Ten kalkulator pomaga programistom, entuzjastom AI i twórcom treści technicznych oszacować rzeczywisty koszt energii elektrycznej self-hostingu lokalnego LLM i porównać go z ceną API w chmurze.

  • Oszacuj koszt mojego serwera

    Wprowadź pobór mocy GPU, prędkości tokenów i typowe rozmiary promptu/wyniku, aby zobaczyć rzeczywisty koszt energii na godzinę, na żądanie i na miesiąc.

  • Załaduj preset GPU

    Kliknij preset (RTX 4070 Ti Super, RTX 5090, RTX 5090 eco), aby wypełnić realistyczne wartości mocy i prędkości, a następnie je dostosuj.

  • Porównaj self-hosted z API w chmurze

    Zobacz tabelę i wykres porównujące Twoją konfigurację i presety z API w chmurze, aby zrozumieć miesięczne oszczędności lub straty self-hostingu.

  • Zamodeluj realistyczny scenariusz ciągłej pracy

    Uzyskaj szacunek najgorszego przypadku ciągłej pracy (60k wejścia / 50k w cache / 2k wyjścia, 90% czasu pracy) niezależnie od Twoich wartości na żądanie.

  • Zrozum formuły

    Rozwiń sekcję 'Jak to działa', aby zobaczyć dokładne formuły kosztów i założenie dotyczące cache KV, dzięki czemu możesz przytoczyć metodologię.

Częste pytania

Co szacuje ten kalkulator?
Koszt energii elektrycznej uruchamiania lokalnego serwera LLM, na podstawie poboru mocy GPU, prędkości tokenów i typowego rozmiaru żądania.
Jak traktowane są tokeny w cache?
Zakłada się, że tokeny w cache (trafienie w cache KV) są przetwarzane w 1/100 czasu tokenów spoza cache, więc kosztują znacznie mniej.
Co robią presety?
Wypełniają pobór mocy i prędkości promptu/dekodowania dla popularnych GPU, abyś mógł zacząć od realistycznych wartości i je dostosować.
Jak obliczane jest porównanie z API w chmurze?
Wycenia ten sam stały scenariusz (60k wejścia, 50k w cache, 2k wyjścia) po stawkach referencyjnych API i porównuje koszt miesięczny z każdym profilem self-hosted.
Czy moje dane są gdzieś wysyłane?
Nie. Wszystkie obliczenia wykonują się w Twojej przeglądarce i nic nie jest wysyłane ani przechowywane.