Kalkulator kosztów serwera LLM
Oszacuj koszt energii elektrycznej uruchamiania lokalnego serwera LLM. Porównaj profile GPU self-hosted z API w chmurze, z wynikami na żywo.
Parametry
Wyniki
Realistyczny scenariusz
Stały scenariusz ciągłej pracy: 60k wejścia, 50k w cache, 2k wyjścia, 90% czasu pracy (21,6 h/dobę). Używa Twojego aktualnego poboru mocy, ceny energii i prędkości.
Porównanie z API w chmurze
Porównuje każdy profil self-hosted z API w chmurze dla stałego scenariusza (60k wejścia / 50k w cache / 2k wyjścia, 90% czasu pracy).
API referencyjne: $0,25/1M wejścia · $0,02/1M w cache · $1,20/1M wyjścia
| Profil | Moc | Prędkość (wej/wyj) | Na żądanie | Miesięcznie (self) | Miesięcznie (API) | Oszczędność |
|---|
Skuteczność energetyczna
| Profil | Wejście tok/kWh | Wyjście tok/kWh |
|---|
Jak to działa
Kalkulator przekłada pobór mocy GPU i prędkości przetwarzania tokenów na koszty energii elektrycznej, używając poniższych formuł.
Założenia: tokeny w cache są przetwarzane w 1/100 czasu tokenów spoza cache (trafienie w cache KV). Scenariusz używa 90% czasu pracy (21,6 h/dobę) jako szacunku najgorszego przypadku ciągłej pracy.
Koszt na godzinę cost_per_hour = power_w / 1000 * energy_cost Podział tokenów (w cache vs spoza cache) cached_tokens = input_tokens * cache_rate / 100 uncached_tokens = input_tokens - cached_tokens Czas przetwarzania promptu prompt_time = uncached_tokens / prompt_speed + cached_tokens / (prompt_speed * 100) Całkowity czas żądania request_time = prompt_time + output_tokens / decode_speed Koszt na żądanie cost_per_request = cost_per_hour * request_time / 3600 Koszt na 1M tokenów wejścia cost_per_1m_input = cost_per_hour * (1_000_000 / prompt_speed) / 3600 cost_per_1m_input_cached = cost_per_hour * (1_000_000 / (prompt_speed * 100)) / 3600 Koszt dzienny daily_cost = cost_per_request * requests_per_day Koszt miesięczny monthly_cost = daily_cost * 30 Koszt dzienny scenariusza scenario_daily = cost_per_hour * 21.6 (90% uptime)
Kiedy używać tego kalkulatora
Ten kalkulator pomaga programistom, entuzjastom AI i twórcom treści technicznych oszacować rzeczywisty koszt energii elektrycznej self-hostingu lokalnego LLM i porównać go z ceną API w chmurze.
-
Oszacuj koszt mojego serwera
Wprowadź pobór mocy GPU, prędkości tokenów i typowe rozmiary promptu/wyniku, aby zobaczyć rzeczywisty koszt energii na godzinę, na żądanie i na miesiąc.
-
Załaduj preset GPU
Kliknij preset (RTX 4070 Ti Super, RTX 5090, RTX 5090 eco), aby wypełnić realistyczne wartości mocy i prędkości, a następnie je dostosuj.
-
Porównaj self-hosted z API w chmurze
Zobacz tabelę i wykres porównujące Twoją konfigurację i presety z API w chmurze, aby zrozumieć miesięczne oszczędności lub straty self-hostingu.
-
Zamodeluj realistyczny scenariusz ciągłej pracy
Uzyskaj szacunek najgorszego przypadku ciągłej pracy (60k wejścia / 50k w cache / 2k wyjścia, 90% czasu pracy) niezależnie od Twoich wartości na żądanie.
-
Zrozum formuły
Rozwiń sekcję 'Jak to działa', aby zobaczyć dokładne formuły kosztów i założenie dotyczące cache KV, dzięki czemu możesz przytoczyć metodologię.
Częste pytania
- Co szacuje ten kalkulator?
- Koszt energii elektrycznej uruchamiania lokalnego serwera LLM, na podstawie poboru mocy GPU, prędkości tokenów i typowego rozmiaru żądania.
- Jak traktowane są tokeny w cache?
- Zakłada się, że tokeny w cache (trafienie w cache KV) są przetwarzane w 1/100 czasu tokenów spoza cache, więc kosztują znacznie mniej.
- Co robią presety?
- Wypełniają pobór mocy i prędkości promptu/dekodowania dla popularnych GPU, abyś mógł zacząć od realistycznych wartości i je dostosować.
- Jak obliczane jest porównanie z API w chmurze?
- Wycenia ten sam stały scenariusz (60k wejścia, 50k w cache, 2k wyjścia) po stawkach referencyjnych API i porównuje koszt miesięczny z każdym profilem self-hosted.
- Czy moje dane są gdzieś wysyłane?
- Nie. Wszystkie obliczenia wykonują się w Twojej przeglądarce i nic nie jest wysyłane ani przechowywane.
Pomoc kalkulatora kosztów LLM
Jak korzystać
- Dostosuj parametry za pomocą suwaków lub wpisz dokładne wartości w polach liczbowych
- Opcjonalnie, kliknij preset GPU, aby załadować realistyczne wartości mocy i prędkości
- Przejrzyj wyniki na żywo: koszt na godzinę, na żądanie, na milion tokenów, dzienny i miesięczny
- Porównaj swoją konfigurację z API w chmurze w tabeli i wykresie porównawczym
Funkcje
- Natychmiastowe przeliczanie przy każdej zmianie wejścia
- Presety GPU dla popularnych kart
- Porównanie z API w chmurze z rozbiciem oszczędności
- 100% po stronie klienta — żadne dane nie opuszczają Twojej przeglądarki
Wskazówki
- Użyj sekcji 'Jak to działa', aby zobaczyć dokładne formuły stojące za każdą liczbą.
- Skuteczność cache ma duży wpływ na koszt wejścia — nawet 50% cache zmniejsza koszt wejścia o połowę.
- Kliknij Resetuj w dowolnym momencie, aby przywrócić wartości domyślne i zacząć od nowa.