Zbieramy tu obserwacje z własnych wdrożeń i podajemy je za darmo — nie zastąpią przeglądu Waszej faktury przez kogoś, kto zna Wasze zużycie.
Rachunek za API modeli rośnie zwykle nie dlatego, że firma robi więcej, tylko dlatego, że każde zadanie idzie do tego samego, najdroższego modelu. Tak wygląda konfiguracja domyślna: ktoś wybrał model na starcie, bo dawał najlepsze wyniki w demo, i nikt do tego nie wrócił.

Skąd to się bierze
W cennikach dostawców — OpenAI, Anthropic — rozpiętość między modelem najmniejszym a największym w tej samej rodzinie liczy się w dziesiątkach razy za ten sam milion tokenów. Zestawienie wielu dostawców obok siebie widać na liście modeli OpenRouter. Tymczasem znaczna część firmowych zadań to klasyfikacja zgłoszenia, wyciągnięcie daty z e-maila albo streszczenie akapitu — czyli robota, przy której różnicy między modelami nie widać w wyniku, tylko na fakturze.
Drugie źródło kosztu to długość zapytania. Jeśli przy każdym pytaniu do systemu doklejana jest cała instrukcja i cały regulamin, płacicie za te same tokeny tysiąc razy dziennie. Trzecie: brak trybu wsadowego tam, gdzie na odpowiedź nikt nie czeka. Skala tej różnicy jest u nas policzona i opisana — obraz generowany priorytetowo kosztuje około 0,15 zł, ten sam obraz puszczony w kolejce wsadowej poniżej 0,08 zł, co przy partii dziesięciu tysięcy sztuk daje inny rząd wielkości rachunku.
Co z tym zrobić u siebie
Zacznijcie od jednego tygodnia logów: jakie zadania faktycznie idą do modelu i ile ich jest. Zwykle wychodzi, że 80 procent wywołań to trzy albo cztery powtarzalne czynności. Te przenosi się na model mniejszy i sprawdza na stu prawdziwych przykładach, czy wynik nadal jest do przyjęcia. Zadania trudne — pisanie ofert, analiza umowy, decyzje z konsekwencją finansową — zostają tam, gdzie były.

Drugi ruch to skrócenie stałej części zapytania i włączenie pamięci podręcznej na fragmenty, które się nie zmieniają. Trzeci: przeniesienie wszystkiego, co nie musi odpowiedzieć natychmiast, do kolejki wsadowej. Czwarty, najrzadziej robiony: ustawienie twardego limitu miesięcznego i alarmu, bo pierwszym objawem błędnej pętli w kodzie bywa faktura, a nie awaria.
Kiedy oszczędzanie kosztuje więcej
Nie warto schodzić z modelem tam, gdzie błąd wraca do człowieka. Jeśli tańszy model gubi jedną datę na dwadzieścia, a ktoś musi potem sprawdzić wszystkie dwadzieścia, oszczędność na tokenach zamienia się w koszt godzin. Ta sama granica działa przy dokumentach: przy odczycie pól z polskich umów przyjmujemy próg 95 procent poprawnych pól i poniżej niego wycofujemy się z tańszej konfiguracji, zamiast obniżać próg.

Osobna kalkulacja dotyczy danych, które nie mogą opuścić firmy — tam rachunek przestaje być abonamentem, a staje się jednorazowym zakupem sprzętu. Widełki dla obu wariantów zebraliśmy na stronie ile kosztuje wdrożenie AI.
Materiały, do których zaglądaliśmy przy pisaniu. Tekst powyżej jest nasz; te strony nie odpowiadają za jego treść ani jej nie autoryzowały.