Prejsť na obsah

Financie a náklady20:00

Rachunek za modele AI rośnie. Gdzie realnie da się ciąć

Cennikowa różnica między najtańszym a najdroższym modelem tego samego dostawcy idzie w dziesiątki razy. Cztery miejsca, w których firma przepłaca za AI, i jedno, w którym oszczędzanie kosztuje więcej, niż daje.

Obraz vygenerovaný cez AI.

Zbieramy tu obserwacje z własnych wdrożeń i podajemy je za darmo — nie zastąpią przeglądu Waszej faktury przez kogoś, kto zna Wasze zużycie.

Rachunek za API modeli rośnie zwykle nie dlatego, że firma robi więcej, tylko dlatego, że każde zadanie idzie do tego samego, najdroższego modelu. Tak wygląda konfiguracja domyślna: ktoś wybrał model na starcie, bo dawał najlepsze wyniki w demo, i nikt do tego nie wrócił.

Obraz vygenerovaný cez AI.

Odkiaľ to pramení

W cennikach dostawców — OpenAI, Anthropic — rozpiętość między modelem najmniejszym a największym w tej samej rodzinie liczy się w dziesiątkach razy za ten sam milion tokenów. Zestawienie wielu dostawców obok siebie widać na liście modeli OpenRouter. Tymczasem znaczna część firmowych zadań to klasyfikacja zgłoszenia, wyciągnięcie daty z e-maila albo streszczenie akapitu — czyli robota, przy której różnicy między modelami nie widać w wyniku, tylko na fakturze.

Drugie źródło kosztu to długość zapytania. Jeśli przy każdym pytaniu do systemu doklejana jest cała instrukcja i cały regulamin, płacicie za te same tokeny tysiąc razy dziennie. Trzecie: brak trybu wsadowego tam, gdzie na odpowiedź nikt nie czeka. Skala tej różnicy jest u nas policzona i opisana — obraz generowany priorytetowo kosztuje około 0,15 zł, ten sam obraz puszczony w kolejce wsadowej poniżej 0,08 zł, co przy partii dziesięciu tysięcy sztuk daje inny rząd wielkości rachunku.

Ako postupovať vo vlastnej firme

Zacznijcie od jednego tygodnia logów: jakie zadania faktycznie idą do modelu i ile ich jest. Zwykle wychodzi, że 80 procent wywołań to trzy albo cztery powtarzalne czynności. Te przenosi się na model mniejszy i sprawdza na stu prawdziwych przykładach, czy wynik nadal jest do przyjęcia. Zadania trudne — pisanie ofert, analiza umowy, decyzje z konsekwencją finansową — zostają tam, gdzie były.

Obraz vygenerovaný cez AI.

Drugi ruch to skrócenie stałej części zapytania i włączenie pamięci podręcznej na fragmenty, które się nie zmieniają. Trzeci: przeniesienie wszystkiego, co nie musi odpowiedzieć natychmiast, do kolejki wsadowej. Czwarty, najrzadziej robiony: ustawienie twardego limitu miesięcznego i alarmu, bo pierwszym objawem błędnej pętli w kodzie bywa faktura, a nie awaria.

Kiedy oszczędzanie kosztuje więcej

Nie warto schodzić z modelem tam, gdzie błąd wraca do człowieka. Jeśli tańszy model gubi jedną datę na dwadzieścia, a ktoś musi potem sprawdzić wszystkie dwadzieścia, oszczędność na tokenach zamienia się w koszt godzin. Ta sama granica działa przy dokumentach: przy odczycie pól z polskich umów przyjmujemy próg 95 procent poprawnych pól i poniżej niego wycofujemy się z tańszej konfiguracji, zamiast obniżać próg.

Obraz vygenerovaný cez AI.

Osobna kalkulacja dotyczy danych, które nie mogą opuścić firmy — tam rachunek przestaje być abonamentem, a staje się jednorazowym zakupem sprzętu. Widełki dla obu wariantów zebraliśmy na stronie ile kosztuje wdrożenie AI.

Zdrojové materiály

Podklady, ktoré sme využili pri písaní. Text vyššie je náš, tieto stránky nezodpovedajú za jeho obsah ani ho neautorizovali.

Nezáväzný rozhovor

Dohodnúť workshop s Paulom

Tridsať minút alebo celý workshop, vyberte si sami. Termín si rezervujete v kalendári, potvrdenie príde okamžite.

Paul Lazniak

Zakladateľ HEXART