Saltar para o conteúdo

Finanças e custos20:00

Rachunek za modele AI rośnie. Gdzie realnie da się ciąć

Cennikowa różnica między najtańszym a najdroższym modelem tego samego dostawcy idzie w dziesiątki razy. Cztery miejsca, w których firma przepłaca za AI, i jedno, w którym oszczędzanie kosztuje więcej, niż daje.

Imagem gerada por IA.

Zbieramy tu obserwacje z własnych wdrożeń i podajemy je za darmo — nie zastąpią przeglądu Waszej faktury przez kogoś, kto zna Wasze zużycie.

Rachunek za API modeli rośnie zwykle nie dlatego, że firma robi więcej, tylko dlatego, że każde zadanie idzie do tego samego, najdroższego modelu. Tak wygląda konfiguracja domyślna: ktoś wybrał model na starcie, bo dawał najlepsze wyniki w demo, i nikt do tego nie wrócił.

Imagem gerada por IA.

Qual a origem

W cennikach dostawców — OpenAI, Anthropic — rozpiętość między modelem najmniejszym a największym w tej samej rodzinie liczy się w dziesiątkach razy za ten sam milion tokenów. Zestawienie wielu dostawców obok siebie widać na liście modeli OpenRouter. Tymczasem znaczna część firmowych zadań to klasyfikacja zgłoszenia, wyciągnięcie daty z e-maila albo streszczenie akapitu — czyli robota, przy której różnicy między modelami nie widać w wyniku, tylko na fakturze.

Drugie źródło kosztu to długość zapytania. Jeśli przy każdym pytaniu do systemu doklejana jest cała instrukcja i cały regulamin, płacicie za te same tokeny tysiąc razy dziennie. Trzecie: brak trybu wsadowego tam, gdzie na odpowiedź nikt nie czeka. Skala tej różnicy jest u nas policzona i opisana — obraz generowany priorytetowo kosztuje około 0,15 zł, ten sam obraz puszczony w kolejce wsadowej poniżej 0,08 zł, co przy partii dziesięciu tysięcy sztuk daje inny rząd wielkości rachunku.

Como aplicar na sua empresa

Zacznijcie od jednego tygodnia logów: jakie zadania faktycznie idą do modelu i ile ich jest. Zwykle wychodzi, że 80 procent wywołań to trzy albo cztery powtarzalne czynności. Te przenosi się na model mniejszy i sprawdza na stu prawdziwych przykładach, czy wynik nadal jest do przyjęcia. Zadania trudne — pisanie ofert, analiza umowy, decyzje z konsekwencją finansową — zostają tam, gdzie były.

Imagem gerada por IA.

Drugi ruch to skrócenie stałej części zapytania i włączenie pamięci podręcznej na fragmenty, które się nie zmieniają. Trzeci: przeniesienie wszystkiego, co nie musi odpowiedzieć natychmiast, do kolejki wsadowej. Czwarty, najrzadziej robiony: ustawienie twardego limitu miesięcznego i alarmu, bo pierwszym objawem błędnej pętli w kodzie bywa faktura, a nie awaria.

Kiedy oszczędzanie kosztuje więcej

Nie warto schodzić z modelem tam, gdzie błąd wraca do człowieka. Jeśli tańszy model gubi jedną datę na dwadzieścia, a ktoś musi potem sprawdzić wszystkie dwadzieścia, oszczędność na tokenach zamienia się w koszt godzin. Ta sama granica działa przy dokumentach: przy odczycie pól z polskich umów przyjmujemy próg 95 procent poprawnych pól i poniżej niego wycofujemy się z tańszej konfiguracji, zamiast obniżać próg.

Imagem gerada por IA.

Osobna kalkulacja dotyczy danych, które nie mogą opuścić firmy — tam rachunek przestaje być abonamentem, a staje się jednorazowym zakupem sprzętu. Widełki dla obu wariantów zebraliśmy na stronie ile kosztuje wdrożenie AI.

Fontes

Materiais consultados durante a elaboração deste texto. O conteúdo acima é da nossa autoria; estas páginas não se responsabilizam pelo mesmo nem o autorizaram.

Conversa sem compromisso

Agendar workshop com Paul

Trinta minutos ou um workshop completo, a escolha é sua. Reserve a data no calendário e receba a confirmação de imediato.

Paul Lazniak

Fundador da HEXART