Prejsť na obsah

Integrácie a dáta20:05

Kde vzniká 14 200 PLN na faktúre za API

Ukážeme vám, ako za týždeň odhaliť v usage logoch zdroj nárastu faktúry za API, nastaviť pevné limity aj upozornenia a znížiť výdavky o 35–60 percent bez nových nástrojov.

Obraz vygenerovaný cez AI.

Vypočujte si zhrnutie článku

Syntetický hlas.
0:00
0:00

Zdieľame to, čo sme sami overili pri implementáciách: bezplatne a bez predpokladu, že váš prípad vyzerá rovnako. V obchodnej firme so 70 ľuďmi tím zákazníckej podpory od januára používa asistenta, ktorý sumarizuje e-maily a pripravuje ponuky. V marcovej faktúre od dodávateľa API svieti 14 200 PLN netto namiesto 2 100 PLN. Kód sa nezmenil, nikto nenasadzoval nové funkcie. Tento nárast pramení z troch polí viditeľných v paneli usage: vstupné tokeny rastú spolu s históriou konverzácie, jedna požiadavka po prekročení limitu sa opakuje v slučke a jeden API kľúč obsluhuje päť tímov bez rozpočtov na projekt.

Obraz vygenerovaný cez AI.

Na faktúre za API vidíte súčet viacerých položiek: vstupné tokeny (celá odoslaná história), výstupné tokeny (vygenerovaný obsah), reasoning tokens, tool calling, structured output a obrázky alebo audio, ak ich model spracováva. Mechanika konverzačného kola je jednoduchá: poplatok za kolo = súčet vstupných tokenov z celej histórie × sadzba in plus vygenerované tokeny × sadzba out. Preto je konverzácia s dokumentom s 20 tisíc tokenmi záležitosťou pár centov, no rovnaká konverzácia po pridaní celého vlákna má 200 tisíc tokenov a vyčerpá rozpočet skôr, než model napíše prvú vetu. Oficiálne sadzby OpenAI nájdete v cenníku, tokeny a ich počítanie opisuje dokumentácia.

Čo sa dá stihnúť tento týždeň

Krok 1: report usage do tabuľky. Trvanie: 2 hodiny, realizuje administrátor API alebo DevOps. Export z panela poskytovateľa filtruje podľa polí: model, api_key, project_id, cached_tokens, completion_tokens, requests. Zostaví kontingenčnú tabuľku, aby zistil, ktorý projekt a kľúč generuje 80% faktúry. Krok 2: pevný limit a upozornenia v konzole. Trvanie: 30 minút, realizuje vlastník fakturačného účtu. V OpenAI sa nastavuje monthly budget, v Azure Cost Management rozpočet, v Google Cloud Billing upozornenie, v AWS Budgets upozornenie. Hranice: 50%, 80%, 100%. Pri 100% sa musí API nekompromisne zastaviť. Krok 3: prompt caching pri opakujúcich sa kontextoch. Trvanie: 2–4 hodiny, realizuje aplikačný inžinier. Stačí neposielať rovnakú systémovú inštrukciu znova a nastaviť cache TTL tam, kde to umožňuje dokumentácia. Odhadovaná úspora: 30–90% nákladov na vstupné tokeny. Krok 4: menší model na nízkorizikových trasách. Trvanie: 1 deň, realizuje produktový tím s programátorom. Sumarizácia e-mailov, kategorizácia, vstupné verzie ponúk prechádzajú na GPT-4o mini, Claude Haiku alebo Gemini Flash, zatiaľ čo vyjednávania a analýzy zmlúv zostávajú na väčšom modeli. Sadzby pre modely Anthropic nájdete v oficiálnom cenníku. Krok 5: samostatné API kľúče pre každý tím. Trvanie: 2 hodiny, realizuje IT manažér. Pre každý tím nový kľúč a limit výdavkov. Vďaka tomu sa nárast z jednej retry slučky nestratí v celkovom účte.

Čo nerobiť okamžite

Prvým reflexom býva nákup platformy na monitoring výdavkov na AI alebo LLM brány. Náklady na takúto implementáciu predstavujú zvyčajne 4 000–15 000 PLN a dva týždne integrácie, pričom problémom v danom týždni býva najčastejšie jediná slučka retry po kóde 429. Druhou chybou je plošný prechod na najmenší model. Pri úlohách v poľštine zvládajú GPT-4o mini, Claude Haiku a Gemini Flash kategorizáciu a zhrnutia dobre, no v ponuke dokážu skresliť dátumy či sumy. Treťou chybou je jeden pevný limit pre celú firmu: v piatok o 16:40 zablokuje produkciu, nielen experiment. Limity sa namiesto toho nastavujú pre kľúč, projekt a tím. Štvrtou chybou je migrácia poskytovateľa alebo vyjednávanie v prvom týždni; bez reportu usage niet o čom rokovať. Piatou chybou je vypnutie Batch API a nočného spracovania, kde býva sadzba o 50% nižšia a často ide o jedinú vec, ktorá drží rozpočet.

Obraz vygenerovaný cez AI.

Ako po dvoch týždňoch overiť funkčnosť

Po dvoch týždňoch spočítajte náklady na 1 milión vstupných a výstupných tokenov v projekte, ktorý predtým generoval najvyššiu faktúru. V tabuľke vydeľte poplatok súčtom vstupných a výstupných tokenov z poľa usage. Referenčná hodnota pre menší model v poľštine pri kurze z 24.04.2026 (1 USD = 3,78 PLN, zdroj NBP, sumy net) predstavuje 0,70–0,90 PLN za 1 milión tokenov vstupu a výstupu spolu. Ak pred zmenou bola suma 2,40 PLN a po zapnutí cache a výmene modelu klesla na 1,10 PLN, úspora dosahuje 54%. Hranica pre návrat: ak výdavky na 1 milión tokenov neklesli pod 1,20 PLN alebo podiel požiadaviek s kódom 429 Too Many Requests naďalej presahuje 5% z celku, vráťte pôvodný model a overte, či cache reálne vykazuje zásahy.

Ak nemáte čas na report a konfiguráciu limitov, HEXART to vyrieši formou rýchleho zásahu: 3–5 pracovných dní. Začíname vytiahnutím usage pre projekt a kľúč, potom nastavíme rozpočty, upozornenia a pravidlá cache. Výstupom je kontrolná tabuľka pripravená na pondelok. Podrobnosti: https://hexart.pl/uslugi.

Zdrojové materiály

Podklady, ktoré sme využili pri písaní. Text vyššie je náš, tieto stránky nezodpovedajú za jeho obsah ani ho neautorizovali.

Nezáväzný rozhovor

Dohodnúť workshop s Paulom

Tridsať minút alebo celý workshop, vyberte si sami. Termín si rezervujete v kalendári, potvrdenie príde okamžite.

Paul Lazniak

Zakladateľ HEXART