Pāriet uz saturu

Integrācijas un dati20:05

No kurienes rodas 14 200 PLN API rēķinā

Parādām, kā vienas nedēļas laikā lietojuma žurnālos atrast API rēķina kāpuma cēloni, iestatīt stingrus limitus un brīdinājumus, kā arī samazināt izdevumus par 35–60 procentiem bez jauniem rīkiem.

Attēls ģenerēts ar AI.

Klausīties raksta kopsavilkumu

Sintētiskā balss.
0:00
0:00

Dalāmies ar to, ko paši esam pārbaudījuši ieviešanā: bez maksas un bez pieņēmuma, ka jūsu gadījums ir identisks. Tirdzniecības uzņēmumā ar 70 darbiniekiem klientu apkalpošanas komanda kopš janvāra izmanto asistentu, kas apkopo e-pastus un sagatavo piedāvājumus. Marta rēķinā no API nodrošinātāja ir 14 200 PLN neto 2 100 PLN vietā. Kods nemainījās, jaunus funkcionalitātes moduļus neviens neieviesa. Šis kāpums rodas no trim laukiem, kas redzami usage panelī: ievades marķieri pieaug līdzi sarunas vēsturei, viens vaicājums pēc limita sasniegšanas tiek atkārtots ciklā, un viena API atslēga apkalpo piecas komandas bez budžetiem katram projektam.

Attēls ģenerēts ar AI.

API rēķinā parādās vairāku pozīciju summa: ievades marķieri (visa nosūtītā vēsture), izvades marķieri (ģenerētais saturs), reasoning tokens, tool calling, structured output, kā arī attēli vai audio, ja modelis tos apstrādā. Sarunas raunda mehānika ir vienkārša: raunda maksa = visas vēstures ievades marķieru summa × in likme plus ģenerētie marķieri × out likme. Tāpēc saruna ar 20 tūkstošu marķieru dokumentu maksā centus, bet tā pati saruna pēc visas sarakstes pievienošanas satur 200 tūkstošus marķieru un iztērē budžetu vēl pirms modelis uzraksta pirmo teikumu. Oficiālās OpenAI likmes ir pieejamas cenrādī, bet marķierus un to uzskaiti apraksta dokumentācija.

Ko iespējams paveikt šonedēļ

1. solis: patēriņa pārskats izklājlapā. Laiks: 2 stundas, veic API administrators vai DevOps. Eksports no pakalpojumu sniedzēja paneļa tiek filtrēts pēc laukiem: model, api_key, project_id, cached_tokens, completion_tokens, requests. Datus sakārto rakurstabulā, lai redzētu, kurš projekts un atslēga ģenerē 80% no rēķina. 2. solis: stingrs limits un brīdinājumi konsolē. Laiks: 30 minūtes, veic norēķinu konta īpašnieks. OpenAI platformā iestata monthly budget, Azure Cost Management budžetu, Google Cloud Billing brīdinājumu, AWS Budgets brīdinājumu. Sliekšņi: 50%, 80%, 100%. Pie 100% API darbība ir pilnībā jāaptur. 3. solis: uzvedņu kešatmiņa (prompt caching) atkārtotiem kontekstiem. Laiks: 2–4 stundas, veic lietojumprogrammu inženieris. Pietiek nenosūtīt to pašu sistēmas instrukciju no jauna un iestatīt cache TTL vietās, kur to paredz dokumentācija. Paredzamais ietaupījums: 30–90% no ievades marķieru izmaksām. 4. solis: mazāks modelis zema riska procesos. Laiks: 1 diena, veic produktu komanda kopā ar programmētāju. E-pastu kopsavilkumi, kategorizēšana, piedāvājumu sākotnējās versijas tiek novirzītas uz GPT-4o mini, Claude Haiku vai Gemini Flash, bet sarunas par darījumiem un līgumu analīze paliek lielajam modelim. Anthropic modeļu likmes ir pieejamas oficiālajā cenrādī. 5. solis: atsevišķas API atslēgas katrai komandai. Laiks: 2 stundas, veic IT vadītājs. Katrai komandai jauna atslēga un tēriņu limits. Tādējādi viena atkārtojumu cikla lēciens nepazūd kopējā rēķinā.

Ko nedarīt uzreiz

Pirmā reakcija ir iegādāties AI izdevumu uzraudzības platformu vai LLM vārteju. Šādas ieviešanas izmaksas parasti ir 4 000–15 000 PLN un divas integrācijas nedēļas, bet problēmas cēlonis šajā nedēļā visbiežāk izrādās viens atkārtojumu cikls pēc 429. koda. Otrā kļūda ir globāla pāreja uz vismazāko modeli. Uzdevumos poļu valodā GPT-4o mini, Claude Haiku un Gemini Flash labi tiek galā ar kategorizēšanu un kopsavilkumiem, taču spēj sagrozīt datumus vai summas piedāvājumā. Trešā kļūda ir viens stingrs limits visam uzņēmumam: piektdienā plkst. 16:40 tas bloķēs ražošanu, nevis tikai eksperimentu. Tā vietā limitus nosaka katrai atslēgai, projektam un komandai. Ceturtā kļūda ir pakalpojumu sniedzēja maiņa vai sarunas pirmajā nedēļā; bez patēriņa pārskata nav par ko runāt. Piektā kļūda ir atteikšanās no Batch API un nakts apstrādes, jo tur likme mēdz būt par 50% zemāka, un tas bieži vien ir vienīgais risinājums, kas notur budžetu rāmjos.

Attēls ģenerēts ar AI.

Kā pēc divām nedēļām pārliecināties, ka tas darbojas

Pēc divām nedēļām aprēķiniet izmaksas par 1 milj. ievades un izvades marķieru projektā, kas iepriekš radīja lielāko rēķinu. Izklājlapā daliet maksu ar ievades un izvades marķieru summu no lauka usage. Mazāka modeļa atsauces vērtība poļu valodā pēc 24.04.2026. kursa (1 USD = 3,78 PLN, avots NBP, summas bez PVN) ir 0,70–0,90 PLN par 1 milj. marķieru ievadei un izvadei kopā. Ja pirms izmaiņām bija 2,40 PLN, bet pēc kešatmiņas ieslēgšanas un modeļa nomaiņas nokritās līdz 1,10 PLN, ietaupījums ir 54%. Atkāpšanās slieksnis: ja izmaksas par 1 milj. marķieru nav nokritušās zem 1,20 PLN vai pieprasījumu īpatsvars ar 429 Too Many Requests joprojām pārsniedz 5% no kopskaita, atjaunojiet iepriekšējo modeli un pārbaudiet, vai kešatmiņa reāli dod trāpījumus.

Ja jums trūkst laika atskaitei un limitu konfigurēšanai, HEXART to paveic kā īsu iesaisti: 3–5 darba dienas, sākam ar usage datu izgūšanu katram projektam un atslēgai, pēc tam iestatām budžetus, brīdinājumus un kešatmiņas kārtulas. Pēc tam paliek kontroles izklājlapa pirmdienai. Papildinformācija: https://hexart.pl/uslugi.

Avota materiāli

Materiāli, kurus izmantojām rakstīšanas laikā. Iepriekš minētais teksts ir mūsu; šīs vietnes neatbild par tā saturu un nav to autorizējušas.

Saruna bez saistībām

Pieteikt darbnīcu ar Paul

Trīsdesmit minūtes vai pilna darbnīca, izvēlieties paši. Rezervējiet laiku kalendārā, apstiprinājums pienāk uzreiz.

Paul Lazniak

HEXART dibinātājs