Siirry sisältöön

Integraatiot ja data20:05

Mistä 14 200 PLN API-lasku muodostuu

Näytämme, miten API-laskun kasvun syy paikannetaan käyttölogeista viikossa, miten asetetaan tiukat rajat sekä hälytykset ja miten kuluja pienennetään 35–60 prosenttia ilman uusia työkaluja.

Kuva on luotu tekoälyllä.

Kuuntele artikkelin tiivistelmä

Synteettinen ääni.
0:00
0:00

Jaamme sen, mitä olemme itse testanneet käyttöönotoissa: maksutta ja olettamatta, että tilanteenne on täysin identtinen. 70 hengen kauppayrityksessä asiakaspalvelutiimi on käyttänyt tammikuusta alkaen avustajaa, joka tiivistää sähköposteja ja laatii tarjouksia. Maaliskuun API-laskussa lukee 14 200 PLN netto aiemman 2 100 PLN:n sijaan. Koodi ei ole muuttunut, eikä uusia ominaisuuksia ole otettu käyttöön. Tämä piikki johtuu kolmesta hallintapaneelissa näkyvästä kentästä: syötetokenien määrä kasvaa keskusteluhistorian myötä, yksi virheellinen kysely toistuu silmukassa ja yksi API-avain palvelee viittä tiimiä ilman projektikohtaisia budjetteja.

Kuva on luotu tekoälyllä.

API-laskussa näkyy useiden tekijöiden summa: syötetokenit (koko lähetetty historia), tulostokenit (luotu sisältö), reasoning tokens, tool calling, structured output sekä kuvat tai audio, jos malli käsittelee niitä. Keskustelukierroksen logiikka on yksinkertainen: kierroksen hinta = koko historian syötetokenien summa × in-hinta + luodut tokenit × out-hinta. Siksi keskustelu 20 tuhannen tokenin dokumentista maksaa pikkusummia, mutta sama keskustelu koko ketjun kera on 200 tuhatta tokenia ja kuluttaa budjetin ennen kuin malli kirjoittaa ensimmäistäkään virkettä. Viralliset OpenAI-hinnat löytyvät hinnastosta, ja tokeneita sekä niiden laskentaa käsittelee dokumentaatio.

Mitä tällä viikolla voidaan tehdä

Toimenpide 1: käyttöraportti taulukkolaskentaan. Aika: 2 tuntia, tekee API-ylläpitäjä tai DevOps. Vienti palveluntarjoajan paneelista suodatetaan kenttien mukaan: model, api_key, project_id, cached_tokens, completion_tokens, requests. Kootaan pivot-taulukkoon, jotta nähdään, mikä projekti ja avain tuottaa 80% laskusta. Toimenpide 2: tiukka raja ja hälytykset konsolissa. Aika: 30 minuuttia, tekee laskutustilin omistaja. OpenAI:hin asetetaan monthly budget, Azure Cost Managementiin budjetti, Google Cloud Billingiin hälytys, AWS Budgetsiin hälytys. Rajat: 50%, 80%, 100%. 100%:n kohdalla API:n tulee pysähtyä kokonaan. Toimenpide 3: prompt caching toistuville konteksteille. Aika: 2–4 tuntia, tekee sovellusinsinööri. Riittää, että samaa järjestelmäohjetta ei lähetetä uudelleen, ja asetetaan cache TTL dokumentaation ohjeiden mukaisesti. Arvioitu säästö: 30–90% syötetokenien kuluista. Toimenpide 4: pienempi malli matalan riskin reiteille. Aika: 1 päivä, tekee tuotetiimi yhdessä ohjelmoijan kanssa. Sähköpostien tiivistäminen, luokittelu ja tarjousten luonnostelu siirretään malleille GPT-4o mini, Claude Haiku tai Gemini Flash, ja neuvottelukeskustelut sekä sopimusanalyysit jätetään suuremmalle mallille. Anthropic-mallien hinnat löytyvät virallisesta hinnastosta. Toimenpide 5: erilliset API-avaimet tiimeittäin. Aika: 2 tuntia, tekee IT Manager. Jokaiselle tiimille uusi avain ja kulutusraja. Tämän ansiosta yhden toistosilmukan aiheuttama piikki ei huku kokonaislaskuun.

Mitä ei pidä tehdä heti

Ensimmäinen reaktio on usein AI-kulujen seurantatyökalun tai LLM-yhdyskäytävän ostaminen. Tällainen käyttöönotto maksaa tyypillisesti 4 000–15 000 PLN ja vaatii kahden viikon integroinnin, vaikka viikon todellinen ongelma paljastuu usein yhdeksi virhekoodin 429 retry-silmukaksi. Toinen virhe on siirtyä globaalisti pienimpään malliin. Puolan kielen tehtävissä GPT-4o mini, Claude Haiku ja Gemini Flash suoriutuvat hyvin luokittelusta ja tiivistelmistä, mutta saattavat vääristää tarjouksen päivämääriä tai summia. Kolmas virhe on asettaa yksi tiukka raja koko yritykselle: perjantaina kello 16:40 se pysäyttää tuotannon kokeilujen sijaan. Rajat asetetaan sen sijaan avain-, projekti- ja tiimikohtaisesti. Neljäs virhe on palveluntarjoajan vaihto tai neuvottelut heti ensimmäisellä viikolla, sillä ilman usage-raporttia ei ole neuvoteltavaa. Viides virhe on Batch API:n ja yöajojen poistaminen käytöstä, vaikka niiden hinnat ovat usein 50% alhaisemmat ja pitävät usein budjetin kurissa.

Kuva on luotu tekoälyllä.

Miten varmistaa kahden viikon jälkeen toimivuus

Laske kahden viikon kuluttua kulut miljoonaa syöte- ja tulostokenia kohti projektissa, joka tuotti aiemmin suurimman laskun. Jaa taulukkolaskennassa maksu usage-kentän syöte- ja tulostokenien summalla. Vertailuarvo pienemmälle puolankieliselle mallille 24.04.2026 kurssilla (1 USD = 3,78 PLN, lähde NBP, nettohinnat) on 0,70–0,90 PLN miljoonaa tokenia kohti syötteen ja tulosteen osalta yhteensä. Jos hinta oli ennen muutosta 2,40 PLN ja laski välimuistin käyttöönoton sekä mallivaihdon jälkeen 1,10 PLN:ään, säästö on 54%. Peruutusraja: jos kulu miljoonaa tokenia kohti ei pudonnut alle 1,20 PLN tai 429 Too Many Requests -pyyntöjen osuus ylittää edelleen 5% kokonaismäärästä, palauta edellinen malli ja tarkista, tuottaako välimuisti osumia.

Jos aika ei riitä raportointiin ja rajojen määrittelyyn, HEXART toteuttaa tämän tiiviinä toimeksiantona: 3–5 työpäivää. Aloitamme käyttöhistorian purkamisesta projekti- ja avaintasolla, minkä jälkeen asetamme budjetit, hälytykset ja välimuistisäännöt. Työstä jää käyttöön seurantataulukko heti maanantaille. Lisätiedot: https://hexart.pl/uslugi.

Lähdemateriaalit

Materiaaleja, joihin viittasimme kirjoittaessamme. Yllä oleva teksti on omamme. Nämä sivustot eivät vastaa sen sisällöstä eivätkä ole sitä valtuuttaneet.

Sitoumukseton keskustelu

Varaa työpaja Paulin kanssa

Kolmekymmentä minuuttia tai täysi työpaja, valitse sopivin. Varaa aika kalenterista, vahvistus tulee heti.

Paul Lazniak

HEXARTin perustaja