Hopp til innhold

Integrasjoner og data20:05

Hvorfor API-fakturaen havner på 14 200 PLN

Vi viser hvordan man på én uke sporer årsaken til høye API-fakturaer i forbruksloggene, etablerer faste grenser og varsler, samt reduserer kostnadene med 35–60 prosent uten nye verktøy.

Bilde generert av AI.

Hør et sammendrag av artikkelen

Syntetisk stemme.
0:00
0:00

Vi deler det vi selv har testet under implementeringer: kostnadsfritt og uten å anta at deres sak er identisk. I en handelsbedrift med 70 ansatte har kundeserviceteamet siden januar brukt en assistent som oppsummerer e-poster og utarbeider tilbud. På marsfakturaen fra API-leverandøren står det 14 200 PLN netto i stedet for 2 100 PLN. Koden er uendret, ingen har rullet ut nye funksjoner. Dette hoppet skyldes tre felter som er synlige i brukskontrollpanelet: inndatatokener vokser sammen med samtalehistorikken, én forespørsel etter grensen gjentas i en løkke, og én API-nøkkel betjener fem team uten prosjektspesifikke budsjetter.

Bilde generert av AI.

API-fakturaen viser summen av flere elementer: inndatatokener (hele den sendte historikken), utdatatokener (generert innhold), resonneringstokener, verktøykall, strukturerte utdata samt bilder eller lyd dersom modellen behandler dette. Samtalemekanikken er enkel: samtalerundens kostnad = summen av inndatatokener fra hele historikken × inndatatakst pluss genererte tokener × utdatatakst. Derfor koster en samtale med et dokument på 20 000 tokener lommerusk, mens den samme samtalen etter at hele tråden er lagt til har 200 000 tokener og tømmer budsjettet før modellen skriver den første setningen. De offisielle prisene for OpenAI finnes i prislisten, og tokener samt beregning av disse er beskrevet i dokumentasjonen.

Dette kan gjøres denne uken

Tiltak 1: bruksrapport til regneark. Tid: 2 timer, utføres av API-administrator eller DevOps. Eksporten fra leverandørpanelet filtreres etter feltene: model, api_key, project_id, cached_tokens, completion_tokens, requests. Sett det opp i en pivottabell for å se hvilket prosjekt og hvilken nøkkel som genererer 80% av fakturaen. Tiltak 2: hard grense og varsler i konsollen. Tid: 30 minutter, utføres av eier av faktureringskontoen. I OpenAI settes månedlig budsjett, i Azure Cost Management budsjett, i Google Cloud Billing varsel, i AWS Budgets varsel. Terskelverdier: 50%, 80%, 100%. Ved 100% skal API stoppe helt. Tiltak 3: hurtigbufring av ledetekster ved gjentakende kontekster. Tid: 2–4 timer, utføres av applikasjonsingeniør. Det holder å unngå å sende samme systeminstruksjon på nytt, og sette cache TTL der dokumentasjonen åpner for det. Estimert besparelse: 30–90% av utgiftene til inndatatokener. Tiltak 4: mindre modell på ruter med lav risiko. Tid: 1 dag, utføres av produktteam sammen med utvikler. Oppsummering av e-poster, kategorisering og førsteutkast til tilbud flyttes til GPT-4o mini, Claude Haiku eller Gemini Flash, mens forhandlingssamtaler og avtaleanalyser forblir på den større modellen. Prisene for Anthropic-modeller finnes i den offisielle prislisten. Tiltak 5: separate API-nøkler per team. Tid: 2 timer, utføres av IT-leder. Ny nøkkel og forbruksgrense for hvert team. Slik forsvinner ikke et hopp fra en enkelt retry-løkke i den samlede fakturaen.

Dette bør du ikke gjøre med en gang

Første innskytelse er ofte å kjøpe en plattform for overvåking av AI-kostnader eller en LLM-gateway. Kostnaden for en slik implementering ligger vanligvis på 4 000–15 000 PLN og to ukers integrasjon, mens ukens egentlige problem som oftest viser seg å være en enkel retry-løkke etter kode 429. Den andre feilen er å nedskalere globalt til den minste modellen. Ved oppgaver på polsk takler GPT-4o mini, Claude Haiku og Gemini Flash kategorisering og oppsummeringer godt, men de kan forveksle datoer eller beløp i tilbud. Den tredje feilen er én felles hard grense for hele selskapet: en fredag kl. 16:40 vil den stanse produksjonen, ikke bare eksperimentene. Sett i stedet grenser per nøkkel, prosjekt og team. Den fjerde feilen er leverandørmigrering eller forhandlinger i første uke; uten en forbruksrapport finnes det ikke noe forhandlingsgrunnlag. Den femte feilen er å utelate Batch API og nattkjøring, der prisene ofte er 50% lavere, noe som ofte er det eneste tiltaket som holder budsjettet intakt.

Bilde generert av AI.

Slik bekrefter du effekten etter to uker

Etter to uker beregner dere kostnaden per 1 million inndata- og utdatatokener i prosjektet som tidligere genererte den største fakturaen. Del fakturabeløpet på summen av inndata- og utdatatokener fra usage-feltet i regnearket. Referanseverdien for en mindre modell på polsk, basert på valutakursen per 24.04.2026 (1 USD = 3,78 PLN, kilde NBP, nettobeløp), er 0,70–0,90 PLN per 1 million tokener samlet for inn- og utdata. Hvis kostnaden før endringen lå på 2,40 PLN og sank til 1,10 PLN etter aktivering av cache og modellbytte, utgjør besparelsen 54%. Reverseringsgrense: hvis kostnaden per 1 million tokener ikke faller under 1,20 PLN, eller andelen forespørsler med 429 Too Many Requests fortsatt overstiger 5% totalt, tilbakestill til forrige modell og kontroller om cachen faktisk leverer treff.

Mangler dere tid til rapport og oppsett av grenser, utfører HEXART dette som et kort oppdrag: 3–5 dagers arbeid. Vi starter med å hente ut forbruk per prosjekt og nøkkel, og setter deretter opp budsjetter, varsler og cacheregler. Dere sitter igjen med et kontrollark for mandagsmøtet. Detaljer: https://hexart.pl/uslugi.

Kildemateriale

Kildene vi har konsultert under utarbeidelsen. Teksten ovenfor er vår egen; disse nettstedene er ikke ansvarlige for innholdet og har ikke godkjent det.

Uforpliktende samtale

Book en workshop med Paul

Tretti minutter eller full workshop, velg det som passer best. Velg tidspunkt direkte i kalenderen, bekreftelsen kommer umiddelbart.

Paul Lazniak

Grunnlegger av HEXART