🌐 NO

🧮 AI Token Cost Calculator

Beregn tokenskostnader for GPT, Claude, Gemini og andre store LLM-API-er. Skriv inn tokenantall direkte eller lim inn tekst for å anslå dem, og sjekk deretter forventet månedskostnad.

Simulering av månedlig bruk

I lim-inn-modus, eller i direkte modus når input/output er tomme, antar simuleringen en fordeling på 70% input / 30% output per forespørsel. Hvis både input- og output-token er fylt ut i direkte modus, brukes disse eksakte tallene per forespørsel i stedet.

Estimert kostnad (per forespørsel)
Input-kostnad Output-kostnad Total kostnad
Input-kostnad ved cache (referanse)

I praksis gjelder caching for gjentatte systemprompter eller kontekst, ikke for en helt ny tekst ved hver forespørsel.

Kilde:
Simulering av månedlig bruk
Kostnad per dag Kostnad per måned (×30) Kostnad per år (×365)
GUIDE

Les mer

01

1. Hvorfor anslå kostnad for LLM-API før du skalerer

Å beregne forventet kostnad før du kobler et LLM-API til en ny funksjon eller et nytt produkt hindrer at en voksende brukerbase blir til en uoversiktlig regning. Dette betyr enda mer for tjenester med lange promter eller flertrinnssamtaler - én forespørsel kan se billig ut, men tallene endrer seg raskt når du ganger med daglig eller månedlig volum. Denne kalkulatoren viser både kostnad per forespørsel og en månedlig simulering, slik at du får et budsjettinntrykk før du skalerer.

02

2. Hvordan token skiller seg fra ord og tegn

Et token er den minste enheten en modell behandler tekst i, og det har ikke et 1:1-forhold til ord eller tegn. En vanlig tommelfingerregel for engelsk er omtrent 4 tegn per token, men det er bare et anslag - faktiske tall avhenger av hver models tokenizer (f.eks. BPE-baserte varianter). Særlig CJK-språk (koreansk, japansk, kinesisk) bruker ofte flere token per tegn enn engelsk, siden ett tegn ofte deles opp i flere subword-token - så samme antall tegn kan koste merkbart mer enn tilsvarende engelsk tekst.

03

3. Hvorfor pris for input og output er forskjellig

De fleste leverandører priser output-token (genererte token) flere ganger høyere enn input-token (prompt-token), og alle modellene i dette datasettet følger det mønsteret. Input kan behandles (enkodes) på én gang, mens output må genereres (dekodes) ett token om gangen - mer beregning og høyere ventetid per token. Derfor er det å holde svar korte en særlig effektiv måte å kutte kostnader på.

04

4. Hva prompt caching er

Prompt caching (kontekstcaching) lar en leverandør lagre en systemprompt, lang kontekst eller et dokument på serversiden, og deretter ta langt lavere pris når det samme innholdet dukker opp igjen i en senere forespørsel. Det lønner seg mest i samtaleløsninger der en systemprompt eller chathistorikk sendes på nytt ved hvert steg. Det gjelder ikke når hver forespørsel sender helt ny tekst, så "hvis cached"-tallet i denne kalkulatoren er et referansescenario, ikke en garanti.

05

5. Hvordan redusere tokenskostnader i produksjon

(1) Hold promptene så korte som oppgaven faktisk krever - ta bare med nødvendig kontekst. (2) Utnytt prompt caching for systemprompter eller kontekst som gjentas mellom forespørsler. (3) Ruter enkle oppgaver som klassifisering eller oppsummering til en billigere og mindre modell i stedet for flaggskipmodellen. (4) Batch flere forespørsler sammen for å dra nytte av batch-rabatter eller gjennomstrømningsoptimalisering. Bare disse fire grepene kan redusere reelle driftskostnader merkbart.

06

6. Begrensninger ved denne kalkulatoren

Denne kalkulatoren anslår kostnad ut fra leverandørenes publiserte listepriser for API-er. Den tar ikke hensyn til volumrabatter, bedriftsavtaler, provisjonert throughput, gratiskreditter, regionale prisforskjeller eller den reelle tregheten fra rate limits. Faktisk fakturert beløp kan avvike avhengig av kontraktsvilkår - bruk dette som et utgangspunkt for budsjettering, og bekreft sluttallene direkte med leverandøren.

Vanlige sporsmal

Hvor nøyaktig er anslaget fra tekst til token?
~4 tegn per token er en grov tommelfingerregel basert på engelsk tekst. Faktiske tokenizere varierer med modell, og tekst på andre språk (koreansk, japansk, kinesisk osv.) kan avvike mer fra dette anslaget. For nøyaktige tall bør du kjøre teksten gjennom leverandørens offisielle tokenizer.
Hvorfor er output dyrere enn input?
Å generere token ett om gangen (dekoding) krever mer beregning enn å behandle input på én gang (enkoding), og derfor priser de fleste leverandører output-token flere ganger høyere enn input-token.
Inkluderer dette bilde- eller lyd-token?
Nei - denne kalkulatoren håndterer bare tekst-token. Bilde-, lyd- og videoinndata prises ofte etter egne ordninger som ligger utenfor dette verktøyet.
Hvor ofte oppdateres disse prisene?
Manuelt, basert på datoen som vises i datafilens as_of-felt. Leverandørpriser kan endres uten varsel, så bekreft alltid de nyeste tallene på leverandørens offisielle prisside før du ferdigstiller et budsjett.