🌐 DA

🧮 AI Token Cost Calculator

Beregn tokonomkostninger for GPT, Claude, Gemini og andre store LLM-API'er. Indtast tokenantal direkte eller indsæt tekst for at estimere dem, og se derefter den forventede månedlige pris.

Simulering af månedligt forbrug

I paste-tilstand, eller i direkte tilstand når input/output er tomme, antager simuleringen en fordeling på 70% input / 30% output pr. forespørgsel. Hvis både input- og output-tokens er udfyldt i direkte tilstand, bruges de nøjagtige tal pr. forespørgsel i stedet.

Anslået pris (pr. forespørgsel)
Inputpris Outputpris Samlet pris
Inputpris hvis cachet (reference)

I praksis gælder caching for gentagne systemprompter eller kontekst, ikke for helt ny input ved hvert kald.

Kilde:
Simulering af månedligt forbrug
Pris pr. dag Pris pr. måned (×30) Pris pr. år (×365)
GUIDE

Laes mere

01

1. Hvorfor estimere LLM-API-pris, før du skalerer

At regne den forventede pris ud, før du kobler et LLM-API på en ny funktion eller et produkt, forhindrer, at en voksende brugerbase bliver til en uoverskuelig regning. Det gælder især tjenester med lange prompts eller samtaler over flere runder - en enkelt forespørgsel kan se billig ud, men tallene ændrer sig hurtigt, når de ganges op med dagligt eller månedligt forbrug. Denne calculator viser både pris pr. forespørgsel og en månedlig simulering, så du kan få en fornemmelse af budgettet, før du skalerer.

02

2. Hvordan tokens adskiller sig fra ord og tegn

Et token er den mindste enhed, en model behandler tekst i, og det kan ikke oversættes 1:1 til ord eller tegn. En almindelig tommelfingerregel for engelsk er omtrent 4 tegn pr. token, men det er kun en tilnærmelse - de faktiske antal afhænger af hver models tokenizer (f.eks. BPE-stil). Især CJK-sprog (koreansk, japansk, kinesisk) bruger typisk flere tokens pr. tegn end engelsk, fordi et enkelt tegn ofte deles op i flere subword-tokens - så samme antal tegn kan koste mærkbart mere end tilsvarende engelsk tekst.

03

3. Hvorfor input- og outputpriser er forskellige

De fleste udbydere prissætter output-tokens (genererede tokens) flere gange højere end input-tokens (prompt-tokens), og alle modeller i dette dataset følger det mønster. Input kan behandles (kodes) på én gang, mens output skal genereres (afkodes) token for token - mere beregning og latenstid pr. token. Derfor er det særligt effektivt at holde svar korte, hvis du vil nedbringe omkostningerne.

04

4. Hvad prompt caching er

Prompt caching (context caching) lader en udbyder cache en systemprompt, lang kontekst eller et dokument på serversiden og derefter opkræve en langt lavere pris, når det samme indhold dukker op igen i en senere forespørgsel. Det betaler sig især i samtaleopsætninger, hvor en systemprompt eller chat-historik sendes igen ved hvert trin. Det gælder ikke, når hver forespørgsel sender helt ny tekst, så figuren "if cached" i denne calculator er et referencescenarie, ikke en garanti.

05

5. Sådan reducerer du tokonomkostninger i produktion

(1) Hold promts så korte, som opgaven faktisk kræver - medtag kun nødvendig kontekst. (2) Udnyt prompt caching for systemprompter eller kontekst, der gentages på tværs af forespørgsler. (3) Send simple opgaver som klassificering eller opsummering til en billigere, mindre model i stedet for din flagskibsmodel. (4) Batch flere forespørgsler sammen for at udnytte batchrabat eller optimering af throughput. Disse fire greb alene kan mærkbart sænke de reelle driftsomkostninger.

06

6. Begrænsninger ved denne calculator

Denne calculator estimerer pris ud fra hver udbyders offentliggjorte listepris-API-takster. Den tager ikke højde for volumenrabatter, enterprise-aftaler, provisioneret throughput, gratis kreditter, regionale prisforskelle eller den reelle langsommere hastighed fra rate limits. De faktiske fakturerede beløb kan variere afhængigt af dine kontraktvilkår - brug dette som et udgangspunkt for budgettering, og bekræft de endelige tal direkte hos udbyderen.

Ofte stillede sporgsmal

Hvor præcist er estimatet fra tekst til token?
~4 tegn pr. token er en grov tommelfingerregel baseret på engelsk tekst. Faktiske tokenizers varierer efter model, og ikke-engelsk tekst (koreansk, japansk, kinesisk osv.) kan afvige mere fra denne tilnærmelse. For præcise tal skal du køre teksten gennem modeludbyderens officielle tokenizer.
Hvorfor er output dyrere end input?
At generere tokens ét ad gangen (dekodning) kræver mere beregning end at behandle input på én gang (kodning), og derfor prissætter de fleste udbydere output-tokens flere gange højere end input-tokens.
Inkluderer det billed- eller audio-tokens?
Nej - denne calculator håndterer kun tekst-tokens. Billede-, lyd- og videoinput faktureres ofte efter separate prisstrukturer, som ligger uden for dette værktøj.
Hvor ofte opdateres disse priser?
Manuelt, pr. den dato der vises i datafilens as_of-felt. Udbyderpriser kan ændre sig uden varsel, så bekræft altid de nyeste tal på udbyderens officielle prisside, før du fastlægger et budget.