🌐 SV

🧮 AI-tokenkostnadskalkylator

Beräkna tokenkostnader för GPT, Claude, Gemini och andra stora LLM-API:er. Ange tokenantal direkt eller klistra in text för att uppskatta dem, och kontrollera sedan den beräknade månadskostnaden.

Månatlig användningssimulering

I klistraläge, eller i direktläge när inmatning/utdata lämnas tomma, antar simuleringen en fördelning på 70% inmatning / 30% utdata per begäran. Om både inmatnings- och utdatatoken fylls i direktläge används i stället de exakta per-begäran-värdena.

Beräknad kostnad (per begäran)
Inmatningskostnad Utmatningskostnad Total kostnad
Inmatningskostnad om cachad (referens)

Verklig cache används för upprepade systempromptar eller kontext, inte för helt ny text vid varje anrop.

Källa:
Månatlig användningssimulering
Kostnad per dag Kostnad per månad (×30) Kostnad per år (×365)
GUIDE

Las mer

01

1. Varför uppskatta kostnaden för LLM API innan du skalar

Att räkna ut den förväntade kostnaden innan du kopplar in ett LLM API i en ny funktion eller produkt gör att en växande användarbas inte förvandlas till en ohanterlig faktura. Det gäller ännu mer för tjänster med långa prompts eller samtal i flera steg - en enskild begäran kan se billig ut, men siffrorna ändras snabbt när du multiplicerar med daglig eller månatlig volym. Den här kalkylatorn visar både kostnad per begäran och en månadssimulering så att du får en budgetkänsla innan du skalar.

02

2. Hur token skiljer sig från ord och tecken

En token är den minsta enhet som en modell bearbetar text i, och den motsvarar inte ord eller tecken 1:1. En vanlig tumregel för engelska är ungefär 4 tecken per token, men det är bara en approximation - det faktiska antalet beror på modellens tokenizer (t.ex. BPE-stil). Särskilt CJK-språk (koreanska, japanska, kinesiska) tenderar att använda fler token per tecken än engelska, eftersom ett enda tecken ofta delas upp i flera subword-token - så samma antal tecken kan kosta märkbart mer än motsvarande engelsk text.

03

3. Varför priset skiljer sig mellan inmatning och utdata

De flesta leverantörer prissätter utdata-token (genererade) flera gånger högre än inmatningstoken (prompt), och varje modell i det här datamaterialet följer det mönstret. Inmatning kan behandlas (enkodas) i ett svep, medan utdata måste genereras (dekodas) en token i taget - mer beräkning och högre latens per token. Därför är det särskilt effektivt att hålla svaren korta för att sänka kostnaden.

04

4. Vad promptcachning är

Promptcachning (kontextcachning) gör att en leverantör kan cacha en systemprompt, lång kontext eller ett dokument på serversidan och sedan ta mycket lägre betalt när samma innehåll dyker upp igen i en senare begäran. Det ger störst effekt i konversationsupplägg där en systemprompt eller chatthistorik skickas på nytt i varje tur. Det gäller inte när varje begäran skickar helt ny text, så "om cachad"-värdet i den här kalkylatorn är ett referensscenario, inte en garanti.

05

5. Hur du minskar tokenkostnader i produktion

(1) Håll promptar så korta som uppgiften faktiskt kräver - inkludera bara nödvändig kontext. (2) Utnyttja promptcachning för systempromptar eller kontext som upprepas mellan begäranden. (3) Skicka enkla uppgifter som klassificering eller sammanfattning till en billigare, mindre modell i stället för din flaggskeppsmodell. (4) Samla flera begäranden i batch för att dra nytta av batchrabatter eller optimerad genomströmning. Bara dessa fyra spakar kan minska de faktiska driftskostnaderna avsevärt.

06

6. Begränsningar i den här kalkylatorn

Den här kalkylatorn uppskattar kostnaden utifrån varje leverantörs publicerade API-priser enligt listpris. Den tar inte hänsyn till volymrabatter, företagsavtal, garanterad genomströmning, gratis krediter, regionala prisskillnader eller den faktiska fördröjningen från rate limits. De faktiska debiterade beloppen kan skilja sig beroende på avtalsvillkor - använd detta som utgångspunkt för budgetering och bekräfta slutliga siffror direkt med leverantören.

Vanliga fragor

Hur exakt är uppskattningen från text till token?
~4 tecken per token är en grov tumregel baserad på engelsk text. Faktiska tokenizers varierar mellan modeller, och icke-engelsk text (koreanska, japanska, kinesiska osv.) kan avvika mer från denna approximation. För exakta antal, kör texten genom modellleverantörens officiella tokenizer.
Varför är utdata dyrare än inmatning?
Att generera token en i taget (dekodning) kräver mer beräkning än att bearbeta inmatning i ett svep (enkodning), vilket är anledningen till att de flesta leverantörer prissätter utdata-token flera gånger högre än inmatningstoken.
Ingår bild- eller ljud-token här?
Nej - den här kalkylatorn hanterar bara texttoken. Bild-, ljud- och videoinmatning debiteras ofta enligt separata prismodeller som ligger utanför detta verktygs omfång.
Hur ofta uppdateras de här priserna?
Manuellt, enligt datumet som visas i datafilens as_of-fält. Leverantörernas priser kan ändras utan förvarning, så kontrollera alltid de senaste siffrorna på leverantörens officiella prissida innan du fastställer en budget.