🌐 NL

🧮 AI-tokenkostencalculator

Bereken tokenkosten voor GPT, Claude, Gemini en andere grote LLM-API's. Voer tokenaantallen rechtstreeks in of plak tekst om ze te schatten, en bekijk daarna de verwachte maandelijkse kosten.

Simulatie van maandgebruik

In plakmodus, of in directe modus wanneer input/output leeg zijn, gaat de simulatie uit van een verdeling van 70% input / 30% output per verzoek. Als in directe modus zowel input- als outputtokens zijn ingevuld, worden die exacte aantallen per verzoek gebruikt.

Geschatte kosten (per verzoek)
Inputkosten Outputkosten Totale kosten
Inputkosten bij cache (referentie)

In de praktijk geldt caching voor herhaalde systeemprompts of context, niet voor een volledig nieuwe invoer bij elke call.

Bron:
Simulatie van maandgebruik
Kosten per dag Kosten per maand (×30) Kosten per jaar (×365)
GIDS

Meer lezen

01

1. Waarom LLM-API-kosten schatten voordat je opschaalt

Door de verwachte kosten te berekenen voordat je een LLM-API in een nieuwe functie of product inbouwt, voorkom je dat een groeiende gebruikersgroep uitmondt in een onhandelbare rekening. Dit is nog belangrijker bij diensten met lange prompts of gesprekken met meerdere beurten - één verzoek lijkt misschien goedkoop, maar de cijfers lopen snel op zodra je het vermenigvuldigt met dagelijks of maandelijks volume. Deze calculator toont zowel de kosten per verzoek als een maandelijkse simulatie, zodat je een budgetgevoel krijgt voordat je opschaalt.

02

2. Hoe tokens verschillen van woorden en tekens

Een token is de kleinste eenheid waarin een model tekst verwerkt, en die komt niet 1-op-1 overeen met woorden of tekens. Een vuistregel voor Engels is ongeveer 4 tekens per token, maar dat is slechts een benadering - de werkelijke aantallen hangen af van de tokenizer van elk model (bijv. BPE-achtig). Vooral CJK-talen (Koreaans, Japans, Chinees) gebruiken vaak meer tokens per teken dan Engels, omdat één teken vaak wordt opgesplitst in meerdere subword-tokens - dus dezelfde hoeveelheid tekens kan merkbaar meer kosten dan equivalente Engelse tekst.

03

3. Waarom input- en outputprijzen verschillen

De meeste aanbieders prijzen outputtokens (gegenereerde tokens) meerdere keren hoger dan inputtokens (prompttokens), en elk model in deze dataset volgt dat patroon. Input kan in één keer worden verwerkt (gecodeerd), terwijl output token voor token moet worden gegenereerd (gedecodeerd) - dat vraagt meer rekenkracht en veroorzaakt meer latentie per token. Daarom is het kort houden van antwoorden een bijzonder effectieve manier om kosten te verlagen.

04

4. Wat promptcaching is

Promptcaching (contextcaching) laat een aanbieder een systeemprompt, lange context of document server-side cachen, en vervolgens een veel lager tarief rekenen wanneer dezelfde inhoud later opnieuw verschijnt in een volgend verzoek. Het levert vooral voordeel op in conversationele opzetten waarbij een systeemprompt of chatgeschiedenis bij elke beurt opnieuw wordt meegestuurd. Het geldt niet wanneer elk verzoek echt nieuwe tekst verzendt, dus het 'if cached'-cijfer in deze calculator is een referentiescenario, geen garantie.

05

5. Hoe je tokenkosten in productie verlaagt

(1) Houd prompts zo kort als de taak echt vereist - neem alleen de noodzakelijke context op. (2) Maak gebruik van promptcaching voor systeemprompts of context die over verzoeken heen herhaald wordt. (3) Routeer eenvoudige taken zoals classificatie of samenvatting naar een goedkoper, kleiner model in plaats van je vlaggenschipmodel. (4) Bundel meerdere verzoeken om gebruik te maken van batchkortingen of doorvoeroptimalisaties. Alleen al deze vier knoppen kunnen de operationele kosten in de praktijk aanzienlijk verlagen.

06

6. Beperkingen van deze calculator

Deze calculator schat de kosten op basis van de gepubliceerde API-tarieven van elke aanbieder. Hij houdt geen rekening met volumekortingen, enterprise-afspraken, provisioned throughput, gratis credits, regionale prijsverschillen of de effectieve vertraging door rate limits. De werkelijke gefactureerde bedragen kunnen afwijken op basis van je contractvoorwaarden - gebruik dit als startpunt voor je budgettering en bevestig de eindcijfers rechtstreeks bij de aanbieder.

Veelgestelde vragen

Hoe nauwkeurig is de schatting van tekst naar token?
~4 tekens per token is een ruwe vuistregel op basis van Engelse tekst. Werkelijke tokenizers verschillen per model, en niet-Engelse tekst (Koreaans, Japans, Chinees, enz.) kan hier sterker van afwijken. Voor exacte aantallen voer je de tekst door de officiële tokenizer van de modelaanbieder.
Waarom is output duurder dan input?
Tokens één voor één genereren (decoderen) kost meer rekenkracht dan input in één keer verwerken (coderen), daarom prijzen de meeste aanbieders outputtokens meerdere keren hoger dan inputtokens.
Zijn beeld- of audiotokens inbegrepen?
Nee - deze calculator ondersteunt alleen teksttokens. Beeld-, audio- en videoinvoer valt vaak onder aparte prijsstructuren en valt buiten de scope hier.
Hoe vaak worden deze prijzen bijgewerkt?
Handmatig, volgens de datum die staat vermeld in het as_of-veld van het gegevensbestand. Prijzen van aanbieders kunnen zonder voorafgaande kennisgeving veranderen, dus controleer altijd de nieuwste cijfers op de officiële prijspagina van de aanbieder voordat je een budget definitief maakt.