Tokens
Wat zijn tokens?
Tokens zijn kleine eenheden waarin een AI-model tekst opdeelt voordat het deze verwerkt. Een token kan een volledig woord zijn, maar ook een deel van een woord, een leesteken of een combinatie van tekens. De zin “Wat is een taalmodel?” bestaat daardoor niet automatisch uit hetzelfde aantal tokens als woorden. Hoe de tekst precies wordt verdeeld, hangt af van het gebruikte model en de bijbehorende tokenizer.
Taalmodellen werken met tokens omdat zij tekst niet rechtstreeks als woorden en zinnen verwerken. Elk token wordt omgezet naar een numerieke weergave waarmee het model patronen en relaties kan herkennen. Op basis van de tokens in je prompt berekent het model vervolgens welk token waarschijnlijk als volgende komt. Door dit proces steeds te herhalen, ontstaat een volledig antwoord.
Tokens en het context window
Het aantal tokens bepaalt hoeveel informatie een AI-model tegelijk kan meenemen. De beschikbare ruimte hiervoor heet het context window. Daarin vallen meestal je prompt, eerdere berichten, toegevoegde documenten, instructies en het antwoord dat het model genereert. Hoe groter het context window, hoe meer informatie het model binnen één interactie kan verwerken.
Wanneer de totale hoeveelheid tekst de beschikbare ruimte overschrijdt, moet een deel worden weggelaten, samengevat of verdeeld over meerdere stappen. Het model kan oudere informatie dan uit het zicht verliezen. Dit is vooral relevant bij lange gesprekken, uitgebreide documenten en workflows waarin veel gegevens aan een prompt worden toegevoegd. Een groot context window betekent overigens niet automatisch dat alle informatie even goed wordt gebruikt.
Waarom het aantal tokens belangrijk is
Bij veel AI-diensten hangen gebruikslimieten en kosten samen met het aantal verwerkte tokens. Er kan onderscheid worden gemaakt tussen inputtokens en outputtokens. Inputtokens komen uit de prompt en toegevoegde context, terwijl outputtokens onderdeel zijn van het gegenereerde antwoord. Een lange prompt en een uitgebreid antwoord gebruiken dus allebei meer tokens.
Efficiënt omgaan met tokens betekent niet dat iedere prompt zo kort mogelijk moet zijn. Belangrijke context schrappen kan juist leiden tot een minder bruikbaar resultaat. Geef daarom voldoende informatie om de opdracht goed uit te voeren, maar voorkom onnodige herhaling en grote hoeveelheden irrelevante tekst. Bij complexe taken kan prompt chaining helpen om het proces over meerdere gerichte stappen te verdelen.