<h2><strong>Inleiding</strong></h2>
<p></p>
<p>Onlangs merkten sommige gebruikers een ongebruikelijke situatie op:</p>
<blockquote>
<p>‘Ik stuurde alleen “Hi”, waarom verbruikte dat meer dan 10.000 tokens?’</p>
</blockquote>
<p>Op het eerste gezicht lijkt dat misschien onverwacht. Een bericht van twee tekens zou toch maar een paar tokens moeten vereisen?</p>
<p>Het antwoord is: <strong>het model verwerkt niet alleen je zichtbare bericht.</strong></p>
<p>Moderne AI-assistenten, vooral codeeragents zoals Codex, Claude Code en andere IDE-gebaseerde AI-tools, sturen samen met je bericht veel meer informatie mee om het model te helpen de taak te begrijpen en betere antwoorden te geven.</p>
<hr>
<p></p>
<h2>Je bericht is maar een klein deel van de context</h2>
<p>Wanneer je stuurt:</p>
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>Hi</code></pre>
<p>kan het daadwerkelijke verzoek dat naar het AI-model wordt gestuurd er eerder zo uitzien:</p>
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>Systeeminstructies
+
Gebruikersinstellingen
+
Geconfigureerde vaardigheden
+
Beschikbare tools
+
Projectinformatie
+
Bestandscontext
+
Eerdere gespreksgeschiedenis
+
Jouw bericht: "Hi"</code></pre>
<p>De totale omvang van al deze onderdelen is de werkelijke context die door het model wordt verwerkt.</p>
<p>Daarom kan zelfs een heel kort bericht een aanzienlijk aantal tokens verbruiken.</p>
<hr>
<h2>Wat kan het contextverbruik verhogen?</h2>
<h3>1. Geconfigureerde vaardigheden</h3>
<p>Als je aangepaste vaardigheden of AI-mogelijkheden hebt ingeschakeld, moeten de instructies daarvan in de modelcontext worden geladen.</p>
<p>Bijvoorbeeld:</p>
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>Instructies voor vaardigheid A: 2.000 tokens
Instructies voor vaardigheid B: 3.000 tokens
Instructies voor vaardigheid 1.500 tokens</code></pre>
<p>Zelfs voordat je iets typt, kunnen deze instructies al enkele duizenden tokens innemen.</p>
<hr>
<h3>2. Tools en agentmogelijkheden</h3>
<p>AI-codeerassistenten bieden meestal tools zoals:</p>
<ul>
<li><p>Bestanden lezen</p></li>
<li><p>Code doorzoeken</p></li>
<li><p>Terminaluitvoering</p></li>
<li><p>Git-bewerkingen</p></li>
<li><p>Browsertoegang</p></li>
<li><p>Externe integraties</p></li>
</ul>
<p>De definities en gebruiksinstructies van deze tools verbruiken ook contextruimte.</p>
<hr>
<h3>3. Project- en bestandscontext</h3>
<p>Wanneer je binnen een IDE of coderepository werkt, kan de AI-client automatisch het volgende opnemen:</p>
<ul>
<li><p>Projectstructuur</p></li>
<li><p>Geopende bestanden</p></li>
<li><p>Codefragmenten</p></li>
<li><p>Afhankelijkheden</p></li>
<li><p>Configuratiebestanden</p></li>
</ul>
<p>Hierdoor kan de AI je project begrijpen, maar het verhoogt ook het contextverbruik.</p>
<hr>
<h3>4. Eerdere gespreksgeschiedenis</h3>
<p>Als je een bestaand gesprek voortzet, worden eerdere berichten meestal opnieuw meegestuurd zodat het model de context begrijpt.</p>
<p>Bijvoorbeeld:</p>
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>Eerdere discussie: 12.000 tokens
Nieuw bericht:
Hi</code></pre>
<p>Het nieuwe verzoek kan dus nog steeds die eerdere 12.000 tokens bevatten.</p>
<hr>
<h2>Hoe je minimaal tokenverbruik kunt testen</h2>
<p>Als je het tokenverbruik van een eenvoudig bericht wilt meten, probeer dan het volgende:</p>
<ol>
<li><p>Start een volledig nieuw gesprek.</p></li>
<li><p>Schakel aangepaste vaardigheden uit.</p></li>
<li><p>Voeg geen bestanden toe.</p></li>
<li><p>Open geen projectwerkruimte.</p></li>
<li><p>Stuur alleen:</p></li>
</ol>
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>Hi</code></pre>
<p>Dit laat het benaderende minimale contextverbruik zien.</p>
<hr>
<h2>Contextvenster vs tokenverbruik</h2>
<p>Het is belangrijk om onderscheid te maken tussen:</p>
<h3>Contextvenster</h3>
<p>De maximale hoeveelheid informatie die een model in één verzoek kan verwerken.</p>
<p>Voorbeeld:</p>
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>Contextvenster van 1M tokens</code></pre>
<p>betekent dat het model theoretisch tot 1 miljoen tokens aankan.</p>
<h3>Tokenverbruik</h3>
<p>De werkelijke hoeveelheid tokens die in een specifiek verzoek is opgenomen.</p>
<p>Voorbeeld:</p>
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>Gebruikersbericht:
Hi
Daadwerkelijk verzoek:
Systeeminstructies + tools + geschiedenis + "Hi"
Totaal:
15.000 tokens</code></pre>
<p>Een groot contextvenster betekent niet dat elk verzoek alleen de lengte van je bericht verbruikt.</p>
<hr>
<h2>Conclusie</h2>
<p>Hoog tokenverbruik door een kort bericht duidt niet noodzakelijk op een probleem met het model of de API.</p>
<p>In AI-agentomgevingen omvat de totale context veel verborgen onderdelen die nodig zijn voor intelligente werking. Een eenvoudig ‘Hi’ kan nog steeds resulteren in het verwerken van duizenden tokens als de sessie vaardigheden, tools, projectinformatie of eerdere geschiedenis bevat.</p>
<p>We raden aan een schone sessie zonder extra context te starten wanneer je het ruwe tokenverbruik wilt testen.</p>
<p>Dank je voor je begrip en voortdurende steun.</p>