./research / token-efficient-agents

De tokenkosten van langlopende agents verlagen.

Agents verbranden de meeste tokens door context opnieuw te lezen die ze al gezien hebben: dezelfde instructies, dezelfde bedrijfsfeiten, dezelfde geschiedenis, bij elke aanroep. We onderzoeken hoe ver caching, contextcompressie en voorgecompileerde kennis de marginale kosten van een agentstap kunnen verlagen zonder de beslissingen te verslechteren.

efficiëntieagentsactive

De vraag

Een agent die de hele dag werkt, stuurt vrijwel identieke context honderden keren opnieuw en betaalt er bij elke aanroep de volle prijs voor. Hoe ver kunnen de marginale tokenkosten van een agentstap omlaag, via cache-discipline voor prompts, agressieve contextcompressie en kennis die voorgecompileerd is tot een compacte uitvoerbare vorm, voordat de beslissingskwaliteit meetbaar afneemt?

Waarom het ertoe doet

Tokenuitgaven bepalen of een agent goedkoper is dan het werk dat hij vervangt of niet. De meeste implementaties stranden op de unit economics, niet op de mogelijkheden. Als een stap die een volledige contextlezing kost, nog maar een fractie daarvan hoeft te kosten, houden hele categorieën van altijd-actieve automatisering op luxe te zijn en worden ze de vanzelfsprekende keuze.

Wat we doen

We brengen in kaart waar echte agent-workloads hun tokens werkelijk aan besteden en pakken de grote posten aan: prompts zo structureren dat caches over beurten heen blijven raken; geschiedenis comprimeren tot een toestand die het model kan vertrouwen in plaats van ruwe transcripties; stabiele bedrijfskennis één keer compileren tot skills-bestanden zodat ze niet bij elke aanroep opnieuw wordt uitgelegd. Elke techniek wordt op dezelfde manier beoordeeld: bespaarde tokens per stap tegenover taaksucces, met faalmodi die net zo zorgvuldig worden gedocumenteerd als de winsten.