./research / token-efficient-agents

Sänka tokenkostnaden för långkörande agenter.

Agenter bränner det mesta av sina tokens på att läsa om kontext de redan sett: samma instruktioner, samma företagsfakta, samma historik, vid varje anrop. Vi undersöker hur långt cachning, kontextkomprimering och förkompilerad kunskap kan skära ner marginalkostnaden för ett agentsteg utan att försämra dess beslut.

effektivitetagenteractive

Frågan

En agent som arbetar hela dagen skickar om nästan identisk kontext hundratals gånger och betalar fullt pris vid varje anrop. Hur långt går det att pressa ner marginalkostnaden i tokens för ett agentsteg, genom disciplinerad promptcachning, aggressiv kontextkomprimering och kunskap som förkompilerats till kompakt körbar form, innan beslutskvaliteten försämras mätbart?

Varför det spelar roll

Tokenkostnaden avgör om en agent är billigare än arbetet den ersätter eller inte. De flesta driftsättningar faller på enhetsekonomin, inte på förmågan. Om ett steg som kostar en full kontextläsning kan göras till en bråkdel av det, upphör hela kategorier av alltid-på-automatisering att vara lyx och blir det självklara valet.

Vad vi gör

Vi kartlägger var verkliga agentarbetslaster faktiskt lägger sina tokens och tar oss an de stora posterna: strukturera prompter så att cachen fortsätter träffa mellan turer; komprimera historik till ett tillstånd som modellen kan lita på i stället för råa transkript; kompilera stabil företagskunskap en gång till färdighetsfiler så att den inte förklaras om vid varje anrop. Varje teknik poängsätts likadant: sparade tokens per steg mot uppgiftsframgång, med felmoder dokumenterade lika noga som vinsterna.