./research / token-efficient-agents
Reducerea costului în tokenuri al agenților de lungă durată.
Agenții consumă majoritatea tokenurilor recitind context pe care l-au văzut deja: aceleași instrucțiuni, aceleași date despre companie, același istoric, la fiecare apel. Studiem cât de mult pot reduce memorarea în cache, comprimarea contextului și cunoștințele precompilate costul marginal al unui pas de agent fără a-i degrada deciziile.
Întrebarea
Un agent care lucrează toată ziua retrimite context aproape identic de sute de ori și plătește prețul întreg la fiecare apel. Cât de jos poate fi coborât costul marginal în tokenuri al unui pas de agent, prin disciplina cache-ului de prompturi, comprimarea agresivă a contextului și cunoștințe precompilate într-o formă executabilă compactă, înainte ca al deciziilor să se degradeze în mod măsurabil?
De ce contează
Cheltuiala pe tokenuri este diferența dintre un agent mai ieftin decât munca pe care o înlocuiește și unul care nu este. Majoritatea implementărilor eșuează pe economia unitară, nu pe capacitate. Dacă un pas care costă o citire completă a contextului poate ajunge să coste o fracțiune din ea, categorii întregi de automatizare mereu activă încetează să fie un lux și devin alegerea evidentă.
Ce facem
Analizăm unde cheltuiesc de fapt tokenurile sarcinile reale ale agenților, apoi atacăm posturile mari: structurăm prompturile astfel încât cache-ul să nimerească în continuare de la o tură la alta; comprimăm istoricul într-o stare în care modelul poate avea încredere, în locul transcrierilor brute; compilăm o singură dată cunoștințele stabile ale companiei în fișiere de competențe, ca să nu fie reexplicate la fiecare apel. Fiecare tehnică este notată la fel: tokenuri economisite pe pas față de succesul sarcinii, cu modurile de eșec documentate la fel de atent ca reușitele.