./research / token-efficient-agents

Snižování nákladů na tokeny u dlouho běžících agentů.

Agenti spálí většinu svých tokenů opakovaným čtením kontextu, který už viděli: tytéž instrukce, tatáž fakta o firmě, tatáž historie, při každém volání. Zkoumáme, jak daleko dokáže cachování, komprese kontextu a předkompilované znalosti snížit mezní náklady jednoho kroku agenta, aniž by zhoršily jeho rozhodnutí.

efektivitaagentiactive

Otázka

Agent, který pracuje celý den, posílá téměř totožný kontext stokrát znovu a při každém volání za něj platí plnou cenu. Jak nízko lze stlačit mezní náklady kroku agenta v tokenech, díky disciplíně cache promptů, agresivní kompresi kontextu a znalostem předkompilovaným do úsporné spustitelné podoby, než se kvalita rozhodnutí měřitelně zhorší?

Proč na tom záleží

Výdaje na tokeny rozhodují o tom, zda je agent levnější než práce, kterou nahrazuje, nebo ne. Většina nasazení selhává na jednotkové ekonomice, ne na schopnostech. Pokud lze krok, který stojí úplné načtení kontextu, dostat na zlomek této ceny, přestávají být celé kategorie stále běžící automatizace luxusem a stávají se samozřejmou volbou.

Co děláme

Profilujeme, kam reálné zátěže agentů své tokeny skutečně utrácejí, a pak se pouštíme do největších položek: strukturovat prompty tak, aby cache dál zasahovala napříč tahy; komprimovat historii do stavu, kterému model může věřit, místo surových přepisů; stabilní firemní znalosti jednou zkompilovat do souborů dovedností, aby se nevysvětlovaly znovu při každém volání. Každou techniku hodnotíme stejně: ušetřené tokeny na krok proti úspěšnosti úkolu, přičemž režimy selhání dokumentujeme stejně pečlivě jako úspěchy.