./research / token-efficient-agents
Obniżanie kosztu tokenów długo działających agentów.
Agenci zużywają większość tokenów na ponowne czytanie kontekstu, który już widzieli: te same instrukcje, te same fakty o firmie, tę samą historię, przy każdym wywołaniu. Badamy, jak daleko buforowanie, kompresja kontekstu i wcześniej skompilowana wiedza mogą obniżyć koszt krańcowy kroku agenta bez pogarszania jego decyzji.
Pytanie
Agent pracujący cały dzień setki razy przesyła niemal identyczny kontekst i za każdym wywołaniem płaci pełną cenę. Jak nisko można zejść z krańcowym kosztem tokenów kroku agenta, dzięki dyscyplinie bufora promptów, agresywnej kompresji kontekstu i wiedzy skompilowanej wcześniej do zwięzłej formy wykonywalnej, zanim jakość decyzji zauważalnie się pogorszy?
Dlaczego to ważne
Wydatek na tokeny decyduje o tym, czy agent jest tańszy od pracy, którą zastępuje, czy nie. Większość wdrożeń upada na ekonomii jednostkowej, nie na możliwościach. Jeśli krok, który kosztuje pełne odczytanie kontekstu, uda się sprowadzić do ułamka tego kosztu, całe kategorie zawsze aktywnej automatyzacji przestają być luksusem, a stają się oczywistym wyborem.
Co robimy
Profilujemy, na co realne obciążenia agentów naprawdę wydają tokeny, a potem bierzemy się za największe pozycje: strukturyzujemy prompty tak, by bufor trafiał między turami; kompresujemy historię do stanu, któremu model może zaufać, zamiast surowych transkryptów; stabilną wiedzę firmy kompilujemy raz do plików umiejętności, by nie tłumaczyć jej przy każdym wywołaniu. Każdą technikę oceniamy tak samo: tokeny zaoszczędzone na krok wobec skuteczności zadania, a tryby awarii dokumentujemy równie starannie jak sukcesy.