./research / token-efficient-agents

Снижение стоимости токенов у долгоработающих агентов.

Агенты тратят большую часть токенов на повторное чтение уже виденного контекста: те же инструкции, те же факты о компании, ту же историю, при каждом вызове. Мы изучаем, насколько кэширование, сжатие контекста и предварительно скомпилированные знания способны снизить предельную стоимость шага агента, не ухудшая его решений.

эффективностьагентыactive

Вопрос

Агент, работающий весь день, сотни раз пересылает почти одинаковый контекст и каждый раз платит за него полную цену. Насколько можно снизить предельную стоимость шага агента в токенах, за счёт дисциплины кэша промптов, агрессивного сжатия контекста и знаний, предварительно скомпилированных в компактную исполняемую форму, прежде чем качество решений заметно ухудшится?

Почему это важно

Расход токенов определяет, дешевле ли агент той работы, которую он заменяет, или нет. Большинство внедрений проваливаются на юнит-экономике, а не на возможностях. Если шаг, стоящий полного чтения контекста, удаётся свести к доле этой цены, целые классы постоянно работающей автоматизации перестают быть роскошью и становятся очевидным выбором.

Что мы делаем

Мы профилируем, на что реальные рабочие нагрузки агентов на самом деле тратят токены, и беремся за самые крупные статьи: структурировать промпты так, чтобы кэш продолжал срабатывать между ходами; сжимать историю в состояние, которому модель может доверять, вместо сырых стенограмм; один раз компилировать устойчивые знания о компании в файлы навыков, чтобы не объяснять их заново при каждом вызове. Каждый приём оценивается одинаково: сэкономленные токены на шаг против успешности задачи, а режимы отказов документируются так же тщательно, как и выигрыши.