./research / token-efficient-agents
Зниження вартості токенів для довготривалих агентів.
Агенти витрачають більшість токенів на повторне читання контексту, який уже бачили: ті самі інструкції, ті самі факти про компанію, ту саму історію, за кожного виклику. Ми досліджуємо, наскільки кешування, стиснення контексту та попередньо скомпільовані знання здатні зменшити граничну вартість кроку агента, не погіршуючи його рішень.
Питання
Агент, що працює цілий день, сотні разів пересилає майже однаковий контекст і щоразу платить за нього повну ціну. Наскільки можна знизити граничну вартість кроку агента в токенах, завдяки дисципліні кешу промптів, агресивному стисненню контексту та знанням, попередньо скомпільованим у компактну виконувану форму, перш ніж якість рішень помітно погіршиться?
Чому це важливо
Витрати на токени визначають, чи дешевший агент за роботу, яку він замінює, чи ні. Більшість впроваджень зазнають невдачі на юніт-економіці, а не на можливостях. Якщо крок, що коштує повного читання контексту, вдається звести до частки цієї ціни, цілі класи постійно ввімкненої автоматизації перестають бути розкішшю й стають очевидним вибором.
Що ми робимо
Ми профілюємо, на що реальні навантаження агентів насправді витрачають токени, а тоді беремося за найбільші статті: структурувати промпти так, щоб кеш продовжував влучати між ходами; стискати історію до стану, якому модель може довіряти, замість сирих стенограм; один раз компілювати стабільні знання про компанію у файли навичок, щоб не пояснювати їх заново за кожного виклику. Кожен прийом оцінюється однаково: збережені токени на крок проти успішності завдання, а режими відмов документуються так само ретельно, як і виграші.