./research / token-efficient-agents
کاهش هزینه توکن عاملهای بلندمدت.
عاملها بیشتر توکنهای خود را صرف بازخوانی زمینهای میکنند که پیشتر دیدهاند: همان دستورها، همان اطلاعات شرکت، همان تاریخچه، در هر فراخوانی. بررسی میکنیم که ذخیرهسازی موقت، فشردهسازی زمینه و دانش از پیشکامپایلشده تا کجا میتوانند هزینه نهایی یک گام عامل را بدون افت کیفیت تصمیمهایش کاهش دهند.
پرسش
عاملی که تمام روز کار میکند، زمینهای تقریباً یکسان را صدها بار دوباره میفرستد و در هر فراخوانی بهای کامل آن را میپردازد. با انضباط در حافظه موقت پرامپت، فشردهسازی پرقدرت زمینه و دانشی که از پیش به شکل اجرایی فشرده کامپایل شده است، هزینه نهایی توکن یک گام عامل را تا کجا میتوان پایین آورد، پیش از آنکه کیفیت تصمیمها به میزان قابلاندازهگیری افت کند؟
چرا اهمیت دارد
هزینه توکن مرز میان عاملی است که از کاری که جایگزینش میشود ارزانتر است و عاملی که چنین نیست. بیشتر استقرارها در اقتصاد واحد شکست میخورند، نه در توانایی. اگر بتوان گامی را که به اندازه یک بار خواندن کامل زمینه هزینه دارد به کسری از آن رساند، دستههای کاملی از خودکارسازی همیشهفعال دیگر تجمل نیستند و به انتخابی بدیهی بدل میشوند.
چه میکنیم
نخست مشخص میکنیم بار کاری واقعی عاملها توکنها را در کجا خرج میکند، سپس به سراغ اقلام بزرگ میرویم: ساختاردهی پرامپتها تا حافظه موقت میان نوبتها همچنان اصابت کند؛ فشردهسازی تاریخچه به وضعیتی که مدل بتواند به آن اعتماد کند، بهجای رونوشت خام؛ و کامپایل یکباره دانش پایدار شرکت در پروندههای مهارت تا در هر فراخوانی از نو توضیح داده نشود. هر فن با یک معیار سنجیده میشود: توکن صرفهجوییشده در هر گام در برابر موفقیت وظیفه، و حالتهای شکست به همان دقتِ موفقیتها ثبت میشوند.