./research / token-efficient-agents

Menekan biaya token agen yang berjalan lama.

Agen menghabiskan sebagian besar tokennya untuk membaca ulang konteks yang sudah pernah dilihat: instruksi yang sama, fakta perusahaan yang sama, riwayat yang sama, di setiap panggilan. Kami mempelajari sejauh mana caching, kompresi konteks, dan pengetahuan yang dikompilasi lebih dulu dapat memangkas biaya marjinal satu langkah agen tanpa menurunkan kualitas keputusannya.

efisiensiagenactive

Pertanyaannya

Agen yang bekerja seharian mengirim ulang konteks yang nyaris sama ratusan kali, dan membayar penuh di tiap panggilan. Seberapa jauh biaya marjinal token satu langkah agen bisa ditekan, melalui disiplin cache prompt, kompresi konteks yang agresif, dan pengetahuan yang dikompilasi lebih dulu ke bentuk eksekusi yang ringkas, sebelum kualitas keputusan menurun secara terukur?

Mengapa ini penting

Belanja token adalah pembeda antara agen yang lebih murah daripada pekerjaan yang digantikannya dan yang tidak. Sebagian besar penerapan gagal pada ekonomi unit, bukan pada kemampuan. Jika satu langkah yang berbiaya satu kali baca konteks penuh bisa dibuat berbiaya sepersekiannya, seluruh kategori otomasi yang selalu aktif berhenti menjadi kemewahan dan menjadi pilihan yang jelas.

Apa yang kami kerjakan

Kami memetakan di mana beban kerja agen yang nyata sebenarnya menghabiskan token, lalu menyerang pos-pos terbesar: menyusun prompt agar cache terus mengena antar giliran; memampatkan riwayat menjadi keadaan yang dapat dipercaya model alih-alih transkrip mentah; mengompilasi pengetahuan perusahaan yang stabil sekali saja ke berkas keterampilan agar tidak dijelaskan ulang di setiap panggilan. Setiap teknik dinilai dengan cara yang sama: token yang dihemat per langkah dibanding keberhasilan tugas, dengan mode kegagalan didokumentasikan secermat keberhasilannya.