./research / token-efficient-agents

Giảm chi phí token của các tác nhân chạy dài.

Các tác nhân tiêu tốn phần lớn token vào việc đọc lại ngữ cảnh đã thấy: cùng những chỉ dẫn, cùng những dữ kiện về công ty, cùng lịch sử, ở mỗi lượt gọi. Chúng tôi nghiên cứu xem bộ nhớ đệm, nén ngữ cảnh và tri thức biên dịch sẵn có thể cắt giảm chi phí biên của một bước tác nhân tới đâu mà không làm giảm chất lượng quyết định.

hiệu quảtác nhânactive

Câu hỏi

Một tác nhân làm việc cả ngày gửi lại ngữ cảnh gần như giống hệt hàng trăm lần, và trả đủ giá ở mỗi lượt gọi. Có thể kéo chi phí token biên của một bước tác nhân xuống tới đâu, nhờ kỷ luật bộ nhớ đệm prompt, nén ngữ cảnh quyết liệt và tri thức được biên dịch sẵn thành dạng thực thi gọn nhẹ, trước khi chất lượng quyết định suy giảm ở mức đo được?

Vì sao điều này quan trọng

Chi phí token là ranh giới giữa một tác nhân rẻ hơn công việc nó thay thế và một tác nhân thì không. Phần lớn các triển khai thất bại ở bài toán kinh tế đơn vị, chứ không phải ở năng lực. Nếu một bước tốn cả một lần đọc ngữ cảnh đầy đủ có thể chỉ còn tốn một phần nhỏ, thì cả những mảng lớn của tự động hóa luôn bật thôi là xa xỉ và trở thành lựa chọn hiển nhiên.

Chúng tôi đang làm gì

Chúng tôi lập hồ sơ xem các khối lượng công việc tác nhân thực tế tiêu token vào đâu, rồi nhắm vào những khoản lớn nhất: cấu trúc prompt sao cho bộ nhớ đệm tiếp tục trúng qua các lượt; nén lịch sử thành trạng thái mà mô hình có thể tin, thay vì bản ghi thô; biên dịch một lần tri thức ổn định của công ty thành các tệp kỹ năng để không phải giải thích lại ở mỗi lượt gọi. Mỗi kỹ thuật được chấm theo cùng một cách: token tiết kiệm mỗi bước so với mức thành công của tác vụ, và các kiểu thất bại được ghi lại kỹ lưỡng ngang với những thành công.