./research / token-efficient-agents
장시간 실행 에이전트의 토큰 비용 줄이기.
에이전트는 토큰의 대부분을 이미 본 컨텍스트를 다시 읽는 데 씁니다. 같은 지시, 같은 회사 정보, 같은 이력을 호출마다 되풀이하는 것입니다. 캐싱, 컨텍스트 압축, 미리 컴파일한 지식이 판단 품질을 떨어뜨리지 않으면서 에이전트 한 스텝의 한계 비용을 어디까지 낮출 수 있는지 연구하고 있습니다.
질문
하루 종일 일하는 에이전트는 거의 동일한 컨텍스트를 수백 번 다시 보내고, 호출마다 제값을 온전히 치릅니다. 프롬프트 캐시 규율, 공격적인 컨텍스트 압축, 그리고 간결한 실행 형태로 미리 컴파일한 지식을 통해, 판단 품질이 측정 가능한 수준으로 나빠지기 전까지 에이전트 한 스텝의 한계 토큰 비용을 어디까지 낮출 수 있을까요?
왜 중요한가
토큰 지출은 에이전트가 대체하는 일보다 싼 에이전트와 그렇지 못한 에이전트를 가릅니다. 대부분의 배포는 역량이 아니라 단위 경제성에서 실패합니다. 전체 컨텍스트 읽기만큼 드는 한 스텝을 그 일부 비용으로 만들 수 있다면, 상시 가동 자동화의 여러 범주가 사치가 아니라 당연한 선택이 됩니다.
우리가 하는 일
실제 에이전트 워크로드가 토큰을 어디에 쓰는지부터 프로파일링한 뒤 큰 항목부터 공략합니다. 캐시가 턴을 넘어 계속 적중하도록 프롬프트를 구조화하고, 이력을 원시 트랜스크립트가 아니라 모델이 신뢰할 수 있는 상태로 압축하며, 안정적인 회사 지식을 한 번만 스킬 파일로 컴파일해 호출마다 다시 설명하지 않게 합니다. 모든 기법은 같은 기준으로 평가합니다. 스텝당 절약한 토큰 대비 과제 성공률이며, 실패 양상도 성과만큼 꼼꼼히 기록합니다.