./research / token-efficient-agents
Reduzir o custo em tokens de agentes de longa duração.
Os agentes gastam a maior parte dos seus tokens relendo contexto que já viram: as mesmas instruções, os mesmos fatos da empresa, o mesmo histórico, a cada chamada. Estudamos até onde o cache, a compressão de contexto e o conhecimento pré-compilado podem cortar o custo marginal de um passo do agente sem degradar suas decisões.
A pergunta
Um agente que trabalha o dia inteiro reenvia contexto quase idêntico centenas de vezes e paga o preço cheio a cada chamada. Até onde é possível reduzir o custo marginal em tokens de um passo do agente, por meio da disciplina de cache de prompts, de compressão agressiva de contexto e de conhecimento pré-compilado em forma executável e compacta, antes que a qualidade das decisões se degrade de forma mensurável?
Por que importa
O gasto em tokens é a diferença entre um agente mais barato do que o trabalho que ele substitui e um que não é. A maioria das implantações fracassa na economia unitária, não na capacidade. Se um passo que custa uma leitura completa de contexto puder passar a custar uma fração disso, categorias inteiras de automação sempre ativa deixam de ser luxo e passam a ser a escolha óbvia.
O que estamos fazendo
Traçamos o perfil de onde as cargas de trabalho reais dos agentes de fato gastam tokens e atacamos os grandes itens: estruturar os prompts para que os caches continuem acertando entre turnos; comprimir o histórico em um estado no qual o modelo possa confiar, em vez de transcrições brutas; compilar uma vez o conhecimento estável da empresa em arquivos de habilidades para não reexplicá-lo a cada chamada. Cada técnica é avaliada da mesma forma: tokens economizados por passo em relação ao sucesso da tarefa, com os modos de falha documentados com o mesmo cuidado que os acertos.