./research / token-efficient-agents
Ridurre il costo in token degli agenti di lunga durata.
Gli agenti consumano la maggior parte dei loro token rileggendo contesto che hanno già visto: le stesse istruzioni, gli stessi dati dell'azienda, la stessa cronologia, a ogni chiamata. Studiamo fino a che punto la cache, la compressione del contesto e la conoscenza precompilata possano ridurre il costo marginale di un passo dell'agente senza degradarne le decisioni.
La domanda
Un agente che lavora tutto il giorno reinvia contesto quasi identico centinaia di volte e paga il prezzo pieno a ogni chiamata. Fino a che punto si può abbassare il costo marginale in token di un passo dell'agente, tramite la disciplina della cache dei prompt, una compressione aggressiva del contesto e conoscenza precompilata in forma eseguibile e compatta, prima che la qualità delle decisioni si degradi in modo misurabile?
Perché conta
La spesa in token è la differenza tra un agente più economico del lavoro che sostituisce e uno che non lo è. La maggior parte dei deployment fallisce sull'economia unitaria, non sulla capacità. Se un passo che costa una lettura completa del contesto può arrivare a costarne una frazione, intere categorie di automazione sempre attiva smettono di essere un lusso e diventano una scelta ovvia.
Cosa stiamo facendo
Analizziamo dove i carichi di lavoro reali degli agenti spendono davvero i token, poi affrontiamo le voci più pesanti: strutturare i prompt in modo che le cache continuino a colpire tra un turno e l'altro; comprimere la cronologia in uno stato di cui il modello possa fidarsi, invece che in trascrizioni grezze; compilare una volta sola la conoscenza stabile dell'azienda in file di competenze, così da non doverla rispiegare a ogni chiamata. Ogni tecnica è valutata allo stesso modo: token risparmiati per passo rispetto al successo del compito, con le modalità di errore documentate con la stessa cura dei successi.