./research / token-efficient-agents
Reducir el coste en tokens de los agentes de larga duración.
Los agentes gastan la mayoría de sus tokens releyendo contexto que ya han visto: las mismas instrucciones, los mismos datos de la empresa, el mismo historial, en cada llamada. Estudiamos hasta dónde el almacenamiento en caché, la compresión de contexto y el conocimiento precompilado pueden recortar el coste marginal de un paso del agente sin degradar sus decisiones.
La pregunta
Un agente que trabaja todo el día reenvía contexto casi idéntico cientos de veces y paga el precio completo en cada llamada. ¿Hasta dónde puede reducirse el coste marginal en tokens de un paso del agente, mediante la disciplina de caché de prompts, una compresión de contexto agresiva y conocimiento precompilado en forma ejecutable y compacta, antes de que la calidad de las decisiones se degrade de forma medible?
Por qué importa
El gasto en tokens es la diferencia entre un agente más barato que el trabajo que reemplaza y uno que no lo es. La mayoría de los despliegues fracasan por la economía unitaria, no por la capacidad. Si un paso que cuesta una lectura completa de contexto puede pasar a costar una fracción de eso, categorías enteras de automatización siempre activa dejan de ser un lujo para volverse una elección obvia.
Qué estamos haciendo
Perfilamos dónde gastan realmente sus tokens las cargas de trabajo reales de los agentes y atacamos las partidas grandes: estructurar los prompts para que las cachés sigan acertando entre turnos; comprimir el historial en un estado en el que el modelo pueda confiar, en lugar de transcripciones en bruto; compilar una vez el conocimiento estable de la empresa en archivos de habilidades para no reexplicarlo en cada llamada. Cada técnica se evalúa igual: tokens ahorrados por paso frente al éxito de la tarea, con los modos de fallo documentados con el mismo cuidado que los aciertos.