./research / token-efficient-agents
Μείωση του κόστους σε token για μακρόχρονους πράκτορες.
Οι πράκτορες ξοδεύουν τα περισσότερα token τους ξαναδιαβάζοντας συμφραζόμενα που έχουν ήδη δει: τις ίδιες οδηγίες, τα ίδια στοιχεία της εταιρείας, το ίδιο ιστορικό, σε κάθε κλήση. Μελετάμε πόσο μπορούν η προσωρινή αποθήκευση, η συμπίεση συμφραζομένων και η προμεταγλωττισμένη γνώση να μειώσουν το οριακό κόστος ενός βήματος πράκτορα χωρίς να υποβαθμίζουν τις αποφάσεις του.
Το ερώτημα
Ένας πράκτορας που δουλεύει όλη μέρα ξαναστέλνει σχεδόν πανομοιότυπα συμφραζόμενα εκατοντάδες φορές και πληρώνει πλήρη τιμή σε κάθε κλήση. Πόσο χαμηλά μπορεί να πέσει το οριακό κόστος σε token ενός βήματος πράκτορα, μέσω πειθαρχίας στην κρυφή μνήμη των prompt, επιθετικής συμπίεσης συμφραζομένων και γνώσης προμεταγλωττισμένης σε συμπαγή εκτελέσιμη μορφή, προτού η ποιότητα των αποφάσεων υποβαθμιστεί με μετρήσιμο τρόπο;
Γιατί έχει σημασία
Η δαπάνη σε token είναι η διαφορά ανάμεσα σε έναν πράκτορα φθηνότερο από τη δουλειά που αντικαθιστά και σε έναν που δεν είναι. Οι περισσότερες αναπτύξεις αποτυγχάνουν στα οικονομικά της μονάδας, όχι στην ικανότητα. Αν ένα βήμα που κοστίζει μια πλήρη ανάγνωση συμφραζομένων γίνει να κοστίζει ένα κλάσμα της, ολόκληρες κατηγορίες πάντα ενεργής αυτοματοποίησης παύουν να είναι πολυτέλεια και γίνονται η προφανής επιλογή.
Τι κάνουμε
Χαρτογραφούμε πού ξοδεύουν πραγματικά τα token οι αληθινοί φόρτοι εργασίας πρακτόρων και επιτιθέμεθα στα μεγάλα κονδύλια: δομούμε τα prompt ώστε η κρυφή μνήμη να συνεχίζει να πετυχαίνει από γύρο σε γύρο· συμπιέζουμε το ιστορικό σε μια κατάσταση που το μοντέλο μπορεί να εμπιστευτεί, αντί για ακατέργαστες μεταγραφές· μεταγλωττίζουμε μία φορά τη σταθερή γνώση της εταιρείας σε αρχεία δεξιοτήτων ώστε να μην ξαναεξηγείται σε κάθε κλήση. Κάθε τεχνική βαθμολογείται με τον ίδιο τρόπο: token που εξοικονομούνται ανά βήμα έναντι της επιτυχίας του έργου, με τους τρόπους αστοχίας τεκμηριωμένους με την ίδια φροντίδα όπως και τα κέρδη.