Anthropic’s new beta header trims the token cost of tool calls by about 14 percent for Claude 3.7 Sonnet, giving AI agents a modest reduction in their monthly bills and a small latency edge.
Kwa nini matumizi ya zana hutumia token nyingi
Kila hatua ambayo wakala anachukua na Claude inahusisha hatua tatu zinazoendeshwa na token:
- Ufafanuzi wa zana (Tool definitions) – majina na miundo ya JSON unayotuma kama sehemu ya prompt.
- Wito wa zana (Tool calls) – matokeo yaliyopangwa ambayo modeli inazalisha inapofanya uamuzi wa kuita zana.
- Matokeo ya zana (Tool results) – data ambayo kodi yako inarudisha kwa modeli.
Hatua ya kwanza na ya tatu ni token za kuingiza (input tokens); hatua ya pili ni token za kutolea (output tokens). Kwa sababu Claude anatoza zaidi kwa matokeo kuliko kwa ingizo, kupunguza token za kutolea kunaweza kushusha gharama hata kama jumla ya idadi ya token inabaki vilevile.
Kichwa cha beta
Anthropic imetangaza kipengele cha beta kinachoitwa token-efficient tool use. Kuongeza kichwa cha HTTP
anthropic-beta: token-efficient-tools-2025-02-19
huamsha uboreshaji huo, lakini ni pale tu ombi linapoelekezwa kwa Claude 3.7 Sonnet. Ikiwa kichwa hicho kitatumwa kwa modeli nyingine yoyote, ombi litaendelea bila mabadiliko; kichwa hicho kitapuuzwa bila kutoa hitilafu.
Uboreshaji huu hufanya kazi kwa kubana matokeo ya wito wa zana ya modeli, ukipunguza takriban asilimia 14 ya idadi ya token za kutolea kwa hatua hiyo.
Unapata akiba kiasi gani hasa
Token za kutolea ni ghali zaidi kuliko token za kuingiza, hivyo kupunguzwa kwa asilimia 14 kwenye sehemu hiyo hakumaanishi anguko la uwiano katika jumla ya bili. Katika mzunguko wa kawaida wa hatua nne wa wakala, ufafanuzi wa zana mara nyingi hutawala gharama za kuingiza, wakati mwingine ukizidi nusu ya token zinazotumiwa. Chini ya hali hizo, akiba ya asilimia 14 ya token za kutolea kwa kawaida hutoa upunguzaji wa takriban asilimia 3 tu katika malipo ya jumla.
Kwa hivyo, takwimu hiyo ya akiba inahisi kuwa ndogo, lakini mabadiliko hayo yanakuja bila gharama ya ziada na huleta ongezeko kidogo la kasi: token chache za kutolea zinamaanisha kuwa modeli inamaliza uzalishaji kwa haraka zaidi kidogo.
Akiba kubwa zaidi inahitaji mbinu tofauti
Ikiwa lengo ni kupunguza gharama kwa maana ya msingi, kichwa pekee hakitoshi. Njia tatu za vitendo hutoa faida kubwa zaidi:
- Prompt caching – hifadhi ufafanuzi wa zana mara moja na utumie tena toleo lililohifadhiwa (cached) kwenye wito unaofuata. Kusoma data iliyohifadhiwa hutozwa kwa kiwango cha chini kuliko token mpya za kuingiza.
- Punguza seti ya zana – weka tu zana ambazo ni muhimu kwa kazi ya sasa. Kila zana ya ziada huongeza ufafanuzi wake kwenye kila ombi, jambo linaloongeza gharama za kuingiza.
- Punguza matokeo ya zana – rudisha tu maeneo (fields) ambayo modeli inahitaji hasa. Majibu makubwa ya API yanayorudishwa kwenye mazungumzo huongeza token za kuingiza na historia ya mazungumzo.
Kutumia mbinu hizi kunaweza kupunguza sehemu kubwa ya matumizi ya jumla, zaidi ya asilimia 3 unayoweza kuona kutokana na beta pekee.
Cha kufuatilia
Anthropic haijajaashiria ni lini—au kama—hali ya token-efficient itabadilika kutoka beta kuwa kipengele cha kawaida. Watengenezaji wanapaswa kufuatilia matangazo ya baadaye ambayo yanaweza kupanua uungaji mkono zaidi ya Claude 3.7 Sonnet au kuleta mbinu za kina zaidi za kubana token. Kufuatilia mgawanyo wa token kwa kila ombi pia kutasaidia kukadiria athari halisi kadiri mifumo ya matumizi inavyobadilika.
Hitimisho
Kichwa cha beta ni marekebisho ya bure na rahisi yanayopunguza token za matokeo ya wito wa zana kwa takriban asilimia 14, yakileta upunguzaji mdogo wa bili na ongezeko kidogo la kasi. Kwa yeyote ambaye tayari anapambana na gharama kubwa za wakala, kichwa hiki ni nyongeza inayosaidia, lakini akiba halisi itatokana na kuhifadhi (caching) prompt, kuzuia matumizi ya zana nyingi, na kurudisha matokeo mafupi zaidi.
*Chanzo:
