Anthropic का नया बीटा हेडर Claude 3.7 Sonnet के लिए टूल कॉल्स (tool calls) की टोकन लागत को लगभग 14 प्रतिशत कम कर देता है, जिससे AI एजेंट्स के मासिक बिलों में मामूली कमी आती है और लेटेंसी (latency) में थोड़ी बढ़त मिलती है।

टूल का उपयोग टोकन क्यों खर्च करता है

Claude के साथ एजेंट द्वारा किए गए प्रत्येक टर्न में तीन टोकन-आधारित चरण शामिल होते हैं:

  • Tool definitions – वे नाम और JSON स्कीमा जो आप प्रॉम्प्ट के हिस्से के रूप में भेजते हैं।
  • Tool calls – वह स्ट्रक्चर्ड आउटपुट जो मॉडल तब जेनरेट करता है जब वह किसी टूल को कॉल करने का निर्णय लेता है।
  • Tool results – वह डेटा जो आपका कोड मॉडल को वापस भेजता है।

पहला और तीसरा चरण इनपुट टोकन हैं; दूसरा चरण आउटपुट टोकन है। चूंकि Claude इनपुट की तुलना में आउटपुट के लिए अधिक शुल्क लेता है, इसलिए आउटपुट टोकन कम करने से लागत कम हो सकती है, भले ही कुल टोकन संख्या समान रहे।

बीटा हेडर

Anthropic ने token-efficient tool use नामक एक बीटा फीचर की घोषणा की है। HTTP हेडर

anthropic-beta: token-efficient-tools-2025-02-19

जोड़ने से यह ऑप्टिमाइज़ेशन सक्रिय हो जाता है, लेकिन केवल तभी जब अनुरोध Claude 3.7 Sonnet को लक्षित करता है। यदि हेडर किसी अन्य मॉडल को भेजा जाता है, तो अनुरोध बिना किसी बदलाव के आगे बढ़ता है; हेडर को बिना किसी त्रुटि के अनदेखा कर दिया जाता है।

यह ऑप्टिमाइज़ेशन मॉडल के टूल-कॉल आउटपुट को कंप्रेस (compress) करके काम करता है, जिससे उस चरण के लिए आउटपुट टोकन काउंट में लगभग 14 प्रतिशत की कमी आती है।

आप वास्तव में कितनी बचत करते हैं

आउटपुट टोकन, इनपुट टोकन की तुलना में महंगे होते हैं, इसलिए उस हिस्से में 14 प्रतिशत की कटौती का मतलब कुल बिल में आनुपातिक गिरावट नहीं है। एक विशिष्ट चार-चरणीय एजेंट लूप में, टूल डेफिनिशन अक्सर इनपुट लागतों पर हावी रहते हैं, जो कभी-कभी उपयोग किए गए टोकन के आधे से अधिक होते हैं। उन परिस्थितियों में, आउटपुट टोकन पर 14 प्रतिशत की बचत आमतौर पर कुल शुल्क में केवल लगभग 3 प्रतिशत की कमी लाती है।

इसलिए, बचत का यह मुख्य आंकड़ा मामूली लगता है, लेकिन यह बदलाव बिना किसी अतिरिक्त लागत के आता है और लेटेंसी में मामूली सुधार लाता है: कम आउटपुट टोकन का मतलब है कि मॉडल जनरेशन को थोड़ा जल्दी पूरा कर लेता है।

बड़ी बचत के लिए अलग रणनीतियों की आवश्यकता है

यदि लक्ष्य खर्चों को सार्थक रूप से कम करना है, तो केवल हेडर से काम नहीं चलेगा। तीन व्यावहारिक तरीके बड़े लाभ दे सकते हैं:

  • Prompt caching – टूल डेफिनिशन को एक बार स्टोर करें और बाद के कॉल्स पर कैश किए गए वर्शन का पुन: उपयोग करें। कैश किए गए रीड्स (reads) के लिए फ्रेश इनपुट टोकन की तुलना में कम दर पर शुल्क लिया जाता है।
  • Trim the tool set – केवल उन्हीं टूल्स को शामिल करें जो वर्तमान कार्य के लिए आवश्यक हैं। प्रत्येक अतिरिक्त टूल हर अनुरोध में अपनी परिभाषा जोड़ता है, जिससे इनपुट लागत बढ़ जाती है।
  • Slim down tool results – केवल वही फ़ील्ड्स वापस करें जिनकी मॉडल को वास्तव में आवश्यकता है। बड़े API रिस्पॉन्स, जिन्हें बातचीत में वापस फीड किया जाता है, इनपुट टोकन और बातचीत के इतिहास (conversation history) दोनों को बढ़ा देते हैं।

इन प्रथाओं को लागू करने से कुल खर्च में उल्लेखनीय कमी आ सकती है, जो केवल बीटा से मिलने वाले 3 प्रतिशत से कहीं अधिक है।

क्या नज़र रखें

Anthropic ने यह संकेत नहीं दिया है कि टोकन-कुशल (token-efficient) मोड कब—या यदि—बीटा से डिफ़ॉल्ट फीचर में बदल जाएगा। डेवलपर्स को भविष्य की घोषणाओं पर नज़र रखनी चाहिए जो Claude 3.7 Sonnet से परे समर्थन का विस्तार कर सकती हैं या गहरी टोकन-कंप्रेशन तकनीकें पेश कर सकती हैं। उपयोग के पैटर्न विकसित होने के साथ वास्तविक दुनिया के प्रभाव को मापने में प्रति-अनुरोध (per-request) टोकन ब्रेकडाउन की निगरानी करना भी मदद करेगा।

निष्कर्ष

बीटा हेडर एक मुफ्त, कम प्रयास वाला बदलाव है जो टूल-कॉल आउटपुट टोकन को लगभग 14 प्रतिशत कम कर देता है, जिससे बिल में मामूली गिरावट और गति में थोड़ी वृद्धि मिलती है। जो कोई भी पहले से ही उच्च एजेंट लागतों से जूझ रहा है, उसके लिए यह हेडर एक सहायक एड-ऑन है, लेकिन वास्तविक बचत प्रॉम्प्ट कैशिंग, टूल एक्सपोज़र को सीमित करने और कम (leaner) परिणाम देने से आएगी।

स्रोत: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l