Anthropic च्या नवीन बीटा हेडरमुळे Claude 3.7 Sonnet साठी टूल कॉल्सचा (tool calls) टोकन खर्च सुमारे १४ टक्क्यांनी कमी होतो, ज्यामुळे AI एजंट्सच्या मासिक बिलात थोडी घट होते आणि लॅटन्सीमध्ये (latency) थोडा फायदा मिळतो.

टूल वापरामुळे टोकन्स का खर्च होतात

Claude सोबत एजंट घेतलेल्या प्रत्येक टर्नमध्ये (turn) टोकन-आधारित तीन पायऱ्यांचा समावेश असतो:

  • Tool definitions – प्रॉम्प्टचा भाग म्हणून तुम्ही पाठवलेली नावे आणि JSON स्कीमा.
  • Tool calls – जेव्हा मॉडेल एखादे टूल वापरण्याचा निर्णय घेते, तेव्हा ते तयार केलेले स्ट्रक्चर्ड आउटपुट (structured output).
  • Tool results – तुमचा कोड मॉडेलला परत पाठवलेला डेटा.

पहिली आणि तिसरी पायरी ही इनपुट टोकन्स आहेत; दुसरी पायरी ही आउटपुट टोकन्स आहे. Claude इनपुटपेक्षा आउटपुटसाठी जास्त शुल्क आकारत असल्याने, एकूण टोकन संख्या सारखीच असली तरी आउटपुट टोकन्स कमी केल्याने खर्च कमी होऊ शकतो.

बीटा हेडर

Anthropic ने token-efficient tool use नावाच्या बीटा फीचरची घोषणा केली आहे. HTTP हेडर

anthropic-beta: token-efficient-tools-2025-02-19

जोडल्याने हे ऑप्टिमायझेशन सक्रिय होते, परंतु हे केवळ Claude 3.7 Sonnet साठी विनंती (request) पाठवल्यास लागू होते. जर हेडर इतर कोणत्याही मॉडेलला पाठवले गेले, तर विनंतीमध्ये कोणताही बदल न होता ती प्रक्रिया पुढे सुरू राहते; हेडर कोणत्याही त्रुटीशिवाय (error) दुर्लक्षित केले जाते.

हे ऑप्टिमायझेशन मॉडेलच्या टूल-कॉल आउटपुटला कॉम्प्रेस (compress) करून काम करते, ज्यामुळे त्या पायरीसाठी आउटपुट टोकनच्या संख्येत सुमारे १४ टक्क्यांची कपात होते.

तुमची प्रत्यक्षात किती बचत होते

आउटपुट टोकन्स हे इनपुट टोकन्सपेक्षा महाग असतात, त्यामुळे त्या भागातील १४ टक्क्यांची कपात म्हणजे एकूण बिलातही त्याच प्रमाणात घट होईल असे नाही. एका सामान्य चार-पायरींच्या एजंट लूपमध्ये, टूल डेफिनिशन्समुळे (tool definitions) अनेकदा इनपुट खर्च जास्त असतो, जो कधीकधी वापरल्या जाणाऱ्या एकूण टोकन्सच्या अर्ध्याहून अधिक असू शकतो. अशा परिस्थितीत, आउटपुट टोकन्सवरील १४ टक्क्यांची बचत केल्याने एकूण शुल्कात साधारणपणे केवळ ३ टक्क्यांचीच घट होते.

त्यामुळे ही वाचलेली रक्कम हेडलाईननुसार कमी वाटू शकते, परंतु हा बदल कोणत्याही अतिरिक्त खर्चाशिवाय होतो आणि यामुळे लॅटन्सीमध्ये थोडी सुधारणा होते: कमी आउटपुट टोकन्स म्हणजे मॉडेल जनरेशनचे काम थोड्या वेगाने पूर्ण करते.

मोठी बचत करण्यासाठी वेगळ्या रणनीतींची आवश्यकता आहे

जर खर्च लक्षणीयरीत्या कमी करणे हे तुमचे उद्दिष्ट असेल, तर केवळ हेडर पुरेसे ठरणार नाही. तीन व्यावहारिक मार्ग अधिक चांगल्या प्रकारे फायदा देऊ शकतात:

  • Prompt caching – टूल डेफिनिशन्स एकदाच स्टोअर करा आणि पुढील कॉल्ससाठी कॅश्ड (cached) व्हर्जनचा वापर करा. कॅश्ड रीड्ससाठी नवीन इनपुट टोकन्सपेक्षा कमी दराने शुल्क आकारले जाते.
  • Trim the tool set – केवळ सध्याच्या कामासाठी आवश्यक असलेल्या टूल्सचाच समावेश करा. प्रत्येक अतिरिक्त टूल प्रत्येक विनंतीमध्ये त्याची व्याख्या जोडते, ज्यामुळे इनपुट खर्च वाढतो.
  • Slim down tool results – मॉडेलला खरोखर आवश्यक असलेले फील्ड्सच परत पाठवा. संभाषणात परत पाठवलेले मोठे API रिस्पॉन्स इनपुट टोकन्स आणि संभाषणाचा इतिहास (conversation history) दोन्ही वाढवतात.

या पद्धतींचा अवलंब केल्यास एकूण खर्चात लक्षणीय घट होऊ शकते, जी केवळ बीटा फीचरमुळे मिळणाऱ्या ३ टक्क्यांपेक्षा कितीतरी जास्त असेल.

काय लक्ष ठेवायचे

टोकन-एफिशिएंट मोड कधी—किंवा जर—बीटावरून डिफॉल्ट फीचरमध्ये रूपांतरित होईल, याबद्दल Anthropic ने काहीही संकेत दिलेले नाहीत. डेव्हलपर्सनी भविष्यातील घोषणांकडे लक्ष दिले पाहिजे, ज्यामध्ये Claude 3.7 Sonnet च्या पलीकडे सपोर्ट वाढवला जाऊ शकतो किंवा अधिक प्रगत टोकन-कॉम्प्रेशन तंत्रे आणली जाऊ शकतात. वापराच्या पद्धती बदलत असताना, प्रत्येक विनंतीमधील टोकन ब्रेकडाउनवर लक्ष ठेवल्याने वास्तविक जगातील प्रभावाचे मोजमाप करण्यास मदत होईल.

थोडक्यात सांगायचे तर

हे बीटा हेडर एक मोफत आणि कमी मेहनतीचा बदल आहे जो टूल-कॉल आउटपुट टोकन्स सुमारे १४ टक्क्यांनी कमी करतो, ज्यामुळे बिलात थोडी घट होते आणि वेग थोडा वाढतो. जे लोक आधीच एजंटच्या उच्च खर्चाशी झुंजत आहेत, त्यांच्यासाठी हे हेडर एक उपयुक्त अ‍ॅड-ऑन आहे, परंतु खरी बचत प्रॉम्प्ट कॅशिंग, टूल्सचा वापर मर्यादित करणे आणि कमीत कमी डेटा (leaner results) परत मिळवण्यामुळे होईल.

स्रोत: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l