Anthropic کا نیا بیٹا ہیڈر Claude 3.7 Sonnet کے لیے ٹول کالز (tool calls) کی ٹوکن لاگت میں تقریباً 14 فیصد کمی کرتا ہے، جس سے AI ایجنٹس کے ماہانہ بلوں میں معمولی کمی اور لیٹنسی (latency) میں تھوڑا سا فائدہ حاصل ہوتا ہے۔

ٹول کا استعمال ٹوکنز کیوں خرچ کرتا ہے

Claude کے ساتھ ایجنٹ کے ہر مرحلے میں تین ٹوکن پر مبنی اقدامات شامل ہوتے ہیں:

  • ٹول کی تعریفیں (Tool definitions) – وہ نام اور JSON schemas جو آپ پرامپٹ کے حصے کے طور پر بھیجتے ہیں۔
  • ٹول کالز (Tool calls) – وہ منظم آؤٹ پٹ جو ماڈل اس وقت تیار کرتا ہے جب وہ کسی ٹول کو استعمال کرنے کا فیصلہ کرتا ہے۔
  • ٹول کے نتائج (Tool results) – وہ ڈیٹا جو آپ کا کوڈ ماڈل کو واپس بھیجتا ہے۔

پہلا اور تیسرا مرحلہ ان پٹ ٹوکنز (input tokens) ہیں؛ دوسرا مرحلہ آؤٹ پٹ ٹوکنز (output tokens) ہے۔ چونکہ Claude ان پٹ کے مقابلے میں آؤٹ پٹ کے لیے زیادہ چارج کرتا ہے، اس لیے آؤٹ پٹ ٹوکنز میں کمی کرنے سے لاگت کم ہو سکتی ہے، چاہے مجموعی ٹوکن کی تعداد تقریباً اتنی ہی رہے۔

بیٹا ہیڈر (The beta header)

Anthropic نے token-efficient tool use کے نام سے ایک بیٹا فیچر کا اعلان کیا ہے۔ HTTP ہیڈر

anthropic-beta: token-efficient-tools-2025-02-19

شامل کرنے سے یہ آپٹیمائزیشن (optimization) فعال ہو جاتی ہے، لیکن صرف اس وقت جب درخواست Claude 3.7 Sonnet کے لیے ہو۔ اگر ہیڈر کسی دوسرے ماڈل کو بھیجا جائے تو درخواست بغیر کسی تبدیلی کے آگے بڑھتی ہے؛ ہیڈر کو بغیر کسی غلطی (error) کے نظر انداز کر دیا جاتا ہے۔

یہ آپٹیمائزیشن ماڈل کے ٹول-کال آؤٹ پٹ کو کمپریس (compress) کر کے کام کرتی ہے، جس سے اس مرحلے کے لیے آؤٹ پٹ ٹوکن کی تعداد میں تقریباً 14 فیصد کمی آتی ہے۔

آپ درحقیقت کتنی بچت کرتے ہیں

آؤٹ پٹ ٹوکنز، ان پٹ ٹوکنز کے مقابلے میں مہنگے ہوتے ہیں، اس لیے اس حصے میں 14 فیصد کی کٹوتی کا مطلب کل بل میں متناسب کمی نہیں ہے۔ ایک عام چار مرحلہ وار ایجنٹ لوپ میں، ٹول کی تعریفیں اکثر ان پٹ لاگت پر حاوی ہوتی ہیں، جو کبھی کبھی استعمال ہونے والے ٹوکنز کے نصف سے بھی زیادہ ہوتی ہیں۔ ان حالات میں، آؤٹ پٹ ٹوکنز پر 14 فیصد کی بچت عام طور پر مجموعی چارج میں صرف تقریباً 3 فیصد کمی لاتی ہے۔

اس لیے بچت کا یہ بڑا ہندسہ معمولی محسوس ہوتا ہے، لیکن یہ تبدیلی بغیر کسی اضافی لاگت کے آتی ہے اور لیٹنسی (latency) میں تھوڑا سا بہتری لاتی ہے: کم آؤٹ پٹ ٹوکنز کا مطلب ہے کہ ماڈل جنریشن کا کام تھوڑا زیادہ تیزی سے مکمل کرتا ہے۔

زیادہ بچت کے لیے مختلف حکمت عملیوں کی ضرورت ہے

اگر مقصد اخراجات میں خاطر خواہ کمی لانا ہے، تو صرف ہیڈر کافی نہیں ہوگا۔ تین عملی طریقے زیادہ فائدے فراہم کرتے ہیں:

  • پرامپٹ کیشنگ (Prompt caching) – ٹول کی تعریفوں کو ایک بار محفوظ کریں اور بعد والی کالز پر کیش شدہ ورژن کو دوبارہ استعمال کریں۔ کیش شدہ ریڈز (cached reads) پر تازہ ان پٹ ٹوکنز کے مقابلے میں کم ریٹ پر چارج کیا جاتا ہے۔
  • ٹول سیٹ کو کم کریں (Trim the tool set) – صرف وہی ٹولز شامل کریں جو موجودہ کام کے لیے ضروری ہوں۔ ہر اضافی ٹول ہر درخواست میں اپنی تعریف شامل کرتا ہے، جس سے ان پٹ لاگت بڑھ جاتی ہے۔
  • ٹول کے نتائج کو مختصر کریں (Slim down tool results) – صرف وہی فیلڈز واپس کریں جن کی ماڈل کو واقعی ضرورت ہے۔ بڑے API رسپانسز جو گفتگو میں واپس بھیجے جاتے ہیں، ان پٹ ٹوکنز اور گفتگو کی ہسٹری دونوں کو بڑھا دیتے ہیں۔

ان طریقوں پر عمل کرنے سے کل اخراجات میں نمایاں کمی لائی جا سکتی ہے، جو صرف بیٹا فیچر سے ملنے والی 3 فیصد بچت سے کہیں زیادہ ہوگی۔

کن چیزوں پر نظر رکھنی چاہیے

Anthropic نے یہ اشارہ نہیں دیا ہے کہ ٹوکن-ایفیشنٹ موڈ کب—یا اگر—بیٹا سے ڈیفالٹ فیچر میں تبدیل ہوگا۔ ڈویلپرز کو مستقبل کے اعلانات پر نظر رکھنی چاہیے جو شاید Claude 3.7 Sonnet سے آگے سپورٹ کو بڑھائیں یا ٹوکن کمپریشن کی مزید گہری تکنیکیں متعارف کروائیں۔ استعمال کے پیٹرنز کے بدلنے کے ساتھ ساتھ، فی درخواست ٹوکن کی تفصیلات (per-request token breakdown) کی نگرانی کرنے سے حقیقی دنیا کے اثرات کا اندازہ لگانے میں بھی مدد ملے گی۔

خلاصہ (Bottom line)

بیٹا ہیڈر ایک مفت اور کم محنت والا طریقہ ہے جو ٹول-کال آؤٹ پٹ ٹوکنز میں تقریباً 14 فیصد کمی کرتا ہے، جس سے بل میں معمولی کمی اور رفتار میں تھوڑا سا اضافہ ہوتا ہے۔ جو لوگ پہلے سے ہی ایجنٹ کی زیادہ لاگت سے نمٹ رہے ہیں، ان کے لیے یہ ہیڈر ایک مددگار اضافہ ہے، لیکن اصل بچت پرامپٹس کی کیشنگ، ٹولز کے استعمال کو محدود کرنے، اور مختصر نتائج فراہم کرنے سے آئے گی۔

ماخذ: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l