12 سوالات کے ایک تجربے میں، Bash wrappers نے سات-اسکیما (seven-schema) Model Context Protocol (MCP) کے مقابلے میں زیادہ ٹوکنز استعمال کیے، جس سے یہ ثابت ہوا کہ شیل (shell) وہ سستا شارٹ کٹ نہیں ہے جو بہت سے انجینئرز سمجھتے ہیں۔ ٹوکن کا استعمال براہ راست ان large-language-model (LLM) ایجنٹس کے لیے لاگت میں تبدیل ہو جاتا ہے جو بڑے پیمانے پر چلتے ہیں۔
وہ تجربہ جس نے صورتحال بدل دی
ایک ڈویلپر نے ان چار طریقوں کی پیمائش کی جن کے ذریعے ایک LLM ایجنٹ جہاز کا ڈیٹا (vessel data) حاصل کر سکتا تھا:
- MCP – سات ٹول اسکیما (tool schemas) جو Model Context Protocol کے پیچھے ہوسٹ کیے گئے ہیں۔
- Bash + curl (cold) – بغیر کسی اضافی پرامپٹنگ کے ایک خام شیل کال (raw shell call)۔
- Bash + curl (warm) – وہی شیل کال اور ساتھ میں سسٹم پرامپٹس جو محفوظ استعمال کی رہنمائی کرتے ہیں۔
- Dedicated CLI tool – ایک خاص مقصد کے لیے بنایا گیا کمانڈ لائن انٹرفیس۔
ان چاروں طریقوں کو 12 سوالات پر مشتمل گفتگو کے ذریعے آزمایا گیا۔ ٹوکن کا استعمال، جو API بلوں کا باعث بنتا ہے، کچھ اس طرح رہا:
- MCP: 109,779 ٹوکنز
- Bash + curl (cold): 158,021 ٹوکنز
- Bash + curl (warm): 178,577 ٹوکنز
Dedicated CLI tool کے اعداد و شمار ظاہر نہیں کیے گئے، لیکن Bash کے دو ورژن پہلے ہی MCP سے زیادہ خرچ کر چکے تھے۔
شیل نے پروٹوکول سے زیادہ خرچ کیوں کیا
ہر Bash ٹول کو تقریباً 2,700 ٹوکنز کے "harness prompts" کی ضرورت تھی – یعنی وہ ہدایات جو ایجنٹ کو بتاتی ہیں کہ شیل کو محفوظ طریقے سے کیسے کال کرنا ہے، آؤٹ پٹ کو کیسے پروسیس (parse) کرنا ہے، اور غلطیوں (errors) کو کیسے سنبھالنا ہے۔ صرف یہ پرامپٹس ہی تمام سات MCP اسکیما کے مجموعی ٹوکن وزن سے زیادہ ہیں۔
لاگت صرف ابتدائی کال تک محدود نہیں ہے۔ پروڈکشن میں، اسی ایجنٹ نے اسٹارٹ اپ پر 11 MCP سرورز کو پہلے سے لوڈ کیا، جس سے صارف کے پہلے سوال کے آنے سے پہلے ہی 19,800 ٹوکنز استعمال ہو گئے۔ پھر، ہر مرحلے (turn) پر، ایجنٹ ہر سرور سے ہر اسکیما کو دوبارہ پڑھتا تھا، اس لیے "ابھی کیا وقت ہوا ہے؟" جیسے معمولی سے سوال کے لیے بھی ہر دوسرے ٹول کی تفصیلات کی ٹوکن قیمت ادا کرنی پڑتی تھی۔
ایگر لوڈنگ (eager loading) کا پوشیدہ نقصان
جب ایک LLM ایجنٹ ہر مرحلے پر ہر ٹول سرور کو ایگری لوڈ (eagerly load) کرتا ہے، تو ٹوکن کا بل ڈرامائی طور پر بڑھ جاتا ہے۔ تجربے سے پتہ چلا کہ Bash استعمال کرنے کی "اصل" لاگت خود شیل کمانڈ نہیں ہے، بلکہ وہ ارد گرد کا سیاق و سباق (context) ہے جسے ہر بار ماڈل کو بھیجنا پڑتا ہے۔
- Fixed-cost tools (MCP اسکیما) ہر مرحلے پر ایک قابلِ پیش گوئی ٹوکن اوور ہیڈ (overhead) کا اضافہ کرتے ہیں۔
- Dynamic payloads (curl رسپانسز) ایک بڑھتا ہوا قرض (debt) شامل کرتے ہیں جو گفتگو کی طوالت اور ڈیٹا کے سائز کے ساتھ بڑھتا جاتا ہے۔
اس طرح، ایک شیل جو بظاہر "مفت" نظر آتا ہے، درحقیقت ایک بڑا اور متغیر (variable) ٹوکن ٹیکس عائد کرتا ہے۔
AI انجینئرز کو آگے کیا کرنا چاہیے
- Lazy loading اپنائیں۔ ٹول سرور کو صرف اس وقت لوڈ کریں جب اس کے اسکیما کی واقعی ضرورت ہو، اور اسے ہر بار دوبارہ پڑھنے کے بجائے مختلف مراحل کے دوران میموری میں رکھیں۔
- ٹول اسکیما کو فی مرحلہ ایک مقررہ اخراجات کے طور پر سمجھیں۔ شیل کمانڈز کو مفت سمجھنے کے بجائے MCP تعریفوں کے معلوم سائز کے مطابق ٹوکن بجٹ بنائیں۔
- "shell = cheap" کے مفروضوں پر نظر ثانی کریں۔ کسی ڈیزائن کو حتمی شکل دینے سے پہلے ہر ٹول پاتھ کے لیے ٹوکن کے استعمال کا جائزہ (profile) لیں۔
- چھوٹے ماڈلز کے لیے بہتر ڈھانچے والے (shaped) ٹولز کا استعمال جاری رکھیں۔ محدود کانٹیکسٹ ونڈوز (context windows) کے باوجود، بہتر طور پر بیان کردہ اسکیما استدلال (reasoning)، یونٹ کنورژن، اور غلطیوں کو سنبھالنے کی صلاحیت کو بہتر بناتے ہیں۔
خلاصہ یہ کہ: لاگت کا تعین پروٹوکول ڈیزائن نہیں بلکہ ٹوکن کی معیشت (token economics) کرتی ہے۔ ٹول سرورز کو کب اور کیسے لوڈ کیا جائے اس کا انتظام گفتگو سے دسیوں ہزار ٹوکنز بچا سکتا ہے، جس سے براہ راست آپریشنل اخراجات میں کمی آتی ہے۔
ماخذ: https://dev.to/clarkbw--/enabling-bash-costs-more-context-than-seven-mcp-tool-schemas-2h82
