MCP servers Claude Code کے لیے ایک نیا اور مقبول طریقہ کار (plumbing) ہیں۔ ایک GitHub server شامل کریں اور آپ کا agent pull requests کھول سکتا ہے۔ ایک filesystem server شامل کریں اور یہ آپ کے repo structure کو پڑھ سکتا ہے۔ ڈیموز جادوئی لگتے ہیں۔ لیکن کوئی بھی ڈیمو میں اس کا بل (receipt) نہیں دکھاتا۔

خرچہ ان API calls میں نہیں ہے جو tools کرتے ہیں۔ بلکہ خرچہ خود tools میں ہے۔

جب بھی آپ ایک MCP server رجسٹر کرتے ہیں، آپ صرف ایک صلاحیت (capability) نہیں بڑھا رہے ہوتے۔ بلکہ آپ اپنے context window میں متن کا ایک حصہ (block of text) شامل کر رہے ہوتے ہیں، اور اس حصے کا بل ہر ایک turn پر آتا ہے۔ چاہے agent اس tool کو استعمال کرے یا نہ کرے، آپ کو اس کے موجود ہونے کی قیمت ادا کرنی پڑتی ہے۔ جیسے ہی server کنیکٹ ہوتا ہے، میٹر چلنا شروع ہو جاتا ہے۔

ان Tools کا کرایہ ادا کرنا جنہیں آپ کبھی استعمال ہی نہیں کرتے

یہاں وہ طریقہ کار ہے جسے نظر انداز کر دیا جاتا ہے۔ ایک MCP server میں ہر tool definition کے ساتھ ایک نام، ایک تفصیل (description)، اور ایک JSON schema ہوتا ہے جو model کو بتاتا ہے کہ tool کو کن arguments کی ضرورت ہے۔ یہ پورا payload ہر turn کے آغاز میں system context میں شامل کر دیا جاتا ہے۔ Model کو مکمل فہرست (catalog) دیکھنے کی ضرورت ہوتی ہے تاکہ وہ فیصلہ کر سکے کہ tool کو کال کرنا ہے یا نہیں، لیکن اس معلومات کی قیمت آپ کو ادا کرنی پڑتی ہے۔

فی tool اضافی بوجھ (overhead) معمولی نہیں ہے۔ عملی طور پر، ایک single tool definition 80 سے 150 tokens تک استعمال کرتی ہے۔ اس کا مطلب ہے کہ دس tools فراہم کرنے والا ایک معمولی server آپ کے ایک جملہ لکھنے سے پہلے ہی خاموشی سے 800 سے 1,500 tokens کھا جاتا ہے۔ آپ compute کے لیے ادائیگی نہیں کر رہے، بلکہ آپ صرف اس اختیار (option) کے لیے ادائیگی کر رہے ہیں کہ وہ آپ کے پاس موجود ہو۔

میں نے یہ دیکھنے کے لیے کہ یہ چیز کس طرح بڑھتی ہے، ایک معیاری 20-turn session کے اعداد و شمار کا جائزہ لیا۔

اگر کوئی MCP server لوڈ نہ ہو، تو overhead صفر ہوتا ہے۔ Context window میں صرف آپ کی گفتگو ہوتی ہے۔

اگر آپ تین مخصوص (tightly scoped) tools والا ایک custom minimal server لوڈ کرتے ہیں، تو ہر turn پر 180 tokens کا ٹیکس لگتا ہے۔ 20 turns کے دوران، یہ 3,600 tokens کا نقصان ہے۔ یہ کوئی بڑی تباہی نہیں ہے، لیکن یہ حقیقی رقم ہے۔

مشہور filesystem server، جو سات tools فراہم کرتا ہے، اسے ہر turn پر 640 tokens تک لے جاتا ہے۔ اسی session کے دوران، آپ صرف connection برقرار رکھنے کے لیے 12,800 tokens ضائع کر چکے ہوں گے۔ آپ نے ابھی تک کوئی فائل نہیں پڑھی، نہ ہی کوئی directory فہرست میں شامل کی ہے۔ آپ نے صرف server کو "مینو" میں برقرار رکھا ہے۔

پھر GitHub server کا نمبر آتا ہے۔ 26 tools رجسٹر ہونے کے ساتھ، یہ ہر turn میں 3,100 tokens ڈال دیتا ہے۔ 20 پیغامات کے تبادلے کے بعد، overhead کا مجموعہ 62,000 tokens ہو جاتا ہے۔ Sonnet 4 کی قیمت کے حساب سے، یہ خالص context tax کے طور پر $0.19 بنتا ہے۔ Agent کے کسی issue کو بنانے کے بارے میں سوچنے سے پہلے ہی آپ نے overhead کے لیے انیس سینٹ ادا کر دیے ہوتے ہیں۔

یہ رقم الگ سے دیکھنے میں چھوٹی لگتی ہے۔ لیکن یہ نہیں ہے۔

رات بھر چلنے والے Agent کا مسئلہ

اصل تکلیف دہ صورتحال طویل عرصے تک چلنے والے autonomous loops میں آتی ہے۔ اگر آپ Claude Code کو ایک ایسے agent کے طور پر استعمال کر رہے ہیں جو خود سے کام کرتا ہے، تو وہ per-turn ٹیکس بہت تیزی سے بڑھتا ہے۔ GitHub server لوڈ کیے بغیر، رات بھر 2,000 turns تک چلنے والا agent صرف 62,000 tokens کا overhead ادا نہیں کرتا، بلکہ یہ 6.2 ملین tokens بن جاتا ہے۔

یہ $18.60 کا خرچہ ہے جو حقیقت میں کسی بھی تعمیری کام پر نہیں ہوا۔ ہو سکتا ہے کہ agent نے پوری رات ایک بھی GitHub tool کو چھوئے بغیر گزار دی ہو۔ ہو سکتا ہے کہ اس نے مکمل طور پر local files کے اندر کام کیا ہو۔ اس کے باوجود، آپ سے ان تمام 26 GitHub tool definitions کے پیسے لیے جائیں گے کیونکہ وہ session میں رجسٹرڈ تھے۔

اہم بات یہ سمجھنا ہے کہ آپ رجسٹرڈ tools کے لیے ادائیگی کرتے ہیں، نہ کہ صرف ان tools کے لیے جنہیں کال کیا گیا ہو۔ Model یہ چیک نہیں کرتا کہ وہ اصل میں کون سے tools استعمال کر رہا ہے اور پھر آپ کے بل میں رعایت دیتا ہے۔ اگر server کنیکٹ ہے، تو اس کا مکمل manifest ہر cycle میں دوبارہ context میں شامل کر دیا جاتا ہے۔ یہ عمل (action) پر نہیں، بلکہ صلاحیت (potential) پر لگنے والا per-turn ٹیکس ہے۔

وہ ڈویلپرز جو iterative coding agents، test harnesses، یا batch review jobs چلا رہے ہیں، ان کے لیے یہ خاموش طور پر بجٹ ختم کرنے والا عنصر ہے۔ انسانوں کے درمیان 20 turns کی گفتگو معمولی ہے۔ لیکن 200 یا 2,000 turns کا agentic loop وہ جگہ ہے جہاں حساب کتاب بہت مہنگا پڑ جاتا ہے۔

اخراجات کو قابو میں کیسے رکھیں

MCP واقعی مفید ہے۔ آپ کو اسے استعمال کرنا چاہیے۔ لیکن اسے ایک ایسی سہولت (utility) کے طور پر سمجھیں جسے آپ صرف ضرورت کے وقت آن کرتے ہیں، نہ کہ کوئی مستقل چیز جسے آپ ہر session کے ساتھ جوڑ دیتے ہیں۔

Configs کو پروجیکٹ اور ٹاسک تک محدود رکھیں

ڈیفالٹ کے طور پر ہر server کو اپنی global Claude Code configuration میں لوڈ نہ کریں۔ پروجیکٹ کے مطابق (project-scoped) MCP configs بنائیں جو آپ کے اصل کام سے مطابقت رکھتی ہوں۔ اگر آپ کسی local module کو refactor کر رہے ہیں، تو شاید آپ کو صرف filesystem server کی ضرورت ہو اور کسی اور چیز کی۔ اگر آپ issues کو حل (triage) کر رہے ہیں، تو اس مخصوص کام کے لیے GitHub server لوڈ کریں اور جب آپ واپس local development پر جائیں تو اسے ڈس کنیکٹ کر دیں۔

اسے اپنے فون پر ایپس کھلی چھوڑنے کی طرح سمجھیں۔ ایک یا دو ٹھیک ہیں۔ لیکن بیس ایپس کا بیک گراؤنڈ میں چلنا بلاوجہ بیٹری ختم کر دیتا ہے۔

کم Tools والے Servers کو ترجیح دیں

تمام MCP سرورز ایک ہی نظم و ضبط کے ساتھ ڈیزائن نہیں کیے جاتے۔ کچھ دو یا تین مخصوص ایکشنز کا ایک مختصر انٹرفیس فراہم کرتے ہیں۔ جبکہ دیگر 25 یا 30 ٹولز کا ایک وسیع کیٹلاگ پیش کرتے ہیں، جن میں سے بہت سے آپ کبھی استعمال نہیں کریں گے۔ تین ٹولز والا سرور آپ کو فی ٹرن 180 ٹوکنز کی قیمت دے سکتا ہے۔ 26 ٹولز والا سرور 3,100 ٹوکنز تک کا خرچ کر سکتا ہے۔ یہ اس صلاحیت کے فرق کے لیے اوور ہیڈ (overhead) میں 17 گنا اضافہ ہے جو شاید آپ کے لیے اہمیت نہ رکھتا ہو۔

کسی سرور کو انسٹال کرنے سے پہلے، اس کے ٹول مینی فیسٹ (tool manifest) کو دیکھیں۔ اگر یہ ایک درجن سے زیادہ ایک جیسے کاموں (overlapping operations) کو رجسٹر کرتا ہے اور آپ کو صرف ایک کی ضرورت ہے، تو اس بات پر غور کریں کہ کیا آپ اسے کم (configure down) کر سکتے ہیں، اسے فورک (fork) کر سکتے ہیں، یا ایک ہلکا (slimmer) ریپر (wrapper) لکھ سکتے ہیں۔ ہر وہ ٹول ڈیفینیشن جسے آپ نکال سکتے ہیں، وہ ہر مستقبل کے ٹرن پر براہ راست اور مستقل ٹوکن کی بچت ہے۔

ٹول کی تفصیلات کو مختصر کریں

فی ٹول 80 سے 150 ٹوکنز کی حد کوئی قدرتی قانون نہیں ہے۔ یہ اس بات پر منحصر ہے کہ تفصیلات اور اسکیمائیں (schemas) کتنی طویل ہیں۔ ایک ضرورت سے زیادہ طویل 400 ٹوکنز کی تفصیل، 80 ٹوکنز کی تفصیل کے مقابلے میں پانچ گنا زیادہ سیاق و سباق (context) استعمال کرتی ہے، اور یہ پانچ گنا کا نقصان ہر ایک ٹرن پر لاگو ہوتا ہے۔

ان سرورز کا آڈٹ کریں جن پر آپ انحصار کرتے ہیں۔ اگر کسی ٹول کی تفصیل مارکیٹنگ کاپی کی طرح لگتی ہے، تو اسے دوبارہ لکھیں۔ صفتوں (adjectives) کو کم کریں۔ ایسی مثالیں ہٹا دیں جو اسکیمہ (schema) کو واضح نہ کرتی ہوں۔ JSON کو مختصر اور جامع بنائیں۔ ماڈل کو یہ سمجھنے کی ضرورت ہے کہ ٹول کیا کرتا ہے، لیکن اسے تمہید کے ایک پیراگراف کی ضرورت نہیں ہے۔ ٹول ڈیفینیشنز کے ساتھ کوڈ کی طرح پیش آئیں: جتنا مختصر اور واضح ہوگا، اتنا ہی بہتر ہوگا۔

اصل حاصلِ کلام

MCP اس حد کو بڑھاتا ہے جہاں تک Claude Code پہنچ سکتا ہے۔ یہ آپ کے کانٹیکسٹ ونڈو (context window) کو مفت میں نہیں بڑھاتا۔ اوور ہیڈ (overhead) یقینی، بار بار ہونے والا، اور اس بات سے مکمل طور پر الگ ہے کہ ٹولز استعمال ہو رہے ہیں یا نہیں۔

صرف وہی سرورز لوڈ کریں جن کی آپ کے موجودہ کام کے لیے ضرورت ہے۔ کام ختم ہونے پر انہیں ڈس کنیکٹ کر دیں۔ ٹولز کی تعداد اور تفصیلات کی لمبائی کا آڈٹ بالکل اسی طرح کریں جیسے آپ کسی دوسری ڈیپینڈنسی (dependency) کا کرتے ہیں۔ اصول سادہ ہے: اگر ٹول اس مخصوص سیشن میں کوئی اہمیت نہیں بڑھا رہا، تو اسے آپ کے بل میں ٹوکنز کا اضافہ نہیں کرنا چاہیے۔

ماپنے کے ذرائع اور طریقہ کار: I added MCP servers to Claude Code — here’s what they cost in tokens

مزید انجینئرنگ بریک ڈاؤنز کے لیے GyaanSetu AI لرننگ کمیونٹی میں شامل ہوں: t.me/GyaanSetuAi