Claude کا نیا Deep Research ٹول ایک ہی کال میں 6.57 ملین ٹوکنز استعمال کر سکتا ہے—ایسا کام جسے صرف ایک بھاری کمپیوٹنگ بجٹ ہی سنبھال سکتا ہے۔ یہ سسٹم کوئی ایک واحد (monolithic) لینگویج ماڈل نہیں ہے؛ بلکہ یہ ایک سخت JavaScript map-reduce پائپ لائن کے طور پر چلتا ہے جو تلاش کے عمل کو پھیلاتا ہے، ڈیٹا حاصل کرتا ہے، دعووں کا تین آزاد تصدیق کنندگان (verifiers) کے ساتھ مقابلہ کرتا ہے، اور پھر ایک رپورٹ تیار کرتا ہے۔

یہ آرکیٹیکچر کیوں اہم ہے

زیادہ تر AI سے لیس ریسرچ اسسٹنٹ ایک سادہ "سوال اور جواب" والا انٹرفیس پیش کرتے ہیں، جس میں ماڈل ایک ہی بار میں متن اور حوالہ جات (citations) تیار کر دیتا ہے۔ Claude کا Deep Research اس ماڈل کو مکمل طور پر بدل دیتا ہے۔ یہ کام کو الگ الگ، مخصوص مراحل میں تقسیم کرتا ہے اور ماڈل کو ایک سافٹ ویئر ہارنس (software harness) کی پابندی کرنے پر مجبور کرتا ہے۔ ڈیزائنرز نے اسے اس طرح بنایا ہے کہ یہ ہالوسینیشنز (hallucinations) کو قابو میں رکھتے ہوئے بھرپور اور مستند جوابات فراہم کر سکے۔ یہ طریقہ کار ایک خودکار بگ ہنٹنگ فریم ورک سے ماخوذ ہے، جہاں پہلے ایک مفروضہ تیار کیا جاتا ہے اور پھر اسے جان بوجھ کر غلط ثابت کرنے کی کوشش کی جاتی ہے۔ ریسرچ کی اصطلاح میں، ایک دعویٰ جنم لیتا ہے، اور پھر تین ایڈورسرئیل (adversarial) ایجنٹس حتمی خلاصے تک پہنچنے سے پہلے اسے ختم کرنے کی کوشش کرتے ہیں۔

میپ ریڈیوس (map-reduce) کا بہاؤ

  1. فین آؤٹ سرچ (Fan-out search) – آرکیسٹریٹر ایسے متوازی ورکرز پیدا کرتا ہے جو ڈیٹا کے مختلف ذرائع سے سوالات کرتے ہیں۔
  2. ڈیٹا حاصل کرنا (Fetch data) – ہر ورکر خام معلومات (snippets)، میٹا ڈیٹا، اور دستیاب ڈھانچہ جاتی معلومات حاصل کرتا ہے۔
  3. ایڈورسرئیل تصدیق (Adversarial verification) – تین آزاد ایجنٹس ہر دعوے کو وصول کرتے ہیں، اور ہر ایک کو ہدایت دی جاتی ہے کہ غیر یقینی کی صورت میں اسے مسترد (refuted) قرار دے۔ دعویٰ صرف اسی صورت میں برقرار رہتا ہے اگر وہ کافی مثبت ووٹ حاصل کر لے۔
  4. سمیسسز (Synthesis) – برقرار رہنے والے دعووں کو ایک حتمی JSON رپورٹ میں جوڑ دیا جاتا ہے جسے صارف نثر (prose) کی صورت میں دیکھ سکتا ہے۔

ہارنس کے اندر

ہارنس کوڈ کی ایک باریک تہہ ہے جو یہ طے کرتی ہے کہ لینگویج ماڈل کیا کر سکتا ہے۔ اس کے قواعد منظم کاموں کے ایک سیٹ کے طور پر ظاہر ہوتے ہیں:

  • SCOPE – ماڈل کو تحقیقی سوال کی ایک مختصر وضاحت موصول ہوتی ہے۔
  • SEARCH – اسے ذرائع کی شناخت کرنے والی فہرست فراہم کرنی چاہیے، کبھی بھی آزاد متن (free-form text) نہیں۔
  • EXTRACT – ہر ذریعے کے لیے، ماڈل ایک لفظ بہ لفظ اقتباس (verbatim quote) واپس کرتا ہے جو کسی بھی بعد کے دعوے کی تائید کرتا ہے۔
  • VERDICT – یہ ایک JSON آبجیکٹ تیار کرتا ہے جس میں دعویٰ، معاون اقتباس، اور اعتماد کا اسکور (confidence score) شامل ہوتا ہے۔
  • REPORT – حتمی مرحلہ تمام تصدیق شدہ دعووں کو ایک واحد دستاویز میں سمو دیتا ہے۔

ہارنس ایویڈنس بانڈنگ (evidence binding) کو نافذ کرتا ہے: بغیر کسی درست اقتباس کے کسی بھی دعوے کو خود بخود مسترد کر دیا جاتا ہے۔ یہ پالیسی کانسٹنٹ (policy constants) کو بھی ظاہر کرتا ہے جنہیں کوڈ تبدیل کیے بغیر تبدیل کیا جا سکتا ہے—جیسے کہ ایک دعوے کو کتنے مثبت ووٹوں کی ضرورت ہے، سسٹم کتنے ذرائع پڑھ سکتا ہے، یا تصدیق کے لیے کتنے دعوے آگے بڑھ سکتے ہیں۔

ایکسٹریکشن اور تصدیق کے درمیان ایک ٹریاج (triage) مرحلہ موجود ہے۔ ہر دعوے کو مہنگے ایڈورسرئیل ایجنٹس کے پاس بھیجنے کے بجائے، سسٹم انہیں اہمیت اور ذریعے کے معیار کے لحاظ سے درجہ بندی کرتا ہے، اور پھر صرف ٹاپ 25 کو آگے بھیجتا ہے۔ یہ چھانٹ بین ٹوکن کے استعمال اور کمپیوٹنگ اخراجات کو بے قابو ہونے سے روکتی ہے۔

عملی طور پر ایڈورسرئیل تصدیق

تصدیق کا مرحلہ جان بوجھ کر سخت رکھا گیا ہے۔ تینوں ایجنٹس میں سے ہر ایک کو ایک ہی دعویٰ اور اس کا ماخذ اقتباس ملتا ہے، اور پھر وہ ایک ایسے ہدایات کے سیٹ کے تحت کام کرتے ہیں جو انہیں یہ فرض کرنے کو کہتا ہے کہ دعویٰ غلط ہے جب تک کہ انہیں فیصلہ کن ثبوت نہ مل جائے۔ اگر کوئی ایجنٹ غیر یقینی کا شکار ہو، تو وہ مسترد (refuted) کا ووٹ دیتا ہے۔ دعوے کو برقرار رہنے کے لیے ایک قابلِ ترتیب تعداد میں تصدیق شدہ (affirmed) ووٹ جمع کرنے ہوتے ہیں۔

غیر رسمی ٹیسٹنگ کے دوران، ایڈورسرئیل لیئر نے ایک ایسے دعوے کو پکڑ لیا جس نے ایک مجموعی میٹرک (aggregate metric) کو مخصوص پریسیژن اسکور سمجھ لیا تھا۔ ماڈل نے پریسیژن کے بارے میں ایک پراعتماد بیان تیار کیا تھا، لیکن ماخذ نے صرف ایک مجموعی میٹرک رپورٹ کیا تھا۔

AI سسٹم کی تعمیر کے بارے میں یہ ڈیزائن کیا ظاہر کرتا ہے

  1. کنٹرول کو استدلال (reasoning) سے الگ کرنا – ماڈل استنباط (inference) کے لیے ذمہ دار رہتا ہے؛ ہارنس عمل کے نظم و ضبط کو برقرار رکھتا ہے۔
  2. ٹائپڈ انٹرفیسز ہالوسینیشنز کو کم کرتے ہیں – JSON آؤٹ پٹ اور درست اقتباسات کا مطالبہ کر کے، سسٹم آزادانہ متن کے بہاؤ (free-form drift) کو ختم کر دیتا ہے۔
  3. مہنگے تصدیقی مرحلے سے پہلے دعووں کی چھانٹ بین کرنے سے ٹوکن کا استعمال اور کمپیوٹنگ اخراجات کم ہو جاتے ہیں۔
  4. بیرونی ان پٹ کو ناقابل اعتبار سمجھنا – ہر ماخذ کے اقتباس کو آزاد ایجنٹس کے ذریعے دوبارہ چیک کیا جاتا ہے، جس سے کسی ایک غلط دستاویز کو جواب کو خراب کرنے سے روکا جا سکتا ہے۔

یہ اصول "ماڈل کے باہر ماڈل" (model-outside-the-model) آرکیٹیکچرز کی طرف ایک وسیع تر تبدیلی کی عکاسی کرتے ہیں، جہاں احتمالی (probabilistic) لینگویج ماڈل کے بجائے یقینی (deterministic) کوڈ آرکیسٹریشن، تصدیق، اور وسائل کی تقسیم کو سنبھالتا ہے۔

ممکنہ نقصانات اور کھلے سوالات

پائپ لائن کی طاقت—اس کی سختی—چیلنجز بھی ساتھ لاتی ہے۔

بحث کا ایک اور پہلو لفظ بہ لفظ اقتباسات پر انحصار ہے۔ تمام معلومات درست الفاظ میں موجود نہیں ہوتیں؛ کچھ بصیرتیں متعدد دستاویزات کے تجزیے کے بعد ہی سامنے آتی ہیں۔

آگے کیا دیکھنا ہے

Claude کا Deep Research ابھی تحقیقی مرحلے میں ہے، لیکن اس کا ڈھانچہ ایک ایسے مستقبل کی طرف اشارہ کرتا ہے جہاں بڑے لینگویج ماڈلز کو خود مختار چھوڑنے کے بجائے سختی سے کنٹرول شدہ پائپ لائنز میں شامل کیا جائے گا۔ نگرانی کے لیے اہم اشارے درج ذیل ہیں:

  • Token-efficiency metrics – کیا 6.57 M ٹوکن کا بنیادی معیار (baseline) کم ہو جائے گا جیسے جیسے سسٹم میں زیادہ منتخب درجہ بندی (triage) کی منطق شامل ہوگی؟
  • Latency trends – جب تین تصدیقی ایجنٹس عمل میں شامل ہوں تو سسٹم کتنی جلدی مکمل رپورٹ فراہم کر سکتا ہے؟

خلاصہ

Claude کا Deep Research ظاہر کرتا ہے کہ جب ایک لینگویج ماڈل کو ایک منظم، کثیر مرحلہ وار پائپ لائن تک محدود رکھا جائے تو وہ قابل اعتماد اور ذرائع سے منسلک جوابات دے سکتا ہے۔ اصل کامیابی ماڈل کا سائز نہیں ہے؛ بلکہ وہ ارد گرد کا سافٹ ویئر ہے جو ماڈل کو ہر دعوے کو ثابت کرنے، کمپیوٹ استعمال کرنے سے پہلے شواہد کی درجہ بندی کرنے، اور ہر بیرونی اقتباس کو اس وقت تک مشکوک سمجھنے پر مجبور کرتا ہے جب تک کہ تین ایجنٹس اس کے برعکس اتفاق نہ کر لیں۔ AI پر مبنی ٹولز بنانے والوں کے لیے سبق واضح ہے: ماڈل کو سوچنے دیں، لیکن کوڈ کو یہ فیصلہ کرنے دیں کہ وہ کیا کہہ سکتا ہے۔