Claude का नया Deep Research टूल एक ही कॉल में 6.57 मिलियन टोकन को प्रोसेस कर सकता है—एक ऐसी क्षमता जिसे केवल एक विशाल कंप्यूट बजट ही बनाए रख सकता है। यह सिस्टम कोई अखंड (monolithic) लैंग्वेज मॉडल नहीं है; यह एक सख्त JavaScript map-reduce पाइपलाइन के रूप में चलता है जो सर्च को फैलाता है (fans out), डेटा प्राप्त करता है, दावों की तुलना तीन स्वतंत्र सत्यापनकर्ताओं (verifiers) से करता है, और फिर एक रिपोर्ट तैयार करता है।

आर्किटेक्चर क्यों महत्वपूर्ण है

अधिकांश AI-संचालित रिसर्च असिस्टेंट एक सिंगल "पूछें-और-जवाब पाएं" (ask-and-answer) इंटरफ़ेस पेश करते हैं, जिससे मॉडल एक ही बार में टेक्स्ट और साइटेशन जेनरेट कर देता है। Claude का Deep Research इस मॉडल को पूरी तरह से बदल देता है। यह कार्य को अलग-अलग, टाइप किए गए चरणों (discrete, typed stages) में विभाजित करता है और मॉडल को एक सॉफ्टवेयर हार्नेस (software harness) का पालन करने के लिए मजबूर करता है। डिजाइनरों ने इसे इस तरह बनाया है कि यह समृद्ध और प्रमाणित उत्तर देते हुए भी हैलुसिनेशन (hallucinations) को नियंत्रण में रखे। यह दृष्टिकोण एक ऑटोमेटेड बग-हंटिंग फ्रेमवर्क से प्रेरित है, जहाँ एक परिकल्पना (hypothesis) तैयार की जाती है और फिर उसे जानबूझकर गलत साबित करने की कोशिश की जाती है। रिसर्च के संदर्भ में, एक दावा पैदा होता है, और फिर तीन एडवर्सैरियल एजेंट (adversarial agents) अंतिम सिंथेसिस तक पहुँचने से पहले उसे खत्म करने की कोशिश करते हैं।

Map-reduce फ्लो

  1. Fan-out search – ऑर्केस्ट्रेटर समानांतर वर्कर्स (parallel workers) बनाता है जो डेटा स्रोतों की एक विस्तृत श्रृंखला से प्रश्न पूछते हैं।
  2. Fetch data – प्रत्येक वर्कर कच्चे स्निपेट्स, मेटाडेटा और किसी भी उपलब्ध स्ट्रक्चर्ड जानकारी को निकालता है।
  3. Adversarial verification – तीन स्वतंत्र एजेंटों को प्रत्येक दावा प्राप्त होता है, जिनमें से प्रत्येक को अनिश्चित होने पर डिफ़ॉल्ट रूप से refuted (खारिज) घोषित करने का निर्देश दिया जाता है। दावा तभी जीवित रहता है जब वह पर्याप्त सकारात्मक वोट प्राप्त करता है।
  4. Synthesis – जीवित बचे दावों को एक अंतिम JSON रिपोर्ट में जोड़ दिया जाता है जिसे उपयोगकर्ता गद्य (prose) के रूप में देख सकता है।

हार्नेस के अंदर

हार्नेस कोड की एक पतली परत है जो यह परिभाषित करती है कि लैंग्वेज मॉडल क्या कर सकता है। इसके नियम संरचित कार्यों के एक सेट के रूप में दिखाई देते हैं:

  • SCOPE – मॉडल को शोध प्रश्न का एक संक्षिप्त विवरण प्राप्त होता है।
  • SEARCH – इसे सोर्स आइडेंटिफायर की एक सूची जारी करनी चाहिए, कभी भी फ्री-फॉर्म टेक्स्ट नहीं।
  • EXTRACT – प्रत्येक स्रोत के लिए, मॉडल एक सटीक उद्धरण (verbatim quote) देता है जो किसी भी आगामी दावे का समर्थन करता है।
  • VERDICT – यह एक JSON ऑब्जेक्ट तैयार करता है जिसमें दावा, सहायक उद्धरण और एक कॉन्फिडेंस स्कोर होता है।
  • REPORT – अंतिम चरण सभी सत्यापित दावों को एक एकल दस्तावेज़ में समेट देता है।

हार्नेस एविडेंस बाइंडिंग (evidence binding) को लागू करता है: सटीक उद्धरण के बिना किसी भी दावे को स्वचालित रूप से खारिज कर दिया जाता है। यह पॉलिसी कांस्टेंट्स (policy constants) को भी उजागर करता है जिन्हें कोड बदले बिना बदला जा सकता है—जैसे कि एक दावे को कितने सकारात्मक वोटों की आवश्यकता है, सिस्टम कितने स्रोत पढ़ सकता है, या सत्यापन के लिए जाने वाले दावों की अधिकतम संख्या।

एक्सट्रैक्शन और वेरिफिकेशन के बीच एक ट्राइएज (triage) चरण होता है। हर दावे को महंगे एडवर्सैरियल एजेंटों के पास भेजने के बजाय, सिस्टम उन्हें महत्व और स्रोत की गुणवत्ता के आधार पर रैंक करता है, और फिर केवल शीर्ष 25 को आगे भेजता है। यह छंटनी टोकन उपयोग और कंप्यूट लागत को अनियंत्रित होने से रोकती है।

व्यवहार में एडवर्सैरियल वेरिफिकेशन

वेरिफिकेशन चरण जानबूझकर कठोर है। तीनों एजेंटों में से प्रत्येक को एक ही दावा और उसका सोर्स उद्धरण प्राप्त होता है, और फिर वे एक ऐसे निर्देश सेट के तहत काम करते हैं जो उन्हें यह मानने के लिए कहता है कि दावा गलत है, जब तक कि उन्हें निर्णायक प्रमाण न मिल जाए। यदि कोई एजेंट अनिश्चित है, तो वह refuted (खारिज) वोट देता है। जीवित रहने के लिए दावे को एक कॉन्फ़िगर करने योग्य संख्या में affirmed (पुष्ट) वोटों को इकट्ठा करना होगा।

अनौपचारिक परीक्षण के दौरान, एडवर्सैरियल लेयर ने एक ऐसे दावे को पकड़ लिया जिसने एक एग्रीगेट मेट्रिक को विशिष्ट प्रिसिजन स्कोर के रूप में गलत पढ़ लिया था। मॉडल ने प्रिसिजन के बारे में एक आत्मविश्वासपूर्ण बयान जेनरेट किया था, लेकिन स्रोत ने केवल एक एग्रीगेट मेट्रिक की रिपोर्ट की थी।

AI सिस्टम निर्माण के बारे में डिज़ाइन क्या बताता है

  1. कंट्रोल को रीजनिंग से अलग करना – मॉडल इन्फरेंस (inference) के लिए जिम्मेदार रहता है; हार्नेस प्रक्रिया के अनुशासन को लागू करता है।
  2. टाइप्ड इंटरफ़ेस हैलुसिनेशन को कम करते हैं – JSON आउटपुट और सटीक उद्धरणों की मांग करके, सिस्टम फ्री-फॉर्म विचलन (drift) को समाप्त कर देता है।
  3. महंगे वेरिफिकेशन स्टेप से पहले दावों को फ़िल्टर करने से टोकन उपयोग और कंप्यूट लागत कम हो जाती है।
  4. बाहरी इनपुट को अविश्वसनीय मानना – प्रत्येक सोर्स उद्धरण की स्वतंत्र एजेंटों द्वारा पुन: जाँच की जाती है, जिससे किसी एक दोषपूर्ण दस्तावेज़ को उत्तर को दूषित करने से रोका जा सके।

ये सिद्धांत "मॉडल-आउटसाइड-द-मॉडल" (model-outside-the-model) आर्किटेक्चर की ओर एक व्यापक बदलाव को दर्शाते हैं, जहाँ प्रोबेबिलिस्टिक लैंग्वेज मॉडल के बजाय डिटरमिनिस्टिक कोड ऑर्केस्ट्रेशन, वैलिडेशन और रिसोर्स एलोकेशन को संभालता है।

संभावित कमियां और खुले प्रश्न

पाइपलाइन की ताकत—इसकी कठोरता—चुनौतियां भी पेश करती है।

विवाद का एक और बिंदु शब्दशः उद्धरणों (verbatim quotes) पर निर्भरता है। सारा ज्ञान सटीक शब्दावली में नहीं होता; कुछ अंतर्दृष्टि केवल कई दस्तावेज़ों के संश्लेषण के बाद ही उभरती है।

आगे क्या देखें

Claude का Deep Research अभी शोध चरण में है, लेकिन इसकी वास्तुकला एक ऐसे भविष्य का संकेत देती है जहाँ लार्ज लैंग्वेज मॉडल्स को स्वयं निर्देशित करने के बजाय कड़ाई से नियंत्रित पाइपलाइनों में समाहित किया जाएगा। निगरानी के लिए प्रमुख संकेतक हैं:

  • टोकन-दक्षता मेट्रिक्स (Token-efficiency metrics) – क्या 6.57 M टोकन बेसलाइन कम होगी जैसे-जैसे हार्नेस अधिक चयनात्मक ट्राइएज लॉजिक (selective triage logic) प्राप्त करेगा?
  • लेटेंसी रुझान (Latency trends) – जब तीन सत्यापन एजेंट (verification agents) लूप में हों, तो सिस्टम कितनी जल्दी एक पूर्ण रिपोर्ट दे सकता है?

निष्कर्ष

Claude का Deep Research दिखाता है कि जब एक लैंग्वेज मॉडल को एक अनुशासित, बहु-चरणीय पाइपलाइन तक सीमित रखा जाता है, तो वह विश्वसनीय और स्रोत-बद्ध उत्तर दे सकता है। वास्तविक सफलता मॉडल का आकार नहीं है; बल्कि वह आसपास का सॉफ्टवेयर है जो मॉडल को हर दावे को साबित करने, कंप्यूट खर्च करने से पहले साक्ष्यों को रैंक करने और तब तक हर बाहरी स्निपेट को संदिग्ध मानने के लिए मजबूर करता है जब तक कि तीन एजेंट अन्यथा सहमत न हों। AI-संचालित उपकरण बनाने वाले किसी भी व्यक्ति के लिए सबक स्पष्ट है: मॉडल को सोचने दें, लेकिन कोड को यह तय करने दें कि वह क्या कह सकता है।