Claude के स्वायत्त प्रोटीन-बाइंडर अभियान ने 27% हिट रेट दर्ज किया, जो मानव-संचालित प्रयोगशालाओं के विशिष्ट 10-15% से बेहतर है और उसी लक्ष्य पर किए गए समानांतर मानव प्रयास से भी आगे है। यह परिणाम दिखाता है कि एक विशाल, अच्छी तरह से तैयार किया गया प्रॉम्प्ट एक भाषा मॉडल को वर्चुअल बायोटेक वर्कफ़्लो में बदल सकता है, लेकिन यह यह भी उजागर करता है कि जब मॉडल के कॉन्फिडेंस मेट्रिक्स गलत हो जाते हैं, तो यह दृष्टिकोण कितना नाजुक बना रहता है।

आंकड़ों में प्रयोग

Anthropic ने अपने Claude मॉडल को एक पूर्ण-स्तरीय प्रोटीन डिज़ाइन प्रोटोकॉल और एक निश्चित GPU बजट दिया, और फिर इसे 16 प्रोटीन लक्ष्यों पर एंड-टू-एंड अभियान चलाने दिया। लैब-साइड विफलता के कारण एक लक्ष्य को हटा दिया गया, जिससे 15 व्यवहार्य अभियान बचे। उनमें से Claude ने 1,320 उम्मीदवार सीक्वेंस जेनरेट किए; प्रयोगशाला परीक्षण ने 354 को 'ट्रू बाइंडर्स' के रूप में पुष्टि की, जिससे 26.8% की सफलता दर प्राप्त हुई।

तुलना के लिए, अधिकांश मानव-नेतृत्व वाले बाइंडर प्रोजेक्ट 10% से 15% के बीच हिट रेट की रिपोर्ट करते हैं। RBX1 लक्ष्य पर सीधे मुकाबले में, मानव प्रतिभागियों ने 3.7% हिट रेट हासिल किया जबकि Claude के डिज़ाइनों ने 31.1% हासिल किया। मॉडल ने सेल्फ-रैंकिंग में भी क्षमता साबित की: Claude ने जिस एकल डिज़ाइन को अपना सर्वश्रेष्ठ बताया था, वह 49% बार सफल रहा, और शीर्ष दस डिज़ाइनों ने 39% बार सफलता प्राप्त की।

जहाँ सिस्टम विफल रहा

ये आंकड़े दो बड़ी कमियों को छिपाते हैं। Claude MBP लक्ष्य पर पूरी तरह विफल रहा और TNFα लक्ष्य पर खराब प्रदर्शन किया, फिर भी उन रन के लिए इसके आंतरिक कॉन्फिडेंस स्कोर उच्च रहे। दूसरे शब्दों में, मॉडल को विश्वास था कि वह सफल हो रहा है, जबकि वेट-लैब रीडआउट्स कुछ और ही कहानी बता रहे थे। वे गलत तरीके से कैलिब्रेट किए गए संकेत एक जोखिम को उजागर करते हैं: एक स्वायत्त पाइपलाइन जो अपने स्वयं के मेट्रिक्स पर भरोसा करती है, वह व्यर्थ के प्रयोगों पर संसाधन बर्बाद कर सकती है।

प्रॉम्प्ट इंजीनियरिंग: एक नया लैब नोटबुक

अध्ययन का सबसे चौंकाने वाला पहलू जीव विज्ञान नहीं बल्कि वह प्रॉम्प्ट है जिसने इसे संचालित किया। एक वरिष्ठ वैज्ञानिक आमतौर पर यह तय करने में हफ्तों बिताता है कि किन प्रोटीन क्षेत्रों की खोज करनी है, किन कंप्यूटेशनल टूल्स का उपयोग करना है, और कंप्यूट समय कैसे आवंटित करना है। Anthropic ने उस विशेषज्ञता को 16,000 शब्दों के एक प्रॉम्प्ट में समेट दिया—जो लगभग एक लघु उपन्यास की लंबाई के बराबर है। टेक्स्ट का लगभग दो-तिहाई हिस्सा परिचालन संबंधी चिंताओं से संबंधित था: समय, बजट की निगरानी, और उन सब-एजेंट्स का समन्वय करना जो बाहरी सॉफ़्टवेयर को कॉल करते थे।

Claude ने RFdiffusion (एक डिफ्यूजन-आधारित स्ट्रक्चर जनरेटर) और ProteinMPNN (एक सीक्वेंस डिज़ाइन नेटवर्क) जैसे ओपन-सोर्स डिज़ाइन इंजन का उपयोग किया। भाषा मॉडल एक शेड्यूलर के रूप में कार्य करता था, जो इन टूल्स के बीच मध्यवर्ती परिणाम भेजता था, पैरामीटरों को समायोजित करता था, और यह निर्णय लेता था कि डिज़ाइन चक्र को कब रोकना है। प्रभावी रूप से, प्रॉम्प्ट एक वर्चुअल प्रयोगशाला प्रबंधक बन गया, जिसने मानव वैज्ञानिकों को वर्कफ़्लो समन्वय की बारीकियों से मुक्त कर दिया।

बाइंडर वास्तव में क्या हैं

सभी 354 पुष्ट हिट्स ऐसे अणु हैं जो भौतिक रूप से अपने लक्षित प्रोटीन से जुड़ते हैं। पेपर बाइंडिंग एसेज़ की रिपोर्ट करता है लेकिन कार्यात्मक डेटा प्रदान नहीं करता है—कोई प्रमाण नहीं है कि कोई बाइंडर गतिविधि को नियंत्रित करता है, कन्फ़ॉर्मेशन को स्थिर करता है, या चिकित्सीय क्षमता प्रदर्शित करता है। इसी तरह, संरचनात्मक सत्यापन (जैसे, X-ray क्रिस्टलोग्राफी या cryo-EM) अनुपस्थित है, इसलिए सटीक बाइंडिंग मोड काल्पनिक बना हुआ है। इसलिए, यह अभियान तेजी से बाइंडर खोज के लिए एक प्रूफ-ऑफ-कॉन्सेप्ट प्रदर्शित करता है, न कि ऐसा पाइपलाइन जो ड्रग कैंडिडेट प्रदान करता है।

बायोटेक और AI अनुसंधान के लिए दांव

यदि प्रॉम्प्ट-संचालित मॉडल विश्वसनीय रूप से मानव हिट रेट को दोहरा सकता है या उससे अधिक हो सकता है, तो बायोटेक कंपनियां प्रारंभिक चरण की खोज की लागत और समय में भारी कटौती कर सकती हैं। हालांकि, MBP और TNFα पर गलत तरीके से कैलिब्रेट किए गए कॉन्फिडेंस स्कोर यह दर्शाते हैं कि पूरी तरह से स्वचालित (hands-off) सिस्टम अभी उत्पादन के लिए तैयार नहीं है। कंपनियों को कॉन्फिडेंस मेट्रिक्स की व्याख्या करने और कार्यात्मक प्रासंगिकता को मान्य करने के लिए अभी भी मानवीय निरीक्षण की आवश्यकता होगी।

AI के दृष्टिकोण से, यह कार्य "टूल" और "एजेंट" के बीच की रेखा को धुंधला करता है। Claude कोई नया प्रोटीन-डिज़ाइन एल्गोरिदम नहीं है; यह एक सामान्य-उद्देश्यीय भाषा मॉडल है जो पर्याप्त विस्तृत निर्देश सेट दिए जाने पर मौजूदा विशिष्ट टूल्स का समन्वय कर सकता है। प्रयोग एक ऐसे भविष्य का सुझाव देता है जहाँ AI किसी एकल घटक को बदलने के बजाय, ओपन-सोर्स वैज्ञानिक सॉफ़्टवेयर के एक मॉड्यूलर इकोसिस्टम को एक साथ जोड़ने वाले गोंद (glue) के रूप में कार्य करता है।

प्रतिवाद: प्रॉम्प्ट जटिलता की छिपी हुई लागत

जबकि अध्ययन 16,000 शब्दों के प्रॉम्प्ट को ज्ञान कैप्चर की जीत के रूप में पेश करता है, उस प्रॉम्प्ट का आकार ही व्यावहारिक चिंताएं पैदा करता है। ऐसे दस्तावेज़ तैयार करने के लिए गहरी डोमेन विशेषज्ञता, अंतर्निहित टूल्स की जानकारी और एज केसेस का अनुमान लगाने की क्षमता की आवश्यकता होती है। दूसरे शब्दों में, विशेषज्ञता गायब नहीं हुई है—यह लैब वैज्ञानिकों से प्रॉम्प्ट इंजीनियरों की ओर स्थानांतरित हो गई है।

इसके अलावा, एक निश्चित GPU बजट पर निर्भरता अन्वेषण की गहराई पर एक कठोर प्रतिबंध लगाती है। मानव टीमें अंतरिम परिणामों के आधार पर संसाधनों का गतिशील रूप से पुनर्वितरण कर सकती हैं, जबकि Claude का अभियान एक पूर्व-निर्धारित बजट के अनुसार चला, जिससे संभावित रूप से नमूना लिए गए अनुक्रम स्थान (sequence space) की व्यापकता सीमित हो सकती है।

आगे क्या देखें

Anthropic का पेपर कई अनुत्तरित प्रश्न छोड़ देता है। भविष्य के कार्यों में कॉन्फिडेंस कैलिब्रेशन (confidence calibration) को संबोधित करने की आवश्यकता होगी ताकि मॉडल का स्व-मूल्यांकन प्रायोगिक परिणामों के अनुरूप हो सके। कार्यात्मक परख (functional assays)—जैसे कि एंजाइमी निषेध (enzymatic inhibition) या कोशिकीय गतिविधि—को स्वायत्त लूप में एकीकृत करने से यह तकनीक केवल बाइंडर पहचान के बजाय दवा की खोज (drug discovery) के अधिक करीब पहुंच जाएगी। अंत में, विभिन्न बजट स्थितियों के तहत और लक्ष्यों के एक व्यापक सेट पर इस दृष्टिकोण का बेंचमार्किंग यह स्पष्ट करेगा कि देखा गया हिट रेट पुनरुत्पादनीय है या केवल एक आउटलायर है।

निष्कर्ष स्पष्ट है: विस्तृत प्रॉम्प्ट ऑर्केस्ट्रेशन एक भाषा मॉडल को एक वर्चुअल बायोटेक लैब में बदल सकता है, जो ऐसे बाइंडर हिट रेट प्रदान कर सकता है जो मानवीय औसत से कहीं अधिक हों। फिर भी, यह दृष्टिकोण अभी भी विशेषज्ञ प्रॉम्प्ट लेखन पर निर्भर है और कॉन्फिडेंस की चूक (confidence misfires) से ग्रस्त है जो महंगे प्रयोगों को विफल कर सकती है। जैसे-जैसे समुदाय इन पाइपलाइनों को परिष्कृत करेगा, AI स्वायत्तता और मानवीय निरीक्षण के बीच का संतुलन यह निर्धारित करेगा कि क्या ऐसे सिस्टम नियमित उपकरण बन जाएंगे या केवल प्रायोगिक जिज्ञासा बनकर रह जाएंगे।