क्लॉडच्या (Claude's) स्वायत्त प्रोटीन-बाइंडर मोहिमेने २७% हिट रेट नोंदवला, जो मानवी प्रयोगशाळांच्या १०-१५% च्या सरासरीपेक्षा जास्त आहे आणि एकाच टार्गेटवर केलेल्या समांतर मानवी प्रयत्नांनाही मागे टाकणारा आहे. हे निकाल दर्शवतात की, एक प्रचंड आणि सुव्यवस्थित तयार केलेला प्रॉम्प्ट (prompt) लँग्वेज मॉडेलला व्हर्च्युअल बायोटेक वर्कफ्लोमध्ये रूपांतरित करू शकतो, परंतु मॉडेलचे कॉन्फिडन्स मेट्रिक्स (confidence metrics) चुकू लागल्यास हा दृष्टिकोन किती नाजूक राहतो, हे देखील यातून अधोरेखित होते.
आकडेवारीनुसार प्रयोग
अँथ्रोपिकने (Anthropic) त्यांच्या क्लॉड मॉडेलला पूर्ण-स्तरीय प्रोटीन डिझाइन प्रोटोकॉल आणि एक निश्चित GPU बजेट दिले, आणि त्यानंतर त्याला १६ प्रोटीन टार्गेट्सवर एंड-टू-एंड मोहीम राबवू दिले. प्रयोगशाळेतील अपयशामुळे एक टार्गेट वगळण्यात आले, ज्यामुळे १५ व्यवहार्य मोहिमा शिल्लक राहिल्या. त्यातून क्लॉडने १,३२० उमेदवार सिक्वेन्स (candidate sequences) तयार केले; प्रयोगशाळेतील चाचण्यांनी ३५४ सिक्वेन्स खरे बायंडर्स (true binders) असल्याचे पुष्टी केली, ज्यामुळे २६.८% यश दर प्राप्त झाला.
तुलनेसाठी, मानवाद्वारे नेतृत्व केलेल्या बहुतेक बाइंडर प्रकल्पांमध्ये १०% ते १५% दरम्यान हिट रेट नोंदवला जातो. RBX1 टार्गेटवर थेट तुलना केली असता, मानवी सहभागींनी ३.७% हिट रेट मिळवला, तर क्लॉडच्या डिझाइन्सनी ३१.१% हिट रेट गाठला. मॉडेलने स्वतःची रँकिंग करण्याची क्षमता देखील सिद्ध केली: क्लॉडने सर्वोत्तम म्हणून सूचित केलेले एक डिझाइन ४९% वेळा यशस्वी झाले आणि पहिल्या दहा डिझाइन्सचा यश दर ३९% होता.
प्रणाली कुठे कमी पडली
या आकडेवारीमध्ये दोन स्पष्ट त्रुटी (blind spots) लपलेल्या आहेत. क्लॉड MBP टार्गेटवर पूर्णपणे अपयशी ठरले आणि TNFα टार्गेटवर खराब कामगिरी केली, तरीही त्या प्रयोगांसाठी त्याचे अंतर्गत कॉन्फिडन्स स्कोअर (confidence scores) उच्च राहिले. दुसऱ्या शब्दांत, मॉडेलला वाटत होते की ते यशस्वी होत आहे, परंतु वेट-लॅब (wet-lab) रिडींग्स वेगळीच गोष्ट सांगत होते. हे चुकीच्या पद्धतीने कॅलिब्रेट केलेले संकेत एक धोका दर्शवतात: स्वतःच्या मेट्रिक्सवर विश्वास ठेवणारी स्वायत्त पाइपलाइन निरर्थक प्रयोगांवर संसाधने वाया घालवू शकते.
प्रॉम्प्ट इंजिनिअरिंग: नवीन लॅब नोटबुक म्हणून
या अभ्यासाचा सर्वात लक्षवेधी पैलू जीवशास्त्र नसून त्याला चालवणारा प्रॉम्प्ट आहे. एक वरिष्ठ शास्त्रज्ञ सहसा कोणते प्रोटीन भाग तपासायचे, कोणते कॉम्प्युटेशनल टूल्स वापरायचे आणि कॉम्प्युट टाइम कसा वाटप करायचा हे ठरवण्यासाठी अनेक आठवडे घालवतो. अँथ्रोपिकने ही सर्व तज्ज्ञता १६,००० शब्दांच्या एका प्रॉम्प्टमध्ये सामावली—जी साधारणपणे एका लघुकथेच्या लांबीइतकी आहे. या मजकुरापैकी सुमारे दोन-तृतीयांश भाग कार्यात्मक बाबींशी संबंधित होता: वेळ, बजेट मॉनिटरिंग आणि बाह्य सॉफ्टवेअर वापरणाऱ्या सब-एजंट्सचे (sub-agents) समन्वय साधणे.
क्लॉडने RFdiffusion (एक डिफ्यूजन-आधारित स्ट्रक्चर जनरेटर) आणि ProteinMPNN (एक सिक्वेन्स डिझाइन नेटवर्क) सारख्या ओपन-सोर्स डिझाइन इंजिन्सचा वापर केला. लँग्वेज मॉडेलने एका शेड्युलरप्रमाणे (scheduler) काम केले, जे या टूल्समध्ये मध्यवर्ती निकाल देणे, पॅरामीटर्स (parameters) समायोजित करणे आणि डिझाइन सायकल कधी थांबवायची हे ठरवत असे. परिणामी, तो प्रॉम्प्ट एका व्हर्च्युअल प्रयोगशाळा व्यवस्थापकाप्रमाणे (virtual laboratory manager) बनला, ज्यामुळे मानवी शास्त्रज्ञांना वर्कफ्लो समन्वयातील बारकाव्यांपासून मुक्तता मिळाली.
बायंडर्स प्रत्यक्षात काय आहेत
पुष्टी થયलेले सर्व ३५४ हिट्स हे असे रेणू (molecules) आहेत जे त्यांच्या टार्गेट प्रोटीन्सना भौतिकरित्या जोडले जातात. पेपरमध्ये बाइंडिंग असेस (binding assays) चा उल्लेख आहे, परंतु कार्यात्मक डेटा दिलेला नाही—कोणताही बाइंडर क्रिया नियंत्रित करतो, कन्फर्मेशन स्थिर करतो किंवा उपचारात्मक क्षमता दर्शवतो याचा कोणताही पुरावा नाही. त्याचप्रमाणे, स्ट्रक्चरल व्हॅलिडेशन (उदा. X-ray crystallography किंवा cryo-EM) उपलब्ध नाही, त्यामुळे नेमकी बाइंडिंग पद्धत केवळ एक अंदाज आहे. त्यामुळे ही मोहीम जलद बाइंडर शोधण्यासाठी एक 'प्रूफ-ऑफ-कॉन्सेप्ट' (proof-of-concept) आहे, औषध उमेदवार (drug candidates) देणारी पाइपलाइन नाही.
बायोटेक आणि AI संशोधनासाठीचे महत्त्व
जर प्रॉम्प्ट-चालित मॉडेल मानवी हिट रेट्सची विश्वासार्हपणे पुनरावृत्ती करू शकले किंवा त्यापेक्षा जास्त कामगिरी करू शकले, तर बायोटेक कंपन्या सुरुवातीच्या टप्प्यातील संशोधनाचा खर्च आणि वेळ मोठ्या प्रमाणात कमी करू शकतात. तथापि, MBP आणि TNFα वरील चुकीचे कॉन्फिडन्स स्कोअर हे दर्शवतात की, पूर्णपणे मानवी हस्तक्षेपाशिवाय चालणारी प्रणाली अद्याप उत्पादनासाठी (production) तयार नाही. कॉन्फिडन्स मेट्रिक्सचा अर्थ लावण्यासाठी आणि कार्यात्मक सुसंगतता तपासण्यासाठी कंपन्यांना अजूनही मानवी देखरेखीची (human oversight) गरज भासेल.
AI च्या दृष्टिकोनातून, हे कार्य 'टूल' (tool) आणि 'एजंट' (agent) मधील रेषा धूसर करते. क्लॉड हा नवीन प्रोटीन-डिझाइन अल्गोरिदम नाही; तो एक सामान्य-उद्देशीय लँग्वेज मॉडेल आहे जो पुरेशी तपशीलवार सूचना मिळाल्यास अस्तित्वात असलेली विशेष टूल्स नियंत्रित करू शकतो. हा प्रयोग असे भविष्य सुचवतो जिथे AI कोणत्याही एका घटकाला बदलण्याऐवजी, ओपन-सोर्स वैज्ञानिक सॉफ्टवेअरच्या मॉड्युलर इकोसिस्टमला एकत्र बांधणारा 'गोंद' (glue) म्हणून काम करेल.
प्रतिवाद: प्रॉम्प्टच्या जटिलतेचा छुपा खर्च
अभ्यासात १६,००० शब्दांच्या प्रॉम्प्टला ज्ञान संकलनाचा विजय म्हणून सादर केले असले तरी, त्या प्रॉम्प्टच्या आकारामुळे काही व्यावहारिक चिंता निर्माण होतात. असा दस्तऐवज तयार करण्यासाठी सखोल डोमेन तज्ज्ञता, मूळ टूल्सची ओळख आणि 'एज केसेस' (edge cases) ओळखण्याची क्षमता आवश्यक असते. दुसऱ्या शब्दांत, तज्ज्ञता नाहीशी झालेली नाही—ती केवळ लॅबमधील शास्त्रज्ञांकडून प्रॉम्प्ट इंजिनिअर्सकडे स्थलांतरित झाली आहे.
शिवाय, ठराविक GPU बजेटवर अवलंबून राहिल्यामुळे शोध घेण्याच्या खोलीवर (exploration depth) एक कठोर मर्यादा येते. मानवी पथके मध्यंतरीच्या निकालांच्या आधारे संसाधनांचे गतिशील पुनर्वितरण करू शकतात, तर Claude ची मोहीम पूर्व-निर्धारित बजेटचे पालन करत होती, ज्यामुळे नमुना घेतलेल्या सिक्वेन्स स्पेसची व्याप्ती मर्यादित होण्याची शक्यता आहे.
पुढे काय पाहावे
Anthropic च्या शोधनिबंधात अनेक प्रश्न अनुत्तरित राहतात. भविष्यातील कामामध्ये कॉन्फिडन्स कॅलिब्रेशनवर (confidence calibration) लक्ष केंद्रित करणे आवश्यक असेल, जेणेकरून मॉडेलचे स्वयं-मूल्यांकन प्रायोगिक परिणामांशी सुसंगत असेल. फंक्शनल असेसमेंट्स—जसे की एंझाइमॅटिक इनहिबिशन किंवा सेल्युलर ॲक्टिव्हिटी—स्वायत्त लूपमध्ये समाविष्ट केल्यास, हे तंत्रज्ञान केवळ 'बाइंडर आयडेंटिफिकेशन'च्या पलीकडे जाऊन 'ड्रग डिस्कव्हरी'च्या अधिक जवळ येईल. शेवटी, विविध लक्ष्यांवर (targets) आणि बदलत्या बजेट परिस्थितीत या पद्धतीचे बेंचमार्किंग केल्यास, दिसून आलेला 'हिट रेट' हा पुनरुत्पादनीय आहे की केवळ एक अपवाद (outlier) आहे, हे स्पष्ट होईल.
निष्कर्ष स्पष्ट आहे: तपशीलवार प्रॉम्प्ट ऑर्केस्ट्रेशन एका लँग्वेज मॉडेलला आभासी बायोटेक लॅबमध्ये रूपांतरित करू शकते, ज्यामुळे मानवी सरासरीपेक्षा जास्त 'बाइंडर हिट रेट्स' मिळू शकतात. तरीही, ही पद्धत अजूनही तज्ज्ञ प्रॉम्प्ट लेखनावर अवलंबून आहे आणि कॉन्फिडन्स मिसफायरमुळे (चुकीच्या अंदाजांमुळे) महागड्या प्रयोगांना धोका निर्माण होऊ शकतो. जसजसे समुदाय या पाइपलाईन्समध्ये सुधारणा करेल, तसतसे AI स्वायत्तता आणि मानवी देखरेख यांच्यातील संतुलन या प्रणाली नियमित साधने बनतील की केवळ प्रायोगिक कुतूहल म्हणून राहतील, हे ठरवेल.
