GSK ने ब्रिटिश बायोटेक फर्म Relation Therapeutics के साथ $110 मिलियन तक के शोध सहयोग (research collaboration) पर हस्ताक्षर किए हैं। यह साझेदारी विशाल, उच्च-रिज़ॉल्यूशन वाले डेटासेट तैयार करेगी जो यह ट्रैक करेंगे कि मानव कोशिकाएं आनुवंशिक परिवर्तनों (genetic alterations) और दवा उपचारों के प्रति कैसे प्रतिक्रिया करती हैं। यह उस डेटा बाधा (data bottleneck) को दूर करता है जिसने AI-संचालित दवा खोज (drug discovery) की गति को धीमा कर दिया है और अणु (molecule) से दवा तक के सफर में लगने वाले वर्षों को कम कर सकता है।
डेटा की समस्या जिसने AI को पीछे रखा है
पिछले दशक के अधिकांश समय में, फार्मा में AI का मूल्यांकन मॉडल के आकार से किया गया है, न कि इनपुट की प्रासंगिकता से। इंटरनेट टेक्स्ट पर प्रशिक्षित लार्ज लैंग्वेज मॉडल्स (LLMs) पैटर्न मैचिंग में उत्कृष्ट हैं, लेकिन जब उनसे यह अनुमान लगाने के लिए कहा जाता है कि कोई यौगिक (compound) जीवित कोशिका के माध्यम से कैसे फैलता है, तो वे लड़खड़ा जाते हैं। जो चीज़ गायब थी, वह थी "वेट लैब" (wet lab) डेटा—वास्तविक प्रयोगों से प्राप्त माप जो किसी जीन के चालू या बंद होने के बाद, या दवा लगाने के बाद होने वाले जैविक प्रभावों के क्रम (cascade) को कैप्चर करते हैं।
Relation Therapeutics इस कमी को पूरा करेगा। समझौते के तहत, यह बड़े पैमाने पर डेटा तैयार करेगा जो सूक्ष्मता से मापेगा कि मानव कोशिकाएं दो चरों (variables) के प्रति कैसे प्रतिक्रिया करती हैं: आनुवंशिक परिवर्तन और दवा हस्तक्षेप (drug interventions)। AI सिस्टम को कोशिकीय व्यवहार का यह विस्तृत (granular) दृश्य प्रदान करके, इस साझेदारी का लक्ष्य मॉडल्स को केवल कच्चे बाइंडिंग अनुमानों (crude binding predictions) से हटाकर संपूर्ण मार्गों (pathways) के सिमुलेशन तक ले जाना है।
ब्लैक-बॉक्स अनुमानों से कोशिकीय सटीकता तक
पारंपरिक AI पाइपलाइन अक्सर एक एकल संख्या आउटपुट करती हैं: इस बात की संभावना कि कोई अणु किसी लक्षित प्रोटीन (target protein) से जुड़ेगा। शोधकर्ता फिर यह परीक्षण करने में महीनों या वर्षों बिताते हैं कि क्या वह बाइंडिंग एक चिकित्सीय प्रभाव (therapeutic effect) में बदलती है। नया दृष्टिकोण एकल-बिंदु अनुमान (single-point estimate) को डाउनस्ट्रीम परिणामों के बहु-आयामी मानचित्र (multi-dimensional map) से बदल देता है। जब एक AI मॉडल यह जान जाता है कि जीन X को हटाने (knocking out) से पाथवे Y सक्रिय होता है, और एक संभावित दवा उसी पाथवे को कम करती है, तो वह बहुत पहले ही प्रभावकारिता (efficacy) का अनुमान लगा सकता है।
इसका लाभ महंगे ट्रायल-एंड-एरर (trial-and-error) प्रयोगों में कमी के रूप में मिलता है। यदि कोई मॉडल विश्वसनीय रूप से पूर्वानुमान लगा सकता है कि कोई यौगिक एक वांछनीय कोशिकीय प्रतिक्रिया को ट्रिगर करेगा, तो कम यौगिकों को संश्लेषित (synthesize), स्क्रीन और खारिज करने की आवश्यकता होगी। इससे R&D खर्च कम होता है और समय सीमा छोटी हो जाती है—ऐसे लाभ जो सीधे तौर पर दवा की मार्केट एक्सक्लूसिविटी विंडो और फार्मा कंपनियों के मुनाफे (bottom line) को प्रभावित करते हैं।
"सही डेटा" एक सुरक्षा कवच (moat) बनता है
यह साझेदारी "बिग डेटा" से "सही डेटा" की ओर बदलाव को रेखांकित करती है। सामान्य उद्देश्य वाले मॉडल्स केवल भारी मात्रा पर फलते-फूलते हैं, लेकिन दवा खोज के लिए ऐसे डेटा की आवश्यकता होती है जो अत्यधिक विशिष्ट हो और जिसे प्राप्त करना कठिन हो। विश्वसनीय कोशिकीय प्रतिक्रिया प्रोफाइल तैयार करने के लिए परिष्कृत उपकरणों (sophisticated instrumentation), कुशल कर्मियों और कड़े गुणवत्ता नियंत्रण की आवश्यकता होती है—ऐसे निवेश जो केवल अच्छी तरह से वित्तपोषित खिलाड़ी ही वहन कर सकते हैं।
जो कंपनियां आनुवंशिक कोड को मापने योग्य कोशिकीय परिणामों से जोड़ने वाली पाइपलाइन की मालिक होंगी, उनके पास सबसे मूल्यवान बौद्धिक संपदा (intellectual property) होगी। ऐसे डेटासेट की विशिष्टता एक रक्षात्मक बाधा (defensive barrier) बनाती है जिसे एक नए न्यूरल नेटवर्क आर्किटेक्चर की तुलना में दोहराना कठिन होता है। बायोटेक संस्थापकों के लिए संदेश स्पष्ट है: अगले एल्गोरिथम ब्रेकथ्रू के पीछे भागने की तुलना में एक डेटा इंजन बनाना अधिक रणनीतिक हो सकता है।
प्रतिपक्ष: केवल डेटा सब कुछ हल नहीं करेगा
आलोचकों का कहना है कि सटीक डेटा भी AI मॉडल्स को गुमराह कर सकता है। ऊतक प्रकारों (tissue types), रोग की स्थितियों और रोगी जनसांख्यिकी (demographics) के आधार पर कोशिकाएं भिन्न होती हैं; एक संदर्भ में कैप्चर किया गया डेटासेट दूसरे पर लागू नहीं हो सकता है। विशाल, उच्च-गुणवत्ता वाले डेटासेट तैयार करने और उन्हें व्यवस्थित करने की लागत मॉडल्स को प्रशिक्षित करने के खर्च से कहीं अधिक हो सकती है, जिससे छोटी फर्मों के लिए स्केलेबिलिटी (scalability) के सवाल खड़े होते हैं।
नियामक (Regulators) भी महत्वपूर्ण हैं। जो प्रेडिक्टिव AI मानव जीव विज्ञान का अनुकरण करने का दावा करता है, उसे अंततः नैदानिक परिणामों (clinical outcomes) के विरुद्ध सत्यापित किया जाना चाहिए, जिससे जांच का एक स्तर बढ़ जाता है। यदि उद्योग पर्याप्त वास्तविक दुनिया के परीक्षण के बिना इन-सिलिको (in-silico) भविष्यवाणियों पर बहुत अधिक निर्भर रहता है, तो आशाजनक उम्मीदवारों के परीक्षणों में विफल होने पर उसे झटकों का सामना करना पड़ सकता है।
आगे क्या देखें
अगले कुछ महीने यह स्पष्ट कर देंगे कि क्या GSK-Relation का प्रयास वादे के मुताबिक पैमाने पर उपयोगी डेटा दे सकता है। प्रमुख संकेतकों में शामिल हैं:
- बेंचमार्क डेटासेट का प्रकाशन जिसे अन्य शोधकर्ता (प्रतिबंधित शर्तों के तहत भी) एक्सेस कर सकें
- शुरुआती चरण के AI मॉडल्स जो एक टेस्ट सेट पर पारंपरिक स्क्रीनिंग विधियों की तुलना में स्पष्ट रूप से बेहतर प्रदर्शन करते हों
- अन्य प्रमुख फार्मा कंपनियों से आगामी निवेश, जो इस बात का संकेत हो कि डेटा दृष्टिकोण को दोहराया जा सकता है
यदि इस सहयोग से हिट-रेट (hit-rate) या चक्र समय (cycle time) में ठोस सुधार होता है, तो यह इसी तरह के सौदों की एक लहर शुरू कर सकता है, जिससे उद्योग के R&D बजट के आवंटन का तरीका बदल जाएगा। इसके विपरीत, यदि डेटा बहुत अधिक शोर वाला (noisy) या एकीकृत करने में महंगा साबित होता है, तो कंपनियां हाइब्रिड दृष्टिकोणों की ओर वापस लौट सकती हैं जो AI को पारंपरिक हाई-थ्रूपुट स्क्रीनिंग के साथ मिलाते हैं।
मुख्य निष्कर्ष
उच्च-सटीकता वाले सेलुलर डेटा पर GSK का $110 मिलियन का दांव एक निर्णायक बदलाव का संकेत देता है: AI ड्रग डिस्कवरी में, सबसे निर्णायक लाभ तेजी से उन जैविक संकेतों की गुणवत्ता और विशिष्टता होगी जो मॉडलों को प्रशिक्षित करते हैं, न कि केवल एल्गोरिदम का आकार।
