GSK ने ब्रिटिश बायोटेक कंपनी Relation Therapeutics सोबत $110 दशलक्षपर्यंतच्या मूल्याचा संशोधन करार केला आहे. या भागीदारीमुळे मानवी पेशी जनुकीय बदल आणि औषध उपचारांना कशा प्रकारे प्रतिसाद देतात, याचा मागोवा घेणारे प्रचंड आणि उच्च-रिझोल्यूशन डेटासेट तयार केले जातील. हे AI-आधारित औषध शोध प्रक्रियेत अडथळा ठरणाऱ्या 'डेटा बॉटलनेक'वर (माहितीचा अडथळा) प्रहार करते आणि रेणूपासून (molecule) औषधापर्यंतचा प्रवास कित्येक वर्षे कमी करू शकते.
AI ला मागे खेचणारा डेटाचा प्रश्न
गेल्या दशकातील बहुतांश काळ, फार्मा क्षेत्रातील AI चे मूल्यमापन मॉडेलच्या आकारावरून केले गेले आहे, इनपुटच्या सुसंगततेवरून नाही. इंटरनेटवरील मजकुरावर प्रशिक्षित केलेले लार्ज लँग्वेज मॉडेल्स पॅटर्न मॅचिंगमध्ये उत्कृष्ट आहेत, परंतु एखादा घटक जिवंत पेशीमध्ये कसा परिणाम करतो, याचे भाकीत करण्यास सांगून घेतल्यास ते अडखळतात. यात जो महत्त्वाचा घटक गहाळ होता, तो म्हणजे "wet lab" डेटा—म्हणजेच प्रत्यक्ष प्रयोगातून मिळालेली मोजमापे, जी एखादे जनुक (gene) सुरू किंवा बंद केल्यानंतर किंवा औषध लागू केल्यानंतर होणाऱ्या जैविक परिणामांचा क्रम टिपतात.
Relation Therapeutics ही पोकळी भरून काढेल. या करारानुसार, मानवी पेशी दोन चलांना (variables) कशा प्रकारे प्रतिसाद देतात: जनुकीय बदल आणि औषध हस्तक्षेप, याचे सूक्ष्म मापन करणारा मोठ्या प्रमाणावरील डेटा ते तयार करतील. AI प्रणालींना पेशींच्या वर्तनाचे हे सूक्ष्म स्वरूप उपलब्ध करून देऊन, ही भागीदारी मॉडेल्सना केवळ कच्च्या 'बाइंडिंग प्रेडिक्शन्स'कडून (binding predictions) संपूर्ण 'पाथवे सिम्युलेशन'कडे नेण्याचे उद्दिष्ट ठेवते.
'ब्लॅक-बॉक्स' प्रेडिक्शन्सपासून पेशींच्या अचूकतेपर्यंत
पारंपारिक AI पाइपलाईन्स अनेकदा एकच आकडा देतात: एखादा रेणू लक्ष्यित प्रथिनाशी (target protein) बांधला जाण्याची शक्यता. त्यानंतर संशोधक हे तपासण्यासाठी महिने किंवा वर्षे घालवतात की ते बाइंडिंग उपचारात्मक परिणामात रूपांतरित होते की नाही. नवीन दृष्टिकोन या एकल-बिंदू अंदाजाची जागा पुढील परिणामांच्या (downstream outcomes) बहुआयामी नकाशाने घेतो. जेव्हा एखादे AI मॉडेल हे जाणून घेते की जनुक X काढून टाकल्यामुळे पाथवे Y सक्रिय होतो आणि एखादे संभाव्य औषध त्याच पाथवेला कमी करते, तेव्हा ते खूप लवकर परिणामकारकता ओळखू शकते.
याचा फायदा म्हणजे खर्चिक 'ट्रायल-अँड-एरर' प्रयोगांमध्ये होणारी घट. जर एखादे मॉडेल विश्वासार्हपणे भाकीत करू शकले की एखादा घटक अपेक्षित पेशी प्रतिसाद देईल, तर कमी संयुगे (compounds) संश्लेषित, स्क्रीन आणि बाद करण्याची गरज पडेल. यामुळे R&D खर्च कमी होतो आणि कालमर्यादा कमी होते—या फायद्यांचा थेट परिणाम औषधाच्या मार्केट एक्सक्लुझिव्हिटी विंडोवर आणि फार्मा कंपन्यांच्या नफ्यावर होतो.
"योग्य डेटा" हे संरक्षण कवच (moat) बनेल
ही भागीदारी "big data" कडून "right data" कडे होणाऱ्या बदलावर प्रकाश टाकते. सामान्य वापरासाठीची मॉडेल्स केवळ मोठ्या प्रमाणावरील डेटावर अवलंबून असतात, परंतु औषध शोध प्रक्रियेसाठी अत्यंत विशिष्ट आणि मिळवणे कठीण असलेल्या डेटाची आवश्यकता असते. विश्वासार्ह सेल्युलर रिस्पॉन्स प्रोफाइल्स तयार करण्यासाठी प्रगत उपकरणे, कुशल कर्मचारी आणि कडक गुणवत्ता नियंत्रणाची आवश्यकता असते—यामध्ये केवळ मोठ्या प्रमाणात निधी असलेले खेळाडूच गुंतवणूक करू शकतात.
ज्या कंपन्यांकडे जनुकीय कोड आणि मोजता येण्याजोग्या पेशींच्या परिणामांना जोडणारी पाइपलाइन असेल, त्यांच्याकडे सर्वात मौल्यवान बौद्धिक संपदा (intellectual property) असेल. अशा डेटासेटची अनन्यता (exclusivity) एक असा संरक्षणात्मक अडथळा निर्माण करते जो नवीन न्यूरल नेटवर्क आर्किटेक्चरपेक्षा तयार करणे कठीण असते. बायोटेक संस्थापकांसाठी संदेश स्पष्ट आहे: पुढील अल्गोरिदमिक शोध घेण्यापेक्षा डेटा इंजिन तयार करणे अधिक धोरणात्मक ठरू शकते.
प्रतिवाद: केवळ डेटा सर्व काही सोडवणार नाही
टीकाकारांचे म्हणणे आहे की अगदी अचूक डेटा देखील AI मॉडेल्सना दिशाभूल करू शकतो. पेशी ऊतींचे प्रकार (tissue types), आजारांची स्थिती आणि रुग्णांच्या लोकसंख्याशास्त्रीय वैशिष्ट्यांनुसार भिन्न असतात; एका संदर्भात गोळा केलेला डेटा सर्वत्र लागू पडेलच असे नाही. मोठ्या प्रमाणावरील, उच्च-गुणवत्तेचे डेटासेट तयार करण्याचा आणि त्यांचे व्यवस्थापन करण्याचा खर्च मॉडेल्स प्रशिक्षित करण्याच्या खर्चापेक्षाही जास्त असू शकतो, ज्यामुळे लहान कंपन्यांसाठी स्केलेबिलिटीचे प्रश्न निर्माण होतात.
नियामक (Regulators) देखील महत्त्वाचे आहेत. मानवी जीवशास्त्राचे सिम्युलेशन करण्याचा दावा करणाऱ्या प्रेडिक्टिव्ह AI ला शेवटी क्लिनिकल निकालांच्या आधारे प्रमाणित करावे लागेल, ज्यामुळे तपासणीचा स्तर वाढेल. जर उद्योग पुरेसा वास्तविक जगातील चाचणी न करता केवळ in-silico अंदाजांवर अवलंबून राहिला, तर आशाजनक उमेदवार चाचण्यांमध्ये अपयशी ठरल्यास त्यांना अडचणींचा सामना करावा लागू शकतो.
पुढे काय पाहावे
पुढील काही महिने हे स्पष्ट करतील की GSK-Relation चा प्रयत्न वचन दिलेल्या प्रमाणात वापरण्यायोग्य डेटा देऊ शकेल की नाही. मुख्य निर्देशकांमध्ये खालील गोष्टींचा समावेश आहे:
- बेंचमार्क डेटासेटचे प्रकाशन जे इतर संशोधक वापरू शकतील (अगदी मर्यादित अटींनुसारही)
- सुरुवातीच्या टप्प्यातील AI मॉडेल्स जे टेस्ट सेटवर पारंपारिक स्क्रीनिंग पद्धतींपेक्षा स्पष्टपणे सरस कामगिरी करतात
- इतर मोठ्या फार्मा कंपन्यांकडून होणारी पुढील गुंतवणूक, जी डेटा दृष्टिकोन पुनरावृत्ती करण्यायोग्य आहे यावरील विश्वास दर्शवते
जर या सहकार्यामुळे hit-rate किंवा सायकल टाइममध्ये ठोस सुधारणा झाली, तर यामुळे अशाच प्रकारच्या करारांची लाट येऊ शकते, ज्यामुळे उद्योग R&D निधी कसा वाटप करतो याचे स्वरूप बदलेल. याउलट, जर डेटा खूप गोंधळलेला (noisy) किंवा एकत्रित करणे खूप खर्चिक ठरले, तर कंपन्या AI आणि पारंपारिक हाय-थ्रूपुट स्क्रीनिंग यांचे मिश्रण असलेल्या हायब्रिड दृष्टिकोनाकडे परत जाऊ शकतात.
मुख्य निष्कर्ष
GSK चा उच्च-तंतोतंत सेल्युलर डेटावरील $११० दशलक्षचा डाव एक निर्णायक वळण दर्शवतो: AI औषध शोधामध्ये, सर्वात निर्णायक फायदा हा अधिकाधिक प्रमाणात मॉडेल्सना प्रशिक्षित करणाऱ्या जैविक सिग्नलची गुणवत्ता आणि अनन्यता असेल, केवळ अल्गोरिदमच्या आकारावर अवलंबून नसेल.
