संशोधकांनी दाखवून दिले आहे की, रेषीय स्वरूपात विस्तारण्यायोग्य (linearly scalable) लाँग-कॉन्टेक्स्ट ट्रान्सफॉर्मर्स, मानक ट्रान्सफॉर्मर्समध्ये आढळणाऱ्या मेमरीच्या अनियंत्रित वाढीशिवाय (memory blow-up) प्रथिन सिक्वेन्सवर (protein sequences) मास्क्ड लँग्वेज मॉडेल्स प्रशिक्षित करू शकतात. मेमरीचा खर्च वर्ग (quadratic) वरून रेषीय (linear) मध्ये बदलून, ही पद्धत शास्त्रज्ञांना पूर्वीच्या तुलनेत अधिक लांब प्रथिने हाताळण्यास सक्षम करते, जे औषध शोध (drug discovery) आणि बायोटेक संशोधनाला गती देणारे पाऊल ठरू शकते.
मानक ट्रान्सफॉर्मर्सना मर्यादा का येतात
प्रथिन डेटाबेसमध्ये असे सिक्वेन्स असतात जे अनेकदा हजारो अमिनो ॲसिड्सपर्यंत विस्तारलेले असतात. पारंपारिक ट्रान्सफॉर्मर मॉडेल्स प्रत्येक जोडीमधील 'अटेंशन' (attention) मोजतात, ही प्रक्रिया सिक्वेन्सच्या लांबीच्या वर्गाप्रमाणे (square) वाढते. जसा सिक्वेन्स वाढतो, तसा मेमरीचा वापर प्रचंड वाढतो, ज्यामुळे संशोधकांना प्रथिने कापून टाकणे किंवा त्यांचे तुकडे करणे भाग पडते. संदर्भाचा (context) हा अभाव, साखळीच्या मोठ्या भागांवर पसरलेल्या स्ट्रक्चरल मोटिफ्सना (structural motifs) शिकण्याच्या मॉडेलच्या क्षमतेत अडथळा आणतो.
रेषीय-स्केलमधील (linear-scale) मोठी प्रगती
ही नवीन पद्धत पूर्ण 'सेल्फ-अटेंशन'च्या जागी अशी रचना आणते ज्याची मेमरी सिक्वेन्सच्या लांबीनुसार केवळ रेषीय पद्धतीने वाढते. प्रत्यक्ष वापरात, हे मॉडेल संपूर्ण प्रथिन एकाच वेळी ग्रहण करू शकते, ज्यामुळे फोल्डिंग आणि कार्यासाठी अत्यंत महत्त्वाच्या असलेल्या दीर्घ-अंतरावरील परस्परक्रिया (long-range interactions) जतन केल्या जातात. या अल्गोरिदमला मेमरी संसाधनांची खूप कमी गरज असल्याने, मोठ्या प्रथिन संग्रहांवर (protein corpora) प्रशिक्षण देणे स्वस्त आणि जलद होते, ज्यामुळे संपूर्ण साखळीतील अमिनो ॲसिड्स मास्क आणि प्रेडिक्ट करणाऱ्या अधिक समृद्ध मास्क्ड-लँग्वेज-मॉडेल (MLM) उद्दिष्टांसाठी मार्ग मोकळा होतो.
जीवशास्त्रासाठी याचा अर्थ काय
दीर्घ आणि अखंड प्रथिन प्रतिनिधित्व (protein representations) मॉडेलची त्रिमितीय संरचना, ॲक्टिव्ह साइट्स आणि उत्क्रांतीच्या नमुन्यांची समज सुधारते. संशोधक आता मोठ्या, अनक्युरेटेड (uncurated) सिक्वेन्स संग्रहांवर प्री-ट्रेनिंग करू शकतात आणि म्युटेशन-परिणाम अंदाज किंवा अँटीबॉडी डिझाइन यांसारख्या विशिष्ट कार्यांसाठी फाईन-ट्यूनिंग करू शकतात. कमी झालेल्या संगणकीय भारामुळे लहान प्रयोगशाळांनाही मर्यादित हार्डवेअरवर अत्याधुनिक मॉडेल्स चालवणे सोपे होईल.
मर्यादा आणि उघड्या प्रश्नांची (Caveats and open questions)
लिनियर-स्केल अटेंशन अनेकदा अंदाजे पद्धतींवर (approximations) अवलंबून असते—जसे की स्लाईडिंग विंडोज, लो-रँक फॅक्टरायझेशन्स किंवा स्पार्स पॅटर्न—ज्यामुळे दूरच्या रेसिड्यूजमधील (residues) सूक्ष्म परस्परक्रिया सुटू शकतात. सुरुवातीच्या प्रयोगांवरून असे दिसून येते की मेमरीची बचत आणि प्रेडिक्टिव्ह अचूकता यामध्ये एक मध्यम तडजोड (trade-off) करावी लागते, विशेषतः ज्या कामांमध्ये अचूक दीर्घ-अंतरावरील कपलिंगची आवश्यकता असते. या नवीन आर्किटेक्चरमुळे अंमलबजावणीतील गुंतागुंत देखील वाढते, ज्यामुळे सक्षम लायब्ररी उपलब्ध होईपर्यंत त्याचा अवलंब मंदावू शकतो.
पुढे काय पाहावे
प्रमाणित डेटासेटवर पारंपारिक मॉडेल्सच्या तुलनेत लिनियर-स्केल ट्रान्सफॉर्मरच्या प्रथिन-MLM कामगिरीची तुलना करणारे बेंचमार्क निकाल समुदाय उत्सुकतेने पाहतील. विद्यमान बायो-इन्फॉर्मेटिक्स पाइपलाइन्समध्ये याचे एकत्रीकरण आणि ओपन-सोर्स आवृत्त्या या तंत्राचा प्रसार किती वेगाने होईल हे ठरवतील. जर अचूकतेतील अंतर कमी झाले, तर ही पद्धत मोठ्या प्रमाणावरील प्रथिन लँग्वेज मॉडेलिंगसाठी डीफॉल्ट ठरू शकते, ज्यामुळे कॉम्प्युटेशनल बायोलॉजी प्रथिन फोल्डिंगच्या समस्येवर कशी मात करते याचे स्वरूप बदलू शकते.
थोडक्यात: मेमरीची मागणी वर्ग (quadratic) वरून रेषीय (linear) पर्यंत कमी करून, लाँग-कॉन्टेक्स्ट ट्रान्सफॉर्मर्स पूर्ण-लांबीच्या प्रथिन सिक्वेन्सना मास्क्ड लँग्वेज मॉडेलिंगसाठी व्यवहार्य बनवतात, ज्यामुळे संगणकीय खर्च नियंत्रणात ठेवून अधिक समृद्ध जैविक माहिती मिळवण्याचे आश्वासन मिळते.
