ट्रान्सफॉर्मर्सच्या पलीकडे: LLMs च्या पुढील युगाला नवी दिशा देणारे स्टार्टअप्स
ट्रान्सफॉर्मरचे युग एका मूलभूत अडथळ्याचा (bottleneck) सामना करत आहे, कारण लार्ज लँग्वेज मॉडेल्सच्या (LLMs) संगणकीय गरजा (computational demands) एका टोकाला पोहोचत आहेत. २०१७ मधील "Attention Is All You Need" या शोधनिबंधाने सध्याच्या AI क्रांतीचा पाया रचला असला तरी, आता स्टार्टअप्सची एक नवीन पिढी खरी कार्यक्षमता प्राप्त करण्यासाठी मूळ आर्किटेक्चर बदलण्यासाठी किंवा त्यात सुधारणा करण्यासाठी स्पर्धा करत आहे.
ट्रान्सफॉर्मरचा अडथळा: 'Dense Attention' का अपयशी ठरत आहे?
गेल्या दशकापासून, ट्रान्सफॉर्मर हे AI उद्योगाचे इंजिन राहिले आहे, जे "dense attention" नावाच्या यंत्रणेवर आधारित आहे. ही प्रक्रिया मजकुराच्या एका ब्लॉक मधील प्रत्येक 'टोकन'ची (token) इतर प्रत्येक टोकनशी मोठ्या प्रमाणावर गुणाकार करून तुलना करते. अर्थाचा (semantic meaning) अचूक वेध घेण्यास ही प्रक्रिया अत्यंत सक्षम असली तरी, तिची गणितीय गुंतागुंत (mathematical complexity) वाढताना खूप वेगाने वाढते.
उदाहरणार्थ, १०,००० शब्दांच्या दस्तऐवजासाठी ट्रान्सफॉर्मरला अंदाजे ५ कोटी (50 million) वेळा गुणाकार करावा लागू शकतो. गणनेतील ही 'क्वाड्रॅटिक' (quadratic) वाढ दोन मोठ्या आव्हानांना जन्म देते: विजेचा प्रचंड वापर आणि मर्यादित 'कॉन्टेक्स्ट विंडोज' (context windows). OpenAI यावर्षी संगणकीय कार्यासाठी ५० अब्ज डॉलर्स खर्च करणार असल्याचे समजते आणि २०३० पर्यंत डेटा सेंटरच्या विजेची मागणी दुप्पट होण्याची शक्यता आहे, त्यामुळे हे उद्योग खर्च आणि भौतिकशास्त्र (physics) या दोन्ही मर्यादांच्या आड येत आहेत.
अटेंशनचा पुनर्विचार: 'Sparse Mechanisms'चा उदय
कार्यक्षमतेचे संकट सोडवण्यासाठी, अनेक स्टार्टअप्स 'dense attention' कडून "sparse attention" कडे वळण्याचा प्रयत्न करत आहेत. शब्दांच्या प्रत्येक संभाव्य जोडीची गणना करण्याऐवजी, sparse attention केवळ सर्वात संबंधित संबंधांवर लक्ष केंद्रित करते, ज्यामुळे संगणकीय भार (computational load) लक्षणीयरीत्या कमी होतो.
मियामीस्थित स्टार्टअप Subquadratic त्यांच्या SubQ मॉडेलसह या क्षेत्रात आघाडीवर आहे. अचूकता टिकवून ठेवण्यासाठी संघर्ष करणाऱ्या मागील sparse mechanisms च्या उलट, Subquadratic चा दावा आहे की त्यांचे तंत्रज्ञान कोडिंग आणि सर्च यांसारख्या विशेष कामांमध्ये मुख्य प्रवाहातील LLMs ला टक्कर देते. त्यांचा दृष्टिकोन एका डायनॅमिक सिस्टमवर आधारित आहे, जी अनावश्यक टोकन्सवर वेळ वाया घालवण्याऐवजी, दिलेल्या मजकुरासाठी नेमके कोणते शब्द महत्त्वाचे आहेत हे त्वरित ओळखते.
पॉवर रिटेंशन (Power Retention): रोलिंग समरीच्या दिशेने वाटचाल
आणखी एक दृष्टिकोन म्हणजे अटेंशन मेकॅनिझमपासून पूर्णपणे दूर जाणे. सॅन फ्रान्सिस्कोस्थित Manifest AI "power retention" नावाच्या तंत्रज्ञानाचे नेतृत्व करत आहे. SubQ सारखी sparse attention मॉडेल्स संपूर्ण कॉन्टेक्स्ट विंडोचे ढोबळ चित्र ठेवण्याचा प्रयत्न करतात, तर power retention मॉडेलला त्याच्या स्मृतीची (memory) 'रोलिंग समरी' (rolling summary) प्रदान करून काम करते.
कॉन्टेक्स्ट विंडोमध्ये नवीन माहिती आल्यावर, मॉडेल कमी संबंधित डेटा ओळखते आणि काढून टाकते, ज्यामुळे इनपुटचा आकार कितीही असला तरी संगणकीय भार नियंत्रणात राहतो. Manifest AI ने या दृष्टिकोनाची व्यवहार्यता आधीच सिद्ध केली आहे:
- power retention वापरून ओपन-सोर्स StarCoder मॉडेलचे PowerCoder मध्ये रूपांतर केले.
- Brumby लाँच केले, जे त्यांच्या मते Alibaba च्या लोकप्रिय Qwen ओपन-सोर्स मॉडेल्सना टक्कर देते.
अस्तित्वात असलेल्या ट्रान्सफॉर्मर मॉडेल्सना किमान री-ट्रेनिंगसह (retraining) power retention मॉडेल्समध्ये रूपांतरित करण्याची क्षमता पाहता, "LLMs+"—म्हणजेच मॉडेल्सच्या पुढील पिढीकडे होणारे संक्रमण अपेक्षित वेळेपेक्षा खूप वेगाने होऊ शकते असे दिसून येते.
मुख्य निष्कर्ष
- ट्रान्सफॉर्मरची मर्यादा: Dense attention ची 'क्वाड्रॅटिक स्केलिंग' सध्याच्या LLMs चालवणे अत्यंत खर्चिक बनवते आणि मोठ्या डेटासेटसाठी किंवा दीर्घकालीन तर्कासाठी (long-form reasoning) त्यांना स्केल करणे कठीण करते.
- Sparse विरुद्ध Retention: स्टार्टअप्स या समस्येवर दोन बाजूंनी उपाय शोधत आहेत: Subquadratic हे sparse कॅल्क्युलेशनद्वारे (SubQ) अटेंशन ऑप्टिमाइझ करत आहे, तर Manifest AI ते रोलिंग समरीने (Power Retention) बदलत आहे.
- आर्थिक निकड: AI संगणकीय खर्च (compute costs) अब्जावधी डॉलर्सपर्यंत पोहोचत असताना, पुढील AI युगाचा विजेता तो असेल जो केवळ स्केल वाढवण्याऐवजी कार्यक्षमतेवर (efficiency) लक्ष केंद्रित करेल.
