ट्रांसफॉर्मर्स से परे: वे स्टार्टअप जो LLMs के अगले युग को फिर से परिभाषित कर रहे हैं

ट्रांसफॉर्मर का युग एक मौलिक बाधा (bottleneck) का सामना कर रहा है क्योंकि लार्ज लैंग्वेज मॉडल्स (LLMs) की कंप्यूटेशनल मांगें एक निर्णायक मोड़ पर पहुँच रही हैं। हालाँकि 2017 के "Attention Is All You Need" पेपर ने वर्तमान AI उछाल की नींव रखी थी, लेकिन अब स्टार्टअप्स की एक नई पीढ़ी वास्तविक दक्षता प्राप्त करने के लिए मूल आर्किटेक्चर को बदलने या उसे फिर से नया रूप देने की दौड़ में है।

ट्रांसफॉर्मर बॉटलनेक: डेंस अटेंशन (Dense Attention) क्यों विफल हो रहा है

लगभग एक दशक से, ट्रांसफॉर्मर AI उद्योग का इंजन बना हुआ है, जो "dense attention" नामक तंत्र द्वारा संचालित है। यह प्रक्रिया टेक्स्ट के एक ब्लॉक में प्रत्येक टोकन की तुलना बड़े पैमाने पर गुणन (multiplication) के माध्यम से अन्य सभी टोकन से करती है। हालांकि यह अर्थ संबंधी अर्थ (semantic meaning) को पकड़ने में अविश्वसनीय रूप से सटीक है, लेकिन इसकी गणितीय जटिलता (mathematical complexity) बहुत तेजी से बढ़ती है।

उदाहरण के लिए, 10,000 शब्दों के दस्तावेज़ के लिए एक ट्रांसफॉर्मर को लगभग 5 करोड़ (50 million) गुणन करने की आवश्यकता हो सकती है। कंप्यूटेशन में यह द्विघातीय वृद्धि (quadratic growth) दो बड़ी चुनौतियों का कारण बनती है: ऊर्जा की खपत में भारी वृद्धि और सीमित कॉन्टेक्स्ट विंडो (context windows)। रिपोर्टों के अनुसार, OpenAI इस वर्ष कंप्यूटिंग पर $50 बिलियन खर्च करने वाला है और 2030 तक डेटा सेंटर की बिजली की मांग दोगुनी होने की उम्मीद है, जिससे उद्योग लागत और भौतिकी (physics) दोनों की सीमाओं से टकरा रहा है।

अटेंशन पर पुनर्विचार: स्पार्स मैकेनिज्म (Sparse Mechanisms) का उदय

दक्षता के संकट को हल करने के लिए, कई स्टार्टअप डेंस अटेंशन से हटकर "sparse attention" की ओर बढ़ने का प्रयास कर रहे हैं। शब्दों के हर संभावित जोड़े की गणना करने के बजाय, स्पार्स अटेंशन केवल सबसे प्रासंगिक कनेक्शनों पर ध्यान केंद्रित करता है, जिससे कंप्यूटेशनल लोड काफी कम हो जाता है।

मियामी स्थित स्टार्टअप Subquadratic अपने SubQ मॉडल के साथ इस क्षेत्र में अग्रणी है। पिछले स्पार्स मैकेनिज्म के विपरीत, जिन्हें सटीकता बनाए रखने में संघर्ष करना पड़ता था, Subquadratic का दावा है कि उनकी तकनीक कोडिंग और सर्च जैसे विशिष्ट कार्यों में मुख्यधारा के LLMs को टक्कर देती है। उनके दृष्टिकोण में एक गतिशील प्रणाली शामिल है जो अप्रासंगिक टोकन पर समय बर्बाद करने के बजाय, यह पहचानती है कि टेक्स्ट के किसी दिए गए हिस्से के लिए वास्तव में कौन से शब्द मायने रखते हैं।

पावर रिटेंशन (Power Retention): रोलिंग समरी की ओर बढ़ना

एक अन्य दृष्टिकोण अटेंशन मैकेनिज्म से पूरी तरह से अलग होना है। सैन फ्रांसिस्को स्थित Manifest AI "power retention" नामक तकनीक का नेतृत्व कर रहा है। जबकि SubQ जैसे स्पार्स अटेंशन मॉडल अभी भी पूरे कॉन्टेक्स्ट विंडो की एक मोटा-मोटी तस्वीर बनाए रखने की कोशिश करते हैं, पावर रिटेंशन मॉडल को उसकी मेमोरी की एक 'रोलिंग समरी' (rolling summary) प्रदान करके काम करता है।

जैसे ही कॉन्टेक्स्ट विंडो में नई जानकारी आती है, मॉडल कम प्रासंगिक डेटा की पहचान करता है और उसे हटा देता है, जिससे यह सुनिश्चित होता है कि इनपुट आकार चाहे जो भी हो, कंप्यूटेशनल लोड प्रबंधनीय बना रहे। Manifest AI ने पहले ही इस दृष्टिकोण की व्यवहार्यता का प्रदर्शन किया है:

  • पावर रिटेंशन का उपयोग करके ओपन-सोर्स StarCoder मॉडल को PowerCoder में बदलना।
  • Brumby को रिलीज़ करना, एक ऐसा मॉडल जिसके बारे में उनका दावा है कि यह अलीबाबा के लोकप्रिय Qwen ओपन-सोर्स मॉडल्स को टक्कर देता है।

न्यूनतम रीट्रेनिंग के साथ मौजूदा ट्रांसफॉर्मर मॉडल्स को पावर रिटेंशन मॉडल्स में ढालने की क्षमता यह संकेत देती है कि "LLMs+"—मॉडल्स की अगली पीढ़ी—की ओर संक्रमण अनुमान से कहीं अधिक तेजी से हो सकता है।

मुख्य बातें (Key Takeaways)

  • ट्रांसफॉर्मर की सीमा: डेंस अटेंशन का द्विघातीय स्केलिंग (quadratic scaling) वर्तमान LLMs को चलाने के लिए अविश्वसनीय रूप से महंगा बनाता है और विशाल डेटासेट या लंबे तर्क (long-form reasoning) के लिए स्केल करना कठिन बनाता है।
  • स्पार्स बनाम रिटेंशन: स्टार्टअप इस समस्या पर दो तरफ से हमला कर रहे हैं: Subquadratic स्पार्स गणनाओं (SubQ) के माध्यम से अटेंशन को ऑप्टिमाइज़ कर रहा है, जबकि Manifest AI इसे रोलिंग समरी (Power Retention) के साथ बदल रहा है।
  • आर्थिक अनिवार्यता: जैसे-जैसे AI कंप्यूट लागत अरबों डॉलर तक पहुँच रही है, अगले AI युग का विजेता संभवतः वह होगा जो केवल कच्चे पैमाने (raw scale) के बजाय दक्षता (efficiency) का समाधान करेगा।