ટ્રાન્સફોર્મર્સથી આગળ: LLMs ના આગામી યુગને પુનઃવ્યાખ્યાયિત કરતા સ્ટાર્ટઅપ્સ

ટ્રાન્સફોર્મરનો યુગ એક મૂળભૂત અવરોધ (bottleneck) નો સામનો કરી રહ્યો છે કારણ કે લાર્જ લેંગ્વેજ મોડલ્સ (LLMs) ની કમ્પ્યુટેશનલ જરૂરિયાતો હવે તેની મર્યાદા પર પહોંચી રહી છે. જોકે 2017 ના "Attention Is All You Need" પેપરે વર્તમાન AI બૂમનો પાયો નાખ્યો હતો, પરંતુ હવે સ્ટાર્ટઅપ્સની એક નવી પેઢી સાચી કાર્યક્ષમતા પ્રાપ્ત કરવા માટે મુખ્ય આર્કિટેક્ચરને બદલવા અથવા તેને ફરીથી શોધવા માટે દોડી રહી છે.

ટ્રાન્સફોર્મર બોટલનેક: ડેન્સ એટેન્શન (Dense Attention) કેમ નિષ્ફળ જઈ રહ્યું છે?

લગભગ એક દાયકાથી, ટ્રાન્સફોર્મર AI ઉદ્યોગનું એન્જિન રહ્યું છે, જે "dense attention" તરીકે ઓળખાતી પદ્ધતિ દ્વારા સંચાલિત છે. આ પ્રક્રિયા ટેક્સ્ટના બ્લોકમાં રહેલા દરેક ટોકનને વિશાળ સ્કેલના ગુણાકાર દ્વારા અન્ય દરેક ટોકન સાથે સરખાવે છે. અર્થપૂર્ણ અર્થ (semantic meaning) સમજવામાં અત્યંત સચોટ હોવા છતાં, તેની ગાણિતિક જટિલતા ખૂબ જ ઝડપથી વધે છે.

ઉદાહરણ તરીકે, 10,000 શબ્દોના દસ્તાવેજ માટે ટ્રાન્સફોર્મરે અંદાજે 5 કરોડ (50 million) ગુણાકાર કરવા પડી શકે છે. કમ્પ્યુટેશનમાં આ રીતે થતો ચતુરાંશ વધારો (quadratic growth) બે મોટા પડકારો તરફ દોરી જાય છે: ઊર્જાના વપરાશમાં આસમાને પહોંચતો વધારો અને મર્યાદિત કોન્ટેક્સ્ટ વિન્ડોઝ (context windows). અહેવાલો અનુસાર OpenAI આ વર્ષે કમ્પ્યુટિંગ પર $50 બિલિયન ખર્ચવા જઈ રહ્યું છે અને 2030 સુધીમાં ડેટા સેન્ટરની વીજળીની માંગ બમણી થવાની અપેક્ષા છે, તેથી ઉદ્યોગ ખર્ચ અને ભૌતિક વિજ્ઞાન બંનેની મર્યાદાનો સામનો કરી રહ્યો છે.

એટેન્શન વિશે નવેસરથી વિચારવું: સ્પાર્સ મિકેનિઝમ્સનો ઉદય

કાર્યક્ષમતાના સંકટને ઉકેલવા માટે, ઘણા સ્ટાર્ટઅપ્સ "dense attention" થી દૂર જઈને "sparse attention" તરફ વળવાનો પ્રયાસ કરી રહ્યા છે. દરેક સંભવિત શબ્દના જોડાણની ગણતરી કરવાને બદલે, sparse attention માત્ર સૌથી સુસંગત જોડાણો પર ધ્યાન કેન્દ્રિત કરે છે, જેનાથી કમ્પ્યુટેશનલ ભારમાં નોંધપાત્ર ઘટાડો થાય છે.

માયામી સ્થિત સ્ટાર્ટઅપ Subquadratic તેના SubQ મોડલ સાથે આ ક્ષેત્રમાં અગ્રેસર છે. અગાઉના સ્પાર્સ મિકેનિઝમ્સ જે સચોટતા જાળવવામાં સંઘર્ષ કરતા હતા તેનાથી વિપરીત, Subquadratic નો દાવો છે કે તેનું ટેકનોલોજી કોડિંગ અને સર્ચ જેવા વિશિષ્ટ કાર્યોમાં મુખ્યધારાના LLMs ને ટક્કર આપી શકે છે. તેમનો અભિગમ એક ડાયનેમિક સિસ્ટમનો ઉપયોગ કરે છે જે બિનજરૂરી ટોકન્સ પર સમય બગાડવાને બદલે, આપેલ ટેક્સ્ટ માટે કયા શબ્દો ખરેખર મહત્વના છે તે તરત જ ઓળખી લે છે.

પાવર રિટેન્શન (Power Retention): રોલિંગ સમરીઝ તરફ પ્રયાણ

બીજો અભિગમ એટેન્શન મિકેનિઝમથી સંપૂર્ણપણે દૂર જવાનો છે. સેન ફ્રાન્સિસ્કો સ્થિત Manifest AI "power retention" નામની ટેકનિકમાં અગ્રેસર છે. જ્યારે SubQ જેવા sparse attention મોડલ્સ હજુ પણ સમગ્ર કોન્ટેક્સ્ટ વિન્ડોનું એક અંદાજિત ચિત્ર જાળવી રાખવાનો પ્રયાસ કરે છે, ત્યારે power retention મોડલને તેની મેમરીની 'રોલિંગ સમરી' (rolling summary) પૂરી પાડીને કામ કરે છે.

જેમ નવી માહિતી કોન્ટેક્સ્ટ વિન્ડોમાં પ્રવેશે છે, તેમ મોડલ ઓછી સુસંગત માહિતીને ઓળખીને દૂર કરે છે, જેનાથી ઇનપુટના કદ ગમે તે હોય, કમ્પ્યુટેશનલ ભાર નિયંત્રિત રહે છે. Manifest AI એ આ અભિગમની વ્યવહારિકતા પહેલેથી જ સાબિત કરી દીધી છે:

  • power retention નો ઉપયોગ કરીને ઓપન-સોર્સ StarCoder મોડલને PowerCoder માં રૂપાંતરિત કરીને.
  • Brumby રિલીઝ કરીને, જે મોડલ વિશે તેમનો દાવો છે કે તે Alibaba ના લોકપ્રિય Qwen ઓપન-સોર્સ મોડલ્સને ટક્કર આપે છે.

ન્યૂનતમ રીટ્રેનિંગ (retraining) સાથે હાલના ટ્રાન્સફોર્મર મોડલ્સને power retention મોડલ્સમાં અનુકૂલિત કરવાની ક્ષમતા સૂચવે છે કે "LLMs+" — મોડલ્સની આગામી પેઢી — તરફનું સંક્રમણ અપેક્ષા કરતા ઘણું ઝડપી બની શકે છે.

મુખ્ય મુદ્દાઓ

  • ટ્રાન્સફોર્મરની મર્યાદા: Dense attention નું quadratic scaling વર્તમાન LLMs ને ચલાવવા માટે અત્યંત ખર્ચાળ બનાવે છે અને વિશાળ ડેટાસેટ્સ અથવા લાંબા તર્ક (long-form reasoning) માટે તેને સ્કેલ કરવું મુશ્કેલ બનાવે છે.
  • Sparse વિરુદ્ધ Retention: સ્ટાર્ટઅપ્સ બે રીતે આ સમસ્યાનો ઉકેલ લાવી રહ્યા છે: Subquadratic સ્પાર્સ ગણતરીઓ (SubQ) દ્વારા એટેન્શનને ઓપ્ટિમાઇઝ કરી રહ્યું છે, જ્યારે Manifest AI તેને રોલિંગ સમરીઝ (Power Retention) સાથે બદલી રહ્યું છે.
  • આર્થિક અનિવાર્યતા: જેમ જેમ AI કમ્પ્યુટિંગ ખર્ચ અબજો ડોલર સુધી પહોંચી રહ્યો છે, તેમ આગામી AI યુગનો વિજેતા તે હશે જે માત્ર સ્કેલ વધારવાને બદલે કાર્યક્ષમતા (efficiency) માટે ઉકેલ લાવશે.