ട്രാൻസ്ഫോർമറുകൾക്ക് അപ്പുറം: LLM-കളുടെ അടുത്ത യുഗത്തെ പുനർനിർവചിക്കുന്ന സ്റ്റാർട്ടപ്പുകൾ
ലാർജ് ലാംഗ്വേജ് മോഡലുകളുടെ (LLMs) കമ്പ്യൂട്ടേഷണൽ ആവശ്യങ്ങൾ അതിന്റെ പരിധിയിൽ എത്തുന്നതോടെ, ട്രാൻസ്ഫോർമറുകളുടെ കാലഘട്ടം ഒരു അടിസ്ഥാനപരമായ തടസ്സത്തെ (bottleneck) നേരിടുകയാണ്. 2017-ലെ "Attention Is All You Need" എന്ന പ്രബന്ധം നിലവിലെ AI കുതിച്ചുചാട്ടത്തിന് അടിത്തറയിട്ടുവെങ്കിലും, യഥാർത്ഥ കാര്യക്ഷമത കൈവരിക്കുന്നതിനായി കോർ ആർക്കിടെക്ചറിനെ മാറ്റാനോ പുനർനിർമ്മിക്കാനോ ഒരു പുതിയ തലമുറ സ്റ്റാർട്ടപ്പുകൾ ഇപ്പോൾ മത്സരിക്കുകയാണ്.
ട്രാൻസ്ഫോർമർ തടസ്സം: എന്തുകൊണ്ട് ഡെൻസ് അറ്റൻഷൻ (Dense Attention) പരാജയപ്പെടുന്നു?
ഏകദേശം ഒരു പതിറ്റാണ്ടായി, "ഡെൻസ് അറ്റൻഷൻ" (dense attention) എന്നറിയപ്പെടുന്ന ഒരു സംവിധാനം ഉപയോഗിച്ച് പ്രവർത്തിക്കുന്ന ട്രാൻസ്ഫോർമറുകൾ AI വ്യവസായത്തിന്റെ എഞ്ചിനായി പ്രവർത്തിക്കുന്നു. ഈ പ്രക്രിയ ഒരു ടെക്സ്റ്റ് ബ്ലോക്കിലെ ഓരോ ടോക്കണും മറ്റ് എല്ലാ ടോക്കണുകളുമായും വൻതോതിലുള്ള ഗുണനത്തിലൂടെ (multiplication) താരതമ്യം ചെയ്യുന്നു. അർത്ഥതലങ്ങൾ (semantic meaning) കൃത്യമായി മനസ്സിലാക്കുന്നതിൽ ഇത് അവിശ്വസനീയമായ കൃത്യത പുലർത്തുന്നുണ്ടെങ്കിലും, ഇതിന്റെ ഗണിതശാസ്ത്രപരമായ സങ്കീർണ്ണത (mathematical complexity) വർദ്ധനവിനനുസരിച്ച് കൈകാര്യം ചെയ്യാൻ പ്രയാസമാണ്.
ഉദാഹരണത്തിന്, 10,000 വാക്കുകളുള്ള ഒരു ഡോക്യുമെന്റ് പ്രോസസ്സ് ചെയ്യാൻ ഒരു ട്രാൻസ്ഫോർമറിന് ഏകദേശം 50 ദശലക്ഷം ഗുണനങ്ങൾ ചെയ്യേണ്ടി വന്നേക്കാം. കമ്പ്യൂട്ടേഷണിലെ ഈ ക്വാഡ്രാറ്റിക് വളർച്ച (quadratic growth) രണ്ട് വലിയ വെല്ലുവിളികളിലേക്ക് നയിക്കുന്നു: കുതിച്ചുയരുന്ന ഊർജ്ജ ഉപഭോഗവും പരിമിതമായ കോൺടെക്സ്റ്റ് വിൻഡോകളും (context windows). ഈ വർഷം കമ്പ്യൂട്ടിംഗിനായി OpenAI 50 ബില്യൺ ഡോളർ ചെലവഴിക്കാൻ തയ്യാറെടുക്കുന്നതായും 2030-ഓടെ ഡാറ്റാ സെന്ററുകളുടെ വൈദ്യുതി ആവശ്യകത ഇരട്ടിയാകുമെന്നും റിപ്പോർട്ടുകൾ സൂചിപ്പിക്കുന്നു. ഇത് വ്യവസായത്തെ ചിലവ്, ഭൗതികശാസ്ത്രം (physics) എന്നീ രണ്ട് തലങ്ങളിൽ വലിയ പ്രതിസന്ധിയിലാക്കുന്നു.
അറ്റൻഷനെക്കുറിച്ച് പുനർചിന്തനം: സ്പാർസ് മെക്കാനിസങ്ങളുടെ (Sparse Mechanisms) ഉദയം
കാര്യക്ഷമതയിലെ ഈ പ്രതിസന്ധി പരിഹരിക്കുന്നതിനായി, പല സ്റ്റാർട്ടപ്പുകളും ഡെൻസ് അറ്റൻഷനിൽ നിന്ന് "സ്പാർസ് അറ്റൻഷനിലേക്ക്" (sparse attention) മാറാൻ ശ്രമിക്കുന്നു. സാധ്യമായ എല്ലാ വാചക ജോഡികളും കണക്കാക്കുന്നതിന് പകരം, ഏറ്റവും പ്രസക്തമായ ബന്ധങ്ങളിൽ മാത്രം സ്പാർസ് അറ്റൻഷൻ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നു, ഇത് കമ്പ്യൂട്ടേഷണൽ ഭാരം ഗണ്യമായി കുറയ്ക്കുന്നു.
മിയാമി ആസ്ഥാനമായുള്ള സ്റ്റാർട്ടപ്പായ Subquadratic, അതിന്റെ SubQ മോഡലിലൂടെ ഈ മേഖലയിൽ മുൻപന്തിയിലാണ്. കൃത്യത നിലനിർത്താൻ ബുദ്ധിമുട്ടിയ മുൻപത്തെ സ്പാർസ് മെക്കാനിസങ്ങളിൽ നിന്ന് വ്യത്യസ്തമായി, കോഡിംഗ്, സെർച്ച് തുടങ്ങിയ പ്രത്യേക ജോലികളിൽ പ്രധാനപ്പെട്ട LLM-കൾക്ക് തുല്യമായ സാങ്കേതികവിദ്യയാണ് തങ്ങളുടേതെന്ന് Subquadratic അവകാശപ്പെടുന്നു. അപ്രസക്തമായ ടോക്കണുകളിൽ സമയം കളയുന്നതിന് പകരം, ഒരു ടെക്സ്റ്റിലെ ഏത് വാക്കുകളാണ് യഥാർത്ഥത്തിൽ പ്രസക്തമെന്ന് തത്സമയം തിരിച്ചറിയുന്ന ഒരു ഡൈനാമിക് സിസ്റ്റമാണ് അവരുടെ സമീപനം.
പവർ റിറ്റൻഷൻ (Power Retention): റോളിംഗ് സമ്മറികളിലേക്ക് ഒരു മാറ്റം
മറ്റൊരു സമീപനം അറ്റൻഷൻ മെക്കാനിസത്തിൽ നിന്ന് പൂർണ്ണമായും മാറുന്നതാണ്. സാൻ ഫ്രാൻസിസ്കോ ആസ്ഥാനമായുള്ള Manifest AI, "പവർ റിറ്റൻഷൻ" (power retention) എന്നറിയപ്പെടുന്ന ഒരു സാങ്കേതികവിദ്യയ്ക്ക് നേതൃത്വം നൽകുന്നു. SubQ പോലുള്ള സ്പാർസ് അറ്റൻഷൻ മോഡലുകൾ മുഴുവൻ കോൺടെക്സ്റ്റ് വിൻഡോയുടെയും ഒരു ഏകദേശ ചിത്രം നിലനിർത്താൻ ശ്രമിക്കുമ്പോൾ, പവർ റിറ്റൻഷൻ മോഡലിന് അതിന്റെ മെമ്മറിയുടെ ഒരു റോളിംഗ് സമ്മറി (rolling summary) നൽകിക്കൊണ്ട് പ്രവർത്തിക്കുന്നു.
പുതിയ വിവരങ്ങൾ കോൺടെക്സ്റ്റ് വിൻഡോയിലേക്ക് വരുമ്പോൾ, മോഡൽ കുറഞ്ഞ പ്രസക്തിയുള്ള ഡാറ്റ തിരിച്ചറിഞ്ഞ് ഒഴിവാക്കുന്നു, ഇത് ഇൻപുട്ടിന്റെ വലിപ്പം പരിഗണിക്കാതെ തന്നെ കമ്പ്യൂട്ടേഷണൽ ഭാരം നിയന്ത്രിക്കാൻ സഹായിക്കുന്നു. Manifest AI ഈ സമീപനത്തിന്റെ പ്രായോഗികത ഇതിനോടകം തെളിയിച്ചു കഴിഞ്ഞു:
- പവർ റിറ്റൻഷൻ ഉപയോഗിച്ച് ഓപ്പൺ സോഴ്സ് StarCoder മോഡലിനെ PowerCoder ആയി മാറ്റുക.
- അലിബാബയുടെ പ്രശസ്തമായ Qwen ഓപ്പൺ സോഴ്സ് മോഡലുകൾക്ക് തുല്യമായ Brumby എന്ന മോഡൽ പുറത്തിറക്കി.
നിലവിലുള്ള ട്രാൻസ്ഫോർമർ മോഡലുകളെ കുറഞ്ഞ പുനർപരിശീലനത്തിലൂടെ (retraining) പവർ റിറ്റൻഷൻ മോഡലുകളാക്കി മാറ്റാനുള്ള കഴിവ്, "LLMs+" എന്ന അടുത്ത തലമുറ മോഡലുകളിലേക്കുള്ള മാറ്റം പ്രതീക്ഷിച്ചതിലും വേഗത്തിൽ സംഭവിക്കുമെന്ന സൂചന നൽകുന്നു.
പ്രധാന കാര്യങ്ങൾ
- ട്രാൻസ്ഫോർമർ പരിധി: ഡെൻസ് അറ്റൻഷന്റെ ക്വാഡ്രാറ്റിക് സ്കെയിലിംഗ് നിലവിലെ LLM-കളെ പ്രവർത്തിപ്പിക്കാൻ അങ്ങേയറ്റം ചിലവേറിയതാക്കുന്നു, കൂടാതെ വലിയ ഡാറ്റാസെറ്റുകൾക്കോ ദീർഘമായ യുക്തിചിന്തകൾക്കോ (long-form reasoning) വേണ്ടി ഇവ വികസിപ്പിക്കുന്നത് പ്രയാസകരവുമാണ്.
- സ്പാർസ് vs. റിറ്റൻഷൻ: സ്റ്റാർട്ടപ്പുകൾ രണ്ട് രീതിയിലാണ് ഈ പ്രശ്നത്തെ നേരിടുന്നത്: Subquadratic സ്പാർസ് കണക്കുകൂട്ടലുകളിലൂടെ (SubQ) അറ്റൻഷൻ ഒപ്റ്റിമൈസ് ചെയ്യുന്നു, അതേസമയം Manifest AI അത് റോളിംഗ് സമ്മറികൾ (Power Retention) ഉപയോഗിച്ച് മാറ്റുന്നു.
- സാമ്പത്തികമായ അനിവാര്യത: AI കമ്പ്യൂട്ട് ചിലവ് പതിനായിരക്കണക്കിന് കോടി ഡോളറുകളിലെത്തുമ്പോൾ, അടുത്ത AI യുഗത്തിലെ വിജയി കേവലം വലിപ്പത്തിലല്ല (scale), മറിച്ച് കാര്യക്ഷമത (efficiency) കണ്ടെത്തുന്നവരായിരിക്കും.
