അലിബാബയുടെ Qwen2.5-Max-ഉം ഡീപ്സീക്കിന്റെ (DeepSeek) V3-Flash-ഉം ഈ ആഴ്ച വിപണിയിലെത്തി. കുറഞ്ഞ ചിലവിൽ AI ഇൻഫറൻസ് (inference) ലഭ്യമാക്കുന്നതിന് ഇവ രണ്ടും വ്യത്യസ്തമായ വഴികളാണ് സ്വീകരിക്കുന്നത്. അലിബാബയുടെ 2.4 ട്രില്യൺ പാരാമീറ്ററുകളുള്ള മിക്സ്ചർ-ഓഫ്-എക്സ്പെർട്ട്സ് (MoE) ഡിസൈനിൽ ഓരോ ക്വറിയ്ക്കും ഏകദേശം 95 ബില്യൺ പാരാമീറ്ററുകൾ മാത്രമാണ് സജീവമാക്കുന്നത്; ഡീപ്സീക്ക് ഓരോ ടോക്കണിനും (token) വരുന്ന ചിലവ് കുറയ്ക്കുന്നതിനായി അതിന്റെ ആർക്കിടെക്ചറിൽ മാറ്റം വരുത്തിയിരിക്കുന്നു. AI രംഗത്തെ മത്സരങ്ങൾ ഇപ്പോൾ വെറും മോഡൽ വലുപ്പത്തിലല്ല, മറിച്ച് ഓരോ ടോക്കണിനും എത്ര ഡോളർ ചിലവാകുന്നു എന്നതിലാണ് അളക്കപ്പെടുന്നത്.
“കൂടുതൽ പാരാമീറ്ററുകൾ” എന്നതിൽ നിന്ന് “കുറഞ്ഞ ചിലവ്” എന്നതിലേക്ക്
വർഷങ്ങളായി ലാർജ് ലാംഗ്വേജ് മോഡൽ (LLM) വികസനത്തിലെ പ്രധാന അളവുകോൽ പാരാമീറ്റർ എണ്ണമായിരുന്നു. വലുതായാൽ കൂടുതൽ ബുദ്ധിയുള്ളതാകുമെന്ന ധാരണയിൽ OpenAI, Google തുടങ്ങിയ കമ്പനികൾ ട്രില്യൺ പാരാമീറ്റർ എന്ന പരിധി മറികടന്നതിനെക്കുറിച്ച് അഭിമാനിച്ചു. എന്നാൽ അലിബാബയും ഡീപ്സീക്കും ഈ കണക്കുകൂട്ടലുകൾ മാറിയെന്ന് കാണിച്ചുതരുന്നു.
അലിബാബയുടെ Qwen2.5-Max ഇപ്പോഴും വലിയ തോതിലുള്ള (scale) ഉപയോഗത്തെ ആശ്രയിക്കുന്നുണ്ടെങ്കിലും, അതിൽ ചിലവ് കുറയ്ക്കാനുള്ള ഒരു വിദ്യ കൂടി ഉൾപ്പെടുത്തിയിട്ടുണ്ട്. ഒരു ഡെൻസ് മോഡലിൽ (dense model) ഓരോ ഇൻഫറൻസിനും എല്ലാ പാരാമീറ്ററുകളും പ്രവർത്തിക്കുന്നു, ഇത് 2.4 ട്രില്യൺ പാരാമീറ്ററുകളുള്ള ഒരു നെറ്റ്വർക്കിനെ വലിയ ഊർജ്ജം ഉപയോഗിക്കുന്ന ഒന്നാക്കി മാറ്റുന്നു. എന്നാൽ MoE ഈ നെറ്റ്വർക്കിനെ പല “എക്സ്പെർട്ടുകളായി” (experts) തിരിക്കുകയും ഓരോ റിക്വസ്റ്റിനെയും അവയിൽ ഒരു വിഭാഗത്തിലേക്ക് മാത്രം എത്തിക്കുകയും ചെയ്യുന്നു. Qwen2.5-Max-ന്റെ റൂട്ടർ ഏത് പ്രോംപ്റ്റിനും ഏകദേശം 95 ബില്യൺ പാരാമീറ്ററുകൾ തിരഞ്ഞെടുക്കുന്നു, ഇത് ലേറ്റൻസിയും (latency) ഊർജ്ജ ഉപഭോഗവും നിയന്ത്രിച്ചുകൊണ്ട് തന്നെ ഒരു ട്രില്യൺ പാരാമീറ്റർ സിസ്റ്റത്തിന്റെ യുക്തിപരമായ കരുത്ത് (reasoning power) നൽകുന്നു.
ഡീപ്സീക്ക് ട്രില്യൺ പാരാമീറ്റർ എന്ന ലക്ഷ്യം പൂർണ്ണമായും ഒഴിവാക്കി. അതിന്റെ V3-Flash മോഡൽ കുറഞ്ഞ ചിലവിലും വേഗതയിലും വലിയ തോതിൽ പ്രവർത്തിക്കാൻ രൂപകൽപ്പന ചെയ്തതാണ്. ദിവസവും ദശലക്ഷക്കണക്കിന് ടോക്കണുകൾ പ്രോസസ്സ് ചെയ്യുന്ന ഡെവലപ്പർമാരെ ലക്ഷ്യമിട്ട് “അൾട്രാ-ലോ ഇൻഫറൻസ് പ്രൈസിംഗ്” (ultra-low inference pricing) എന്ന രീതിയിലാണ് കമ്പനി ഈ മോഡലിനെ വിപണനം ചെയ്യുന്നത്. കൃത്യമായ വില വെളിപ്പെടുത്തിയിട്ടില്ലെങ്കിലും സന്ദേശം വ്യക്തമാണ്: പാശ്ചാത്യ രാജ്യങ്ങളിലെ ടോക്കൺ നിരക്കുകൾ താങ്ങാൻ ഒരു സ്റ്റാർട്ടപ്പിന് കഴിയില്ലെങ്കിൽ, V3-Flash ഒരു മികച്ച ബദലായി മാറും.
എന്തുകൊണ്ടാണ് ഇൻഫറൻസ് ചിലവ് ഒരു മത്സര നേട്ടമായി മാറുന്നത്?
മോഡലുകൾ ലാബുകളിൽ നിന്ന് പുറത്തുവന്ന് പ്രൊഡക്ഷനിലേക്ക് എത്തുമ്പോൾ ഇൻഫറൻസ് ചിലവ് വളരെ പ്രധാനമാണ്. ചാറ്റ്ബോട്ടുകൾ, ഡോക്യുമെന്റ് അനാലിസിസ് പൈപ്പ്ലൈനുകൾ അല്ലെങ്കിൽ റെക്കമെൻഡേഷൻ എഞ്ചിനുകൾ എന്നിവയിൽ LLM ഉപയോഗിക്കുന്ന സംരംഭങ്ങൾ, ടോക്കൺ നിരക്കുകൾ അവരുടെ പ്രവർത്തനച്ചെലവിനെ (operating expenses) എങ്ങനെ സ്വാധീനിക്കുന്നു എന്ന് വേഗത്തിൽ തിരിച്ചറിയുന്നു. ഒരു ടോക്കണിന് പകുതി വില മാത്രം വരുന്ന ഒരു മോഡൽ ഉപയോഗിച്ചാൽ, മറ്റ് പ്രവർത്തനങ്ങൾക്കായി (കൂടുതൽ ഡാറ്റ, ഉയർന്ന ട്രാഫിക് അല്ലെങ്കിൽ അധിക ഫീച്ചറുകൾ) ഇരട്ടി ബജറ്റ് മാറ്റിവെക്കാൻ സാധിക്കും.
ഈ രണ്ട് ചൈനീസ് കമ്പനികളും വ്യത്യസ്ത വിപണികളെയാണ് ലക്ഷ്യമിടുന്നത്. അലിബാബയുടെ MoE സങ്കീർണ്ണവും യുക്തിപരമായ ചിന്ത ആവശ്യമായതുമായ ജോലികൾക്ക് ഉയർന്ന പ്രകടനം വാഗ്ദാനം ചെയ്യുന്നു, അതേസമയം ഓരോ റിക്വസ്റ്റിനും ആവശ്യമായ കമ്പ്യൂട്ട് ബജറ്റ് മിതമായി നിലനിർത്തുന്നു. അതേസമയം, ഡീപ്സീക്കിന്റെ ലളിതമായ മോഡൽ, വലിയ അളവിലുള്ളതും വേഗത പ്രധാനമായതുമായ (latency-sensitive) ജോലികൾക്കായി ഉപയോഗിക്കാം, അവിടെ കമ്പ്യൂട്ടിംഗ് കരുത്തിനേക്കാൾ പ്രവചിക്കാവുന്ന ചിലവിനാണ് പ്രാധാന്യം.
വലിയ മോഡലുകൾ ഉയർന്ന വിലയിൽ നൽകുന്ന പാശ്ചാത്യ സേവനദാതാക്കളുടെ വിപണിയിൽ ഈ രണ്ട് തന്ത്രങ്ങളും സ്വാധീനം ചെലുത്തിയേക്കാം. കുറഞ്ഞ ടോക്കൺ നിരക്കിൽ സമാനമായ ഫലങ്ങൾ ഡെവലപ്പർമാർക്ക് ലഭിക്കുകയാണെങ്കിൽ, വിലകൂടിയ API-കൾ ഉപയോഗിക്കാനുള്ള താൽപ്പര്യം കുറയും.
ആഗോള AI ഇക്കോസിസ്റ്റത്തിന് ഇതിന്റെ പ്രത്യാഘാതങ്ങൾ
- സ്റ്റാർട്ടപ്പുകളും ചെറുകിട ഇടത്തരം സംരംഭങ്ങളും (SMEs): കുറഞ്ഞ ഇൻഫറൻസ് ചിലവ് AI അധിഷ്ഠിത ഉൽപ്പന്നങ്ങൾ നിർമ്മിക്കുന്നതിനുള്ള തടസ്സങ്ങൾ കുറയ്ക്കുന്നു. മുൻപ് API ബില്ലുകൾക്കായി വലിയ തുക ആവശ്യമായിരുന്ന ടീമുകൾക്ക് ഇപ്പോൾ കുറഞ്ഞ ബജറ്റിൽ തന്നെ പ്രോട്ടോടൈപ്പുകൾ നിർമ്മിക്കാനും ഉൽപ്പന്നങ്ങൾ പുറത്തിറക്കാനും സാധിക്കും.
- സംരംഭങ്ങൾ (Enterprises): ആഭ്യന്തര AI സേവനങ്ങൾ നടത്തുന്ന വലിയ കോർപ്പറേറ്റുകൾക്ക് പ്രവർത്തനച്ചെലവ് കുറയ്ക്കാൻ സാധിക്കും, ഇത് ഡാറ്റ ശേഖരണത്തിനോ മോഡൽ ഫൈൻ ട്യൂണിംഗിനോ (fine-tuning) അല്ലെങ്കിൽ അധിക കമ്പ്യൂട്ടിംഗിനോ വേണ്ടി പണം മാറ്റിവെക്കാൻ സഹായിക്കും.
- പാശ്ചാത്യ സേവനദാതാക്കൾ: അവരുടെ വരുമാന മാതൃകകൾ ടോക്കൺ നിരക്കുകളെ അടിസ്ഥാനമാക്കിയുള്ളതാണ്. ചിലവ് കുറഞ്ഞ ബദലുകളിലേക്കുള്ള മാറ്റം, വില കുറയ്ക്കാനോ അല്ലെങ്കിൽ കുറഞ്ഞ ചിലവുള്ള മോഡലുകൾക്ക് ചെയ്യാൻ കഴിയാത്ത മികച്ച കഴിവുകൾ പ്രദർശിപ്പിക്കാനോ അവരെ നിർബന്ധിതരാക്കും.
- റെഗുലേറ്റർമാരും നയരൂപകർത്താക്കളും: കുറഞ്ഞ ചിലവിലുള്ള AI സാങ്കേതികവിദ്യ വിവിധ മേഖലകളിൽ വേഗത്തിൽ വ്യാപിക്കാൻ കാരണമായേക്കാം, ഇത് മേൽനോട്ടം, ഡാറ്റാ സ്വകാര്യത, ഓട്ടോമേഷൻ വേഗത എന്നിവയെക്കുറിച്ചുള്ള ചോദ്യങ്ങൾ ഉയർത്തുന്നു.
ഗുണദോഷങ്ങളും എതിർവാദങ്ങളും
Qwen2.5-Max പോലുള്ള MoE മോഡലുകൾ പൂർണ്ണമായും ലാഭകരമായ ഒന്നല്ല. റൂട്ടിംഗ് ലോജിക് (routing logic) എഞ്ചിനീയറിംഗ് സങ്കീർണ്ണത വർദ്ധിപ്പിക്കുന്നു, കൂടാതെ സ്പാർസ് ആക്റ്റിവേഷൻ (sparse activation) വിവിധ തരം ക്വറികളിൽ വ്യത്യസ്തമായ പ്രകടനം കാഴ്ചവെച്ചേക്കാം. റൂട്ടർ തെറ്റായ രീതിയിൽ പ്രവർത്തിച്ചാൽ, ഒരു റിക്വസ്റ്റ് അനുയോജ്യമല്ലാത്ത എക്സ്പെർട്ടുകളെ ഉപയോഗിച്ചേക്കാം, ഇത് ഔട്ട്പുട്ടിന്റെ ഗുണനിലവാരം കുറയ്ക്കും. കൂടാതെ, ഹാർഡ്വെയറുകൾ ഇപ്പോഴും ഡെൻസ് കമ്പ്യൂട്ടിംഗിനാണ് മുൻഗണന നൽകുന്നത്; MoE ഇൻഫറൻസിനായുള്ള പ്രത്യേക ആക്സിലറേറ്ററുകൾ (accelerators) ഇനിയും വ്യാപകമായിട്ടില്ല, ഇത് യഥാർത്ഥ ലോകത്തിലെ കാര്യക്ഷമതയെ പരിമിതപ്പെടുത്തിയേക്കാം.
ഡീപ്സീക്കിന്റെ കുറഞ്ഞ ചിലവിനുള്ള മുൻഗണനയും ചില റിസ്ക്കുകൾ വഹിക്കുന്നുണ്ട്. ആക്രമണപരമായ വില de la (pricing) പലപ്പോഴും മോഡൽ വലുപ്പത്തിലും ട്രെയിനിംഗ് ഡാറ്റയിലും നിയന്ത്രണങ്ങൾ ഏർപ്പെടുത്തുന്നുണ്ടാകാം, ഇത് മോഡലിന്റെ പ്രകടനത്തെ ബാധിച്ചേക്കാം. സൂക്ഷ്മമായ യുക്തിപരമായ ചിന്ത (nuanced reasoning) ആവശ്യമായ ആപ്ലിക്കേഷനുകൾക്ക് ഈ കുറഞ്ഞ ചിലവുള്ള മോഡൽ മതിയാകാതെ വരാം, ഇത് ഉപയോക്താക്കളെ വീണ്ടും വലിയതും വിലകൂടിയതുമായ ബദലുകളിലേക്ക് തിരികെ എത്തിച്ചേക്കാം.
അവസാനമായി, "ഒരു ഡോളറിന് ലഭിക്കുന്ന ബുദ്ധിശക്തി" എന്നത് മത്സരത്തിന്റെ ഒരു വശം മാത്രമാണ്. ലേറ്റൻസി, വിശ്വാസ്യത, ഇക്കോസിസ്റ്റം സപ്പോർട്ട്, പ്രാദേശിക നിയമങ്ങളുമായുള്ള പൊരുത്തം എന്നിവ ഇപ്പോഴും നിർണ്ണായകമാണ്. ഈ എല്ലാ മേഖലകളിലും സന്തുലിതമായ പാക്കേജ് നൽകുന്ന കമ്പനികളായിരിക്കും വിപണിയിൽ ആധിപത്യം സ്ഥാപിക്കുക, വെറും വിലയുദ്ധത്തിൽ ജയിക്കുന്നവർ മാത്രമല്ല.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
- ബെഞ്ച്മാർക്ക് റിപ്പോർട്ടുകൾ: Qwen2.5-Max-ന്റെ MoE റൂട്ടിംഗ് കാര്യക്ഷമതയെയും V3-Flash-ന്റെ ടോക്കൺ ചിലവിനെയും കുറിച്ചുള്ള സ്വതന്ത്രമായ വിലയിരുത്തലുകൾ, ഈ പ്രചാരണം യഥാർത്ഥത്തിൽ അളക്കാവുന്ന ലാഭത്തിലേക്ക് മാറുന്നുണ്ടോ എന്ന് വെളിപ്പെടുത്തും.
- ഹാർഡ്വെയർ വികസനങ്ങൾ: സ്പാർസ് ആക്റ്റിവേഷനായി (sparse activation) ഒപ്റ്റിമൈസ് ചെയ്ത ആക്സിലറേറ്ററുകളുടെ ഉപയോഗം MoE ഗുണങ്ങൾ വർദ്ധിപ്പിച്ചേക്കാം, അതേസമയം ജനറൽ പർപ്പസ് GPU-കൾ ഡെൻസ് മോഡലുകളെ (dense models) മത്സരബുദ്ധിയോടെ നിലനിർത്തിയേക്കാം.
- വിലനിർണ്ണയത്തിലുള്ള പ്രതികരണങ്ങൾ: പാശ്ചാത്യ സേവനദാതാക്കൾ അവരുടെ നിരക്കുകൾ (tiers) ക്രമീകരിക്കുകയോ, ബാച്ച് ഇൻഫറൻസ് ഡിസ്കൗണ്ടുകൾ അല്ലെങ്കിൽ ഓൺ-പ്രെമിസ് ലൈസൻസിംഗ് പോലുള്ള ചിലവ് കുറയ്ക്കുന്ന ഫീച്ചറുകൾ ചേർക്കുകയോ ചെയ്തേക്കാം.
- നിയന്ത്രണപരമായ നീക്കങ്ങൾ: കുറഞ്ഞ ചിലവിലുള്ള AI വ്യാപിക്കുമ്പോൾ, സുതാര്യതയ്ക്കും സുരക്ഷയ്ക്കുമായി ഗവൺമെന്റുകൾ മാനദണ്ഡങ്ങൾ കൊണ്ടുവന്നേക്കാം; ഇത് ഈ മോഡലുകൾ വലിയ തോതിൽ വിന്യസിക്കുന്ന രീതിയെ ബാധിച്ചേക്കാം.
പ്രധാന കാര്യങ്ങൾ
അലിബാബയുടെ MoE അധിഷ്ഠിത Qwen2.5-Max-ഉം ഡീപ്സീക്കിന്റെ കുറഞ്ഞ ചിലവിലുള്ള V3-Flash-ഉം കാണിക്കുന്നത്, AI മത്സരങ്ങൾ ഇപ്പോൾ പാരാമീറ്റർ എണ്ണത്തോളം തന്നെ ബജറ്റ് കണക്കുകളെയും ആശ്രയിച്ചിരിക്കുന്നു എന്നാണ്. ടോക്കൺ ചിലവ് കുറഞ്ഞ നിലയിൽ നിലനിർത്തിക്കൊണ്ട് തന്നെ മികച്ച ഭാഷാപരമായ കഴിവുകൾ നൽകുന്ന കമ്പനികൾ AI സാങ്കേതികവിദ്യയെ കൂടുതൽ ഉപയോക്താക്കളിലേക്ക് എത്തിക്കും, ഇത് ഇതുവരെ ഏറ്റവും വലിയതും വിലകൂടിയതുമായ മോഡലുകൾക്ക് അനുകൂലമായിരുന്ന മത്സര സാഹചര്യങ്ങളെ മാറ്റിമറിക്കും.
