DeepMind ഈ ആഴ്ച DiffusionGemma പുറത്തിറക്കി. ഒരു സിംഗിൾ H100 GPU-വിൽ സെക്കൻഡിൽ ഏകദേശം 1,500 ടോക്കണുകൾ വരെ നിർമ്മിക്കാൻ കഴിയുന്ന ഒരു ഓപ്പൺ-വെയ്റ്റ് ലാംഗ്വേജ് മോഡലാണിത്. എന്നാൽ സാധാരണ Gemma 4 മോഡലിന്റെ വേഗത സെക്കൻഡിൽ 303 ടോക്കണുകൾ മാത്രമാണ്. റിയൽ-ടൈം ആപ്ലിക്കേഷനുകളിൽ AI അധിഷ്ഠിത ഏജന്റുകളുടെ പ്രവർത്തനത്തെ സാവധാനത്തിലാക്കുന്ന ലേറ്റൻസി തടസ്സങ്ങൾ (latency bottleneck) കുറയ്ക്കാൻ ഈ വേഗത വർദ്ധനവ് സഹായിക്കും എന്നതിനാൽ ഇത് വളരെ പ്രധാനമാണ്.

ടോക്കൺാടി ടോക്കൺ എന്ന രീതിയെ DiffusionGemma എങ്ങനെ മാറ്റുന്നു

മിക്ക ആധുനിക ലാംഗ്വേജ് മോഡലുകളും ഓട്ടോറഗ്രസീവ് (autoregressive) രീതിയിലാണ് ടെക്സ്റ്റ് നിർമ്മിക്കുന്നത്: അവ ഓരോ ടോക്കണും പ്രവചിക്കുന്നു, അത് വീണ്ടും മോഡലിലേക്ക് നൽകുന്നു, തുടർന്ന് അടുത്ത ടോക്കൺ പ്രവചിക്കുന്നു. ഈ "ഇടത്തുനിന്ന് വലത്തോടുള്ള" ലൂപ്പ് കമ്പ്യൂട്ടിനും മെമ്മറിക്കും ഇടയിൽ ശക്തമായ ഒരു ബന്ധം ഉണ്ടാക്കുന്നു, കാരണം ഓരോ ടോക്കണിനും മോഡലിന്റെ വെയ്റ്റുകൾ (weights) ആക്സസ് ചെയ്യേണ്ടതുണ്ട്. DiffusionGemma ഈ ലൂപ്പിന് പകരം ഒരു ഡിസ്ക്രീറ്റ് ഡിഫ്യൂഷൻ പ്രക്രിയ (discrete diffusion process) ഉപയോഗിക്കുന്നു; ഇത് 256 ടോക്കണുകൾ അടങ്ങിയ ഒരു ഭാഗത്തെ (chunk) ഒരു സിംഗിൾ ബ്ലോക്ക് നോയിസി ഡാറ്റയായി കണക്കാക്കുന്നു. തുടർന്ന് മോഡൽ ഈ മുഴുവൻ ബ്ലോക്കിനെയും സമാന്തരമായി (in parallel) ഡീനോയിസ് ചെയ്യുന്നു. ഇത് ആവർത്തിച്ചുള്ള വെയ്റ്റ് ലുക്കപ്പുകൾക്ക് (weight lookups) പകരം ഓരോ ഘട്ടത്തിലും കൂടുതൽ കമ്പ്യൂട്ട് ഉപയോഗിക്കുന്ന രീതിയിലേക്ക് പ്രവർത്തനത്തെ മാറ്റുന്നു. Nvidia-യുടെ H100 പോലുള്ള സമാന്തര ഗണിതക്രിയകളിൽ (parallel math) മികshowing ഹാർഡ്‌വെയറുകളിൽ ഈ മാറ്റം മികച്ച ഫലം നൽകുന്നു.

AI ഏജന്റുകൾക്ക് വേഗത പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്

സ്വയം പ്രവർത്തിക്കുന്ന ഏജന്റുകൾ (Autonomous agents) സാധാരണയായി തിരയൽ, സംഗ്രഹം തയ്യാറാക്കൽ, പരിശോധന എന്നിവയുടെ ഒരു ചക്രം പിന്തുടരുന്നു. ഓരോ ഘട്ടത്തിലും ഒന്നിലധികം മോഡൽ കോളുകൾ ആവശ്യമായി വന്നേക്കാം, അതിനാൽ ഓരോ ടോക്കണിനും എടുക്കുന്ന സമയം (latency) വേഗത്തിൽ വർദ്ധിച്ചേക്കാം. ഒരു മോഡൽ സാവധാനത്തിലാകുമ്പോൾ, മുഴുവൻ ഏജന്റ് പൈപ്പ്‌ലൈനും തടസ്സപ്പെടുകയും ഇത് ചിലവ് വർദ്ധിപ്പിക്കുകയും ഉപയോക്താവിന്റെ അനുഭവം മോശമാക്കുകയും ചെയ്യുന്നു.

പ്രകടനത്തിലെ വിട്ടുവീഴ്ചകൾ (The performance trade-off)

DiffusionGemma-യുടെ വേഗത ലഭിക്കുമ്പോൾ അതിന്റെ അടിസ്ഥാന ശേഷ്യത്തിൽ (raw capability) അളക്കാവുന്ന കുറവുണ്ടാകുന്നു. യുക്തിചിന്ത (reasoning), വസ്തുതാപരമായ കൃത്യത (factuality), ഭാഷാപരമായ ധാരണ (language understanding) എന്നിവ അളക്കുന്ന AIME ബെഞ്ച്മാർക്കിൽ DiffusionGemma 69.1 സ്കോർ ചെയ്യുമ്പോൾ, Gemma 4 88.3 സ്കോർ ചെയ്യുന്നു. വളരെ ചെറിയ ഔട്ട്പുട്ടുകൾ നൽകുന്നതിലും, ചിലപ്പോൾ ടോക്കണുകൾ ആവർത്തിക്കുന്നതോ തപ്പിത്തടയുന്നതോ ആയ (stuttering) അവസ്ഥയിലും ഡിഫ്യൂഷൻ രീതി പോരായ്മകൾ കാണിക്കുന്നു. ഏകദേശം 32-ലധികം ഉപയോക്താക്കൾ ഒരേസമയം മോഡലിനെ ഉപയോഗിക്കുമ്പോൾ, ഇതിന്റെ സമാന്തര പ്രവർത്തനത്തിന്റെ ഗുണം കുറയുകയും സാധാരണ ഓട്ടോറഗ്രസീവ് രീതിയുടെ വേഗത ഇതിനോട് എത്തുകയും ചെയ്യുന്നു.

ഓരോ രീതിയും എവിടെ ഉപയോഗിക്കാം

താഴെ പറയുന്ന രീതിയിലുള്ള ഒരു ഹൈബ്രിഡ് വിന്യാസമാണ് (hybrid deployment strategy) ഡാറ്റ സൂചിപ്പിക്കുന്നത്:

  • Diffusion models: ആഴത്തിലുള്ള യുക്തിചിന്ത ആവശ്യമില്ലാത്തതും എന്നാൽ ലേറ്റൻസിക്ക് പ്രാധാന്യമുള്ളതുമായ ജോലികൾക്കായി—ഉദാഹരണത്തിന്, ചെറിയ പ്രോംപ്റ്റുകൾ നിർമ്മിക്കുക, ടെംപ്ലേറ്റുകൾ പൂരിപ്പിക്കുക, അല്ലെങ്കിൽ ഡ്രാഫ്റ്റ് ടെക്സ്റ്റുകൾ തയ്യാറാക്കുക എന്നിവയ്ക്ക്.
  • Autoregressive models: ഉയർന്ന കോൺകറൻസി ഉള്ള ജോലികൾക്കും, സങ്കീർണ്ണമായ യുക്തിചിന്ത ആവശ്യമായ കാര്യങ്ങൾക്കും, അല്ലെങ്കിൽ വേഗതയേക്കാൾ കൃത്യതയ്ക്ക് പ്രാധാന്യമുള്ള ദീർഘമായ എഴുത്തുകൾക്കും വേണ്ടി.

ഈ മാറ്റം AI ഇൻഫ്രാസ്ട്രക്ചറിനെ എങ്ങനെ ബാധിക്കുന്നു

മോഡലിന്റെ വലിപ്പം കൂട്ടുന്നതിന് പകരം ജനറേഷൻ അൽഗോരിതം പുനർചിന്തനം ചെയ്യുന്നതിലൂടെ വേഗത വർദ്ധിപ്പിക്കാൻ സാധിക്കുമെങ്കിൽ, ഏറ്റവും വലിയ കാര്യക്ഷമത നേട്ടങ്ങൾ അടിസ്ഥാനപരമായ സംവിധാനങ്ങളിലെ (plumbing) മെച്ചപ്പെടുത്തലുകളിൽ നിന്നായിരിക്കും ലഭിക്കുക. എന്നാൽ ഈ വിട്ടുവീഴ്ചകൾ കാരണം ചില ഉപയോഗങ്ങളിൽ ഗുണനിലവാരത്തിൽ നേരിയ കുറവ് സംഭവിക്കുമെന്ന് ഡെവലപ്പർമാർ അംഗീകരിക്കേണ്ടി വരും.

വിപരീത വാദം: ഡിഫ്യൂഷൻ രീതി പൂർണ്ണമായ ഉപയോഗത്തിന് തയ്യാറാണോ?

ചെറിയ പ്രോംപ്റ്റുകൾ കൈകാര്യം ചെയ്യുന്നതിൽ ഡിഫ്യൂഷൻ രീതി ബുദ്ധിമുട്ടുന്നുണ്ട്, കൂടാതെ ഇത് അസ്ഥിരമായ (jittery) ഔട്ട്പുട്ടുകൾ നൽകിയേക്കാം.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

  • Scaling studies: വലിയ ഡിഫ്യൂഷൻ മോഡലുകൾ വേഗത നിലനിർത്തിക്കൊണ്ട് തന്നെ ശേഷിയിലെ വിടവ് നികത്തുമോ?
  • Hardware optimizations: GPU-കൾ വികസിക്കുന്നതിനനുസരിച്ച്, കമ്പ്യൂട്ട്-ഭാരമേറിയ ഡിഫ്യൂഷൻ ഘട്ടങ്ങളും വെയ്റ്റ്-ഭാരമേറിയ ഓട്ടോറഗ്രസീഷനും തമ്മിലുള്ള സന്തുലിതാവസ്ഥ വീണ്ടും മാറാൻ സാധ്യതയുണ്ട്.
  • Routing algorithms: ടാസ്ക്-അവയർ മോഡൽ റൂട്ടറുകളുടെ (task-aware model routers) പ്രാരംഭ മാതൃകകൾ വഴി ഡൈനാമിക് സെലക്ഷൻ ഉപയോഗിച്ച് സിസ്റ്റത്തിന്റെ മൊത്തത്തിലുള്ള ലേറ്റൻസി എത്രത്തോളം കുറയ്ക്കാൻ കഴിയുമെന്ന് മനസ്സിലാക്കാം.

ചുരുക്കം

അടിസ്ഥാനപരമായ ജനറേഷൻ ലൂപ്പ് പുനർചിന്തനം ചെയ്യുന്നതിലൂടെ കൂടുതൽ ചിപ്പുകൾ ചേർക്കാതെ തന്നെ ലേറ്റൻസി ഗണ്യമായി കുറയ്ക്കാൻ കഴിയുമെന്ന് DiffusionGemma തെളിയിക്കുന്നു. ഈ സാങ്കേതികവിദ്യ ഓട്ടോറഗ്രസീവ് മോഡലുകൾക്ക് പകരമാവില്ല, എന്നാൽ വേഗതയും കൃത്യതയും ഓരോ ജോലിക്കും അനുസരിച്ച് സന്തുലിതമാക്കുന്ന ഒരു ഹൈബ്രിഡ് AI സ്റ്റാക്കിന് ഇത് മികച്ചൊരു ഉപകരണം വാഗ്ദാനം ചെയ്യുന്നു. വരുംകാല AI ഇൻഫ്രാസ്ട്രക്ചറുകൾ മോഡലിന്റെ വലിപ്പം കൊണ്ട് മാത്രമല്ല, ജോലികൾ ശരിയായ എഞ്ചിനുകളിലേക്ക് എത്ര ബുദ്ധിപരമായി റൂട്ട് ചെയ്യുന്നു എന്നതിനെ അടിസ്ഥാനമാക്കിയായിരിക്കും വിലയിരുത്തപ്പെടുക.