Tencent ഈ ആഴ്ച WeMM-Embedding മോഡൽ പുറത്തിറക്കി, ഇത് WeChat-ന്റെ സെർച്ച്, റെക്കമെൻഡേഷൻ, ഇ-കൊമേഴ്‌സ് പൈപ്പ്‌ലൈനുകളിൽ നിലവിൽ തന്നെ ഉൾപ്പെടുത്തിയിട്ടുള്ള 2 ബില്യൺ പാരാമീറ്ററുകളുള്ള ഒരു മൾട്ടിമോഡൽ സിസ്റ്റമാണ്. യഥാർത്ഥ ലോകത്തെ റിട്രീവൽ ക്വാളിറ്റി, കുറഞ്ഞ ലേറ്റൻസി (latency), ചെറിയ ഇൻഡക്സ് സൈസ് എന്നിവ നൽകുന്ന ഒരു മോഡൽ ആയതുകൊണ്ടാണ് ഈ റിലീസ് ശ്രദ്ധേയമാകുന്നത്.

ഒരു “deployment story”-യെ ചുറ്റിയുള്ള ചർച്ചകൾ എന്തുകൊണ്ട്?

മിക്ക പുതിയ AI മോഡലുകളും ക്യൂറേറ്റഡ് ഡാറ്റാസെറ്റുകളിൽ സ്കോറുകൾ താരതമ്യം ചെയ്യുന്ന ഗ്ലോസി ബെഞ്ച്മാർക്ക് ടേബിളുകളുമായാണ് വരുന്നത്. ആ നമ്പറുകൾ ഗവേഷകർക്ക് ഒരു കാര്യം തെളിയിക്കാൻ സഹായിക്കുമെങ്കിലും, ഉൽപ്പന്നങ്ങളെ നയിക്കുന്ന മെട്രിക്സുകളിലേക്ക് അവ അപൂർവ്വമായി മാത്രമേ പരിവർത്തനം ചെയ്യപ്പെടുന്നുള്ളൂ: ഒരു ക്വറി എത്ര വേഗത്തിൽ മറുപടി നൽകുന്നു, ഒരു ഇൻഡക്സ് എത്രത്തോളം മെമ്മറി ഉപയോഗിക്കുന്നു, കൂടാതെ ഉപയോക്താക്കൾ നിർമ്മിക്കുന്ന സങ്കീർണ്ണമായ (noisy) ഉള്ളടക്കങ്ങളോട് മോഡൽ എത്രത്തോളം നന്നായി പ്രതികരിക്കുന്നു എന്നിവയാണവ. WeMM ആദ്യ ദിവസം മുതൽ തന്നെ ഒരു പ്രൊഡക്ഷൻ-ഗ്രേഡ് കമ്പോണന്റായി പ്രവർത്തിക്കുന്നതിലൂടെ ഈ രീതിയെ മാറ്റുന്നു. ഇത് ഒരു ഡൗൺസ്ട്രീം ടീം സ്വീകരിക്കുന്നത് വരെ കാത്തിരിക്കേണ്ട ഒരു ലാബ് പരീക്ഷണമല്ല; ഇത് നിലവിൽ തന്നെ Channels, Moments, ഇ-കൊമേഴ്‌സ് എന്നിവയ്ക്ക് കരുത്ത് പകരുന്നു.

ഡെവലപ്പർമാർ ശ്രദ്ധിക്കേണ്ട സാങ്കേതിക വശങ്ങൾ

  • യഥാർത്ഥ മൾട്ടിമോഡൽ കൈകാര്യം ചെയ്യൽ – ഈ മോഡൽ ടെക്സ്റ്റ്, ഇമേജുകൾ, വീഡിയോ ഫ്രെയിമുകൾ, ഡോക്യുമെന്റ് തംബ്‌നെയിലുകൾ എന്നിവയെ ഒരൊറ്റ എംബെഡിംഗ് സ്പേസിലേക്ക് സ്വീകരിക്കുന്നു. ഒരു ഉപയോക്താവിന് “sunset” എന്ന് ടൈപ്പ് ചെയ്താൽ, ടെക്സ്റ്റ് മാത്രമുള്ളതോ വിഷൻ മാത്രമുള്ളതോ ആയ പൈപ്പ്‌ലൈനുകൾ പ്രത്യേകം യോജിപ്പിക്കാതെ തന്നെ അനുയോജ്യമായ ഒരു വീഡിയോ ക്ലിപ്പ്, ഫോട്ടോ അല്ലെങ്കിൽ ഒരു വാർത്താ ലേഖനം എന്നിവ കണ്ടെത്താൻ സാധിക്കും.

  • വലിപ്പം പ്രധാനമാണ്, പക്ഷേ നിങ്ങൾ വിചാരിക്കുന്ന രീതിയിലല്ല – ലീഡർബോർഡുകളിൽ ആധിപത്യം പുലർത്തുന്ന 9 ബില്യൺ പാരാമീറ്ററുകളിൽ കൂടുതലുള്ള മോഡലുകളുമായി താരതമ്യം ചെയ്യുമ്പോൾ 2 ബില്യൺ പാരാമീറ്ററുകളുള്ള ഈ മോഡൽ “ചെറുതാണ്”. എന്നിരുന്നാലും, ഇന്ററാക്റ്റീവ് സേവനങ്ങൾക്കായി ആവശ്യമായ ലേറ്റൻസി ബജറ്റുകൾ ഇത് നിറവേറ്റുന്നു. നിങ്ങളുടെ ഹാർഡ്‌വെയറിന് അനുയോജ്യമായ ഒരു മോഡലിന് ലൈവ് സിസ്റ്റത്തിൽ വലിയതും പതുക്കെയുമുള്ള ഒരു മോഡലിനേക്കാൾ മികച്ച പ്രകടനം കാഴ്ചവെക്കാൻ കഴിയും.

  • Matryoshka embeddings ഡൈമൻഷൻ ഫ്ലെക്സിബിലിറ്റി നൽകുന്നു – WeMM “Matryoshka” എംബെഡിംഗുകൾ പിന്തുണയ്ക്കുന്നു, അതായത് ഒരേ നെറ്റ്‌വർക്കിന് തന്നെ 256 അല്ലെങ്കിൽ 512 ഡൈമൻഷനുകൾ പോലുള്ള വ്യത്യസ്ത നീളമുള്ള വെക്റ്ററുകൾ ഔട്ട്പുട്ട് നൽകാൻ കഴിയും. 512-ൽ നിന്ന് 256 ഡൈമൻഷനുകളിലേക്ക് കുറയ്ക്കുമ്പോൾ റിട്രീവൽ പെർഫോമൻസ് ഏതാണ്ട് പൂർണ്ണമായി നിലനിർത്തുന്നതോടൊപ്പം മെമ്മറി ഉപയോഗം പകുതിയായി കുറയ്ക്കാനും സാധിക്കുമെന്ന് പരിശോധനകൾ കാണിക്കുന്നു. ഇത് സ്റ്റോറേജ് ചെലവ് നേരിട്ട് കുറയ്ക്കുകയും നിയർസ്റ്റെസ്റ്റ്-നെൈബർ സെർച്ചുകൾ വേഗത്തിലാക്കുകയും ചെയ്യുന്നു.

റിട്രീവൽ സിസ്റ്റങ്ങൾ നിർമ്മിക്കുന്നതിനുള്ള മൂന്ന് പ്രായോഗിക നിയമങ്ങൾ

  1. സ്വന്തം ഡാറ്റയിൽ പരിശോധിക്കുക – ബെഞ്ച്മാർക്കുകൾ വൃത്തിയുള്ളതാണ്; എന്നാൽ പ്രൊഡക്ഷൻ ഡാറ്റ സങ്കീർണ്ണമാണ്. നിങ്ങളുടെ ഉപയോക്താക്കൾ സ്ക്രീൻഷോട്ടുകൾ, കൈപ്പടയിലുള്ള കുറിപ്പുകൾ അല്ലെങ്കിൽ ലോ-റെസല്യൂഷൻ വീഡിയോകൾ എന്നിവ അപ്‌ലോഡ് ചെയ്യുന്നുണ്ടെങ്കിൽ, അത് അനുയോജ്യമാണോ എന്ന് തീരുമാനിക്കുന്നതിന് മുമ്പ് ആ കൃത്യമായ മിശ്രിതത്തിൽ മോഡൽ പ്രവർത്തിപ്പിച്ചു നോക്കുക.

  2. വെക്റ്റർ നീളം ഒരു ചെലവ് നിയന്ത്രണമായി കാണുക – വലിയ വെക്റ്ററുകൾ സിമിലാരിറ്റി സെർച്ചിന് ആവശ്യമായ കമ്പ്യൂട്ടിംഗും ഇൻഡക്സിനായുള്ള ഡിസ്ക് സ്പേസും വർദ്ധിപ്പിക്കുന്നു. നിങ്ങളുടെ ക്വാളിറ്റി ലക്ഷ്യം നിറവേറ്റുന്ന ഏറ്റവും ചെറിയ ഡൈമൻഷനിൽ നിന്ന് തുടങ്ങുക. റികാൾ (recall) അല്ലെങ്കിൽ പ്രിസിഷനിൽ (precision) വ്യക്തമായ കുറവ് കാണുമ്പോൾ മാത്രം വലുതാക്കുക.

  3. ഒറ്റപ്പെട്ട പൈപ്പ്‌ലൈനുകൾ ഒഴിവാക്കുക – ഓരോ മോഡാലിറ്റിക്കും പ്രത്യേക എൻകോഡറുകൾ നിർമ്മിക്കുന്നത് അവസാന റാങ്കിംഗ് ഘട്ടത്തിനായി വെയിറ്റിംഗ് സ്കീമുകൾ കൈകൊണ്ട് തയ്യാറാക്കാൻ നിങ്ങളെ നിർബന്ധിക്കുന്നു. ഒരു യൂണിവേഴ്സൽ എംബെഡിംഗ് ലെയർ ആ ഗ്ലൂ കോഡ് ഒഴിവാക്കുകയും, എഞ്ചിനീയറിംഗ് ജോലിഭാരം കുറയ്ക്കുകയും, A/B ടെസ്റ്റിംഗ് ലളിതമാക്കുകയും ചെയ്യുന്നു.

വിപുലമായ പ്രത്യാഘാതങ്ങൾ

സെർച്ച് അല്ലെങ്കിൽ റെക്കമെൻഡേഷനുകളെ ആശ്രയിക്കുന്ന കമ്പനികളെ സംബന്ധിച്ചിടത്തോളം, എംബെഡിംഗ് മോഡലിന്റെ തിരഞ്ഞെടുപ്പ് ഇൻഫ്രാസ്ട്രക്ചർ ചെലവിനെ സ്വാധീനിച്ചേക്കാം. ഉപയോക്താക്കളുടെ പ്രതീക്ഷകൾ ഉയരുന്നതിനനുസരിച്ച് ലേറ്റൻസി ബജറ്റുകൾ കുറഞ്ഞുവരുന്നു; ഒരു ക്വറിക്ക് ഏതാനും മില്ലിസെക്കൻഡുകൾ പോലും അധികം സമയം എടുക്കുന്ന ഒരു മോഡൽ സേവനത്തിന്റെ പ്രകടനം തകരാനും ഉപയോക്താക്കളുടെ കുറവിനും കാരണമായേക്കാം.

Apache 2.0 ലൈസൻസിന് കീഴിൽ വെയിറ്റുകൾ ഓപ്പൺ സോഴ്‌സ് ആക്കാനുള്ള Tencent-ന്റെ തീരുമാനം ഡെവലപ്പർമാരുടെ ചെലവ് കുറയ്ക്കുകയും ചെയ്യുന്നു. പ്രൊപ്രൈറ്ററി കരാറുകളിൽ ഏർപ്പെടുകയോ അല്ലെങ്കിൽ ഒരു മോഡൽ പൂജ്യത്തിൽ നിന്ന് നിർമ്മിക്കുകയോ ചെയ്യുന്നതിന് പകരം, ടീമുകൾക്ക് ചെക്ക്‌പോയിന്റ് ഡൗൺലോഡ് ചെയ്യാനും ഡൊമെയ്ൻ-സ്പെസിഫിക് ഡാറ്റയിൽ അത് ഫൈൻ ട്യൂൺ ചെയ്യാനും പരാജയപ്പെട്ട കേസുകൾ ഉപയോഗിച്ച് അത് വിലയിരുത്താനും കഴിയും.

മോഡലിന്റെ പരിമിതികൾ

ഈ മോഡൽ നാല് മോഡാലിറ്റികൾ—ടെക്സ്റ്റ്, ഇമേജുകൾ, വീഡിയോ, ഡോക്യുമെന്റുകൾ—കൈകാര്യം ചെയ്യുന്നുണ്ടെങ്കിലും എല്ലാത്തരം ഇൻപുട്ടുകളും ഇത് ഉൾക്കൊള്ളുന്നില്ല.

അടുത്തതായി ശ്രദ്ധിക്കേണ്ടവ

ചുരുക്കം

പ്രൊഡക്ഷൻ നിയന്ത്രണങ്ങൾ മുൻനിർത്തി നിർമ്മിച്ചാൽ ഒരു മിതമായ വലിപ്പമുള്ള മൾട്ടിമോഡൽ എംബെഡിംഗ് മോഡലിന് ദൈനംദിന ക്വറികൾ കൈകാര്യം ചെയ്യാൻ കഴിയുമെന്ന് WeMM തെളിയിക്കുന്നു. ഡെവലപ്പർമാർക്ക് സന്ദേശം വ്യക്തമാണ്: യഥാർത്ഥ ലോകത്തെ റിട്രീവൽ ക്വാളിറ്റിക്ക് മുൻഗണന നൽകുക, വെക്റ്റർ ഡൈമൻഷനുകൾ കഴിയുന്നത്ര ചെറുതാക്കി വെക്കുക, കൂടാതെ എല്ലാ മോഡാലിറ്റികളെയും ഒരു സിംഗിൾ എംബെഡിംഗ് ലെയറിലേക്ക് സംയോജിപ്പിക്കുക. ഈ തിരഞ്ഞെടുപ്പുകൾ ലേറ്റൻസി കുറയ്ക്കാനും സ്റ്റോറേജ് ചെലവ് കുറയ്ക്കാനും ഒടുവിൽ ഉപയോക്താക്കൾക്ക് മികച്ച അനുഭവം നൽകാനും സഹായിക്കും.