സ്പാർസ് ഫെഡറേറ്റഡ് ലേണിംഗും (Sparse federated learning) ഫാക്ടറിയിലെ റോബോട്ട് ഫീഡ്ബാക്കും സംയോജിപ്പിച്ചതിലൂടെ, വെറും മൂന്ന് ട്രെയിനിംഗ് റൗണ്ടുകളിൽ ചെമ്പ് തരംതിരിക്കുന്ന കൃത്യത 60%-ൽ നിന്ന് 94%-ലേക്ക് ഉയർന്നു. ഇതിനിടയിൽ ഓരോ പങ്കാളിയുടെയും ഡാറ്റ സുരക്ഷിതമായി സൂക്ഷിക്കപ്പെട്ടു. നിർമ്മാതാക്കൾക്കോ റീസൈക്ലർമാർക്കോ സ്മെൽറ്ററുകൾക്കോ അവരുടെ ഉടമസ്ഥാവകാശമുള്ള ഡിസൈനുകൾ, സെൻസർ ലോഗുകൾ അല്ലെങ്കിൽ പ്രോസസ് മോഡലുകൾ എന്നിവ വെളിപ്പെടുത്തേണ്ടി വരാതെ തന്നെ, ഉയർന്ന നിലവാരമുള്ള ഇ-വേസ്റ്റ് റീസൈക്ലിംഗിലേക്കുള്ള ഒരു പാത ഇത് കാണിച്ചുതരുന്നു എന്നതിനാൽ ഈ നേട്ടം വളരെ പ്രധാനപ്പെട്ടതാണ്.
എന്തുകൊണ്ടാണ് ഈ പ്രശ്നം പ്രധാനമാകുന്നത്
ഇലക്ട്രോണിക് മാലിന്യങ്ങളിൽ വിലപ്പെട്ട ലോഹങ്ങൾ അടങ്ങിയിട്ടുണ്ട്, എന്നാൽ അവ വേർതിരിച്ചെടുക്കുന്നത് ഡാറ്റാ-തീവ്രമായ (data-intensive) ഒരു പ്രക്രിയയാണ്. ഡിസൈനർമാർ വിശദമായ ബ്ലൂപ്രിന്റുകൾ സംരക്ഷിക്കുന്നു, റീസൈക്ലർമാർ അസംബ്ലി ലൈനുകളിൽ നിന്നുള്ള വൈബ്രേഷൻ, ഇമേജ്, ടെക്സ്റ്റ് ഡാറ്റ എന്നിവ കൈവശം വെക്കുന്നു, സ്മെൽറ്ററുകൾ സ്വന്തം പ്രോസസ്സിംഗ് സിമുലേഷനുകൾ നടത്തുന്നു. മത്സര നേട്ടങ്ങൾ നഷ്ടപ്പെടുമെന്നോ സ്വകാര്യതാ നിയമങ്ങൾ ലംഘിക്കപ്പെടുമെന്നോ ഉള്ള ഭയം കാരണം ഈ വിഭാഗങ്ങളിലൊരാളും തങ്ങളുടെ പക്കലുള്ള പച്ച ഡാറ്റ (raw data) കൈമാറാൻ ആഗ്രഹിക്കുന്നില്ല. ഇതിന്റെ ഫലമായി ഉണ്ടാകുന്ന ഡാറ്റാ സിലോകുകൾ (data silos) സർക്കുലർ ഇക്കോണമിയെ തളർത്തുന്നു: വിലപ്പെട്ട ലോഹങ്ങൾ നഷ്ടപ്പെടുന്നു, കൂടാതെ ഉൽപ്പന്നങ്ങളുടെ ഉപയോഗത്തിന് ശേഷമുള്ള കൈകാര്യം ചെയ്യൽ മെച്ചപ്പെടുത്താനുള്ള അവസരങ്ങൾ നിർമ്മാതാക്കൾക്ക് നഷ്ടപ്പെടുന്നു.
സ്പാർസ് ഫെഡറേറ്റഡ് ലേണിംഗ് ഫാക്ടറിയിലെ യാഥാർത്ഥ്യങ്ങളെ എങ്ങനെ നേരിടുന്നു
സാധാരണ ഫെഡറേറ്റഡ് ലേണിംഗ്—അതായത് പച്ച ഡാറ്റ മാറ്റാതെ തന്നെ ഒന്നിലധികം ഉപകരണങ്ങൾ ഒരു പങ്കിട്ട മോഡലിനെ പരിശീലിപ്പിക്കുന്ന രീതി—വ്യവസായ മേഖലകളിൽ മൂന്ന് കാരണങ്ങളാൽ പരാജയപ്പെടുന്നു.
- അതിശക്തമായ വൈവിധ്യം (Extreme heterogeneity) – സെൻസറുകൾ അവയുടെ തരത്തിലും ഫോർമാറ്റിലും വളരെയധികം വ്യത്യാസപ്പെട്ടിരിക്കുന്നു; ഹൈ-റെസല്യൂഷൻ ക്യാമറകൾ മുതൽ കുറഞ്ഞ ബാൻഡ്വിഡ്ത്ത് ഉള്ള വൈബ്രേഷൻ മീറ്ററുകൾ വരെ ഇതിൽ ഉൾപ്പെടുന്നു. ഇത്രയും വ്യത്യസ്തമായ ഇൻപുട്ടുകളെ ഒരേപോലെ കൈകാര്യം ചെയ്യാൻ ഒരു മോഡലിന് പ്രയാസമാണ്.
- പരിമിതമായ കണക്റ്റിവിറ്റി (Sparse connectivity) – ഫാക്ടറിയിലെ വൈ-ഫൈ ഇടയ്ക്കിടെ തടസ്സപ്പെടാം. അസ്ഥിരമായ കണക്ഷനിലൂടെ മുഴുവൻ മോഡൽ അപ്ഡേറ്റുകളും അയക്കുന്നത് ട്രെയിനിംഗിനെ മന്ദഗതിയിലാക്കുന്നു.
- ലേബൽ പ്രശ്നം (The label problem) – ഓപ്പറേറ്റർമാരുടെ പക്കൽ ഓരോ ഇനത്തെക്കുറിച്ചും കൃത്യമായ ലേബലുകൾ ഉണ്ടാകണമെന്നില്ല. ഒരു കൂട്ടം വസ്തുക്കൾ വിജയകരമായി വീണ്ടെടുത്തു എന്ന് മാത്രമേ അവർക്ക് അറിയാവൂ, ഇത് ലേണിംഗ് പ്രക്രിയയെ അവ്യക്തമാക്കുന്നു.
പുതിയ രീതി ഈ ഇക്കോസിസ്റ്റത്തെ മൂന്ന് ലോജിക്കൽ ക്ലയന്റ് ഗ്രൂപ്പുകളായി തിരിക്കുന്നു. ഡിസൈൻ കേന്ദ്രീകൃതമായ OEM ക്ലയന്റുകൾ ബ്ലൂപ്രിന്റ് ഡാറ്റ ഉപയോഗിച്ച് എൻകോഡറുകളെ പരിശീലിപ്പിക്കുന്നു, അതേസമയം റീസൈക്ലർ ക്ലയന്റുകൾ ഫാക്ടറി ഫ്ലോറുകളിൽ നിന്ന് ശേഖരിക്കുന്ന സെൻസർ ഫീഡുകൾ ഉപയോഗിച്ച് എൻകോഡറുകളെ പരിശീലിപ്പിക്കുന്നു. ക്ലൗഡിലെ ഒരു അഗ്രഗേറ്റർ ഈ രണ്ട് എൻകോഡർ സ്പേസുകളെയും ഒരു പൊതുവായ രൂപത്തിലേക്ക് കൊണ്ടുവരുന്നു.
ബാൻഡ്വിഡ്ത്ത് നിയന്ത്രിക്കുന്നതിനായി, സിസ്റ്റം top-k gradient sparsification ഉപയോഗിക്കുന്നു. ഓരോ ക്ലയന്റും തങ്ങൾക്ക് ഏറ്റവും പ്രധാനപ്പെട്ടതെന്ന് തോന്നുന്ന 1% ഗ്രേഡിയന്റുകൾ മാത്രം കൈമാറുന്നു. ഒഴിവാക്കപ്പെട്ട ചെറിയ അപ്ഡേറ്റുകൾ ഒരു എറർ-ബഫറിൽ പ്രാദേശികമായി സൂക്ഷിക്കുകയും പിന്നീട് അവ വീണ്ടും ഉപയോഗിക്കുകയും ചെയ്യുന്നു, ഇത് മോഡൽ സൂക്ഷ്മമായ പാറ്റേണുകൾ മറന്നുപോകാതിരിക്കാൻ സഹായിക്കുന്നു.
റോബോട്ടിന്റെ അനിശ്ചിതത്വത്തെ ഉയർന്ന നിലവാരമുള്ള ലേബലുകളാക്കി മാറ്റുന്നു
ഫെഡറേറ്റഡ് ലേണിംഗ് കൊണ്ട് മാത്രം ലേബലുകളുടെ കുറവ് പരിഹരിക്കാൻ കഴിയില്ല. ഗവേഷകർ ഇതിനായി embodied agents—അതായത് തരംതിരിക്കാൻ ഉപയോഗിക്കുന്ന അതേ സെൻസറുകൾ ഘടിപ്പിച്ച റോബോട്ടുകളെ—ഉൾപ്പെടുത്തി. ഒരു ലോഹ കഷ്ണം ഏതാണെന്ന് റോബോട്ടിന് ഉറപ്പില്ലാത്തപ്പോൾ, അത് ഒരു മനുഷ്യ ഓപ്പറേറ്ററെ അറിയിക്കുന്നു. ഓപ്പറേറ്റർ ശരിയായ ലോഹ ലേബൽ നൽകുന്നു, ഇത് പ്രാദേശിക ട്രെയിനിംഗ് ലൂപ്പിലേക്ക് തിരികെ എത്തുന്നു.
ഈ ഫീഡ്ബാക്ക് ലൂപ്പ് അനിശ്ചിതത്വത്തിന്റെ നിമിഷങ്ങളെ കൃത്യമായ ഡാറ്റാ പോയിന്റുകളാക്കി മാറ്റുകയും ട്രെയിനിംഗ് സെറ്റിന്റെ സിഗ്നൽ-ടു-നോയിസ് റേഷ്യോ (signal-to-noise ratio) ഗണ്യമായി മെച്ചപ്പെടുത്തുകയും ചെയ്യുന്നു. ലേബൽ ലഭിക്കുന്നത് യഥാർത്ഥ വസ്തു കാണുന്ന ഒരു മനുഷ്യനിൽ നിന്നായതുകൊണ്ട്, മോഡൽ അവ്യക്തമായ "വീണ്ടെടുത്തു vs നഷ്ടപ്പെട്ടു" എന്ന ബാച്ച് ഫലങ്ങളിൽ നിന്നല്ല, മറിച്ച് കൃത്യമായ വിവരങ്ങളിൽ (ground-truth) നിന്നാണ് പഠിക്കുന്നത്.
ഫലങ്ങളും പ്രത്യാഘാതങ്ങളും
നിയന്ത്രിത പരീക്ഷണങ്ങളിൽ, സംയോജിത സിസ്റ്റം വെറും മൂന്ന് ഫെഡറേറ്റഡ് റൗണ്ടുകൾക്ക് ശേഷം ചെമ്പ് തരംതിരിക്കുന്ന കൃത്യത 60%-ൽ നിന്ന് 94%-ലേക്ക് ഉയർത്തി. ഇൻപുട്ട് സ്ട്രീമുകളിലെ കഠിനമായ വൈവിധ്യങ്ങൾക്കിടയിലും കൈമാറിയത് വെറും 1% ഗ്രേഡിയന്റ് ഡാറ്റ മാത്രമായിരുന്നിട്ടും ഈ കുതിച്ചുചാട്ടം ഉണ്ടായി. എറർ-ബഫർ ഉപയോഗിച്ചതിനാൽ, തുടക്കത്തിൽ ഒഴിവാക്കിയ സൂക്ഷ്മമായ അപ്ഡേറ്റുകളും മോഡൽ ഉൾക്കൊണ്ടു എന്ന് ഉറപ്പാക്കി.
ഉയർന്ന കൃത്യതയുള്ള റീസൈക്ലിംഗിന് ഒരു വലിയ സെൻട്രൽ AI മോഡൽ ആവശ്യമില്ലെന്ന് ഈ ഫലം സൂചിപ്പിക്കുന്നു. വിതരണ ഏജന്റുകളുടെ ഡാറ്റാ പരമാധികാരം (data sovereignty) മാനിച്ചുകൊണ്ട് തന്നെ, യഥാർത്ഥ ലോകത്തെ വ്യതിയാനങ്ങളെ നേരിടാൻ ശേഷിയുള്ള ഒരു മോഡൽ വിതരണ aprendizനം (distributed learning) വഴി നൽകാൻ കഴിയും.
സാധ്യമായ പോരായ്മകളും എതിർപ്പുകളും
റോബോട്ടിന് അനിശ്ചിതത്വം ഉണ്ടാകുമ്പോഴെല്ലാം ഈ രീതി മനുഷ്യ ഇടപെടലിനെ ആശ്രയിക്കുന്നു.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
ഈ രീതി സ്ട്രെസ് ടെസ്റ്റുകളിൽ വിജയിച്ചാൽ, സ്വകാര്യത സംരക്ഷിക്കുന്നതും ഡാറ്റാ-കാര്യക്ഷമവുമായ ഒരു റീസൈക്ലിംഗ് ഇൻഫ്രാസ്ട്രക്ചറിന്റെ നട്ടെല്ലായി ഇത് മാറിയേക്കാം—അതായത്, സ്വന്തം രഹസ്യങ്ങൾ വെളിപ്പെടുത്താതെ തന്നെ ഓരോ പങ്കാളിക്കും പങ്കിട്ട ബുദ്ധിശക്തിയുടെ (shared intelligence) ഗുണം ലഭിക്കുന്ന ഒരു സംവിധാനം.
ചുരുക്കത്തിൽ: റോബോട്ട് നിർമ്മിത മനുഷ്യ ലേബലുകളാൽ ശക്തിപ്പെടുത്തിയ സ്പാർസ് ഫെഡറേറ്റഡ് ലേണിംഗ്, സർക്കുലർ മാനുഫാക്ചറിംഗിലെ വിഭജിക്കപ്പെട്ട ഡാറ്റയെ ഇ-വേസ്റ്റ് തരംതിരിക്കാൻ സഹായിക്കുന്ന ശക്തവും സ്വകാര്യത സുരക്ഷിതവുമായ ഒരു മോഡലായി മാറ്റുന്നു. വലിയ സെൻട്രൽ മോഡലുകളല്ല, മറിച്ച് വിതരണ aprendizനമാണ് (distributed AI) കൂടുതൽ ഹരിതവും കാര്യക്ഷമവുമായ ഇലക്ട്രോണിക്സ് സപ്ലൈ ചെയിനിന്റെ യഥാർത്ഥ ചാലകശക്തി എന്ന് ഈ സാങ്കേതികവിദ്യ തെളിയിക്കുന്നു.
