ഒരു സ്വയം നിയന്ത്രിത വാഹനം ഓരോ മിനിറ്റിലും നൂറുകണക്കിന് മെഗാബൈറ്റ് പോയിന്റ് ക്ലൗഡ് ഡാറ്റ ഉത്പാദിപ്പിച്ചേക്കാം. ലിഡാർ (Lidar) സെൻസറുകൾ ദശലക്ഷക്കണക്കിന് ലേസർ പൾസുകൾ പുറത്തേക്ക് വിടുന്നു, തിരികെ വരുന്ന ഓരോ പൾസും കൃത്യമായ ഒരു സ്പേഷ്യൽ കോർഡിനേറ്റ് ആയി മാറുന്നു. ഇതിന്റെ ഫലമായി ലോകത്തിന്റെ സാന്ദ്രതയാർന്ന ഒരു ത്രിമാന സ്നാപ്ഷോട്ട് ലഭിക്കുന്നു. അതിന്റെ കൃത്യത മനോഹരമാണെങ്കിലും, അതിന്റെ വലിപ്പം വലിയൊരു വെല്ലുവിളിയാണ്.
പരമ്പരാഗത കോഡെക്കുകൾ ഉപയോഗിച്ച് റോ പോയിന്റ് ക്ലൗഡുകൾ എളുപ്പത്തിൽ കംപ്രസ് ചെയ്യാൻ കഴിയില്ല. വിഷ്വൽ പാറ്റേണുകൾ ഉപയോഗപ്പെടുത്താൻ കഴിയുന്ന JPEG ചിത്രങ്ങളിൽ നിന്നോ, ഫ്രെയിമുകൾക്കിടയിലെ ചലനം ട്രാക്ക് ചെയ്യാൻ കഴിയുന്ന H.264 വീഡിയോകളിൽ നിന്നോ ഇത് വ്യത്യസ്തമാണ്; ഒരു പോയിന്റ് ക്ലൗഡ് എന്നത് x, y, z മൂല്യങ്ങളുടെ ക്രമരഹിതമായ ഒരു വിതരണമാണ്. അവിടെ സ്വാഭാവികമായ ഗ്രിഡുകളോ, അനാവശ്യമായ പിക്സലുകളോ, എളുപ്പത്തിലുള്ള വഴികളോ ഇല്ല. ഫയലുകളുടെ വലിപ്പം വർദ്ധിക്കുന്നു. ആർക്കൈവുകൾ ചിലവേറിയതാകുന്നു. നെറ്റ്വർക്കുകൾ തടസ്സപ്പെടുന്നു. ഈ ഡാറ്റ വേഗത്തിൽ കൈമാറാനോ കുറഞ്ഞ ചിലവിൽ സംഭരിക്കാനോ ആഗ്രഹിക്കുന്ന വ്യവസായങ്ങളെ സംബന്ധിച്ചിടത്തോളം ഇതൊരു വലിയ ഭാരമാണ്.
Deep AutoEncoder Geometry Compression-നെ കുറിച്ചുള്ള സമീപനമായ പുതിയ പഠനങ്ങൾ ഇതിന് മറ്റൊരു വഴി കാണിച്ചുതരുന്നു. പോയിന്റ് ക്ലൗഡുകളെ വെറുതെ സിപ്പ് (zip) ചെയ്യേണ്ട സ്റ്റാറ്റിക് ഫയലുകളായി കാണുന്നതിന് പകരം, അവയെ പഠിച്ചെടുക്കാവുന്ന ഘടനകളായി (learnable structures) ഈ രീതി കാണുന്നു. സങ്കീർണ്ണമായ രൂപങ്ങൾക്കുള്ളിലെ ഒളിഞ്ഞിരിക്കുന്ന സാന്ദ്രത കണ്ടെത്താൻ ഇത് ഡീപ്പ് ലേണിംഗ് ഉപയോഗിക്കുന്നു.
റോ ജിയോമെട്രിയുടെ ഭാരം
നിങ്ങൾ എപ്പോഴെങ്കിലും ഒരു ഹൈ-റെസല്യൂഷൻ പോയിന്റ് ക്ലൗഡ് ഫയൽ തുറന്നിട്ടുണ്ടെങ്കിൽ, ഈ പ്രശ്നം നേരിട്ട് കണ്ടിട്ടുണ്ടാകും. ഒരു നഗര ബ്ലോക്കിന്റെ വിശദമായ സ്കാൻ എളുപ്പത്തിൽ പല ഗിഗാബൈറ്റുകളോളം വരും. വാഹനങ്ങളിൽ നിന്ന് ആ ഡാറ്റ ഒരു സെൻട്രൽ സെർവറിലേക്ക് അയക്കുന്നത് സാവധാനത്തിലാകുക മാത്രമല്ല, ചിലവേറിയതുമാണ്. റിയൽ-ടൈം സിസ്റ്റങ്ങളിൽ ജോലി ചെയ്യുന്ന എഞ്ചിനീയർമാർ പലപ്പോഴും ഒരു കഠിനമായ തിരഞ്ഞെടുപ്പിനെ നേരിടുന്നു: വിശദാംശങ്ങൾ നിലനിർത്തിക്കൊണ്ട് ലേറ്റൻസി (latency) സഹിക്കുക, അല്ലെങ്കിൽ ഡൗൺസാമ്പിൾ ചെയ്ത് പ്രധാനപ്പെട്ട സൂക്ഷ്മമായ ജിയോമെട്രികൾ നഷ്ടപ്പെടുത്തുക.
സാധാരണ കംപ്രഷൻ ടൂളുകൾ ഇവിടെ പരാജയപ്പെടുന്നു, കാരണം അവ ഘടന (structure) പ്രതീക്ഷിക്കുന്നു. ഒരു ടെക്സ്റ്റ് ഫയലിൽ ആവർത്തിക്കുന്ന വാക്കുകളുണ്ട്. ഒരു ചിത്രത്തിൽ സ്മൂത്ത് ഗ്രേഡിയന്റുകളുണ്ട്. എന്നാൽ ഒരു പോയിന്റ് ക്ലൗഡിൽ ഇവ രണ്ടും ഇല്ല. ശൂന്യമായ ഇടങ്ങളിൽ ഡാറ്റ വളരെ കുറവും (sparse), സങ്കീർണ്ണമായ വിശദാംശങ്ങളുള്ള ഇടങ്ങളിൽ അമിതമായി സാന്ദ്രതയുള്ളതുമാണ്. അടുത്തടുത്തുള്ള രണ്ട് പോയിന്റുകൾ തികച്ചും വ്യത്യസ്തമായ വസ്തുക്കളുടേതാകാം. സെമാന്റിക് അണ്ടർസ്റ്റാൻഡിംഗ് ഇല്ലാതെ, ജനറിക് അൽഗോരിതങ്ങൾ വെറുതെ ബിറ്റുകൾ ക്രമീകരിക്കുകയും മികച്ച ഫലം പ്രതീക്ഷിക്കുകയും ചെയ്യുന്നു. ഇതിലൂടെ ലഭിക്കുന്ന നേട്ടം വളരെ കുറവാണ്.
ഇവിടെയാണ് ന്യൂറൽ കംപ്രഷൻ (neural compression) പ്രസക്തമാകുന്നത്. പോയിന്റ് ക്ലൗഡിനെ വെറും റോ ബിറ്റുകളായി കാണുന്നതിന് പകരം, ആ ജിയോമെട്രി യഥാർത്ഥത്തിൽ എന്താണ് പ്രതിനിധീകരിക്കുന്നത് എന്ന് ഒരു ഡീപ്പ് മോഡൽ പഠിച്ചെടുക്കുന്നു.
ഡീപ്പ് ഓട്ടോഎൻകോഡറുകൾ എങ്ങനെ പോയിന്റ് ക്ലൗഡുകളെ ചുരുക്കുന്നു
ഇതിന്റെ ആർക്കിടെക്ചർ ആശയപരമായി ലളിതമാണ്, ആ ലാളിത്യമാണ് ഇതിന്റെ കരുത്ത്. ഒരു ഡീപ്പ് ഓട്ടോഎൻകോഡറിന് രണ്ട് ഭാഗങ്ങളുണ്ട്. ആദ്യ പകുതിയായ എൻകോഡർ (encoder), മുഴുവൻ പോയിന്റ് ക്ലൗഡിനെയും എടുത്ത് അതിനെ ചുരുക്കുന്നു. ഇത് വെറുതെ പോയിന്റുകൾ ക്രമരഹിതമായി നീക്കം ചെയ്യുകയല്ല ചെയ്യുന്നത്. പകരം, അതിന്റെ അടിസ്ഥാന ജിയോമെട്രിക് സത്ത (core geometric essence) വേർതിരിച്ചെടുക്കാൻ ഇത് പഠിക്കുന്നു. ഈ ഘട്ടത്തിന്റെ ഔട്ട്പുട്ട് ഒരു ലേറ്റന്റ് റെപ്രസന്റേഷൻ (latent representation) ആണ്: അതായത്, യഥാർത്ഥ വസ്തുവിന്റെ ആകൃതിയും രൂപരേഖകളും (contours) സ്പേഷ്യൽ റിലേഷൻഷിപ്പുകളും ഒരുകൂട്ടം പാരാമീറ്ററുകളിലൂടെയോ ഒരു ടൈറ്റ് വെക്റ്ററിലൂടെയോ ഇത് അടയാളപ്പെടുത്തുന്നു.
ഒരു ശില്പി ഒരു കെട്ടിടത്തെക്കുറിച്ച് പഠിച്ച ശേഷം അതിന്റെ നിർമ്മാണ നിർദ്ദേശങ്ങൾ കുറിച്ചുവെക്കുന്നത് പോലെ ഇതിനെ കരുതാം. ആ നിർദ്ദേശങ്ങൾ വളരെ ചെറുതായിരിക്കാം, എന്നാൽ ശരിയായ കൈകളിൽ അവ ഉപയോഗിച്ച് യഥാർത്ഥ രൂപത്തിന് സമാനമായ ഒന്ന് വീണ്ടും നിർമ്മിക്കാൻ സാധിക്കും.
രണ്ടാമത്തെ പകുതി ഡീകോഡർ (decoder) ആണ്. ഇത് കംപ്രസ് ചെയ്ത ലേറ്റന്റ് റെപ്രസന്റേഷൻ ഉപയോഗിച്ച് പോയിന്റുകളെ പുനർനിർമ്മിക്കുന്നു. പുനർനിർമ്മിച്ച ക്ലൗഡ് യഥാർത്ഥ രൂപത്തിന് തുല്യമായിരിക്കില്ല. ചില സൂക്ഷ്മമായ ടെക്സ്ചറുകൾ മങ്ങാം. ചെറിയ ഔട്ട്ലയറുകൾ (outliers) അപ്രത്യക്ഷമാകും. ഇത് ഒരു ലോസി കംപ്രഷൻ (lossy compression) ആണ്, ഇതിൽ ഒളിച്ചുവെക്കാൻ ഒന്നുമില്ല. പൂർണ്ണമായ കൃത്യത (fidelity) നേടുക എന്നതല്ല ഇതിന്റെ ലക്ഷ്യം. സെൻസറുകൾ ശേഖരിക്കുന്ന നോയിസും അനാവശ്യമായ വിവരങ്ങളും ഒഴിവാക്കിക്കൊണ്ട്, ഒരു ഡൗൺസ്ട്രീം അൽഗോരിതത്തിന് യഥാർത്ഥത്തിൽ ആവശ്യമുള്ള ആകൃതിയും ഘടനയും നിലനിർത്തുക എന്നതാണ് ഇതിന്റെ ലക്ഷ്യം.
ഇതിനെ വിജയകരമാക്കുന്നത് അതിന്റെ ട്രെയിനിംഗ് പ്രക്രിയയാണ്. ഏതെല്ലാം സവിശേഷതകളാണ് അത്യാവശ്യമെന്നും ഏതെല്ലാം ഏകദേശമായി കണക്കാക്കാമെന്നും പഠിക്കുന്നത് വരെ ആയിരക്കണക്കിന് രൂപങ്ങൾ ഓട്ടോഎൻകോഡറിന് കാണിച്ചുകൊടുക്കുന്നു. കാലക്രമേണ, ജിയോമെട്രിയുടെ ഒരു അന്തർലീനമായ പദാവലി (implicit vocabulary) അത് വികസിപ്പിച്ചെടുക്കുന്നു. വക്രതകൾ (curves), പ്ലെയിനുകൾ (planes), കോണുകൾ (corners), സിമ്മട്രികൾ (symmetries) എന്നിവയെല്ലാം അത് ഉൾക്കൊള്ളുന്നു. ഒരു പുതിയ പോയിന്റ് ക്ലൗഡ് കാണുമ്പോൾ, അത് അന്ധമായി കംപ്രസ് ചെയ്യുകയല്ല ചെയ്യുന്നത്; മറിച്ച് ബുദ്ധിപരമായി കംപ്രസ് ചെയ്യുന്നു.
എന്തൊക്കെ നിലനിർത്തപ്പെടുന്നു, എന്തൊക്കെ നഷ്ടപ്പെടുന്നു
ലോസി കംപ്രഷനിൽ എപ്പോഴും ചില വിട്ടുവീഴ്ചകൾ (trade-offs) ആവശ്യമാണ്, അവയെക്കുറിച്ച് സത്യസന്ധമായിരിക്കേണ്ടത് അത്യാവശ്യമാണ്. പുനർനിർമ്മിച്ച പോയിന്റ് ക്ലൗഡിൽ ആകെ പോയിന്റുകളുടെ എണ്ണം കുറവായിരിക്കാൻ സാധ്യതയുണ്ട്. ഉപരിതലത്തിലെ പരുപരുപ്പ് കുറഞ്ഞ് അത് മിനുസപ്പെട്ടതാകാം. ഒരു നേർത്ത ആന്റിനയോ ദൂരെയുള്ള ഒരു തെരുവ് ബോർഡോ പശ്ചാത്തലത്തിൽ ലയിച്ചുപോയേക്കാം. നിങ്ങളുടെ ആപ്ലിക്കേഷൻ ഓരോ മില്ലിമീറ്റർ കമ്പിയും തിരിച്ചറിയുന്നതിനെ ആശ്രയിച്ചാണെങ്കിൽ, അമിതമായ കംപ്രഷൻ അപകടകരമായേക്കാം.
എന്നാൽ പല ജോലികൾക്കും, ഈ വിട്ടുവീഴ്ച അനുകൂലമാണ്. മനുഷ്യനേത്രങ്ങൾ ഒരു പോയിന്റ് ക്ലൗഡ് (point cloud) വായിക്കുന്നില്ല; അൽഗോരിതങ്ങളാണ് അത് ചെയ്യുന്നത്. ഒരു റോബോട്ടിന്റെ പാത്ത് പ്ലാനറിന് ചുവരുകൾ എവിടെയാണെന്ന് അറിയേണ്ടതുണ്ട് മാത്രം. ഒരു കാറിലെ ഒബ്ജക്റ്റ് ഡിറ്റക്ടറിന് ഒരു സൈക്ലിസ്റ്റിന്റെയോ പാർക്ക് ചെയ്ത ട്രക്കിന്റെയോ ബൗണ്ടിംഗ് ജിയോമെട്രി (bounding geometry) മാത്രം മതിയാകും. ഇത്തരം സന്ദർഭങ്ങളിൽ, ഓരോ പ്രതിഫലിച്ച ഫോട്ടോണും നിലനിർത്തുന്നതിനേക്കാൾ പ്രധാനമാണ് മാക്രോ-ലെവൽ രൂപം മാറ്റമില്ലാതെ നിലനിർത്തുക എന്നത്. Deep AutoEncoder രീതികൾ പ്രത്യേകിച്ച് ഇത്തരത്തിലുള്ള ഘടനാപരമായ സംരക്ഷണത്തിനായി രൂപകൽപ്പന ചെയ്തവയാണ്. അവ പച്ചയായ പോയിന്റുകളുടെ എണ്ണം ഒഴിവാക്കുമ്പോഴും, വസ്തുവിനെ നിർവചിക്കുന്ന ജിയോമെട്രി സംരക്ഷിക്കാൻ പഠിക്കുന്നു.
സ്റ്റോറേജിലും ബാൻഡ്വിഡ്ത്തിലും വലിയ ലാഭമുണ്ടാക്കാൻ ഇതിലൂടെ സാധിക്കും. ദശലക്ഷക്കണക്കിന് കോർഡിനേറ്റുകൾ കൈമാറുന്നതിന് പകരം, ഒരു സിസ്റ്റത്തിന് ഒരു കോംപാക്ട് ലേറ്റന്റ് കോഡ് (compact latent code) അയക്കാവുന്നതും സ്വീകർത്താവിന് അത് പ്രാദേശികമായി പുനർനിർമ്മിക്കാവുന്നതുമാണ്. ഈ മാറ്റം ഏതൊരു ഡിസ്ട്രിബ്യൂട്ടഡ് 3D ആപ്ലിക്കേഷന്റെയും പ്രവർത്തനരീതിയെ തന്നെ മാറ്റിമറിക്കുന്നു.
റോബോട്ടിക്സും ഓട്ടോണമസ് ഡ്രൈവിംഗും ഇത് ശ്രദ്ധിക്കുന്നത് എന്തുകൊണ്ട്
സെൻസർ ഡാറ്റയുടെ വലിയ അളവിൽ മുങ്ങിനിൽക്കുന്ന വ്യവസായങ്ങളാണ് ഈ സാങ്കേതികവിദ്യയ്ക്ക് ഏറ്റവും കൂടുതൽ പ്രാധാന്യം നൽകുന്നത്. ഓട്ടോണമസ് വാഹനങ്ങൾ തങ്ങളുടെ ചുറ്റുപാടുമുള്ള റിയൽ-ടൈം മാപ്പുകൾ നിർമ്മിക്കാൻ lidar-നെ ആശ്രയിക്കുന്നു. ഈ മാപ്പുകൾ നിരന്തരം പുതുക്കിക്കൊണ്ടിരിക്കുന്നു, ചില സിസ്റ്റങ്ങളിൽ ഇവ വാഹന ശൃംഖലകൾക്കിടയിൽ പങ്കുവെക്കുകയോ അല്ലെങ്കിൽ ഫ്ലീറ്റ് വൈഡ് ലേണിംഗിനായി (fleet-wide learning) ക്ലൗഡിലേക്ക് അപ്ലോഡ് ചെയ്യുകയോ ചെയ്യുന്നു. ഇത്രയധികം പച്ചയായ ഡാറ്റ നിരന്തരം കൈമാറുന്നത് ഇൻഫ്രാസ്ട്രക്ചറിന് വലിയൊരു വെല്ലുവിളിയാണ്. കംപ്രസ്ഡ് ലേറ്റന്റ് റെപ്രസന്റേഷനുകൾ (Compressed latent representations) ഉപയോഗിക്കുന്നത് വഴി Over-the-Air അപ്ഡേറ്റുകളും കൊളാബറേറ്റീവ് പെർസെപ്ഷനും കൂടുതൽ പ്രായോഗികമാകുന്നു.
റോബോട്ടിക്സും സമാനമായ സമ്മർദ്ദങ്ങൾ നേരിടുന്നുണ്ട്. ഷെൽഫുകൾക്കിടയിലൂടെ സഞ്ചരിക്കുന്ന ഒരു വെയർഹൗസ് റോബോട്ട് അല്ലെങ്കിൽ കാർഷിക ഭൂമി സർവേ ചെയ്യുന്ന ഒരു ഡ്രോൺ എന്നിവ കമ്പ്യൂട്ട്, കമ്മ്യൂണിക്കേഷൻ പരിമിതികൾക്കുള്ളിലാണ് പ്രവർത്തിക്കുന്നത്. അവയുടെ ഓൺബോർഡ് മെമ്മറി പരിമിതമാണ്. ബേസിലേക്കുള്ള റേഡിയോ ലിങ്ക് ഇടയ്ക്കിടെ തടസ്സപ്പെടുകയോ സാവധാനത്തിലാവുകയോ ചെയ്തേക്കാം. ഗൗരവകരമായ കംപ്രഷൻ ഇല്ലാതെ വർഷങ്ങളോളം പഴക്കമുള്ള സ്കാൻ ചെയ്ത വിവരങ്ങൾ എഡ്ജ് ഡിവൈസുകളിൽ സൂക്ഷിക്കുക എന്നത് അസാധ്യമാണ്. പോയിന്റ് ക്ലൗഡുകൾ ലഘുവായ രീതിയിൽ നിലനിർത്തുന്നതിലൂടെ, കൂടുതൽ സ്ഥലങ്ങൾ ഓർമ്മിച്ചുവെക്കാനും മാപ്പുകൾ വേഗത്തിൽ പങ്കുവെക്കാനും വലിയ ഡൗൺലോഡുകൾക്കായി കാത്തുനിൽക്കാതെ പുതിയ ജിയോമെട്രികളോട് പ്രതികരിക്കാനും Deep AutoEncoders റോബോട്ടുകളെ സഹായിക്കുന്നു.
ഈ ഗുണങ്ങൾ ആർക്കൈവിംഗിനും ബാധകമാണ്. ഫാക്ടറികൾ, പാലങ്ങൾ അല്ലെങ്കിൽ ഖനികൾ എന്നിവയുടെ ഡിജിറ്റൽ ട്വിൻസുകൾ (digital twins) നിർമ്മിക്കുന്ന കമ്പനികൾ പലപ്പോഴും കാലക്രമേണ പെറ്റാബൈറ്റുകൾ കണക്കിന് സ്കാൻ ഡാറ്റ ശേഖരിക്കുന്നു. ഒരു ന്യൂറൽ കംപ്രഷൻ സ്ട്രാറ്റജി ഉപയോഗിക്കുന്നതിലൂടെ, ആ ആർക്കൈവ് ഒരു വെയർഹൗസ് വലുപ്പത്തിലുള്ള സ്റ്റോറേജ് പ്രശ്നത്തിൽ നിന്നും കൈകാര്യം ചെയ്യാവുന്ന ഒന്നായി മാറുന്നു.
ഭാവിയിലേക്ക് നോക്കുമ്പോൾ
ഈ ഗവേഷണം വളരെ പ്രയോജനപ്രദമായ ഒരു സന്ധിയിലാണ് നിൽക്കുന്നത്. ഇത്
