एक स्वायत्त वाहन (autonomous vehicle) दर मिनिटाला शेकडो मेगाबाइट्सचा पॉइंट क्लाउड डेटा (point cloud data) तयार करू शकते. लिडार (Lidar) सेन्सर्स लाखो लेझर पल्स बाहेर सोडतात आणि प्रत्येक परत येणारा 'पिंग' एक अचूक अवकाशीय समन्वय (spatial coordinate) बनतो. याचा परिणाम म्हणजे जगाचा एक घन, त्रिमितीय (three-dimensional) स्नॅपशॉट मिळतो. तो त्याच्या अचूकतेमुळे सुंदर आहे, पण आकारमानाने प्रचंड मोठा आहे.
रॉ पॉइंट क्लाउड्स (Raw point clouds) पारंपारिक कोडेक्स (codecs) वापरून चांगल्या प्रकारे कॉम्प्रेस होत नाहीत. प्रतिमांप्रमाणे नाही, जिथे JPEG व्हिज्युअल पॅटर्नचा वापर करू शकते, किंवा व्हिडिओप्रमाणे नाही, जिथे H.264 फ्रेममधील हालचालींचा मागोवा घेऊ शकते; पॉइंट क्लाउड हा x, y आणि z मूल्यांचा एक विस्कळीत समूह असतो. तिथे कोणतेही नैसर्गिक ग्रिड्स, अतिरिक्त पिक्सेल्स किंवा सोपे शॉर्टकट नसतात. त्यामुळे फाईल्सचा आकार वाढतो. आर्काइव्ह्स महाग होतात. नेटवर्कवर ताण येतो. ज्या उद्योगांना हा डेटा वेगाने हलवणे किंवा स्वस्त दरात साठवणे आवश्यक आहे, त्यांच्यासाठी हा एक मोठा अडथळा आहे.
'Deep AutoEncoder Geometry Compression' वरील अलीकडील संशोधन एक वेगळा मार्ग सुचवते. पॉइंट क्लाउड्सना केवळ झिप करण्यायोग्य स्थिर फाईल्स मानण्याऐवजी, हा दृष्टिकोन त्यांना 'लर्न करण्यायोग्य संरचना' (learnable structures) म्हणून पाहतो. जटिल आकारांमधील सुप्त सुटसुटीतपणा शोधण्यासाठी हे डीप लर्निंगचा वापर करते.
रॉ जिओमेट्रीचे ओझे
जर तुम्ही कधीही हाय-रिझोल्यूशन पॉइंट क्लाउड फाईल उघडली असेल, तर तुम्हाला ही समस्या प्रत्यक्ष अनुभवता येईल. शहराच्या एका भागाचे सविस्तर स्कॅनिंग सहजपणे अनेक गिगाबाइट्सपर्यंत पोहोचू शकते. वाहनांच्या ताफ्यातून तो डेटा मध्यवर्ती सर्व्हरवर पाठवणे केवळ संथ नाही, तर ते खर्चिकही आहे. रिअल-टाइम सिस्टममध्ये काम करणारे इंजिनिअर्सना अनेकदा कठीण निवडीचा सामना करावा लागतो: तपशील कायम ठेवा आणि लॅटन्सीचा (latency) त्रास सहन करा, किंवा आक्रमकपणे डाऊनसॅम्पलिंग (downsample) करून महत्त्वाचे सूक्ष्म भूमितीय तपशील गमावा.
मानक कॉम्प्रेशन टूल्स येथे अपयशी ठरतात कारण त्यांना विशिष्ट संरचना अपेक्षित असते. टेक्स्ट फाईलमध्ये पुनरावृत्ती होणारे शब्द असतात. इमेजमध्ये स्मूथ ग्रेडियंट्स असतात. पॉइंट क्लाउडमध्ये या दोन्ही गोष्टी नसतात. जिथे रिकामी जागा आहे तिथे डेटा विरळ असतो आणि जिथे गुंतागुंतीचे तपशील आहेत तिथे तो कमालीचा घन असतो. शेजारील दोन बिंदू पूर्णपणे वेगवेगळ्या वस्तूंना संबंधित असू शकतात. सिमेंटिक समज (semantic understanding) शिवाय, सामान्य अल्गोरिदम फक्त बिट्सची अदलाबदल करतात आणि सर्वोत्तम निकालाची आशा करतात. यामुळे मिळणारा फायदा खूपच मर्यादित असतो.
इथेच 'न्यूरल कॉम्प्रेशन' (neural compression) कामाला येते. पॉइंट क्लाउडला केवळ रॉ बिट्स मानण्याऐवजी, एक डीप मॉडेल भूमिती प्रत्यक्षात काय दर्शवते हे शिकते.
डीप ऑटोएनकोडर्स पॉइंट क्लाउड्सचा आकार कसा कमी करतात
याची रचना संकल्पनात्मकदृष्ट्या साधी आहे आणि हीच साधेपणा तिची ताकद आहे. एका डीप ऑटोएनकोडरचे दोन भाग असतात. पहिला भाग, म्हणजेच 'एनकोडर' (encoder), संपूर्ण पॉइंट क्लाउड घेतो आणि त्याचे सार काढतो. तो केवळ यादृच्छिकपणे (randomly) बिंदू काढून टाकत नाही. त्याऐवजी, तो मूळ भूमितीय सार (core geometric essence) काढायला शिकतो. या टप्प्याचे आउटपुट म्हणजे 'लॅटंट रिप्रेझेंटेशन' (latent representation): एक संक्षिप्त वेक्टर किंवा पॅरामीटर्सचा छोटा संच जो मूळ वस्तूचा आकार, बाह्यरेखा (contours) आणि अवकाशीय संबंध काही प्रमाणात टिपतो.
एखाद्या शिल्पकाराचा विचार करा जो एखाद्या इमारतीचा अभ्यास करतो आणि नंतर सूचनांचा संच लिहून ठेवतो. त्या सूचना अगदी लहान असतात, परंतु योग्य हातांत त्या पुन्हा काहीतरी ओळखण्यायोग्य आणि सारखे तयार करू शकतात.
दुसरा भाग म्हणजे 'डिकोडर' (decoder). तो ते कॉम्प्रेस केलेले लॅटंट रिप्रेझेंटेशन घेतो आणि बिंदूंची पुनर्रचना करतो. पुनर्रचित क्लाउड मूळ क्लाउडसारखा तंतोतंत नसेल. काही सूक्ष्म पोत (texture) मऊ होतील. अगदी लहान आउटलायर्स (outliers) नाहीसे होतील. हे 'लॉसी कॉम्प्रेशन' (lossy compression) आहे आणि ते या तथ्याबद्दल माफी मागत नाही. उद्दिष्ट पूर्ण अचूकता (fidelity) मिळवणे हे नाही. उद्दिष्ट म्हणजे सेन्सर्सकडून जमा होणारा गोंधळ (noise) आणि अतिरिक्त माहिती (redundancy) काढून टाकून, पुढील अल्गोरिदमला प्रत्यक्षात आवश्यक असलेला आकार आणि संरचना जतन करणे हे आहे.
या प्रक्रियेला प्रशिक्षण (training process) यशस्वी बनवते. ऑटोएनकोडरला हजारो आकार दाखवले जातात, जोपर्यंत त्याला हे समजत नाही की कोणते वैशिष्ट्ये आवश्यक आहेत आणि कोणते अंदाजित (approximated) केले जाऊ शकतात. काळानुसार, तो भूमितीची एक अंतर्निहित शब्दसंग्रह (implicit vocabulary) विकसित करतो. वक्र (curves), प्रतले (planes), कोपरे (corners) आणि सममिती (symmetries) हे सर्व अंगीभूत होतात. जेव्हा तो नवीन पॉइंट क्लाउड पाहतो, तेव्हा तो आंधळेपणाने कॉम्प्रेस करत नाही, तर तो हुशारीने कॉम्प्रेस करतो.
काय जतन केले जाते आणि काय गमावले जाते
लॉसी कॉम्प्रेशनमध्ये नेहमीच तडजोड (trade-offs) करावी लागते आणि त्याबद्दल प्रामाणिक राहणे गरजेचे आहे. पुनर्रचित पॉइंट क्लाउडमध्ये एकूण बिंदूंची संख्या कमी असू शकते. पृष्ठभागाचा खडबडीतपणा कमी होऊन तो गुळगुळीत होऊ शकतो. एखादा पातळ अँटेना किंवा लांबचा रस्त्यावरील फलक पार्श्वभूमीमध्ये धूसर होऊ शकतो. जर तुमचे ॲप्लिकेशन वायरच्या प्रत्येक मिलीमीटरचा शोध घेण्यावर अवलंबून असेल, तर आक्रमक कॉम्प्रेशन जोखमीचे ठरू शकते.
पण अनेक कामांसाठी, ही तडजोड फायदेशीर ठरते. मानवी डोळे 'पॉइंट क्लाउड' वाचत नाहीत; अल्गोरिदम वाचतात. रोबोटच्या पाथ प्लॅनरला फक्त भिंती कुठे आहेत हे माहित असणे आवश्यक असते. कारच्या ऑब्जेक्ट डिटेक्टरला फक्त सायकलस्वार किंवा पार्क केलेल्या ट्रकच्या बाउंडिंग भूमितीची (bounding geometry) गरज असते. अशा प्रकरणांमध्ये, प्रत्येक विखुरलेला परावर्तित फोटॉन जतन करण्यापेक्षा मॅक्रो-लेव्हल आकार (macro-level shape) अखंडित ठेवणे अधिक महत्त्वाचे असते. Deep AutoEncoder पद्धती विशेषतः अशा प्रकारच्या संरचनात्मक जतनासाठी (structural preservation) ऑप्टिमाइझ केल्या जातात. ते कच्च्या पॉईंटची संख्या काढून टाकतानाही, वस्तूची व्याख्या करणारी भूमिती सुरक्षित ठेवण्यास शिकतात.
स्टोरेज आणि बँडविड्थची बचत लक्षणीय असू शकते. लाखो कोऑर्डिनेट्स पाठवण्याऐवजी, एक सिस्टम कॉम्पॅक्ट लॅटेंट कोड पाठवू शकते आणि रिसीव्हरला स्थानिक पातळीवर दृश्य (scene) पुनर्निर्मित करू शकते. हा बदल कोणत्याही डिस्ट्रिब्युटेड 3D ॲप्लिकेशनसाठी गणित पूर्णपणे बदलून टाकतो.
रोबोटिक्स आणि ऑटोनॉमस ड्रायव्हिंगसाठी हे का महत्त्वाचे आहे
ज्या उद्योगांमध्ये या तंत्रज्ञानाचा सर्वाधिक वापर होत आहे, ते सेन्सर डेटाच्या महापुरात बुडालेले आहेत. ऑटोनॉमस वाहने त्यांच्या सभोवतालचे रिअल-टाइम नकाशे तयार करण्यासाठी lidar वर अवलंबून असतात. हे नकाशे सतत अपडेट होतात आणि काही सिस्टममध्ये, ते वाहन नेटवर्कमध्ये शेअर केले जातात किंवा संपूर्ण फ्लीटच्या (fleet-wide) शिक्षणासाठी क्लाउडवर अपलोड केले जातात. इतका मोठा कच्चा डेटा सतत हलवणे ही पायाभूत सुविधांसाठी एक मोठी समस्या आहे. कॉम्प्रेस्ड लॅटेंट रिप्रेझेंटेशन्समुळे Over-the-Air अपडेट्स आणि कोलाबोरेटिव्ह पर्सेप्शन अधिक व्यावहारिक बनतात.
रोबोटिक्ससमोरही अशाच प्रकारच्या आव्हानांचा सामना करावा लागतो. शेल्फमध्ये फिरणारा वेअरहाऊस रोबोट किंवा शेतीची जमीन सर्वेक्षण करणारा ड्रोन, हे कमी कम्प्युट आणि कम्युनिकेशन मर्यादांमध्ये काम करतात. त्यांची ऑनबोर्ड मेमरी मर्यादित असते. बेसशी असलेला त्यांचा रेडिओ लिंक खंडित किंवा संथ असू शकतो. गंभीर कॉम्प्रेशनशिवाय एज डिव्हाइसेसवर (edge devices) अनेक वर्षांचा स्कॅन केलेला डेटा साठवणे अशक्य आहे. पॉइंट क्लाउड हलके (lightweight) ठेवून, Deep AutoEncoders रोबोट्सना अधिक ठिकाणे लक्षात ठेवण्यास, नकाशे वेगाने शेअर करण्यास आणि मोठ्या डाउनलोड्सची वाट न पाहता नवीन भूमितीला प्रतिसाद देण्यास सक्षम करतात.
याचे फायदे आर्काइव्हिंगसाठी देखील लागू होतात. कारखाने, पूल किंवा खाणींचे डिजिटल ट्विन्स (digital twins) तयार करणाऱ्या कंपन्या अनेकदा कालांतराने पेटॅबाइट्समध्ये स्कॅन डेटा जमा करतात. न्यूरल कॉम्प्रेशन स्ट्रॅटेजी त्या आर्काइव्हला वेअरहाऊसच्या आकाराच्या स्टोरेज समस्येतून काहीतरी व्यवस्थापित करण्यायोग्य गोष्टीत रूपांतरित करते.
भविष्यातील वाटचाल
हे संशोधन एका उपयुक्त वळणावर आहे. ते
