ایک خود مختار گاڑی (autonomous vehicle) ہر منٹ میں پوائنٹ کلاؤڈ ڈیٹا کے سینکڑوں میگا بائٹس پیدا کر سکتی ہے۔ لیڈر (Lidar) سینسرز لاکھوں لیزر پلسز باہر کی طرف چھوڑتے ہیں، اور ہر واپس آنے والی پنگ (ping) ایک درست مکانی کوآرڈینیٹ (spatial coordinate) بن جاتی ہے۔ اس کا نتیجہ دنیا کا ایک گھنا، سہ جہتی (three-dimensional) عکس ہوتا ہے۔ یہ اپنی درستگی میں خوبصورت ہے، لیکن اپنے حجم میں بہت زیادہ بوجھل ہے۔
خام پوائنٹ کلاؤڈز (Raw point clouds) روایتی کوڈیکس (codecs) کے ساتھ اچھی طرح کمپریس نہیں ہوتے۔ تصاویر کے برعکس، جہاں JPEG بصری پیٹرنز کا فائدہ اٹھا سکتا ہے، یا ویڈیو کے برعکس، جہاں H.264 فریموں کے درمیان حرکت کو ٹریک کر سکتا ہے، ایک پوائنٹ کلاؤڈ x، y، اور z ویلیوز کا ایک غیر ترتیب شدہ پھیلاؤ ہوتا ہے۔ اس میں کوئی قدرتی گرڈز، کوئی اضافی پکسلز، اور کوئی آسان شارٹ کٹس نہیں ہوتے۔ فائلیں بڑھتی جاتی ہیں۔ آرکائیوز مہنگی ہو جاتی ہیں۔ نیٹ ورکس چوک ہو جاتے ہیں۔ ان صنعتوں کے لیے جنہیں اس ڈیٹا کو تیزی سے منتقل کرنے یا سستے داموں محفوظ کرنے کی ضرورت ہے، یہ بوجھ حقیقی ہے۔
Deep AutoEncoder Geometry Compression پر حالیہ کام ایک مختلف راستہ فراہم کرتا ہے۔ پوائنٹ کلاؤڈز کو زپ کی جانے والی ساکن فائلوں کے طور پر دیکھنے کے بجائے، یہ طریقہ کار انہیں سیکھنے کے قابل ڈھانچوں (learnable structures) کے طور پر دوبارہ سوچتا ہے۔ یہ پیچیدہ اشکال کے اندر چھپی ہوئی جامعیت (compactness) تلاش کرنے کے لیے ڈیپ لرننگ کا استعمال کرتا ہے۔
خام جیومیٹری کا بوجھ
اگر آپ نے کبھی ہائی ریزولوشن پوائنٹ کلاؤڈ فائل کھولی ہے، تو آپ نے اس مسئلے کو خود دیکھا ہوگا۔ شہر کے ایک بلاک کا تفصیلی اسکین آسانی سے کئی گیگا بائٹس تک پہنچ سکتا ہے۔ گاڑیوں کے بیڑے سے اس ڈیٹا کو مرکزی سرور پر بھیجنا نہ صرف سست ہے بلکہ مہنگا بھی ہے۔ ریئل ٹائم سسٹمز میں کام کرنے والے انجینئرز کو اکثر ایک مشکل انتخاب کا سامنا کرنا پڑتا ہے: تفصیل برقرار رکھیں اور لیٹنسی (latency) کا سامنا کریں، یا جارحانہ طور پر ڈاؤن سیمپلنگ (downsample) کریں اور اس باریک جیومیٹری کو کھو دیں جو اہم ہے۔
معیاری کمپریشن ٹولز یہاں ناکام ہو جاتے ہیں کیونکہ وہ ڈھانچے (structure) کی توقع رکھتے ہیں۔ ایک ٹیکسٹ فائل میں دہرائے جانے والے الفاظ ہوتے ہیں۔ ایک تصویر میں ہموار گریڈینٹس ہوتے ہیں۔ ایک پوائنٹ کلاؤڈ میں دونوں میں سے کچھ نہیں ہوتا۔ ڈیٹا وہاں بکھرا ہوا (sparse) ہوتا ہے جہاں خالی جگہ ہوتی ہے اور وہاں ناقابل یقین حد تک گھنا ہوتا ہے جہاں پیچیدہ تفصیلات ہوتی ہیں۔ دو پڑوسی پوائنٹس مکمل طور پر مختلف اشیاء سے تعلق رکھ سکتے ہیں۔ سیمنٹک سمجھ بوجھ (semantic understanding) کے بغیر، عام الگورتھم صرف بٹس کو ادھر ادھر ترتیب دیتے ہیں اور بہتر کی امید کرتے ہیں۔ اس سے ہونے والا فائدہ معمولی ہوتا ہے۔
یہ وہ جگہ ہے جہاں نیورل کمپریشن (neural compression) کام آتی ہے۔ پوائنٹ کلاؤڈ کو خام بٹس کے طور پر لینے کے بجائے، ایک ڈیپ ماڈل یہ سیکھتا ہے کہ جیومیٹری اصل میں کیا ظاہر کرتی ہے۔
ڈیپ آٹو انکوڈرز پوائنٹ کلاؤڈز کو کیسے چھوٹا کرتے ہیں
اس کا آرکیٹیکچر تصوراتی طور پر سادہ ہے، اور یہی سادگی اس کی طاقت ہے۔ ایک ڈیپ آٹو انکوڈر کے دو حصے ہوتے ہیں۔ پہلا حصہ، انکوڈر (encoder)، مکمل پوائنٹ کلاؤڈ لیتا ہے اور اسے خلاصہ (distill) کر دیتا ہے۔ یہ محض بے ترتیب طور پر پوائنٹس کو نہیں ہٹاتا۔ اس کے بجائے، یہ بنیادی جیومیٹرک جوہر (core geometric essence) کو نکالنا سیکھتا ہے۔ اس مرحلے کا آؤٹ پٹ ایک لیٹنٹ ری پریزنٹیشن (latent representation) ہے: ایک ٹائٹ ویکٹر یا پیرامیٹرز کا ایک چھوٹا سیٹ جو کسی نہ کسی طرح اصل شے کی شکل، کنٹورز اور مکانی تعلقات کو قید کر لیتا ہے۔
اسے ایک ایسے مجسمہ ساز کے طور پر سوچیں جو ایک عمارت کا مطالعہ کرتا ہے اور پھر ہدایات کا ایک سیٹ لکھتا ہے۔ ہدایات بہت چھوٹی ہوتی ہیں، لیکن صحیح ہاتھوں میں، وہ کسی ایسی چیز کو دوبارہ تعمیر کرتی ہیں جو پہچاننے کے قابل اور ملتی جلتی ہو۔
دوسرا حصہ ڈیکوڈر (decoder) ہے۔ یہ اس کمپریس شدہ لیٹنٹ ری پریزنٹیشن کو لیتا ہے اور پوائنٹس کو دوبارہ تعمیر (reconstruct) کرتا ہے۔ دوبارہ تعمیر شدہ کلاؤڈ اصل کے جیسا نہیں ہوگا۔ کچھ باریک ساخت (texture) نرم ہو جائے گی۔ چھوٹے آؤٹ لائرز (outliers) غائب ہو جائیں گے۔ یہ لوسی کمپریشن (lossy compression) ہے، اور یہ اس حقیقت کے لیے معذرت نہیں مانگتی۔ مقصد مکمل وفاداری (perfect fidelity) نہیں ہے۔ مقصد اس شکل اور ڈھانچے کو برقرار رکھنا ہے جس کی ڈاؤن اسٹریم الگورتھم کو اصل میں ضرورت ہوتی ہے، جبکہ اس شور (noise) اور اضافی معلومات (redundancy) کو نکال دینا ہے جو سینسرز ناگزیر طور پر جمع کرتے ہیں۔
جو چیز اسے کام کرنے کے قابل بناتی ہے وہ ٹریننگ کا عمل ہے۔ آٹو انکوڈر کو ہزاروں اشکال دکھائی جاتی ہیں یہاں تک کہ وہ یہ سیکھ لے کہ کون سی خصوصیات ضروری ہیں اور کن کا تخمینہ لگایا جا سکتا ہے۔ وقت کے ساتھ، یہ جیومیٹری کی ایک ضمنی ذخیرہ الفاظ (implicit vocabulary) تیار کر لیتا ہے۔ منحنی خطوط (curves)، سطحیں (planes)، کونے (corners) اور توازن (symmetries) سب اندرونی طور پر جذب ہو جاتے ہیں۔ جب یہ ایک نیا پوائنٹ کلاؤڈ دیکھتا ہے، تو یہ اسے اندھا دھند کمپریس نہیں کرتا۔ یہ اسے ذہانت سے کمپریس کرتا ہے۔
کیا محفوظ رہتا ہے، اور کیا کھو جاتا ہے
لوسی کمپریشن (lossy compression) میں ہمیشہ سمجھوتہ (trade-offs) شامل ہوتا ہے
لیکن بہت سے کاموں کے لیے، یہ توازن (trade-off) فائدہ مند ہے۔ انسانی آنکھ point cloud کو نہیں پڑھتی؛ بلکہ الگورتھم پڑھتے ہیں۔ روبوٹ کے لیے ایک path planner کو صرف یہ جاننے کی ضرورت ہوتی ہے کہ دیواریں کہاں ہیں۔ کار کے لیے ایک object detector کو صرف سائیکل سوار یا کھڑی ہوئی ٹرک کی bounding geometry کی ضرورت ہوتی ہے۔ ان معاملات میں، ہر ایک منتشر منعکس شدہ فوٹون کو محفوظ کرنے کے مقابلے میں میکرو لیول کی شکل کو برقرار رکھنا کہیں زیادہ اہم ہے۔ Deep AutoEncoder طریقے خاص طور پر اس قسم کے ساختی تحفظ (structural preservation) کے لیے موزوں بنائے گئے ہیں۔ وہ اس جیومیٹری کو محفوظ کرنا سیکھتے ہیں جو آبجیکٹ کی تعریف کرتی ہے، چاہے وہ خام پوائنٹ کی تعداد (raw point count) کو ختم ہی کیوں نہ کر دیں۔
اسٹوریج اور بینڈوتھ کی بچت ڈرامائی ہو سکتی ہے۔ لاکھوں کوآرڈینیٹس منتقل کرنے کے بجائے، ایک سسٹم ایک مختصر latent code بھیج سکتا ہے اور وصول کنندہ کو مقامی طور پر منظر کو دوبارہ تعمیر (reconstruct) کرنے دے سکتا ہے۔ یہ تبدیلی کسی بھی تقسیم شدہ (distributed) 3D ایپلی کیشن کے لیے حساب کتاب کو بدل دیتی ہے۔
روبوٹکس اور خود مختار ڈرائیونگ کو اس کی ضرورت کیوں ہے
وہ صنعتیں جو اس ٹیکنالوجی کو سب سے زیادہ فروغ دے رہی ہیں، وہ ہیں جو سینسر ڈیٹا میں ڈوبی ہوئی ہیں۔ خود مختار گاڑیاں اپنے ارد گرد کے ریئل ٹائم نقشے بنانے کے لیے lidar پر انحصار کرتی ہیں۔ یہ نقشے مسلسل اپ ڈیٹ ہوتے رہتے ہیں، اور کچھ سسٹمز میں، انہیں گاڑیوں کے نیٹ ورکس پر شیئر کیا جاتا ہے یا پورے بیڑے (fleet) کی سیکھنے کی صلاحیت کے لیے کلاؤڈ پر اپ لوڈ کیا جاتا ہے۔ اتنے زیادہ خام ڈیٹا (raw data) کو مسلسل منتقل کرنا انفراسٹرکچر کے لیے ایک ڈراؤنا خواب ہے۔ Compressed latent representations، Over-the-Air اپ ڈیٹس اور collaborative perception کو بہت زیادہ عملی بناتے ہیں۔
روبوٹکس کو بھی اسی طرح کے دباؤ کا سامنا ہے۔ شیلفوں کے درمیان راستہ بنانے والا گودام کا روبوٹ، یا زرعی زمین کا جائزہ لینے والا ڈرون، سخت کمپیوٹ اور مواصلاتی حدود (constraints) کے تحت کام کرتا ہے۔ اس کی آن بورڈ میموری محدود ہوتی ہے۔ بیس کے ساتھ اس کا ریڈیو لنک منقطع یا سست ہو سکتا ہے۔ سنگین کمپریشن کے بغیر ایج ڈیوائسز (edge devices) پر برسوں کے اسکین شدہ ماحول کو محفوظ کرنا ناممکن ہے۔ point clouds کو ہلکا پھلکا رکھ کر، Deep AutoEncoders روبوٹس کو زیادہ جگہیں یاد رکھنے، نقشے تیزی سے شیئر کرنے، اور بھاری ڈاؤن لوڈز کے مکمل ہونے کا انتظار کیے بغیر نئی جیومیٹری پر ردعمل دینے کی اجازت دیتے ہیں۔
فوائد آرکائیونگ (archiving) تک بھی پھیلے ہوئے ہیں۔ فیکٹریوں، پلوں یا کانوں کے ڈیجیٹل ٹوئنز (digital twins) بنانے والی کمپنیاں اکثر وقت کے ساتھ پیٹا بائٹس (petabytes) میں اسکین ڈیٹا جمع کر لیتی ہیں۔ ایک نیورل کمپریشن حکمت عملی اس آرکائیو کو گودام کے برابر اسٹوریج کے مسئلے سے بدل کر ایک قابل انتظام چیز میں تبدیل کر دیتی ہے۔
مستقبل کی جھلک
یہ تحقیق ایک مفید سنگم پر کھڑی ہے۔ یہ
