Một chiếc xe tự hành duy nhất có thể tạo ra hàng trăm megabyte dữ liệu đám mây điểm mỗi phút. Các cảm biến Lidar phát ra hàng triệu xung laser ra bên ngoài, và mỗi tín hiệu phản hồi trở thành một tọa độ không gian chính xác. Kết quả là một bản chụp ba chiều dày đặc của thế giới. Nó đẹp đẽ trong sự chính xác, nhưng lại tàn khốc về kích thước.

Các đám mây điểm thô không được nén tốt với các codec truyền thống. Không giống như hình ảnh, nơi JPEG có thể khai thác các mẫu thị giác, hay video, nơi H.264 có thể theo dõi chuyển động giữa các khung hình, một đám mây điểm là một tập hợp phân tán không theo thứ tự của các giá trị x, y và z. Không có lưới tự nhiên, không có pixel dư thừa, và không có lối tắt dễ dàng nào. Các tệp tin phình to. Các kho lưu trữ trở nên đắt đỏ. Mạng lưới bị nghẽn. Đối với các ngành công nghiệp cần di chuyển dữ liệu này nhanh chóng hoặc lưu trữ chúng một cách rẻ tiền, gánh nặng này là có thật.

Các nghiên cứu gần đây về Deep AutoEncoder Geometry Compression mang lại một hướng đi khác. Thay vì coi các đám mây điểm là các tệp tĩnh để nén, phương pháp này tư duy lại chúng như những cấu trúc có thể học được. Nó sử dụng học sâu để tìm ra sự cô đọng tiềm ẩn bên trong các hình dạng phức tạp.

Sức nặng của Hình học Thô

Nếu bạn đã từng mở một tệp đám mây điểm độ phân giải cao, bạn đã tận mắt thấy vấn đề này. Một bản quét chi tiết của một khối phố có thể dễ dàng đạt tới vài gigabyte. Việc truyền dữ liệu đó từ một đội xe về máy chủ trung tâm không chỉ chậm; nó còn tốn kém. Các kỹ sư làm việc trong các hệ thống thời gian thực thường phải đối mặt với một lựa chọn khó khăn: giữ lại chi tiết và chịu đựng độ trễ, hoặc giảm mẫu một cách quyết liệt và làm mất đi những hình học tinh tế quan trọng.

Các công cụ nén tiêu chuẩn thất bại ở đây vì chúng kỳ vọng vào cấu trúc. Một tệp văn bản có các từ lặp lại. Một hình ảnh có các dải màu mượt mà. Một đám mây điểm thì không có cả hai. Dữ liệu thưa thớt ở những nơi có không gian trống và dày đặc đến mức không tưởng ở những nơi có chi tiết phức tạp. Hai điểm lân cận có thể thuộc về các đối tượng hoàn toàn khác nhau. Nếu không có sự hiểu biết về ngữ nghĩa, các thuật toán thông thường chỉ xáo trộn các bit và hy vọng vào kết quả tốt nhất. Hiệu quả đạt được là rất khiêm tốn.

Đây là lúc nén nơ-ron (neural compression) can thiệp. Thay vì coi đám mây điểm là các bit thô, một mô hình học sâu sẽ học xem hình học đó thực sự đại diện cho điều gì.

Cách Deep AutoEncoders Thu nhỏ Đám mây Điểm

Kiến trúc này về mặt khái niệm là đơn giản, và chính sự đơn giản đó là thế mạnh của nó. Một Deep AutoEncoder có hai nửa. Nửa đầu tiên, bộ mã hóa (encoder), nhận toàn bộ đám mây điểm và tinh lọc nó. Nó không chỉ đơn thuần là loại bỏ các điểm một cách ngẫu nhiên. Thay vào đó, nó học cách trích xuất bản chất hình học cốt lõi. Kết quả của bước này là một biểu diễn tiềm ẩn (latent representation): một vectơ chặt chẽ hoặc một tập hợp nhỏ các tham số mà bằng cách nào đó nắm bắt được hình dạng, đường nét và các mối quan hệ không gian của đối tượng ban đầu.

Hãy coi nó như một nhà điêu khắc đang nghiên cứu một tòa nhà và sau đó viết ra một bộ hướng dẫn. Các hướng dẫn đó rất nhỏ bé, nhưng nếu nằm trong tay người phù hợp, chúng có thể tái tạo lại một thứ gì đó tương tự một cách dễ nhận biết.

Nửa thứ hai là bộ giải mã (decoder). Nó lấy biểu diễn tiềm ẩn đã được nén đó và tái tạo lại các điểm. Đám mây được tái tạo sẽ không giống hệt như bản gốc. Một số kết cấu tinh vi sẽ bị làm mờ đi. Những điểm ngoại lai nhỏ sẽ biến mất. Đây là nén có tổn hao (lossy compression), và nó không hề che giấu sự thật đó. Mục tiêu không phải là độ trung thực hoàn hảo. Mục tiêu là bảo tồn hình dạng và cấu trúc mà một thuật toán hạ nguồn thực sự cần, đồng thời loại bỏ nhiễu và sự dư thừa mà các cảm biến chắc chắn sẽ thu thập được.

Điều làm cho phương pháp này hiệu quả chính là quá trình huấn luyện. Bộ tự mã hóa (autoencoder) được cho xem hàng ngàn hình dạng cho đến khi nó học được đặc điểm nào là thiết yếu và đặc điểm nào có thể được xấp xỉ. Theo thời gian, nó phát triển một "từ vựng" hình học ngầm định. Các đường cong, mặt phẳng, góc và tính đối xứng đều được nó ghi nhớ sâu sắc. Khi nó thấy một đám mây điểm mới, nó không nén một cách mù quáng. Nó nén một cách thông minh.

Những gì được bảo tồn và những gì bị mất đi

Nén có tổn hao luôn đi kèm với những sự đánh đổi, và cần phải thành thật về điều đó. Đám mây điểm được tái tạo có khả năng sẽ có ít tổng số điểm hơn. Độ nhám bề mặt có thể bị làm phẳng. Một chiếc ăng-ten mỏng hoặc một biển báo đường phố ở xa có thể bị mờ đi vào nền. Nếu ứng dụng của bạn phụ thuộc vào việc phát hiện từng milimet dây điện, việc nén mạnh có thể sẽ rủi ro.

Nhưng đối với nhiều tác vụ, sự đánh đổi này là có lợi. Mắt người không đọc đám mây điểm; các thuật toán mới làm điều đó. Một bộ lập kế hoạch đường đi cho robot chỉ cần biết tường nằm ở đâu. Một bộ phát hiện vật thể cho ô tô chỉ cần khung hình học bao quanh một người đi xe đạp hoặc một chiếc xe tải đang đỗ. Trong những trường hợp này, việc giữ nguyên hình dạng ở cấp độ vĩ mô quan trọng hơn nhiều so với việc bảo tồn mọi photon phản xạ đơn lẻ. Các phương pháp Deep AutoEncoder được tối ưu hóa đặc biệt cho kiểu bảo tồn cấu trúc này. Chúng học cách bảo vệ hình học định nghĩa vật thể, ngay cả khi chúng loại bỏ số lượng điểm thô.

Việc tiết kiệm lưu trữ và băng thông có thể rất đáng kể. Thay vì truyền hàng triệu tọa độ, một hệ thống có thể gửi một mã tiềm ẩn (latent code) nhỏ gọn và để bên nhận tái tạo lại cảnh vật tại chỗ. Sự thay đổi đó làm thay đổi bài toán cho bất kỳ ứng dụng 3D phân tán nào.

Tại sao Robot và Lái xe tự hành lại quan tâm

Những ngành công nghiệp đang thúc đẩy mạnh mẽ nhất công nghệ này là những ngành đang ngập trong dữ liệu cảm biến. Xe tự hành dựa vào lidar để xây dựng bản đồ thời gian thực về môi trường xung quanh. Các bản đồ này cập nhật liên tục, và trong một số hệ thống, chúng được chia sẻ qua mạng lưới phương tiện hoặc được tải lên đám mây để học tập trên toàn đội xe. Việc di chuyển lượng dữ liệu thô khổng lồ đó một cách liên tục là một cơn ác mộng về hạ tầng. Các biểu diễn tiềm ẩn đã nén giúp việc cập nhật Over-the-Air và nhận thức cộng tác trở nên thực tế hơn nhiều.

Robot cũng đối mặt với những áp lực tương tự. Một robot kho bãi điều hướng giữa các kệ hàng, hay một drone khảo sát đất nông nghiệp, đều hoạt động dưới các ràng buộc chặt chẽ về tính toán và truyền thông. Bộ nhớ tích hợp của nó là hữu hạn. Kết nối vô tuyến với trạm gốc có thể chập chờn hoặc chậm. Việc lưu trữ dữ liệu môi trường quét được trong nhiều năm trên các thiết bị cạnh (edge devices) là điều không thể nếu không có sự nén mạnh mẽ. Bằng cách giữ cho các đám mây điểm trở nên nhẹ nhàng, Deep AutoEncoders cho phép robot ghi nhớ nhiều địa điểm hơn, chia sẻ bản đồ nhanh hơn và phản ứng với các hình học mới mà không cần chờ đợi các tệp tải xuống cồng kềnh hoàn tất.

Lợi ích cũng mở rộng sang cả việc lưu trữ lâu dài. Các công ty xây dựng bản sao số (digital twins) của các nhà máy, cây cầu hoặc mỏ khai thác thường tích lũy hàng petabyte dữ liệu quét theo thời gian. Một chiến lược nén nơ-ron sẽ biến kho lưu trữ đó từ một vấn đề lưu trữ khổng lồ như một nhà kho thành một thứ gì đó có thể quản lý được.

Hướng tới tương lai

Nghiên cứu này nằm tại một điểm giao thoa hữu ích. Nó