Một kiến trúc AI mới có thể cho phép các xe tự hành trên Sao Hỏa và Mặt Trăng tự quyết định những gì cần nghiên cứu và cách di chuyển mà không cần chờ đợi chu kỳ phản hồi từ Trái Đất kéo dài từ 4 đến 24 phút, giúp giảm thiểu độ trễ vốn đang làm trì trệ các quyết định nhanh chóng. Đề xuất này, được xây dựng trên các mô hình decision-transformer kết hợp với một lớp quản trị zero-trust, hứa hẹn mang lại khả năng tự chủ ở "cấp độ nhà khoa học" cho các sứ mệnh hành tinh trong tương lai.

Tại sao các xe tự hành cần phải tự tư duy

Các xe tự hành hiện nay về cơ bản là những chiếc xe điều khiển từ xa. Một lệnh từ Trái Đất sẽ phải nằm trong hàng đợi trong khi robot chờ phản hồi, và bất kỳ chướng ngại vật bất ngờ nào cũng có thể làm đình trệ sứ mệnh trong nhiều giờ.

Bước đột phá AI: decision transformers

Decision transformers biến việc lựa chọn hành động thành một nhiệm vụ mô hình hóa ngôn ngữ. Thay vì học theo kiểu thử và sai, mô hình sẽ quét một chuỗi các trạng thái trong quá khứ—vị trí, các chỉ số cảm biến—và các phần thưởng liên quan—giá trị khoa học, điểm an toàn—rồi dự đoán hành động tiếp theo giúp tối đa hóa phần thưởng. Về bản chất, AI đang "viết" nên dòng tiếp theo hay nhất của một câu chuyện dựa trên cách câu chuyện đó đã diễn ra cho đến nay.

Đảm bảo an toàn cho AI trong không gian

Hai cơ chế bảo vệ được tích hợp sẵn vào thiết kế:

  • Mục tiêu phù hợp với con người – Nhóm nghiên cứu huấn luyện mô hình để cân bằng ba mục tiêu quan trọng của sứ mệnh: tối đa hóa lợi ích khoa học (ví dụ: chọn tảng đá thú vị nhất), tránh các mối nguy hiểm (dốc cao, mất năng lượng) và tuân thủ các ràng buộc của sứ mệnh (thời gian, băng thông dữ liệu). AI không hoạt động chệch khỏi kịch bản; mọi lựa chọn đều được tính toán dựa trên các ưu tiên do con người xác định.

  • Quản trị zero-trust – Được mượn từ lĩnh vực an ninh mạng, khung quản trị này giả định rằng "bộ não" của xe tự hành có thể bị xâm nhập hoặc đơn giản là gặp trục trặc. Các kỹ sư ghi lại mọi quyết định vào một nhật ký kiểm tra không thể thay đổi, và họ chỉ cấp cho AI những quyền hạn tối thiểu cần thiết để hoạt động (nguyên tắc đặc quyền tối thiểu).

Kết hợp lại, các lớp này cho phép xe tự hành hoạt động tự chủ trong khi vẫn giữ cho chuỗi mệnh lệnh luôn minh bạch và có thể đảo ngược.

Những đối tượng được hưởng lợi

Các sứ mệnh trong tương lai như Mars Sample Return hoặc thám hiểm cực Mặt Trăng cần mức độ tự chủ này. Bằng cách kết hợp các mô hình transformer với các giao thức bảo mật nghiêm ngặt, chúng ta có thể thám hiểm sâu hơn vào hệ mặt trời của mình.

Những rủi ro tiềm ẩn

Sự tự chủ làm thay đổi bản chất của rủi ro, và lớp zero-trust giúp giảm thiểu điều này bằng cách buộc mọi hành động phải đi qua một bộ xác thực.

Bước tiếp theo là gì

Phương pháp này xuất hiện trong nghiên cứu của tác giả, đề xuất phương thức cho các sứ mệnh khảo sát địa chất hành tinh.

Điểm mấu chốt: Bằng cách dạy các xe tự hành coi việc ra quyết định như một bài toán ngôn ngữ và bao bọc khả năng đó trong một mô hình bảo mật ưu tiên kiểm tra nghiêm ngặt, các kỹ sư đang tiến gần hơn đến những robot có thể tự thực hiện các nghiên cứu khoa học theo cách riêng của chúng, ngay cả khi không thể kết nối với Trái Đất.