สถาปัตยกรรม AI แบบใหม่จะช่วยให้รถสำรวจบนดาวอังคารและดวงจันทร์สามารถตัดสินใจได้เองว่าจะศึกษาอะไรและควรเคลื่อนที่อย่างไร โดยไม่ต้องรอการสื่อสารไป-กลับจากโลกที่ใช้เวลานานถึง 4 ถึง 24 นาที ซึ่งช่วยลดความหน่วงที่มักจะทำให้การตัดสินใจที่รวดเร็วต้องหยุดชะงัก ข้อเสนอนี้สร้างขึ้นบนโมเดล decision-transformer ที่ห่อหุ้มด้วยเลเยอร์การกำกับดูแลแบบ zero-trust ซึ่งให้คำมั่นสัญญาถึงความเป็นอิสระในระดับ "นักวิทยาศาสตร์" สำหรับภารกิจสำรวจดาวเคราะห์ในอนาคต
ทำไมรถสำรวจจึงต้องคิดด้วยตัวเอง
รถสำรวจในปัจจุบันเปรียบเสมือนรถบังคับวิทยุ คำสั่งจากโลกต้องรออยู่ในคิวในขณะที่หุ่นยนต์รอการตอบกลับ และอุปสรรคที่ไม่คาดคิดใดๆ ก็อาจทำให้ภารกิจต้องหยุดชะงักลงได้นานหลายชั่วโมง
ความก้าวหน้าของ AI: decision transformers
Decision transformers เปลี่ยนการเลือกการกระทำ (action selection) ให้กลายเป็นงานการสร้างแบบจำลองภาษา (language-modeling task) แทนที่จะเรียนรู้ผ่านการลองผิดลองถูก โมเดลจะสแกนลำดับของสถานะในอดีต เช่น ตำแหน่ง และค่าที่อ่านได้จากเซนเซอร์ รวมถึงผลตอบแทนที่เกี่ยวข้อง เช่น มูลค่าทางวิทยาศาสตร์ และคะแนนความปลอดภัย เพื่อทำนายการกระทำถัดไปที่จะให้ผลตอบแทนสูงสุด พูดง่ายๆ ก็คือ AI กำลัง "เขียน" บรรทัดถัดไปที่ดีที่สุดของเรื่องราว โดยอิงจากสิ่งที่เกิดขึ้นในเรื่องราวที่ผ่านมานั่นเอง
การทำให้ AI ปลอดภัยสำหรับการใช้งานในอวกาศ
มีมาตรการป้องกันสองส่วนที่ถูกรวมไว้ในการออกแบบ:
เป้าหมายที่สอดคล้องกับมนุษย์ (Human-aligned objectives) – ทีมงานฝึกฝนโมเดลให้สร้างสมดุลระหว่างเป้าหมายสำคัญของภารกิจ 3 ประการ ได้แก่ การเพิ่มผลตอบแทนทางวิทยาศาสตร์ให้สูงสุด (เช่น การเลือกหินที่น่าสนใจที่สุด) การหลีกเลี่ยงอันตราย (ทางลาดชัน, การสูญเสียพลังงาน) และการปฏิบัติตามข้อจำกัดของภารกิจ (เวลา, แบนด์วิดท์ข้อมูล) AI จะไม่ทำงานออกนอกลู่นอกทาง ทุกการตัดสินใจจะถูกถ่วงน้ำหนักตามลำดับความสำคัญที่มนุษย์กำหนดไว้
การกำกับดูแลแบบ zero-trust (Zero-trust governance) – ซึ่งหยิบยืมมาจากด้านความปลอดภัยทางไซเบอร์ กรอบการทำงานนี้ตั้งสมมติฐานว่า "สมอง" ของรถสำรวจอาจถูกแทรกแซงหรือเพียงแค่ทำงานผิดพลาด วิศวกรจะบันทึกทุกการตัดสินใจลงในร่องรอยการตรวจสอบ (audit trail) ที่ไม่สามารถแก้ไขได้ และจะมอบสิทธิ์การทำงานให้แก่ AI เพียงเท่าที่จำเป็นต่อการปฏิบัติงานเท่านั้น (least-privilege)
เลเยอร์เหล่านี้ทำงานร่วมกันเพื่อให้รถสำรวจสามารถปฏิบัติงานได้อย่างเป็นอิสระ ในขณะที่ยังคงรักษาลำดับการบังคับบัญชาให้มีความโปร่งใสและสามารถย้อนกลับได้
ใครจะได้รับประโยชน์
ภารกิจในอนาคต เช่น Mars Sample Return หรือการสำรวจขั้วดวงจันทร์ จำเป็นต้องมีความเป็นอิสระในระดับนี้ การจับคู่โมเดล transformer เข้ากับโปรโตคอลความปลอดภัยที่เข้มงวด จะช่วยให้เราสามารถสำรวจระบบสุริยะของเราได้ลึกซึ้งยิ่งขึ้น
ความเสี่ยงที่ซ่อนอยู่
ความเป็นอิสระทำให้รูปแบบของความเสี่ยงเปลี่ยนไป และเลเยอร์ zero-trust จะช่วยบรรเทาความเสี่ยงนี้โดยการบังคับให้ทุกการเคลื่อนไหวต้องผ่านการตรวจสอบ (verifier)
ขั้นตอนต่อไป
แนวทางนี้ปรากฏอยู่ในงานวิจัยของผู้เขียน ซึ่งนำเสนอวิธีการสำหรับภารกิจสำรวจธรณีวิทยาของดาวเคราะห์
บทสรุป: ด้วยการสอนให้รถสำรวจมองว่าการตัดสินใจเป็นปัญหาทางภาษา และการห่อหุ้มความสามารถนั้นไว้ในโมเดลความปลอดภัยที่เน้นการตรวจสอบเป็นอันดับแรก วิศวกรกำลังก้าวเข้าใกล้การสร้างหุ่นยนต์ที่สามารถดำเนินงานทางวิทยาศาสตร์ได้ตามเงื่อนไขของตัวเอง แม้ในยามที่โลกจะอยู่ไกลเกินเอื้อม
