Mobil otonom telah menghabiskan waktu bertahun-tahun mengikuti rangkaian instruksi yang kaku. Insinyur menulis ribuan pernyataan if-then. Jika pejalan kaki menyeberang, rem. Jika lampu berubah merah, berhenti. Jika lajur menikung, arahkan setir. Pendekatan ini berfungsi ketika dunia berperilaku persis seperti yang diharapkan, tetapi berkendara di dunia nyata jauh lebih kacau. Sebuah buku aturan tidak dapat mencakup setiap jalan setapak berlumpur, persimpangan tanpa tanda, atau pesepeda yang berkelok-kelok di tengah lalu lintas. Ketika lingkungan berubah, perintah yang ketat akan gagal. Kita membutuhkan sistem yang mempelajari apa arti berkendara yang baik, alih-alih sekadar mengikuti daftar periksa.

Melampaui Aturan yang Terprogram Kaku

Sistem otonom tradisional bergantung pada pemrograman eksplisit. Mereka berfungsi dengan baik di lingkungan tertutup seperti lantai gudang, jalur khusus, dan cuaca yang dapat diprediksi. Di jalan umum, logika yang sama sering kali berantakan.

Bayangkan sebuah zona konstruksi dengan papan tanda tulisan tangan, kerucut yang tersebar di sudut-sudut aneh, dan seorang petugas yang melambaikan tangan untuk mengatur lalu lintas. Sistem berbasis aturan menginginkan sinyal lalu lintas yang jelas. Ia justru melihat kekacauan. Tanpa aturan spesifik untuk "orang beromzet oranye yang memberi isyarat ke kiri," mobil tersebut akan membeku atau salah menebak. Pengemudi manusia menangani hal ini secara instan karena kita menafsirkan niat dan konteks, bukan sekadar piksel. Kita membaca situasi. Mengajarkan mesin untuk melakukan hal yang sama memerlukan pendekatan yang secara fundamental berbeda.

Belajar dengan Mengamati: Inverse Reinforcement Learning

Di sinilah Inverse Reinforcement Learning mengubah segalanya. Dalam reinforcement learning standar, Anda memberikan AI sebuah tujuan dan fungsi reward (imbalan). Capai tujuan dengan cepat, dapatkan poin. Menabrak trotoar, kehilangan poin. Agen tersebut akan mencoba-coba hingga ia menemukan kebijakan (policy) yang memaksimalkan skornya. Namun, berkendara bukan semata-mata tentang efisiensi. Ini tentang kenyamanan, keamanan, legalitas, dan konvensi sosial. Menulis reward matematis untuk "berkendara seperti manusia yang berhati-hati namun kompeten" hampir mustahil dilakukan.

Inverse Reinforcement Learning membalikkan masalah tersebut. Alih-alih memberikan tujuan kepada AI, Anda menunjukkan contoh-contohnya. Algoritma tersebut mengamati berjam-jam rekaman mengemudi manusia. Ia mengamati kapan manusia melambat, berpindah lajur lebih awal, atau memberi jalan kepada truk yang sedang bergabung. Ia tidak sekadar menghafal sudut kemudi yang tepat. Ia bekerja mundur untuk menyimpulkan alasannya. Mungkin pengemudi melambat karena ada anak kecil berdiri di dekat trotoar, meskipun jalan tersebut secara hukum sudah aman. AI mengekstrak reward yang tersembunyi: kedekatan dengan pejalan kaki itu penting, bahkan tanpa adanya penyeberangan jalan.

Dengan memperlakukan manusia sebagai pakar yang telah memecahkan masalah optimasi, algoritma tersebut memulihkan fungsi biaya (cost function) yang diminimalkan oleh pakar tersebut. Setelah sistem memahami preferensi yang mendasarinya, seperti lebih menyukai pengereman yang halus daripada berhenti mendadak atau menjaga posisi di tengah lajur daripada memotong tikungan, ia dapat melakukan generalisasi. Ia akan menemui jalan baru di kota yang berbeda dan mengetahui, secara perkiraan, apa yang akan dihargai oleh pengemudi yang baik dalam pengaturan yang tidak dikenal tersebut.

Membuat Pilihan: Deep Q-Networks

Memahami reward hanyalah setengah dari perjuangan. Mobil tetap perlu bertindak. Deep Q-Networks menangani pengambilan keputusan dengan memproses data sensorik untuk memilih tindakan terbaik.

Q-learning klasik telah ada selama beberapa dekade. Seorang agen mempelajari nilai dari mengambil tindakan tertentu dalam status (state) tertentu. Masalahnya adalah status berkendara di dunia nyata praktis tidak terbatas. Umpan kamera bukanlah dunia grid yang sederhana. Ia terdiri dari jutaan piksel yang berubah pada enam puluh bingkai per detik, dikombinasikan dengan lidar point clouds, pembacaan kecepatan, dan vektor GPS.

Deep Q-Networks mengatasi hal ini dengan menggunakan jaringan saraf (neural network) sebagai aproksimator fungsi. Jaringan tersebut menerima data sensorik mentah dan mengeluarkan nilai prediksi untuk setiap tindakan yang memungkinkan: belok kiri, rem perlahan, akselerasi, pertahankan jalur. Alih-alih menyimpan tabel pencarian (lookup table) untuk setiap skenario, jaringan tersebut melakukan generalisasi. Ia mengenali bahwa gumpalan gelap pada malam yang hujan kemungkinan besar adalah mobil yang terparkir, sama seperti yang ia pelajari selama pelatihan di siang hari yang cerah, dan memberikan nilai rendah pada tindakan "akselerasi".

Pelatihan melibatkan experience replay. Sistem menyimpan momen-momen dari perjalanan masa lalu, perpindahan lajur yang berhasil, kejadian hampir celaka, dan perlambatan yang halus, lalu mengambil sampelnya secara acak untuk memperbarui jaringannya. Hal ini memutus korelasi yang merugikan dan menstabilkan proses pembelajaran. Selama ribuan jam simulasi, jaringan tersebut mempelajari tindakan mana yang mengarah pada kemajuan yang aman dan mana yang mengarah pada masalah.

Menyatukannya

Kedua metode tersebut tidak dapat membangun pengemudi yang kompeten jika berdiri sendiri. Inverse Reinforcement Learning tanpa mesin pengambil keputusan hanyalah seorang pengamat. Ia tahu bahwa manusia menghargai kehalusan berkendara, tetapi tidak dapat menyentuh kemudi. Deep Q-Network tanpa fungsi imbalan yang dirancang dengan baik akan mengoptimalkan hal yang salah. Ia mungkin menemukan bahwa berkendara berputar-putar menghindari tabrakan dengan sempurna, mencapai skor tinggi padahal tidak menuju ke mana pun.

Jika digabungkan, keduanya menciptakan sebuah siklus yang kuat. Inverse Reinforcement Learning mengamati pakar manusia dan menyuling fungsi imbalan yang menangkap prioritas dunia nyata. Deep Q-Network kemudian menggunakan fungsi imbalan tersebut untuk melatih dirinya sendiri melalui uji coba, memproses data sensor secara langsung untuk memilih tindakan. AI mempelajari perilaku kompleks melalui observasi, tetapi juga melalui latihan.

Pertimbangkan situasi penggabungan jalur di jalan tol. Komponen Inverse Reinforcement Learning telah menyimpulkan bahwa pengemudi manusia menyeimbangkan penyesuaian kecepatan dengan penerimaan celah. Deep Q-Network menerima sinyal biaya yang bernuansa ini dan berlatih melakukan penggabungan sepuluh ribu kali dalam simulasi. Ia belajar kapan harus menambah kecepatan, kapan harus menahan diri, dan kapan celah terlalu sempit. Hasilnya bukanlah sekadar meniru gerakan manusia yang terekam seperti burung beo. Melainkan sebuah sistem yang telah menginternalisasi logika tersebut dan dapat beradaptasi saat jalan tol basah atau celah lebih sempit dari biasanya.

Mengapa Ini Penting untuk Jalanan Nyata