Kendaraan otonom, robot industri, dan armada drone tidak mengikuti buku aturan kaku yang ditulis tangan yang menggerakkan sistem autopilot lama. Mereka belajar dari data dalam jumlah besar, yang berarti perilakunya bersifat probabilistik, bukan deterministik. Autopilot pesawat tradisional bereaksi terhadap input sensor melalui logika yang dikodekan secara eksplisit. Model machine learning bereaksi melalui pola yang disimpulkannya selama pelatihan. Perbedaan tersebut membuat verifikasi menjadi jauh lebih sulit, dan itulah alasan mengapa komunitas machine learning telah beralih ke kerangka kerja penjaminan (assurance frameworks) yang terstruktur daripada pengujian ad-hoc.

Mengapa Penjaminan Machine Learning Tidak Bisa Ditawar

Ketika sistem otonom melakukan kesalahan, konsekuensinya melampaui sekadar kesalahan server atau aplikasi yang membeku. Robot gudang yang salah mengidentifikasi rintangan dapat menghancurkan inventaris atau melukai pekerja. Drone pengantar yang mengklasifikasikan kabel listrik sebagai langit terbuka dapat menabrak infrastruktur. Karena sistem ini mengandalkan jaringan saraf (neural networks) yang kompleks dan model statistik, mode kegagalannya bersifat halus. Mereka jarang rusak dengan cara yang jelas. Sebaliknya, mereka mengalami degradasi secara diam-diam saat menghadapi input yang berada di luar distribusi yang mereka lihat selama pelatihan.

Kesalahan dalam machine learning otonom tidak selalu berasal dari kode yang jelas-jelas buruk. Kesalahan tersebut dapat muncul dari celah dalam data pelatihan, pergeseran lingkungan yang tidak terduga, atau prediksi yang terlalu percaya diri pada edge cases. Organisasi yang memperlakukan komponen ML seperti modul perangkat lunak standar, dengan asumsi bahwa rangkaian unit test sudah cukup, baru menyadari terlambat bahwa akurasi laboratorium tidak dapat diterjemahkan ke dalam keamanan dunia nyata. Anda memerlukan standar sistematis yang menangani risiko unik dari perilaku yang dipelajari. Itulah celah yang dirancang untuk ditutup oleh kerangka kerja AMLAS.

Apa Saja yang Dicakup oleh AMLAS

AMLAS, yang merupakan singkatan dari Assurance of Machine Learning for use in Autonomous Systems, menyediakan pendekatan end-to-end untuk memverifikasi bahwa komponen yang dipelajari layak untuk penerapan berisiko tinggi. Ia tidak memperlakukan keamanan sebagai pemikiran tambahan atau gerbang terakhir sebelum rilis. Sebaliknya, ia menjalin aktivitas penjaminan ke dalam siklus hidup sistem.

Kerangka kerja ini berkonsentrasi pada tiga pilar praktis:

Metode verifikasi untuk model ML. Ini jauh melampaui metrik pembagian latih-uji (train-test split) standar seperti akurasi atau skor F1. Penjaminan di bawah AMLAS mempertanyakan apakah model berperilaku secara terprediksi pada batas keputusan (decision boundaries), bagaimana ia merespons input di luar distribusi (out-of-distribution), dan apakah skor kepercayaannya merupakan indikator yang andal dari ketidakpastian yang sebenarnya. Insinyur diharapkan untuk menguji model dengan contoh adversarial dan melakukan uji stres terhadap input dari domain yang sedikit di luar set pelatihan. Tujuannya bukanlah kesempurnaan. Tujuannya adalah mendapatkan bukti yang cukup untuk mengetahui kapan model dapat dipercaya dan kapan tidak.

Protokol keselamatan untuk tindakan otonom. Model persepsi yang dipelajari masuk ke dalam perangkat lunak perencanaan dan kontrol yang menggerakkan perangkat keras fisik. AMLAS menuntut agar tindakan hilir (downstream) ini menyertakan guardrails. Bahkan jika jaringan saraf salah mengklasifikasikan suatu objek, kendaraan atau robot tersebut tidak boleh secara fisik mampu mengeksekusi lintasan yang melanggar batasan keras (hard constraints). Ini mungkin berarti batas torsi pada lengan robot, geofencing untuk drone, atau koridor pengereman wajib untuk kendaraan darat. Sistem otonom memerlukan lapisan arsitektural yang mencegah satu kesalahan model menjadi peristiwa fisik yang tidak terkendali.

Metode untuk mengurangi ketidakpastian. Ketidakpastian dalam machine learning hadir dalam berbagai bentuk. Ada ketidakpastian aleatorik, yaitu noise inheren dalam pembacaan sensor atau lingkungan, dan ketidakpastian epistemik, yang mencerminkan apa yang belum diketahui oleh model. AMLAS mendorong praktik yang mengukur dan mengelola keduanya. Tekniknya dapat mencakup metode ensemble, di mana beberapa model menandai ketidaksepakatan sebagai tanda peringatan, atau lapisan validasi input yang menolak data yang diketahui menyebabkan perilaku tidak menentu. Anda mungkin tidak dapat menghilangkan ketidakpastian sepenuhnya, tetapi Anda dapat mencegah sistem bertindak secara membabi buta terhadapnya.

Jalur Praktis untuk Membangun Kepercayaan

Kerangka kerja hanya akan berarti jika tim menerapkannya dalam praktik. AMLAS paling baik diterjemahkan ke dalam tindakan ketika organisasi mengikuti urutan yang disiplin.

Tentukan tujuan keselamatan Anda sebelum mengumpulkan satu pun dataset. Dalam rekayasa perangkat lunak tradisional, persyaratan datang lebih dulu. Proyek machine learning sering kali membalikkan hal ini, memperlakukan keselamatan sebagai masalah yang harus diselesaikan setelah model dilatih. Balikkan kebiasaan tersebut. Mulailah dengan domain desain operasional yang jelas. Dalam kondisi apa sistem akan berjalan? Berapa tingkat kegagalan yang dapat ditoleransi untuk setiap bahaya? Kegagalan mana yang memerlukan intervensi manusia segera? Menjawab pertanyaan-pertanyaan ini sejak dini akan membentuk segalanya, mulai dari pengumpulan data hingga arsitektur model.

Uji model Anda terhadap data yang mencerminkan kekacauan operasional yang nyata. Tolok ukur lab memang menenangkan, tetapi mereka menipu. Robot gudang yang dilatih secara eksklusif pada gambar barcode yang bersih akan gagal ketika labelnya kusut, pencahayaannya buruk, atau terhalang oleh kotoran. Drone otonom yang hanya diuji dalam cuaca cerah akan kesulitan menghadapi silau dan angin kencang. Anda memerlukan log dari lingkungan penyebaran (deployment) yang sebenarnya, termasuk kasus-kasus tepi (edge cases) yang menjengkelkan yang tidak pernah muncul dalam dataset yang dikurasi. Jalankan uji coba mode bayangan (shadow mode) di mana sistem otonom membuat keputusan secara paralel dengan operator manusia tetapi belum mengendalikan perangkat keras. Bandingkan log tersebut secara ketat.

Pantau kinerja secara terus-menerus setelah penyebaran. Dunia tidak diam di tempat. Perubahan pencahayaan musiman, permukaan jalan yang aus, desain kemasan baru, dan pola lalu lintas jaringan yang berubah-ubah semuanya dapat menurunkan performa model yang dulunya bekerja dengan sangat baik. Siapkan telemetri yang melacak kepercayaan prediksi, pergeseran distribusi input (input distribution drift), dan tingkat insiden. Tetapkan ambang batas yang memicu peninjauan manusia atau pembatasan operasional sementara ketika terjadi perubahan perilaku. Sebuah model bukanlah produk statis yang Anda kirimkan lalu lupakan. Ia adalah komponen yang mulai menua saat bertemu dengan dunia nyata.

Kebenaran Pahit Tentang Validasi Dunia Nyata

Banyak tim meyakinkan diri mereka sendiri bahwa skor validasi yang tinggi menandakan kesiapan. Padahal tidak. Validasi dunia nyata membutuhkan keberanian untuk menghadapi ketidaknyamanan. Itu berarti menerbangkan drone dalam kondisi angin kencang, menjalankan robot gudang selama sif malam saat lampu berkedip-kedip, dan memaparkan model persepsi pada stiker adversarial pada rambu jalan. Jika lingkungan pengujian Anda terasa rapi dan dapat diprediksi, Anda tidak sedang menguji. Anda hanya sedang berlatih.

Proses ini mahal dan lambat. Hal ini menuntut kolaborasi antara insinyur machine learning, spesialis keselamatan, dan operator domain yang memahami lingkungan fisik. Hasilnya adalah kumpulan bukti. Saat Anda akhirnya melakukan penyebaran, Anda harus dapat menunjukkan kondisi pengujian tertentu, mode kegagalan yang diketahui, dan mitigasi yang terkait dengan setiap risiko. Dokumentasi itulah yang membedakan prototipe dari sistem yang siap Anda operasikan tanpa pengawasan di dekat manusia.

Menjaga Kejujuran Sistem dari Waktu ke Waktu

Pemantauan pasca-penyebaran adalah tempat di mana banyak program penjaminan (assurance) perlahan-lahan runtuh. Tim merayakan peluncuran dan mengalihkan sumber daya ke fitur berikutnya. Sementara itu, model yang telah disebarkan menghadapi aliran input yang secara halus menyimpang dari pengalaman pelatihannya. Tanpa pemantauan aktif, pergeseran (drift) ini akan menumpuk hingga insiden serius memaksa dilakukannya investigasi reaktif.

Siapkan lingkaran umpan balik yang terstruktur. Catat setiap instansi di mana model menunjukkan kepercayaan rendah atau di mana operator manusia melakukan intervensi. Gunakan log ini untuk melatih ulang atau menyempurnakan (fine-tune) model secara berkala, tetapi validasi setiap pembaruan melalui gerbang penjaminan yang sama seperti yang diterapkan pada rilis asli. Perlakukan pembaruan model dengan kewaspadaan yang sama seperti saat Anda mengganti sistem rem mekanis dengan desain baru.

Intisari Sebenarnya

Machine learning dalam sistem otonom bukanlah sandbox penelitian. Ini adalah infrastruktur yang membawa risiko fisik, dan ia layak mendapatkan ketelitian yang sama dengan yang diterapkan oleh insinyur kedirgantaraan dan perangkat medis pada perangkat keras. AMLAS menawarkan kosakata dan alur kerja untuk ketelitian tersebut. AMLAS tidak akan mengotomatiskan kepercayaan untuk Anda, tetapi ia memberi Anda cara yang dapat diulang untuk mendapatkannya. Mulailah dengan tujuan keselamatan yang jujur. Validasi terhadap data yang kotor dan autentik. Awasi sistem seperti seorang skeptis setelah sistem tersebut aktif. Kerangka kerja sudah tersedia. Sisanya adalah disiplin.

Untuk rincian teknis lengkap dari panduan AMLAS, baca detail aslinya di sini: https://dev.to/paperium/guidance-on-the-assurance-of-machine-learning-in-autonomous-systems-amlas-f9

Jika Anda ingin mendiskusikan strategi penjaminan dan bertukar catatan praktis dengan komunitas yang mengerjakan masalah serupa, bergabunglah dalam percakapan di sini: https://t.me/GyaanSetuAi