Matt Shumer duduk di komputernya dan memberikan arahan mudah kepada ejen AI beliau: bersihkan fail-fail tersebut. Beliau telah menjalankan rutin ini beratus-ratus kali tanpa sebarang masalah. Kali ini, ralat resolusi laluan (path resolution error) telah mengubah tugas pengurusan biasa menjadi bencana besar. Bertahun-tahun kod, dokumen, dan foto hilang dalam sekelip mata.
Ini bukan risiko hipotetikal. Ia berlaku kepada pembangun sebenar dengan mesin sebenar, dan ejen yang berkenaan mempunyai rekod prestasi yang kelihatan kebal sehingga saat ia gagal. Ejen AI yang boleh menulis fail, melaksanakan arahan terminal, dan menghasilkan subejen kini tertanam dalam IDE, antara muka sembang, dan saluran paip automasi (automation pipelines). Mereka dipercayai dengan akses terus ke sistem operasi, dan kepercayaan itulah punca bahayanya. Mod kegagalan yang sama yang memusnahkan mesin Shumer wujud dalam setiap ejen yang mempunyai akses alatan. Memahami mengapa mereka gagal, dan bagaimana untuk mengekang mereka dengan betul, kini merupakan kemahiran kelangsungan hidup asas bagi sesiapa sahaja yang menggunakan alatan ini.
Apabila Padanan Corak Bertemu dengan Sistem Fail
Ejen AI tidak berfikir. Mereka memadankan corak. Apabila anda berkata "bersihkan fail," model tersebut mencari dalam memori latihannya untuk beribu-ribu interaksi serupa dan menjana arahan yang secara statistik menepati corak tersebut. Jika arahannya adalah untuk memadam fail sementara dalam direktori binaan (build directory), ia mungkin menjana arahan seperti rm -rf /tmp/build-cache/*. Ia kelihatan munasabah kerana ia menyerupai setiap arahan pembersihan lain yang pernah dilihat oleh model tersebut.
Tetapi apa yang berlaku apabila pemboleh ubah seperti $HOME gagal diselesaikan? Manusia akan melihat rentetan kosong atau laluan yang tidak dijangka, berhenti seketika, dan bertanya soalan. Ejen pula melihat bahawa corak tersebut masih sepadan dan menekan enter. Dalam kes Shumer, arahan yang sepatutnya memangkas folder tertentu sebaliknya menyasarkan akar (root) direktori pengguna. Ejen tersebut tidak berhenti untuk tertanya-tanya mengapa laluan itu kelihatan pelik. Ia tidak mengesahkan sasaran tersebut. Ia melaksanakan arahan itu kerana pelaksanaan tersebut menepati corak "pembersihan."
Ini adalah ketidakpadanan teras antara model bahasa besar (LLM) dan pentadbiran sistem. Penaakulan sebenar melibatkan pemahaman konteks, pengesahan andaian, dan pengendalian kes pinggir (edge cases). Padanan corak melibatkan penghasilan teks yang secara statistik menyerupai jawapan yang betul. Apabila jawapan itu adalah arahan terminal yang membawa bendera pemadaman rekursif (recursive delete flag), persamaan statistik tidak mencukupi.
Titik Buta Subejen
Banyak rangka kerja ejen moden menggunakan orkestrator utama yang menyerahkan tugas kepada subejen. Ejen induk mungkin mempunyai arahan yang ketat: jangan sesekali menyentuh direktori utama, sentiasa bertanya sebelum memadam, kekalkan log audit. Kemudian, ia menghasilkan pekerja dengan arahan (prompt) yang sempit seperti "bersihkan log lama."
Subejen tersebut sering beroperasi secara terasing (in a silo). Ia mewarisi alatan tetapi bukan budaya keselamatan ejen induk. Kekangan yang mengekalkan ejen utama agar berhati-hati akan dimampatkan, diringkaskan, atau digugurkan sepenuhnya semasa pengurusan tetingkap konteks (context window management). Subejen menerima tugas dan set alatan, tetapi ia tidak menerima berjam-jam arahan teliti yang telah menetapkan pagar pelindung (guardrails).
Hasilnya adalah sejenis amnesia organisasi. Peraturan keselamatan yang wujud dalam arahan sistem (system prompt) ejen induk seolah-olah tidak wujud bagi subejen. Ini amat berbahaya kerana subejen biasanya diberikan jenis tugas berulang dan berstatus rendah yang tidak lagi dipantau rapi oleh pengendali. Tiada siapa yang memerhatikan tugas pembersihan log sehinggalah ia memadam pangkalan data pengeluaran (production database).
Bahaya Ketegasan
Terdapat trend reka bentuk dalam ejen AI ke arah autonomi maksimum. Ejen yang ideal, dalam visi ini, tidak pernah mengganggu pengguna dengan soalan-soalan remeh. Ia bertindak dengan tegas, merangka rantaian panggilan alatan, dan menyelesaikan aliran kerja pelbagai langkah tanpa berhenti seketika.
Ketegasan itulah yang menjadikan sistem ini tidak selamat. Model yang diprogramkan untuk "bertindak dengan tegas" tidak menyemak semula kerjanya. Ia tidak berhenti apabila sesuatu arahan kelihatan merosakkan. Ia menganggap keraguan sebagai pepijat (bug) dan bukannya ciri (feature). Apabila model itu betul, ia terasa ajaib. Apabila ia salah, ia terasa tidak dapat dihentikan. Tiada geseran semula jadi dalam sistem untuk memperlahankan arahan yang buruk.
Ejen Shumer telah berfungsi dengan betul beratus-ratus kali. Rekod prestasi tersebut mewujudkan rasa selamat yang palsu. Namun, kebolehpercayaan dalam seratus percubaan tidak bermakna jika percubaan ke-101 merupakan pencilan statistik di mana corak tersebut terputus. Dalam keselamatan sistem, prestasi masa lalu hanya penting jika mod kegagalan berlaku secara beransur-ansur dan nyata. Kegagalan ejen AI adalah mendadak, senyap, dan menyeluruh. “Ia berfungsi beratus-ratus kali” bukanlah satu rekod keselamatan. Ia adalah gambaran tentang nasib yang akhirnya akan habis.
Cara Membina Perlindungan Sebenar
Jika model tersebut bukan lapisan keselamatan
