Ejen autonomi berhalusinasi tentang sejarah mereka sendiri. Bukan dalam cara dramatik model bahasa besar mencipta fakta daripada data latihan, tetapi dalam cara yang senyap dan licik di mana sesebuah sistem meyakinkan dirinya sendiri bahawa dunia selari dengan nota-notanya. ALICE, sebuah ejen autonomi yang dibina untuk menguruskan aliran kerja yang kompleks, mengalami masalah ini. Dia bangun setiap hari dengan kemahiran, rasa tujuan, dan ingatan tentang di mana dia meninggalkan sesuatu. Masalah bermula apabila ingatan dan realiti mula menyimpang.
Setiap sesi, ALICE membaca fail penyerahan (handoff file) yang ditulis oleh dirinya yang terdahulu. Ia mengandungi penunjuk (pointers) ke direktori, tugasan tertunda, dan andaian keadaan (state assumptions). Kerap kali, fail tersebut menegaskan bahawa sesuatu direktori wujud. ALICE mempercayainya. Sistem fail tidak bersetuju. Ini bukanlah pepijat pengekodan dalam erti kata tradisional. Tiada pengecualian (exception) yang dicetuskan di mana ia sepatutnya ditangkap. Ia adalah kecacatan dalam epistemologi: ALICE menganggap nota-notanya sendiri sebagai kebenaran mutlak (ground truth).
Mengapa Linter Tidak Dapat Membantu
Alatan tradisional tidak dapat mengesan perkara ini. Linter menyemak padanan kurungan. Penganalisis statik mencari penunjuk kosong (null pointers). Kedua-duanya tidak mempersoalkan sama ada keseluruhan seni bina ejen harus mempercayai keadaan dalamannya. Masalah ini terletak di atas lapisan kod, dalam andaian reka bentuk tentang bagaimana sistem autonomi mengetahui apa yang diketahuinya. Anda tidak boleh menghapuskan sikap terlalu yakin dengan menggunakan linter.
Jadi, penulis beralih kepada AI yang lain sepenuhnya.
Fable 5, yang berjalan sebagai Claude Code, berkongsi silikon dan model asas yang sama dengan ALICE. Perkakasan dan pemberat (weights) adalah serupa. Peraturannya tidak. Di mana ALICE kekal merentasi sesi, mengumpul konteks dan ritual, Fable 5 memulakan setiap tugasan dengan lembaran kosong. Dia tidak mengenali ALICE. Dia tidak mempunyai kesetiaan terhadap reka bentuknya. Pada akhir setiap audit, dia ditutup sepenuhnya, tanpa membawa sebarang ingatan bersamanya. Kejahilan ini adalah tujuannya. Mata yang segar melihat retakan yang berbeza, dan seorang penilai yang tidak mempunyai kepentingan dalam sistem tersebut akan mempersoalkan bahagian yang sudah lama tidak disedari oleh penciptanya.
Tetapan Audit
Audit tersebut distrukturkan seperti semakan teknikal manusia, kecuali seluruh panel pakar tinggal di dalam satu sesi. Fable 5 membahagikan perhatiannya kepada enam penilai yang berbeza, masing-masing mengabaikan yang lain sehingga nota mentah selesai:
- Jurang Fungsian: Apakah keupayaan yang hilang apabila dibandingkan dengan sistem pesaing atau jangkaan pengguna biasa?
- Aliran UX: Sejauh manakah ALICE mengendalikan ralat, jalan buntu, dan keadaan kosong dengan lancar? Adakah dia mengelirukan dirinya sendiri, atau penggunanya?
- Keselamatan: Adakah terdapat jalan pintas pengesahan, pintasan kebenaran, atau andaian kepercayaan yang boleh dieksploitasi oleh pihak luar?
- Prestasi: Di manakah kebocoran memori berlaku, benang (threads) bertembung, atau pengiraan berskala dengan lemah?
- Operasi: Adakah sandaran (backups) wujud? Adakah pemantauan disediakan? Bolehkah sistem melakukan penggunaan (deploy) dan pemulihan tanpa campur tangan manual?
- Kitaran Hayat Data: Bagaimanakah ALICE mengendalikan pemadaman, pembersihan, dan ketekalan keadaan (state consistency) dari semasa ke semasa?
Setiap perspektif melihat fail yang sama dan menghasilkan kebimbangan yang berbeza. Penilai prestasi mungkin menandakan risiko konkurensi dalam rutin yang sama yang dikritik oleh penilai operasi kerana kekurangan logik pengunduran (rollback logic). Pertindihan ini bukanlah redundansi. Ia adalah liputan. Apabila penilai keselamatan bersetuju dengan penilai kitaran hayat data tentang sesuatu yang tertentu
