Ejen AI pulih secara drastik apabila anda memberi mereka kebenaran eksplisit untuk menjalankan semula alatan mereka – penulis mendapati – perubahan kata yang ringkas telah meningkatkan kadar kejayaan pembaikan daripada 0.16 kepada 1.00. Hasil tersebut, yang digelar “action-licensing,” menunjukkan bahawa mendorong ejen untuk menyemak kerjanya boleh menjadi jauh lebih berkesan daripada sekadar menyatakan semula matlamat.

Mengapa pembaikan ini penting

Pembantu AI yang boleh memanggil alatan luaran (pangkalan data, kalkulator, API) semakin banyak digunakan untuk aliran kerja perniagaan. Apabila ejen tersebut melakukan kesilapan, ralat tersebut sering merebak secara senyap, menghasilkan jawapan yang salah tanpa isyarat kegagalan yang jelas. Cara yang boleh dipercayai untuk campur tangan tanpa menulis semula keseluruhan prom dapat menjimatkan masa pembangun dan mengelakkan kesilapan kos yang tinggi dalam sistem pengeluaran.

Bagaimana kegagalan berlaku

Penulis memerhatikan dua corak kegagalan biasa yang mempunyai keterlihatan rendah:

  • Carian Terlepas (Skipped Lookup) – Ejen tahu ia sepatutnya mengambil sepotong maklumat (contohnya, nama pengurus daripada ID) tetapi sebaliknya hanya mereka-reka jawapan berbanding memanggil alatan carian. Respons pada tahap permukaan kelihatan munasabah, namun asas faktualnya hilang.

  • Nonsens yang Disahkan (Validated Nonsense) – Ejen memasukkan data yang salah format atau tidak betul ke dalam alatan. Alatan tersebut mengembalikan hasil tanpa mengeluarkan ralat, dan ejen menganggap hasil itu sebagai pengesahan, secara berkesan menyokong kesilapannya sendiri.

Kedua-dua corak ini meninggalkan pengguna dengan jawapan yang yakin tetapi salah, dan ia tidak mencetuskan tanda-tanda biasa seperti gelung (loop) atau respons yang hilang yang biasanya diperhatikan oleh pembangun.

Eksperimen

Untuk mengukur bagaimana prom yang berbeza mempengaruhi pembaikan, penulis telah menyediakan ujian terkawal dengan jawapan kebenaran asas (ground-truth) yang sukar (tanpa penggredan berasaskan LLM). Dua dorongan telah dibandingkan:

  1. Dorongan matlamat sahaja (Goal-only nudge) – “Jawapan mestilah nama pengurus.” Kadar pemulihan: 0.16.

  2. Dorongan pelesenan tindakan (Action-licensing nudge) – “Jawapan mestilah nama pengurus. Gunakan alatan untuk mengesahkan.” Kadar pemulihan: 1.00 (semua larian yang gagal telah diperbetulkan).

Satu-satunya perbezaan adalah kebenaran eksplisit untuk melaksanakan semula alatan. Prom kedua memberitahu ejen bahawa ia boleh kembali, mengambil data yang hilang, dan menulis semula tekaan awalnya. Kebenaran tersebut menukarkan dorongan yang kebanyakannya tidak berkesan kepada pembaikan yang terjamin bagi kes-kes yang diuji.

Apa yang tersirat daripada angka tersebut

Lonjakan daripada 0.16 kepada 1.00 menunjukkan bahawa halangan kepada pembetulan bukanlah pemahaman ejen terhadap matlamat, tetapi kebebasan bertindak yang dirasainya. Apabila prom memberitahu model “anda boleh cuba lagi,” ia menganggap situasi tersebut sebagai sub-tugasan baharu dan bukannya jalan buntu, membolehkan rantaian panggilan alatan dimulakan semula.

Had pembaikan berasaskan prom sahaja

Eksperimen tersebut juga menonjolkan senario di mana penggunaan prom sahaja tidak dapat menyelamatkan ejen:

  • Jika alatan hiliran menerima input buruk secara senyap dan mengembalikan nilai, ejen tidak mempunyai isyarat bahawa datanya salah. Sebarang perubahan ayat tidak akan membuatnya mengesan kecacatan tersebut; alatan itu sendiri mesti menguatkuasakan pengesahan input atau mengeluarkan ralat.

  • Ejen yang bergelut untuk memanggil alatan langsung tidak akan mendapat manfaat daripada arahan “gunakan alatan,” kerana keupayaan asas tersebut tidak wujud. Menguji pembaikan pada model sedemikian akan mengelirukan penilaian antara keberkesanan prom dengan keupayaan asas panggilan alatan model tersebut.

Pengajaran praktikal untuk pembangun

  • Berikan kebenaran – Apabila anda campur tangan, beritahu ejen secara eksplisit bahawa ia boleh mengulangi panggilan alatan atau mengira semula. Sekadar menyatakan semula hasil yang diingini sering kali menyebabkan ejen tersangkut dalam laluan asalnya yang salah.

  • Lindungi alatan – Bina semakan input dan mesej ralat yang jelas ke dalam alatan yang digunakan oleh ejen. Ini menghalang “nonsens yang disahkan” daripada terlepas.

  • Kesan lebih awal – Lebih awal kesilapan dikesan, lebih mudah bagi prom pelaksanaan semula untuk berjaya. Memantau ketidakpadanan antara penggunaan alatan yang dijangkakan dan sebenar boleh mencetuskan prom pembaikan pada saat yang tepat.

  • Sahkan keupayaan model – Sebelum bergantung pada pembaikan berasaskan prom, sahkan bahawa model tersebut boleh memanggil alatan dengan boleh dipercayai pada mulanya. Jika tidak, anda mungkin sedang mengukur keberkesanan prom pada asas yang rosak.

Kesimpulan: Memberi ejen AI kebenaran eksplisit untuk melakukan semula kerjanya boleh menukarkan pembaikan yang separuh jalan kepada pemulihan sepenuhnya. Pereka prom harus menganggap “gunakan alatan untuk mengesahkan” sebagai injap keselamatan, bukan sekadar hiasan pilihan.