Agen AI pulih secara drastis ketika Anda memberi mereka izin eksplisit untuk menjalankan ulang alat (tools) mereka, temuan penulis – perubahan kata yang sederhana meningkatkan tingkat keberhasilan perbaikan dari 0,16 menjadi 1,00. Hasilnya, yang dijuluki “action-licensing,” menunjukkan bahwa mendorong agen untuk memeriksa pekerjaannya bisa jauh lebih efektif daripada sekadar menyatakan kembali tujuannya.
Mengapa perbaikan ini penting
Asisten AI yang dapat memanggil alat eksternal (database, kalkulator, API) semakin banyak digunakan untuk alur kerja bisnis. Ketika agen tersebut melakukan kesalahan, kesalahan tersebut sering kali menyebar secara diam-diam, menghasilkan jawaban yang salah tanpa sinyal kegagalan yang jelas. Cara yang andal untuk melakukan intervensi tanpa menulis ulang seluruh prompt dapat menghemat waktu pengembang dan mencegah kesalahan fatal dalam sistem produksi.
Bagaimana kegagalan muncul
Penulis mengamati dua pola kegagalan umum dengan visibilitas rendah:
Lookup yang Terlewati – Agen tahu bahwa ia harus mengambil suatu informasi (misalnya, nama manajer dari sebuah ID) tetapi malah mengarang jawaban alih-alih memanggil alat pencarian (lookup tool). Respons di permukaan tampak masuk akal, namun dasar faktualnya hilang.
Omong Kosong yang Tervalidasi – Agen memasukkan data yang salah format atau tidak benar ke dalam alat. Alat tersebut mengembalikan hasil tanpa memunculkan kesalahan, dan agen menganggap hasil tersebut sebagai konfirmasi, yang secara efektif membenarkan kesalahannya sendiri.
Kedua pola tersebut meninggalkan pengguna dengan jawaban yang terdengar meyakinkan tetapi salah, dan tidak memicu tanda-tanda umum seperti loop atau respons yang hilang yang biasanya dipantau oleh pengembang.
Eksperimen
Untuk mengukur bagaimana prompt yang berbeda memengaruhi perbaikan, penulis menyusun tes terkendali dengan jawaban ground-truth yang pasti (tanpa penilaian berbasis LLM). Dua dorongan (nudge) dibandingkan:
Dorongan hanya tujuan – “Jawaban harus berupa nama manajer.” Tingkat pemulihan: 0,16.
Dorongan action-licensing – “Jawaban harus berupa nama manajer. Gunakan alat untuk memverifikasi.” Tingkat pemulihan: 1,00 (semua kegagalan berhasil diperbaiki).
Satu-satunya perbedaan adalah izin eksplisit untuk mengeksekusi ulang sebuah alat. Prompt kedua memberi tahu agen bahwa ia dapat kembali, mengambil data yang hilang, dan menimpa tebakan sebelumnya. Izin tersebut mengubah dorongan yang sebagian besar tidak efektif menjadi perbaikan yang terjamin untuk kasus-kasus yang diuji.
Apa arti angka-angka tersebut
Lonjakan dari 0,16 ke 1,00 menunjukkan bahwa hambatan untuk perbaikan bukanlah pemahaman agen terhadap tujuan, melainkan persepsi kebebasannya untuk bertindak. Ketika prompt memberi tahu model “Anda boleh mencoba lagi,” model menganggap situasi tersebut sebagai sub-tugas baru alih-alih jalan buntu, sehingga memungkinkan rantai pemanggilan alat (tool-call chain) untuk dimulai ulang.
Batasan perbaikan hanya melalui prompt
Eksperimen ini juga menyoroti skenario di mana prompt saja tidak dapat menyelamatkan agen:
Jika alat hilir (downstream tool) menerima input buruk secara diam-diam dan mengembalikan nilai, agen tidak memiliki sinyal bahwa datanya salah. Tidak peduli berapa banyak perubahan kalimat yang dilakukan, agen tidak akan mendeteksi cacat tersebut; alat itu sendiri harus menegakkan validasi input atau memunculkan kesalahan.
Agen yang kesulitan memanggil alat sama sekali tidak akan mendapat manfaat dari instruksi “gunakan alat,” karena kemampuan dasarnya memang tidak ada. Menguji perbaikan pada model seperti itu akan mencampuradukkan evaluasi prompt dengan kemampuan dasar pemanggilan alat model tersebut.
Pelajaran praktis bagi pengembang
Berikan izin – Saat Anda melakukan intervensi, beri tahu agen secara eksplisit bahwa ia boleh mengulangi pemanggilan alat atau menghitung ulang. Sekadar menyatakan kembali hasil yang diinginkan sering kali membuat agen terjebak dalam jalur yang salah dan keliru sejak awal.
Lindungi alat – Bangun pemeriksaan input dan pesan kesalahan yang jelas ke dalam alat yang digunakan agen. Ini mencegah “omong kosong yang tervalidasi” lolos begitu saja.
Deteksi lebih awal – Semakin cepat kesalahan terdeteksi, semakin mudah bagi prompt eksekusi ulang untuk berhasil. Memantau ketidaksesuaian antara penggunaan alat yang diharapkan dan yang sebenarnya dapat memicu prompt perbaikan pada saat yang tepat.
Validasi kemampuan model – Sebelum mengandalkan perbaikan berbasis prompt, pastikan model tersebut memang dapat memanggil alat secara andal sejak awal. Jika tidak, Anda mungkin hanya mengukur efektivitas prompt pada fondasi yang rusak.
Intinya: Memberikan izin eksplisit kepada agen AI untuk mengulangi pekerjaannya dapat mengubah perbaikan yang setengah hati menjadi pemulihan penuh. Perancang prompt harus memperlakukan “gunakan alat untuk memverifikasi” sebagai katup pengaman, bukan sekadar hiasan opsional.
