Sebagian besar tim engineering masih mengevaluasi agen AI dengan cara yang sama seperti mereka menilai PR matematika. Mereka hanya melihat output akhirnya. Jika jawabannya benar, mereka memberikan lampu hijau untuk rilis dan lanjut ke tahap berikutnya. Ini adalah jalan pintas yang berbahaya. Jawaban yang benar dapat menyembunyikan sistem yang rusak parah.
Cerita sebenarnya terletak pada jalur yang diambil agen untuk sampai ke sana. Jalur tersebut disebut trajektori agen (agent trajectory). Ini mencakup setiap pemanggilan alat (tool call), setiap keputusan perutean (routing decision), setiap jeda di mana agen berhenti untuk mempertimbangkan kembali. Anda bisa menganggapnya sebagai jejak remah roti sang agen. Dan jika Anda hanya memeriksa tujuannya, Anda akan melewatkan semua tanda peringatan yang tersebar di sepanjang jalan.
Masalah dengan Jalur yang Berantakan
Seorang agen dapat mencapai jawaban yang benar sambil berperilaku seperti pengemudi mabuk. Ia berbelok-belok melalui alat yang salah, kembali ke router, dan berputar-putar dalam penalaran yang redundan sebelum akhirnya secara tidak sengaja menemukan sesuatu yang benar. Pengguna melihat hasil yang bersih. Di balik layar, sistem tersebut membuang-buang sumber daya dan menumpuk risiko.
Seperti apa kekacauan ini sebenarnya dalam praktiknya?
Pertama, ada pemanggilan alat yang redundan (redundant tool call). Agen melakukan kueri ke database pelanggan Anda, mendapatkan hasilnya, melupakannya lima detik kemudian, dan melakukan kueri ke catatan yang sama lagi dengan parameter yang identik. Ini bukan masalah data. Ini adalah masalah trajektori. Agen gagal mempertahankan status (state), sehingga ia mengulangi pekerjaan yang sama.
Kemudian ada pola wrong-tool-first. Seorang agen coding mungkin mencoba mencari definisi fungsi di web yang sebenarnya sudah ada di repositori lokal. Atau agen dukungan mungkin mencoba mengakses billing API padahal pertanyaan pengguna jelas-jelas membutuhkan alat pengaturan akun (account settings tool). Setiap pilihan yang salah menghabiskan token, menambah latensi, dan meningkatkan kemungkinan batas konteks (context limits) terlampaui sebelum pekerjaan sebenarnya dimulai.
Router loops adalah tanda bahaya lainnya. Node keputusan tidak dapat membuat komitmen. Ia mengirim tugas ke cabang A, berubah pikiran, menariknya kembali, meneruskannya ke cabang B, lalu merutekannya melalui node fallback serbaguna tanpa alasan. Setiap loop menambah lompatan jaringan (network hop) dan lapisan kebingungan lainnya pada log debug nantinya.
Terakhir, ada analisis yang berulang. Agen terus menurunkan kesimpulan yang sama di setiap langkah alih-alih menganggapnya sudah selesai. Ini seperti seorang tukang kayu yang mengukur papan sepuluh kali sebelum setiap potongan. Pengukuran pertama sudah benar. Sembilan pengukuran berikutnya hanyalah gerakan yang sia-sia.
Langkah-langkah ekstra ini memiliki konsekuensi nyata. Latensi menumpuk. Dalam antarmuka chat sinkron, tambahan tiga detik terasa seperti selamanya. Dalam skala besar, detik-detik tersebut diterjemahkan menjadi ribuan dolar biaya komputasi. Risiko kegagalan juga meningkat. Setiap lompatan yang tidak perlu adalah peluang lain bagi API eksternal untuk mengalami timeout, jendela konteks (context window) untuk meluap, atau race condition untuk muncul. Dan ketika sesuatu benar-benar rusak, semoga beruntung saat melakukan debug pada trace yang terlihat seperti spaghetti. Anda akan menghabiskan waktu berjam-jam merekonstruksi mengapa agen mengambil langkah ketujuh, hanya untuk menyadari bahwa langkah ketujuh seharusnya tidak pernah ada.
Apa Arti Konvergensi yang Sebenarnya
Jika trajektori adalah jalurnya, maka konvergensi adalah ukuran efisiensinya. Konvergensi memberi tahu Anda seberapa dekat agen mengikuti rute terpendek yang layak antara permintaan pengguna dan resolusi yang benar.
Ini tidak sama dengan akurasi. Akurasi adalah instrumen yang kasar. Ia menanyakan apakah status akhirnya benar. Konvergensi menanyakan apakah perjalanannya masuk akal. Agen dengan akurasi tinggi dan konvergensi rendah adalah liabilitas yang mengenakan kostum kesuksesan. Agen dengan konvergensi tinggi dan akurasi menengah biasanya lebih mudah diperbaiki, karena penalarannya bersih dan kesalahannya terlokalisasi.
Anda dapat menghitung skor konvergensi kasar dengan membandingkan langkah-langkah yang sebenarnya diambil agen terhadap jalur terpendek yang telah Anda tentukan untuk kelas tugas tersebut. Jika kueri pengembalian dana (refund) standar seharusnya membutuhkan tepat tiga pemanggilan alat dan agen menggunakan sembilan, rasio konvergensi Anda akan menurun. Anda dapat menyempurnakan ini dengan memberi bobot pada berbagai jenis pemborosan. Satu pemanggilan alat yang salah mungkin memakan biaya lebih besar daripada satu pemanggilan yang redundan, tergantung pada latensi dan harga alat tersebut. Router loop yang tidak memberikan nilai tambah mungkin membawa penalti terberat dari semuanya, karena hal itu menandakan masalah arsitektural
