Kebanyakan pasukan kejuruteraan masih menilai ejen AI dengan cara yang sama seperti mereka menyemak kerja sekolah matematik. Mereka hanya melihat output akhir. Jika jawapannya betul, mereka meluluskan pelancaran dan teruskan sahaja. Ini adalah jalan pintas yang berbahaya. Jawapan yang betul boleh menyembunyikan sistem yang sangat rosak.

Cerita sebenar terletak pada laluan yang diambil oleh ejen tersebut untuk sampai ke sana. Laluan itu dipanggil trajektori ejen (agent trajectory). Ia merangkumi setiap panggilan alatan (tool call), setiap keputusan penghalaan (routing decision), dan setiap jeda di mana ejen berhenti untuk mempertimbangkan semula. Anda boleh menganggapnya sebagai jejak serbuk roti ejen tersebut. Dan jika anda hanya memeriksa destinasi, anda akan terlepas semua tanda amaran yang bertaburan di sepanjang jalan.

Masalah dengan Laluan yang Berselerak

Seorang ejen boleh memberikan jawapan yang betul sambil berkelakuan seperti pemandu mabuk. Ia terbabas melalui alatan yang salah, berpatah balik ke penghala (router), dan berputar melalui penaakulan yang berulang-ulang sebelum akhirnya terjumpa sesuatu yang betul. Pengguna melihat hasil yang bersih. Di sebalik tabir, sistem sedang membazirkan sumber dan mengumpul risiko.

Bagaimanakah kekacauan ini sebenarnya kelihatan dalam praktis?

Pertama, terdapat panggilan alatan yang berulang (redundant tool call). Ejen membuat pertanyaan pada pangkalan data pelanggan anda, mendapat hasil, melupakannya lima saat kemudian, dan membuat pertanyaan pada rekod yang sama sekali lagi dengan parameter yang serupa. Ini bukan isu data. Ini adalah isu trajektori. Ejen gagal mengekalkan keadaan (state), jadi ia mengulangi kerja yang sama.

Kemudian, terdapat corak "salah-alatan-terlebih-dahulu" (wrong-tool-first pattern). Ejen pengekodan mungkin cuba mencari definisi fungsi di web yang sebenarnya sudah ada dalam repositori tempatan. Atau ejen sokongan mungkin cuba menggunakan API pengebilan apabila soalan pengguna jelas memerlukan alatan tetapan akaun. Setiap pilihan yang salah membakar token, menambah kependaman (latency), dan meningkatkan kemungkinan had konteks (context limits) terlampaui sebelum kerja sebenar bermula.

Gelung penghala (router loops) adalah tanda amaran lain. Nod keputusan tidak dapat membuat komitmen. Ia menghantar tugasan ke cawangan A, berubah fikiran, menariknya semula, menghantarnya ke cawangan B, kemudian menghalukannya melalui nod sandaran (fallback node) tujuan umum tanpa sebab. Setiap gelung menambah satu lompatan rangkaian (network hop) dan satu lagi lapisan kekeliruan pada log penyahpepijatan (debug log) akhirnya.

Akhir sekali, terdapat analisis berulang. Ejen terus membuat kesimpulan yang sama pada setiap langkah dan bukannya menganggapnya sebagai sudah selesai. Ia seperti seorang tukang kayu yang mengukur papan sepuluh kali sebelum setiap potongan. Ukuran pertama sudah memadai. Sembilan ukuran seterusnya hanyalah pembaziran tenaga.

Langkah-langkah tambahan ini mempunyai kesan yang nyata. Kependaman (latency) akan bertimbun. Dalam antara muka sembang segerak (synchronous chat interface), tambahan tiga saat terasa seperti seumur hidup. Pada skala besar, saat-saat tersebut diterjemahkan kepada ribuan dolar kos pengkomputeran. Risiko kegagalan juga meningkat. Setiap lompatan yang tidak perlu adalah satu lagi peluang untuk API luaran mengalami masa tamat (time out), tetingkap konteks (context window) melimpah, atau keadaan perlumbaan (race condition) muncul. Dan apabila sesuatu rosak, selamat berjaya menyahpepijat jejak (trace) yang kelihatan seperti spageti. Anda akan menghabiskan masa berjam-jam membina semula mengapa ejen mengambil langkah ketujuh hanya untuk menyedari bahawa langkah ketujuh itu sepatutnya tidak pernah wujud.

Apa Maksud Sebenar Konvergens (Convergence)

Jika trajektori adalah laluan, konvergens adalah ukuran kecekapannya. Konvergens memberitahu anda sejauh mana ejen mematuhi laluan paling singkat yang boleh dilaksanakan antara permintaan pengguna dan penyelesaian yang betul.

Ini tidak sama dengan ketepatan (accuracy). Ketepatan adalah alat yang kasar. Ia bertanya sama ada keadaan akhir adalah betul. Konvergens bertanya sama ada perjalanan itu munasabah. Ejen dengan ketepatan tinggi tetapi konvergens rendah adalah liabiliti yang berpura-pura berjaya. Ejen dengan konvergens tinggi dan ketepatan sederhana biasanya lebih mudah diperbaiki, kerana penaakulannya bersih dan kesilapannya bersifat setempat (localized).

Anda boleh mengira skor konvergens kasar dengan membandingkan langkah yang diambil oleh ejen dengan laluan terpendek yang telah anda tetapkan untuk kelas tugasan tersebut. Jika pertanyaan bayaran balik standard sepatutnya memerlukan tepat tiga panggilan alatan dan ejen menggunakan sembilan, nisbah konvergens anda akan terjejas. Anda boleh memperhalusi ini dengan memberi pemberat kepada jenis pembaziran yang berbeza. Satu panggilan alatan yang salah mungkin menelan kos lebih tinggi daripada satu panggilan berulang, bergantung pada kependaman dan harga alatan tersebut. Gelung penghala yang tidak memberi sebarang nilai mungkin membawa penalti yang paling berat, kerana ia menandakan seni bina