Ejen mendominasi setiap perbualan AI sekarang. Demo menjadikannya kelihatan seperti pembantu digital autonomi yang berfikir, merangka strategi, dan menyelesaikan masalah tanpa bantuan manusia. Namun, jika anda meneliti di sebalik antara muka tersebut, anda akan mendapati sesuatu yang jauh lebih ringkas. Ejen hanyalah model bahasa yang berjalan di dalam satu gelung (loop). Ia adalah satu corak reka bentuk, bukannya satu kesedaran. Memahami perbezaan ini adalah penting kerana ia mengubah cara anda membina, menyahpepijat (debug), dan mempercayai sistem ini.

Apa Sebenarnya Ejen Itu

Chatbot standard adalah fungsi satu-tembakan (single-shot). Anda menaip prom. Model meramalkan token seterusnya dan mengembalikan satu blok teks. Kemudian ia berhenti. Ia tidak menyemak sama ada jawapannya tepat. Ia tidak mengesahkan sama ada pautan web berfungsi atau sama ada pengiraan itu betul. Ia memberikan tekaan terbaiknya dalam satu percubaan dan kemudian terdiam.

Ejen memecahkan satu-tembakan tersebut kepada satu kitaran yang berulang. Model masih menjana teks, tetapi kini ia beroperasi di dalam satu gelung terkawal di mana ia boleh mempengaruhi dunia luar dan bertindak balas terhadap apa yang berlaku.

Kitaran ini kelihatan seperti ini:

  • Menilai matlamat dan berfikir tentang apa yang perlu dilakukan.
  • Mengambil tindakan, biasanya dengan memanggil alat atau API.
  • Memerhati hasil tindakan tersebut.
  • Berfikir semula berdasarkan maklumat baharu tersebut.

Kitaran ini berulang sehingga tugasan selesai atau sistem mencapai had keselamatan. Itulah rahsia keseluruhannya. Tiada enjin penaakulan tersembunyi. Keajaibannya datang daripada memberi peluang kepada model untuk membetulkan jalannya sendiri menggunakan data sebenar daripada alat yang sebenar.

ReAct: Kitaran Pemikiran-Tindakan-Pemerhatian

Cara paling biasa untuk melaksanakan gelung ini adalah corak ReAct, yang bermaksud Reason (Penaakulan) ditambah Act (Tindakan). Pada setiap pusingan melalui gelung tersebut, model melalui tiga peringkat yang berbeza.

Pertama, model menghasilkan satu Pemikiran (Thought). Ia merenung situasi semasa, mengingatkan dirinya tentang matlamat asal dan memutuskan apa yang perlu diketahui seterusnya. Kedua, ia memilih satu Tindakan (Action). Ini mungkin carian web, pertanyaan pangkalan data, panggilan kalkulator, atau permintaan untuk membaca fail. Ketiga, ia menerima satu Pemerhatian (Observation). Sistem melaksanakan tindakan di luar model dan memasukkan hasil mentah kembali ke dalam sejarah perbualan. Model kemudian memulakan gelung seterusnya, menggunakan pemerhatian segar tersebut sebagai realiti baharunya.

Pertimbangkan satu contoh mudah. Katakan anda meminta ejen untuk memberitahu sama ada esok akan hujan di Austin. Model mungkin berfikir, "Saya perlukan ramalan cuaca untuk Austin." Tindakannya adalah memanggil API cuaca dengan nama bandar tersebut. Pemerhatian kembali sebagai JSON mentah: bacaan suhu dan kebarangkalian kerpasan. Model kemudian berfikir semula, "Ramalan menunjukkan peluang hujan sebanyak tujuh puluh peratus," dan tindakan terakhirnya adalah untuk mensintesiskan maklumat itu menjadi jawapan dalam bahasa Inggeris yang mudah untuk anda.

Struktur ini penting kerana ia berpijak pada realiti (grounds) model tersebut. Jika model mesti melakukan carian dan membaca hasil sebelum ia meneruskan, ia tidak boleh sekadar mereka-reka fakta. Pemerhatian bertindak sebagai kekangan keras (hard constraint) terhadap pemikiran seterusnya. Gelung tersebut menjadikan rekaan fakta jauh lebih sukar kerana model perlu melihat sebelum ia bercakap.

Apa Yang Anda Perlukan Untuk Membina Gelung Yang Boleh Dipercayai

Menjalankan corak ini dalam produksi memerlukan lebih daripada sekadar prom yang bijak. Anda memerlukan tiga pagar keselamatan (guardrails) praktikal.

Tetapkan bajet langkah. Sentiasa tetapkan jumlah maksimum iterasi gelung. Tanpa had siling, ejen boleh mengejar ekornya sendiri—mencari, memerhati, menaakul, mencari lagi—sehingga ia menghabiskan bajet API anda. Had langkah memaksa penamatan. Anda boleh memutuskan sama ada untuk mengembalikan hasil separa, menyerahkan kepada manusia, atau sekadar gagal secara teratur (fail gracefully) sebaik sahaja had dicapai.

Urus pelaksanaan kod sendiri. Model bahasa tidak menjalankan alat. Ia hanya mencadangkan tindakan, biasanya dengan mengeluarkan teks berstruktur atau JSON yang menamakan alat dan menyediakan parameter. Kod anda mesti