Agen mendominasi setiap percakapan AI saat ini. Demo membuat mereka tampak seperti asisten digital otonom yang berpikir, menyusun strategi, dan memecahkan masalah tanpa bantuan manusia. Namun, jika Anda melihat lebih dalam ke balik antarmukanya, Anda akan menemukan sesuatu yang jauh lebih sederhana. Seorang agen hanyalah model bahasa yang berjalan di dalam sebuah loop. Ini adalah sebuah pola desain, bukan sebuah kesadaran. Memahami perbedaan ini sangat penting karena hal itu mengubah cara Anda membangun, men-debug, dan mempercayai sistem ini.
Apa Itu Agen Sebenarnya
Chatbot standar adalah fungsi single-shot. Anda mengetik prompt. Model memprediksi token berikutnya dan mengembalikan blok teks. Kemudian ia berhenti. Ia tidak memeriksa apakah jawabannya akurat. Ia tidak memverifikasi apakah tautan web berfungsi atau apakah sebuah perhitungan sudah benar. Ia memberikan tebakan terbaiknya dalam satu kali jalan dan kemudian terdiam.
Seorang agen memecah single-shot tersebut menjadi siklus yang berulang. Model tersebut tetap menghasilkan teks, tetapi sekarang ia beroperasi di dalam loop yang terkendali di mana ia dapat memengaruhi dunia luar dan bereaksi terhadap apa yang terjadi.
Siklusnya terlihat seperti ini:
- Menilai tujuan dan menalar apa yang harus dilakukan.
- Mengambil tindakan, biasanya dengan memanggil alat atau API.
- Mengamati hasil dari tindakan tersebut.
- Menalar kembali berdasarkan informasi baru tersebut.
Siklus ini berulang sampai tugas selesai atau sistem mencapai batas keamanan. Itulah seluruh rahasianya. Tidak ada mesin penalaran tersembunyi. Keajaibannya berasal dari memberikan kesempatan kepada model untuk memperbaiki jalurnya sendiri menggunakan data nyata dari alat yang nyata.
ReAct: Siklus Thought-Action-Observation
Cara paling umum untuk mengimplementasikan loop ini adalah pola ReAct, yang merupakan singkatan dari Reason plus Act. Pada setiap putaran melalui loop, model melewati tiga tahap yang berbeda.
Pertama, model menghasilkan sebuah Thought. Ia merenungkan situasi saat ini, mengingatkan dirinya sendiri tentang tujuan awal dan memutuskan apa yang perlu ia ketahui selanjutnya. Kedua, ia memilih sebuah Action. Ini bisa berupa pencarian web, kueri database, pemanggilan kalkulator, atau permintaan untuk membaca file. Ketiga, ia menerima sebuah Observation. Sistem mengeksekusi tindakan tersebut di luar model dan memasukkan hasil mentahnya kembali ke dalam riwayat percakapan. Model kemudian memulai loop berikutnya, menggunakan observasi segar tersebut sebagai realitas barunya.
Pertimbangkan contoh sederhana. Misalkan Anda meminta agen untuk memberi tahu apakah besok akan hujan di Austin. Model mungkin berpikir, "Saya butuh prakiraan cuaca untuk Austin." Tindakannya adalah memanggil API cuaca dengan nama kota tersebut. Observasi datang kembali sebagai JSON mentah: pembacaan suhu dan probabilitas presipitasi. Model kemudian berpikir lagi, "Prakiraan menunjukkan peluang hujan sebesar tujuh puluh persen," dan tindakan akhirnya adalah menyintesis hal tersebut menjadi jawaban bahasa Inggris yang sederhana untuk Anda.
Struktur ini penting karena memberikan pijakan bagi model. Jika model harus melakukan pencarian dan membaca hasilnya sebelum melanjutkan, ia tidak bisa sekadar mengarang fakta. Observasi bertindak sebagai batasan keras pada pemikiran berikutnya. Loop membuat pengarang-ngaran menjadi jauh lebih sulit karena model harus melihat sebelum ia berbicara.
Apa yang Anda Butuhkan untuk Membangun Loop yang Andal
Menjalankan pola ini di produksi membutuhkan lebih dari sekadar prompt yang cerdas. Anda memerlukan tiga guardrail praktis.
Tetapkan anggaran langkah (step budget). Selalu tentukan jumlah maksimum iterasi loop. Tanpa batas atas, seorang agen dapat mengejar ekornya sendiri—mencari, mengamati, menalar, mencari lagi—sampai ia menghabiskan anggaran API Anda. Batas langkah memaksa penghentian. Anda dapat memutuskan apakah akan mengembalikan hasil parsial, meneruskannya ke manusia, atau sekadar gagal secara elegan setelah batas tercapai.
Kelola eksekusi kode sendiri. Model bahasa tidak menjalankan alat. Ia hanya menyarankan tindakan, biasanya dengan mengeluarkan teks terstruktur atau JSON yang menyebutkan nama alat dan menyediakan parameter. Kode Anda harus
