Internet telah memutuskan bahwa ini adalah tahunnya agen. LangGraph, CrewAI, dan AutoGen adalah nama-nama yang ada di setiap peta jalan teknik. Tim-tim sedang menguji ketahanan lapisan orkestrasi, memperdebatkan mesin status versus bermain peran, dan bertanya-tanya pustaka mana yang akhirnya akan membuat model bahasa besar menjadi otonom.
Inilah kenyataan yang tidak menyenangkan: sebagian besar perbandingan tersebut prematur. Kerangka kerja bukanlah bagian yang sulit. Bagian yang sulit adalah kita telah berhenti mendefinisikan istilah-istilah kita. Orang-orang menyebut segalanya sebagai agen sekarang. Sebuah panggilan alat bukanlah agen. Chatbot bukanlah agen. Definisi yang ceroboh itu mengarah langsung pada rekayasa yang buruk, sistem yang berlebihan, dan gangguan produksi yang sebenarnya bisa dihindari dengan skrip sederhana.
Sebelum Anda memilih kerangka kerja, definisikan apa yang sebenarnya sedang Anda bangun.
Apa Itu Agen yang Sebenarnya
Seorang agen tidak ditentukan oleh model tempat ia berjalan atau jumlah panggilan API yang dilakukannya. Seorang agen ditentukan oleh perilakunya. Ia harus memiliki tujuan yang jelas. Ia harus memutuskan langkah apa yang berikutnya tanpa manusia memetakan jalannya terlebih dahulu. Ia harus menangani kegagalan saat langkah tersebut rusak. Dan ia harus tahu kapan harus berhenti.
Bayangkan sebuah sistem dukungan yang membaca email masuk, mengklasifikasikannya sebagai permintaan pengembalian dana, mengekstrak nomor pesanan, menanyakan database pengiriman, memeriksa jendela kebijakan pengembalian, menyusun draf tanggapan, dan menandai tiket sebagai selesai. Jika database mengalami timeout, ia menunggu dan mencoba lagi. Jika jendela kebijakan ambigu, ia menandai manusia. Ketika tanggapan dikirim, ia berhenti. Itulah seorang agen. Sebuah pembungkus di sekitar satu panggilan LLM yang mengembalikan JSON bukanlah agen, tidak peduli berapa banyak stiker "agent" yang ditempelkan oleh tim pemasaran.
Perbedaan ini penting karena kompleksitas memiliki biaya. Sistem yang tidak memerlukan otonomi tidak seharusnya membayar harga untuk itu.
Bentuk Nyata AI Produksi
Sebagian besar sistem AI yang berjalan di produksi saat ini bersifat sempit. Mereka melakukan satu hal dengan baik. Mereka menyortir tiket dukungan ke dalam antrean. Mereka mengekstrak tanggal kedaluwarsa dari dokumen yang dipindai. Mereka mencocokkan kueri pelanggan dengan artikel basis pengetahuan yang ada. Mereka bukan mesin penalaran umum, dan berpura-pura seolah mereka adalah mesin umum akan menyebabkan jenis overengineering terburuk.
Hal ini juga menyebabkan obsesi yang merusak terhadap rilis model. Tim mengejar model fondasi terbaru seolah-olah itu akan mengompensasi arsitektur yang ceroboh. Itu tidak akan berhasil. Model yang lebih mumpuni yang berjalan di dalam loop yang rapuh tanpa penanganan kesalahan hanya akan gagal dengan tingkat kepercayaan yang lebih tinggi dan halusinasi yang lebih kreatif. Berhentilah mengejar benchmark. Mulailah mengejar struktur.
Kerangka Kerja Bukanlah Produknya
LangGraph memberi Anda mesin status dan siklus yang eksplisit. CrewAI berfokus pada orkestrasi berbasis peran di mana agen mengadopsi persona. AutoGen berpusat pada agen percakapan yang mengobrol satu sama lain untuk memecahkan masalah. Semuanya adalah alat yang mumpuni. Mereka juga merupakan pendekatan yang secara fundamental berbeda terhadap aliran kontrol.
Namun kerangka kerja yang Anda pilih kurang penting dibandingkan pola yang Anda terapkan di dalamnya. Saya telah melihat tim mengirimkan otomatisasi yang sangat kokoh hanya dengan menggunakan Python dan Redis karena mereka menghormati batasan. Saya telah melihat tim lain runtuh di bawah beban orkestrasi yang mewah karena mereka memperlakukan kerangka kerja sebagai pengganti desain.
Jika serah terima Anda tidak jelas, alat Anda rapuh, dan logika percobaan ulang Anda tidak ada, logo pada requirements.txt Anda tidak akan menyelamatkan Anda.
Tiga Hal yang Benar-benar Layak Mendapatkan Waktu Anda
Jika Anda sedang membangun sistem agen, curahkan upaya Anda ke dalam tiga bidang ini.
Desain alat. Setiap fungsi yang dapat dipanggil agen Anda adalah liabilitas yang dibungkus dalam sebuah antarmuka. Desainlah dengan ketat. Validasi input secara agresif. Kembalikan kesalahan yang benar-benar dapat dibaca, bukan dump 500. Alat yang baik adalah alat yang dapat dinalar oleh agen saat terjadi kesalahan.
Penanganan kegagalan. Asumsikan setiap LLM
