Seorang agen AI otonom membangun stack Retrieval-Augmented Generation (RAG) yang lengkap dalam waktu sekitar dua puluh menit dan membuka draf pull request tanpa satu baris kode pun dari manusia.

Mengapa "loop" itu penting

Membuat stack RAG biasanya berarti menyatukan mesin pencari, model embedding, model bahasa, dan kode penghubung (glue code). Pengembang membuang waktu berjam-jam untuk menyesuaikan Helm charts, memperbaiki gangguan autentikasi, dan mencari nama model yang tidak cocok. Dalam pengujian ini, agen otonom mengikuti loop lima langkah yang mewajibkan kesepakatan antara manusia dan agen sebelum kode apa pun ditulis.

Fase Apa yang terjadi
Proposal Agen membaca prompt dan menyusun rencana konkret, tetapi belum menghasilkan kode.
Agreement Pengguna meninjau rencana, menyetujuinya, atau meminta perubahan.
Implementation Agen membangun fitur pada branch baru.
Draft Gate Agen menjalankan linting dan rangkaian pengujiannya sendiri, memperbaiki kesalahan yang ditemukan.
Draft PR Kode di-push dan pull request dibuka untuk peninjauan akhir oleh manusia.

Sebagian besar alat bantu pengodean berbasis AI langsung melompat ke implementasi, yang sering kali menghasilkan kode yang tidak tepat sasaran. Dengan menyisipkan langkah persetujuan yang eksplisit, loop ini menghentikan eksekusi buta dan membiarkan pengguna mengarahkan proyek sebelum ada commit yang masuk.

Stack yang terwujud

Dalam dua puluh menit, agen tersebut merakit pipeline RAG yang siap produksi:

  • OpenSearch 3.7 yang dikonfigurasi untuk pencarian hibrida (vector + keyword).
  • Local Ollama LLM yang berfungsi sebagai mesin generatif untuk respons retrieval-augmented.
  • Server FastMCP yang mengekspos empat alat kustom ke model bahasa.
  • Skrip Skaffold dan Helm yang mengotomatiskan build kontainer, manifes Kubernetes, dan deployment layanan.

Pipeline tersebut diisi dengan tiga puluh artikel, memungkinkan pengujian end-to-end retrieval dan generation secara langsung. Seorang pengembang biasanya akan menghabiskan waktu seharian penuh untuk mengonfigurasi setiap komponen; kecepatannya sangat luar biasa.

Bug yang hampir merusaknya

Kepercayaan diri agen diuji oleh lima kegagalan berbeda yang biasanya akan menghentikan deployment yang dijalankan manusia:

  1. Kesalahan kredensial OpenSearch – agen memberikan secret key yang salah, menyebabkan cluster menolak koneksi.
  2. Typo Regex pada URL – satu karakter yang salah tempat mengubah endpoint yang valid menjadi tautan mati, sehingga merusak data loader.
  3. Ketidakcocokan nama model – konektor mengharapkan pengenal model Ollama yang berbeda, yang menyebabkan error “model not found”.
  4. Batas memori JVM – indexing massal menghabiskan Java heap, memicu crash out-of-memory.
  5. Penghapusan chunk model secara tidak sengaja – skrip pembersihan salah mengidentifikasi file penting sebagai duplikat dan menghapusnya, sehingga mengancam seluruh pipeline.

Saat agen mengalami kendala, “loop-police” turun tangan

Sebuah watchdog pendamping bernama loop-police memantau kesehatan loop tersebut. Ketika agen memasuki siklus yang tidak berakhir selama bug penghapusan terjadi, loop-police mendeteksi kemacetan tersebut, membatalkan branch saat ini, dan memaksa peralihan kembali ke fase Agreement. Agen kemudian mengakui kesalahan tersebut, membersihkan status yang korup, dan membangun kembali pipeline dari awal. Siklus pemulihan mandiri (self-healing) selesai tanpa intervensi manusia selain persetujuan rencana awal.

Apa artinya ini bagi pengembang

  • Kecepatan tanpa mengorbankan kendali. Loop ini memungkinkan insinyur menentukan niat, lalu menyerahkan eksekusi ke sistem otonom yang tetap mengikuti cetak biru yang disetujui manusia.
  • Jaring pengaman bawaan. Linting otomatis, pengujian, dan watchdog yang dapat menghentikan loop yang tidak terkendali mengurangi risiko kegagalan senyap (silent failures).
  • Hambatan masuk yang lebih rendah. Tim yang kurang memiliki keahlian mendalam dalam Helm, Kubernetes, atau pencarian vektor dapat menjalankan stack yang fungsional hanya dengan mendeskripsikan apa yang mereka butuhkan dalam bahasa sehari-hari.

Pendekatan ini bukanlah solusi ajaib (silver bullet). Fase Agreement tetap membutuhkan peninjau yang berpengetahuan untuk mendeteksi ekspektasi yang tidak realistis atau masalah keamanan. Loop ini tidak menggantikan keahlian domain; ia hanya mengemas pekerjaan infrastruktur (plumbing) yang berulang menjadi pola yang dapat diulang.