Saya membiarkan agen berbasis AI menjalankan pipeline CI/CD saya selama sebulan. Di akhir masa percobaan, agen tersebut sudah memperbaiki build yang gagal, membuka pull request, dan memicu ulang pekerjaan (jobs), sehingga hanya menyisakan satu langkah persetujuan manusia. Eksperimen ini menunjukkan bahwa DevOps "agentic" dapat memindahkan triase rutin dari back-office ke otak otomatis, tetapi juga menyingkap pentingnya guardrails yang menjaga agar sistem otonom tidak menjadi sumber risiko baru.

Mengapa eksperimen ini penting

Sebagian besar tim perangkat lunak masih menganggap AI sebagai autocomplete yang canggih—alat yang menyarankan baris kode atau menjelaskan pesan kesalahan. Pada tahun 2025, industri sedang bergeser dari "AI yang membantu Anda mengetik" menjadi "AI yang bertindak." Agen yang bertindak dapat membaca log, memutuskan perbaikan, menerapkannya, dan belajar dari hasilnya—semuanya tanpa pengembang perlu mengetik satu perintah pun.

Ide dasarnya: pipeline agentic

Pipeline agentic bukanlah model monolitik tunggal dengan akses tanpa batas ke produksi. Ini adalah orkestrator sempit yang mengoordinasikan alat-alat khusus, mempertahankan konteks, dan beroperasi di balik guardrails yang ketat. Loop intinya mencerminkan proses pemecahan masalah manusia:

  1. Perceive (Persepsi) – menarik log, output pengujian, dan metrik.
  2. Reason (Penalaran) – menganalisis kegagalan, merencanakan remediasi paling aman.
  3. Act (Bertindak) – memanggil alat dengan cakupan terbatas untuk menerapkan patch, meningkatkan dependensi, atau menjalankan ulang pekerjaan.
  4. Learn (Belajar) – mencatat hasil agar keputusan berikutnya lebih terinformasi.

Arsitektur yang menjaga eksperimen tetap aman terlihat seperti ini:

  • Platform CI/CD – menjadwalkan dan menjalankan pekerjaan.
  • Orchestrator – "otak" yang menerima data, menjalankan loop kontrol, dan memutuskan apa yang harus dilakukan.
  • Tools – "tangan" yang melakukan tindakan nyata (misalnya, membuka PR, menaikkan versi).
  • Context store – memori ringan dari kegagalan dan perbaikan terbaru.
  • Guardrails – batasan keras yang mencegah agen menyentuh produksi secara langsung atau melakukan perubahan tanpa persetujuan eksplisit dari manusia.

Dengan menjaga agar large language model (LLM) tetap jauh dari penulisan langsung ke produksi, sistem ini mengurangi permukaan serangan (attack surface) sambil tetap membiarkan model menalar masalah tersebut.

Sebulan dalam kehidupan sang agen

Minggu 1 – observasi baca-saja (read-only)

Agen berjalan dalam mode "hanya penjelasan". Setiap build yang gagal menghasilkan pesan Slack yang merangkum kesalahan dan menyarankan kemungkinan penyebab. Tidak ada kode yang berubah. Fase ini membuktikan bahwa langkah persepsi dan penalaran berfungsi pada log asli dan memberi tim kepercayaan bahwa agen memahami basis kode.

Minggu 2 – mengusulkan perbaikan

Selama tujuh hari berikutnya, orkestrator membuka pull request untuk masalah berisiko rendah seperti kegagalan linting atau dependensi yang usang. Insinyur meninjau PR tersebut sebelum menggabungkannya (merging).

Minggu 3 – tindakan terkendali

Dengan alur kerja persetujuan yang sudah ada, agen menerima izin untuk menjalankan ulang pekerjaan di lingkungan non-produksi. Ketika sebuah build gagal, orkestrator secara otomatis mengunci versi yang benar dari dependensi yang rusak, membuka PR, dan setelah PR digabungkan, memicu ulang pipeline.

Minggu 4 – mengukur dampak

Minggu terakhir difokuskan pada pengukuran hasil, melacak berapa banyak kegagalan yang berhasil diselesaikan oleh agen.

Sisi positifnya: menghilangkan pekerjaan yang membosankan

Eksperimen ini menunjukkan bahwa agen AI dapat menangani bagian repetitif dari CI/CD: membaca log, mengenali pola yang sudah diketahui, menaikkan versi, dan menjalankan ulang pekerjaan. Insinyur hanya perlu menyetujui perubahan akhir dan menyelidiki beberapa kegagalan kasus ekstrem (edge-case) yang tidak dapat diselesaikan oleh agen. Dalam praktiknya, itu berarti lebih sedikit panggilan darurat di tengah malam, lebih sedikit context-switching, dan loop umpan balik yang lebih ketat bagi pengembang.

Jebakan dan cara memitigasinya

  • Perbaikan yang salah namun meyakinkan – Agen terkadang menerapkan patch tingkat gejala yang menutupi bug yang lebih dalam. Guardrails yang memerlukan persetujuan manusia untuk setiap perubahan yang menyentuh kode produksi menjaga risiko ini tetap terkendali.
  • Kelebihan kebisingan (Noise overload) – Notifikasi yang tidak difilter dapat menenggelamkan peringatan yang sebenarnya penting.
  • Scope creep – Memberikan akses tanpa batas kepada model akan dengan cepat menyebabkan efek samping yang tidak diinginkan. Pemisahan ketat dalam arsitektur antara LLM (penalaran) dan tools (tindakan) mencegah agen melakukan perubahan sembarangan.

Rencana peluncuran bertahap untuk tim lain

Jika organisasi Anda ingin mencoba pipeline agentic, ikuti jalur bertahap ini:

  1. Siapkan orchestrator – layanan ringan yang dapat memanggil LLM, menyimpan konteks, dan memanggil API CI/CD.
  2. Tentukan guardrails – buat daftar putih (whitelist) pekerjaan CI/CD yang dapat dipicu oleh agen, wajibkan persetujuan PR, dan blokir penulisan langsung ke produksi.
  3. Minggu 1: Mode observasi – masukkan log ke orchestrator dan biarkan ia mengirimkan ringkasan diagnostik ke saluran chat.
  4. Minggu 2: Mode saran – izinkan agen untuk membuka PR untuk perbaikan non-kritis; tetap wajibkan tinjauan manusia.
  5. Minggu 3: Tindakan terkendali – berikan izin untuk menjalankan ulang pekerjaan di lingkungan staging atau pengujian setelah PR digabungkan.
  6. Minggu 4: Metrik dan penyetelan – lacak kegagalan yang telah ditriage, false positive, dan waktu yang dihemat; sesuaikan ambang batas peringatan dan guardrails sebagaimana mestinya.
  7. Iterasi – perluas set alat (misalnya, rollback otomatis, pemindaian keamanan) hanya setelah setiap kemampuan baru lulus pemeriksaan keamanan yang sama.

Argumen penentang

Para skeptis menunjukkan bahwa agen bisa saja salah dengan penuh percaya diri. Eksperimen ini tidak menghilangkan kekhawatiran tersebut; eksperimen ini hanya menunjukkan bahwa guardrails yang disiplin memungkinkan Anda memetik manfaat sambil menjaga risiko tetap terkendali.

Kesimpulan

Agen AI yang menjalankan loop kontrol CI/CD dapat mengubah proses triage manual yang reaktif menjadi pipeline yang hampir bisa memulihkan diri sendiri (self-healing), asalkan Anda mengisolasi model, menerapkan langkah persetujuan yang ketat, dan memulai dengan pendekatan observasi terlebih dahulu yang berisiko rendah. Nilai sebenarnya bukan terletak pada menggantikan insinyur, melainkan dalam mengalihkan tugas-tugas membosankan dan repetitif yang menjaga pipeline tetap berjalan lancar (green) sehingga pengembang dapat fokus pada pengembangan.