Lima agen Gemini 3.5 Flash yang bekerja sama secara real-time berhasil menyelesaikan 87% dari set 30 soal Project Euler, mengungguli lima agen yang berjalan sendiri-sendiri (72%) dan kedua baseline majority-vote (80% solo, 90% kolaboratif). Pelaksanaan kolaboratif juga memangkas rata-rata waktu eksekusi sebanyak empat menit, turun dari 14 menit per soal menjadi 10 menit, dengan sebagian besar solusi selesai dalam waktu kurang dari lima menit.

Mengapa eksperimen ini penting

Asisten pengodean AI sudah mampu menyusun cuplikan kode (snippets), melakukan debugging, dan menghasilkan program utuh. Peneliti biasanya menguji satu model pada sebuah prompt dan menilai jawabannya. Pengujian ini mengajukan pertanyaan yang berbeda: dapatkah sekelompok agen yang berbagi temuan saat mereka bekerja mengungguli pendekatan "wisdom of the crowd" yang hanya menjumlahkan jawaban-jawaban independen?

Masalah-masalah Project Euler berfungsi sebagai tolok ukur standar untuk pemikiran algoritmik. Masalah tersebut mencampurkan wawasan matematis dan pengodean yang efisien, menjadikannya proksi yang baik untuk tugas pemrograman dunia nyata di mana ketepatan dan kecepatan sangatlah penting.

Bagaimana pengujian ini diatur

  • Agen: Lima instansi Gemini 3.5 Flash yang diakses melalui platform Antigravity.
  • Skenario:
    1. Setiap agen mengerjakan setiap masalah sendirian, melaporkan jawabannya sendiri.
    2. Kelima agen yang sama berkolaborasi secara real-time, menyiarkan hasil perantara dan mengonfirmasi langkah satu sama lain.
    3. Untuk kedua pengaturan tersebut, agregator majority-vote sederhana menggabungkan kelima jawaban independen.
  • Metrik: Akurasi (persentase jawaban yang benar) dan waktu eksekusi (rata-rata waktu per masalah, ditambah distribusi waktu penyelesaian).

Apa yang diungkapkan oleh angka-angka tersebut

  • Akurasi solo: 72%
  • Akurasi kolaboratif: 87%
  • Akurasi majority-vote solo: 80%
  • Akurasi majority-vote kolaboratif: 90%

Waktu eksekusi turun dari rata-rata 14 menit untuk agen solo menjadi 10 menit untuk grup kolaboratif. Sebagian besar sesi kolaboratif selesai dalam waktu kurang dari lima menit, sedangkan upaya solo sering kali mencapai batas waktu timeout 30 menit.

Observasi kunci yang menjelaskan celah tersebut

  • Mustahil bagi satu orang, mungkin bagi banyak orang – Pada satu masalah tertentu, semua agen solo gagal, namun tim kolaboratif bertukar hasil parsial dan secara kolektif mencapai jawaban yang benar.
  • Penangkapan kesalahan melalui pemeriksaan silang – Agen individu terkadang terjebak dalam jebakan logika; kelompok tersebut menangkap kesalahan ini dengan membandingkan catatan secara real-time.
  • Konvergensi cepat – Ketika ada agen yang menemukan nilai perantara yang krusial, ia menyiarkan temuan tersebut, memungkinkan agen lain untuk melewati pekerjaan yang redundan dan mencapai solusi akhir lebih cepat.

Biaya tersembunyi dan batasan

Eksperimen ini hanya menggunakan lima agen; masih belum jelas apakah efisiensi yang sama dapat diskalakan ke puluhan atau ratusan agen. Selain itu, agregator majority-vote masih menunjukkan performa yang baik (90% dengan kolaborasi).

Apa yang perlu diperhatikan selanjutnya

  • Eksperimen penskalaan – Apakah seratus agen masih akan meningkatkan akurasi, atau apakah beban koordinasi akan mendominasi?
  • Spesialisasi peran – Menugaskan tugas-tugas spesifik (misalnya, satu agen fokus pada teori bilangan, yang lain pada optimasi) dapat memperkuat manfaat dibandingkan kolaborasi bebas.
  • Tolok ukur yang lebih luas – Menerapkan kerangka kerja yang sama pada tantangan pembuatan kode, rangkaian debugging, atau pembuatan perangkat lunak dunia nyata akan menguji apakah peningkatan tersebut tetap bertahan di luar teka-teki matematika.

Kesimpulan

Kolaborasi real-time di antara agen pengodean AI dapat meningkatkan tingkat keberhasilan sekaligus kecepatan pada tugas-tugas algoritmik, mengungguli upaya solo dan bahkan pemungutan suara massa (crowd vote) yang sederhana. Pendekatan ini menjanjikan, tetapi skalabilitas dan efektivitas biayanya tetap menjadi pertanyaan terbuka yang perlu dijawab oleh penelitian di masa depan.

Sumber: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0