เอเจนต์ Gemini 3.5 Flash จำนวน 5 ตัวที่ทำงานร่วมกันแบบเรียลไทม์ สามารถแก้โจทย์ Project Euler จำนวน 30 ข้อได้สำเร็จถึง 87% ซึ่งทำได้ดีกว่าเอเจนต์ที่ทำงานแบบตัวใครตัวมัน (72%) และดีกว่าเกณฑ์มาตรฐานแบบใช้เสียงข้างมาก (majority-vote baselines) ทั้งสองแบบ (80% สำหรับแบบเดี่ยว และ 90% สำหรับแบบร่วมมือกัน) นอกจากนี้ การทำงานแบบร่วมมือกันยังช่วยลดเวลาการทำงานเฉลี่ยลงได้ 4 นาที จากเดิม 14 นาทีต่อหนึ่งโจทย์ เหลือเพียง 10 นาที โดยคำตอบส่วนใหญ่ใช้เวลาไม่ถึง 5 นาทีด้วยซ้ำ

ทำไมการทดลองนี้จึงมีความสำคัญ

ผู้ช่วยเขียนโค้ดด้วย AI ในปัจจุบันสามารถร่างโค้ดสั้นๆ (snippets) ช่วยดีบั๊ก (debug) และสร้างโปรแกรมทั้งโปรแกรมได้อยู่แล้ว แต่นักวิจัยมักจะทดสอบโมเดลเพียงตัวเดียวกับคำสั่ง (prompt) หนึ่งๆ แล้วให้คะแนนคำตอบนั้น ทว่าการทดสอบนี้ตั้งคำถามที่ต่างออกไปว่า: กลุ่มของเอเจนต์ที่แบ่งปันสิ่งที่ค้นพบในขณะที่ทำงานร่วมกัน จะสามารถทำผลงานได้ดีกว่าแนวทางแบบ "wisdom of the crowd" (ภูมิปัญญาของฝูงชน) ที่เพียงแค่รวบรวมคำตอบที่เป็นอิสระต่อกันได้หรือไม่?

โจทย์ของ Project Euler ทำหน้าที่เป็นเกณฑ์มาตรฐาน (benchmark) สำหรับการคิดเชิงอัลกอริทึม เนื่องจากมีการผสมผสานระหว่างความเข้าใจทางคณิตศาสตร์และการเขียนโค้ดที่มีประสิทธิภาพ ทำให้เหมาะสำหรับใช้เป็นตัวแทนของงานเขียนโปรแกรมในโลกแห่งความเป็นจริงที่ความถูกต้องและความเร็วเป็นสิ่งสำคัญ

วิธีการตั้งค่าการทดสอบ

  • เอเจนต์: Gemini 3.5 Flash จำนวน 5 อินสแตนซ์ (instances) ที่เข้าถึงผ่านแพลตฟอร์ม Antigravity
  • สถานการณ์:
    1. เอเจนต์แต่ละตัวแก้โจทย์ทุกข้อด้วยตัวเองและรายงานคำตอบของตนเอง
    2. เอเจนต์ทั้ง 5 ตัวเดิมทำงานร่วมกันแบบเรียลไทม์ โดยมีการแพร่กระจายผลลัพธ์ระหว่างทาง (intermediate results) และช่วยยืนยันขั้นตอนของกันและกัน
    3. สำหรับทั้งสองรูปแบบ มีการใช้ตัวรวบรวมแบบเสียงข้างมาก (majority-vote aggregator) แบบง่ายเพื่อรวมคำตอบที่เป็นอิสระทั้ง 5 คำตอบเข้าด้วยกัน
  • ตัวชี้วัด: ความแม่นยำ (เปอร์เซ็นต์ของคำตอบที่ถูกต้อง) และเวลาที่ใช้ (เวลาเฉลี่ยต่อหนึ่งโจทย์ รวมถึงการกระจายตัวของเวลาที่ใช้จนเสร็จสิ้น)

สิ่งที่ตัวเลขบ่งบอก

  • ความแม่นยำแบบเดี่ยว: 72%
  • ความแม่นยำแบบร่วมมือกัน: 87%
  • ความแม่นยำแบบเสียงข้างมากแบบเดี่ยว: 80%
  • ความแม่นยำแบบเสียงข้างมากแบบร่วมมือกัน: 90%

เวลาที่ใช้ลดลงจากเฉลี่ย 14 นาที สำหรับเอเจนต์แบบเดี่ยว เหลือเพียง 10 นาที สำหรับกลุ่มที่ทำงานร่วมกัน โดยการทำงานแบบร่วมมือกันส่วนใหญ่จะเสร็จสิ้นภายในเวลาไม่ถึง 5 นาที ในขณะที่การพยายามแก้โจทย์แบบเดี่ยวมักจะไปถึงขีดจำกัดเวลา (timeout) ที่ 30 นาที

ข้อสังเกตสำคัญที่อธิบายถึงความแตกต่าง

  • เป็นไปไม่ได้สำหรับหนึ่งเดียว แต่เป็นไปได้สำหรับกลุ่ม – ในโจทย์บางข้อเอเจนต์แบบเดี่ยวทั้งหมดล้มเหลว แต่ทีมที่ทำงานร่วมกันสามารถแลกเปลี่ยนผลลัพธ์บางส่วนและหาคำตอบที่ถูกต้องได้ร่วมกัน
  • การตรวจจับข้อผิดพลาดผ่านการตรวจสอบข้ามกัน – เอเจนต์แต่ละตัวบางครั้งก็ตกหลุมพรางทางตรรกะ แต่กลุ่มสามารถตรวจพบความผิดพลาดเหล่านี้ได้โดยการเปรียบเทียบข้อมูลกันแบบเรียลไทม์
  • การลู่เข้าสู่คำตอบอย่างรวดเร็ว – เมื่อเอเจนต์ตัวใดตัวหนึ่งค้นพบค่าระหว่างทางที่สำคัญ มันจะแพร่กระจายสิ่งที่ค้นพบนั้น ทำให้เอเจนต์ตัวอื่นๆ สามารถข้ามขั้นตอนที่ซ้ำซ้อนและลู่เข้าสู่คำตอบสุดท้ายได้เร็วขึ้น

ต้นทุนแฝงและข้อจำกัด

การทดลองนี้ใช้เอเจนต์เพียง 5 ตัวเท่านั้น จึงยังไม่แน่ชัดว่าประสิทธิภาพในลักษณะเดียวกันนี้จะขยายผล (scale) ไปสู่เอเจนต์จำนวนหลายสิบหรือหลายร้อยตัวได้หรือไม่ นอกจากนี้ ตัวรวบรวมแบบเสียงข้างมาก (majority-vote aggregator) ก็ยังคงทำผลงานได้ดี (90% เมื่อทำงานร่วมกัน)

สิ่งที่ต้องจับตามองต่อไป

  • การทดลองเรื่องการขยายขนาด (Scaling) – เอเจนต์หนึ่งร้อยตัวจะยังคงช่วยเพิ่มความแม่นยำได้หรือไม่ หรือภาระในการประสานงาน (coordination overhead) จะกลายเป็นปัจจัยหลักแทน?
  • การแบ่งความเชี่ยวชาญตามบทบาท – การมอบหมายงานเฉพาะด้าน (เช่น เอเจนต์ตัวหนึ่งเน้นทฤษฎีจำนวน อีกตัวเน้นการเพิ่มประสิทธิภาพ) อาจช่วยขยายผลประโยชน์ได้มากกว่าการทำงานร่วมกันแบบอิสระ
  • เกณฑ์มาตรฐานที่กว้างขึ้น – การนำกรอบการทำงานเดียวกันนี้ไปใช้กับความท้าทายในการสร้างโค้ด (code-generation), ชุดเครื่องมือดีบั๊ก (debugging suites) หรือการสร้างซอฟต์แวร์ในโลกจริง จะเป็นการทดสอบว่าผลลัพธ์ที่ได้นั้นจะยังคงอยู่หรือไม่เมื่อพ้นจากโจทย์คณิตศาสตร์ปริศนา

บทสรุป

การทำงานร่วมกันแบบเรียลไทม์ระหว่างเอเจนต์เขียนโค้ด AI สามารถเพิ่มทั้งอัตราความสำเร็จและความเร็วในงานด้านอัลกอริทึม โดยทำผลงานได้ดีกว่าการพยายามแก้โจทย์แบบเดี่ยว และดีกว่าแม้กระทั่งการใช้เสียงข้างมากแบบง่ายๆ แนวทางนี้ดูมีอนาคต แต่ความสามารถในการขยายขนาดและความคุ้มค่าด้านต้นทุนยังคงเป็นคำถามที่ต้องรอคำตอบจากการวิจัยในอนาคต

ที่มา: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0