เอเจนต์ Gemini 3.5 Flash จำนวน 5 ตัวที่ทำงานร่วมกันแบบเรียลไทม์ สามารถแก้โจทย์ Project Euler จำนวน 30 ข้อได้สำเร็จถึง 87% ซึ่งทำได้ดีกว่าเอเจนต์ที่ทำงานแบบตัวใครตัวมัน (72%) และดีกว่าเกณฑ์มาตรฐานแบบใช้เสียงข้างมาก (majority-vote baselines) ทั้งสองแบบ (80% สำหรับแบบเดี่ยว และ 90% สำหรับแบบร่วมมือกัน) นอกจากนี้ การทำงานแบบร่วมมือกันยังช่วยลดเวลาการทำงานเฉลี่ยลงได้ 4 นาที จากเดิม 14 นาทีต่อหนึ่งโจทย์ เหลือเพียง 10 นาที โดยคำตอบส่วนใหญ่ใช้เวลาไม่ถึง 5 นาทีด้วยซ้ำ
ทำไมการทดลองนี้จึงมีความสำคัญ
ผู้ช่วยเขียนโค้ดด้วย AI ในปัจจุบันสามารถร่างโค้ดสั้นๆ (snippets) ช่วยดีบั๊ก (debug) และสร้างโปรแกรมทั้งโปรแกรมได้อยู่แล้ว แต่นักวิจัยมักจะทดสอบโมเดลเพียงตัวเดียวกับคำสั่ง (prompt) หนึ่งๆ แล้วให้คะแนนคำตอบนั้น ทว่าการทดสอบนี้ตั้งคำถามที่ต่างออกไปว่า: กลุ่มของเอเจนต์ที่แบ่งปันสิ่งที่ค้นพบในขณะที่ทำงานร่วมกัน จะสามารถทำผลงานได้ดีกว่าแนวทางแบบ "wisdom of the crowd" (ภูมิปัญญาของฝูงชน) ที่เพียงแค่รวบรวมคำตอบที่เป็นอิสระต่อกันได้หรือไม่?
โจทย์ของ Project Euler ทำหน้าที่เป็นเกณฑ์มาตรฐาน (benchmark) สำหรับการคิดเชิงอัลกอริทึม เนื่องจากมีการผสมผสานระหว่างความเข้าใจทางคณิตศาสตร์และการเขียนโค้ดที่มีประสิทธิภาพ ทำให้เหมาะสำหรับใช้เป็นตัวแทนของงานเขียนโปรแกรมในโลกแห่งความเป็นจริงที่ความถูกต้องและความเร็วเป็นสิ่งสำคัญ
วิธีการตั้งค่าการทดสอบ
- เอเจนต์: Gemini 3.5 Flash จำนวน 5 อินสแตนซ์ (instances) ที่เข้าถึงผ่านแพลตฟอร์ม Antigravity
- สถานการณ์:
- เอเจนต์แต่ละตัวแก้โจทย์ทุกข้อด้วยตัวเองและรายงานคำตอบของตนเอง
- เอเจนต์ทั้ง 5 ตัวเดิมทำงานร่วมกันแบบเรียลไทม์ โดยมีการแพร่กระจายผลลัพธ์ระหว่างทาง (intermediate results) และช่วยยืนยันขั้นตอนของกันและกัน
- สำหรับทั้งสองรูปแบบ มีการใช้ตัวรวบรวมแบบเสียงข้างมาก (majority-vote aggregator) แบบง่ายเพื่อรวมคำตอบที่เป็นอิสระทั้ง 5 คำตอบเข้าด้วยกัน
- ตัวชี้วัด: ความแม่นยำ (เปอร์เซ็นต์ของคำตอบที่ถูกต้อง) และเวลาที่ใช้ (เวลาเฉลี่ยต่อหนึ่งโจทย์ รวมถึงการกระจายตัวของเวลาที่ใช้จนเสร็จสิ้น)
สิ่งที่ตัวเลขบ่งบอก
- ความแม่นยำแบบเดี่ยว: 72%
- ความแม่นยำแบบร่วมมือกัน: 87%
- ความแม่นยำแบบเสียงข้างมากแบบเดี่ยว: 80%
- ความแม่นยำแบบเสียงข้างมากแบบร่วมมือกัน: 90%
เวลาที่ใช้ลดลงจากเฉลี่ย 14 นาที สำหรับเอเจนต์แบบเดี่ยว เหลือเพียง 10 นาที สำหรับกลุ่มที่ทำงานร่วมกัน โดยการทำงานแบบร่วมมือกันส่วนใหญ่จะเสร็จสิ้นภายในเวลาไม่ถึง 5 นาที ในขณะที่การพยายามแก้โจทย์แบบเดี่ยวมักจะไปถึงขีดจำกัดเวลา (timeout) ที่ 30 นาที
ข้อสังเกตสำคัญที่อธิบายถึงความแตกต่าง
- เป็นไปไม่ได้สำหรับหนึ่งเดียว แต่เป็นไปได้สำหรับกลุ่ม – ในโจทย์บางข้อเอเจนต์แบบเดี่ยวทั้งหมดล้มเหลว แต่ทีมที่ทำงานร่วมกันสามารถแลกเปลี่ยนผลลัพธ์บางส่วนและหาคำตอบที่ถูกต้องได้ร่วมกัน
- การตรวจจับข้อผิดพลาดผ่านการตรวจสอบข้ามกัน – เอเจนต์แต่ละตัวบางครั้งก็ตกหลุมพรางทางตรรกะ แต่กลุ่มสามารถตรวจพบความผิดพลาดเหล่านี้ได้โดยการเปรียบเทียบข้อมูลกันแบบเรียลไทม์
- การลู่เข้าสู่คำตอบอย่างรวดเร็ว – เมื่อเอเจนต์ตัวใดตัวหนึ่งค้นพบค่าระหว่างทางที่สำคัญ มันจะแพร่กระจายสิ่งที่ค้นพบนั้น ทำให้เอเจนต์ตัวอื่นๆ สามารถข้ามขั้นตอนที่ซ้ำซ้อนและลู่เข้าสู่คำตอบสุดท้ายได้เร็วขึ้น
ต้นทุนแฝงและข้อจำกัด
การทดลองนี้ใช้เอเจนต์เพียง 5 ตัวเท่านั้น จึงยังไม่แน่ชัดว่าประสิทธิภาพในลักษณะเดียวกันนี้จะขยายผล (scale) ไปสู่เอเจนต์จำนวนหลายสิบหรือหลายร้อยตัวได้หรือไม่ นอกจากนี้ ตัวรวบรวมแบบเสียงข้างมาก (majority-vote aggregator) ก็ยังคงทำผลงานได้ดี (90% เมื่อทำงานร่วมกัน)
สิ่งที่ต้องจับตามองต่อไป
- การทดลองเรื่องการขยายขนาด (Scaling) – เอเจนต์หนึ่งร้อยตัวจะยังคงช่วยเพิ่มความแม่นยำได้หรือไม่ หรือภาระในการประสานงาน (coordination overhead) จะกลายเป็นปัจจัยหลักแทน?
- การแบ่งความเชี่ยวชาญตามบทบาท – การมอบหมายงานเฉพาะด้าน (เช่น เอเจนต์ตัวหนึ่งเน้นทฤษฎีจำนวน อีกตัวเน้นการเพิ่มประสิทธิภาพ) อาจช่วยขยายผลประโยชน์ได้มากกว่าการทำงานร่วมกันแบบอิสระ
- เกณฑ์มาตรฐานที่กว้างขึ้น – การนำกรอบการทำงานเดียวกันนี้ไปใช้กับความท้าทายในการสร้างโค้ด (code-generation), ชุดเครื่องมือดีบั๊ก (debugging suites) หรือการสร้างซอฟต์แวร์ในโลกจริง จะเป็นการทดสอบว่าผลลัพธ์ที่ได้นั้นจะยังคงอยู่หรือไม่เมื่อพ้นจากโจทย์คณิตศาสตร์ปริศนา
บทสรุป
การทำงานร่วมกันแบบเรียลไทม์ระหว่างเอเจนต์เขียนโค้ด AI สามารถเพิ่มทั้งอัตราความสำเร็จและความเร็วในงานด้านอัลกอริทึม โดยทำผลงานได้ดีกว่าการพยายามแก้โจทย์แบบเดี่ยว และดีกว่าแม้กระทั่งการใช้เสียงข้างมากแบบง่ายๆ แนวทางนี้ดูมีอนาคต แต่ความสามารถในการขยายขนาดและความคุ้มค่าด้านต้นทุนยังคงเป็นคำถามที่ต้องรอคำตอบจากการวิจัยในอนาคต
ที่มา: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
