تمكن خمسة وكلاء (agents) من طراز Gemini 3.5 Flash من العمل معاً في الوقت الفعلي لحل 87% من مجموعة مسائل Project Euler المكونة من 30 سؤالاً، متفوقين بذلك على خمسة وكلاء يعملون بشكل فردي (72%) وعلى كلا خطي الأساس القائمين على تصويت الأغلبية (80% للفردي، و90% للتعاوني). كما أدت العملية التعاونية إلى تقليص متوسط وقت التنفيذ بمقدار أربع دقائق، حيث انخفض من 14 دقيقة لكل مسألة إلى 10 دقائق، مع وصول معظم الحلول في أقل من خمس دقائق.
لماذا تكتسب هذه التجربة أهمية
تقوم مساعدات البرمجة المدعومة بالذكاء الاصطناعي بالفعل بصياغة مقتطفات برمجية، وتصحيح الأخطاء، وتوليد برامج كاملة. وعادة ما يختبر الباحثون نموذجاً واحداً بناءً على أمر (prompt) معين ويقيمون إجابته. لكن هذا الاختبار يطرح سؤالاً مختلفاً: هل يمكن لمجموعة من الوكلاء الذين يتشاركون النتائج أثناء عملهم أن يتفوقوا على نهج "حكمة الجمهور" الذي يكتفي بمجرد إحصاء الإجابات المستقلة؟
تُعد مسائل Project Euler معياراً قياسياً للتفكير الخوارزمي؛ فهي تمزج بين الرؤية الرياضية والبرمجة الفعالة، مما يجعلها نموذجاً جيداً لمهام البرمجة في العالم الحقيقي حيث تبرز أهمية الدقة والسرعة.
كيف تم إعداد الاختبار
- الوكلاء: خمس نسخ من Gemini 3.5 Flash تم الوصول إليها عبر منصة Antigravity.
- السيناريوهات:
- تعامل كل وكيل مع كل مسألة بمفرده، وقدم إجابته الخاصة.
- تعاون الوكلاء الخمسة أنفسهم في الوقت الفعلي، حيث قاموا ببث النتائج المرحلية وتأكيد خطوات بعضهم البعض.
- في كلا الإعدادين، قام مجمع بسيط يعتمد على تصويت الأغلبية بدمج الإجابات الخمس المستقلة.
- المقاييس: الدقة (نسبة الإجابات الصحيحة) ووقت التشغيل (متوسط الوقت لكل مسألة، بالإضافة إلى توزيع أوقات الإنجاز).
ما تكشفه الأرقام
- الدقة الفردية: 72%
- الدقة التعاونية: 87%
- دقة تصويت الأغلبية الفردية: 80%
- دقة تصويت الأغلبية التعاونية: 90%
انخفض وقت التشغيل من متوسط 14 دقيقة للوكلاء المنفردين إلى 10 دقائق للمجموعة التعاونية. وانتهت معظم العمليات التعاونية في أقل من خمس دقائق، بينما كانت المحاولات الفردية تصل غالباً إلى حد المهلة الزمنية البالغ 30 دقيقة.
ملاحظات رئيسية تفسر الفجوة
- المستحيل على الفرد، والممكن للمجموعة – في مسألة واحدة، فشل جميع الوكلاء المنفردين، ومع ذلك تبادل الفريق التعاوني النتائج الجزئية وتوصلوا جماعياً إلى الإجابة الصحيحة.
- اكتشاف الأخطاء من خلال التحقق المتبادل – وقع الوكلاء الأفراد أحياناً في فخاخ منطقية؛ لكن المجموعة اكتشفت هذه العثرات من خلال مقارنة الملاحظات في الوقت الفعلي.
- التقارب السريع – عندما يكتشف أي وكيل قيمة مرحلية حاسمة، فإنه يبث هذا الاكتشاف، مما يسمح للآخرين بتجاوز العمل المتكرر والوصول إلى الحل النهائي بشكل أسرع.
التكاليف والقيود الخفية
استخدمت التجربة خمسة وكلاء فقط؛ ولا يزال من غير الواضح ما إذا كانت هذه الكفاءة نفسها ستتوسع لتشمل العشرات أو المئات. علاوة على ذلك، لا يزال مجمع تصويت الأغلبية يؤدي بشكل جيد (90% مع التعاون).
ما يجب مراقبته مستقبلاً
- تجارب التوسع – هل سيظل مائة وكيل يحسن الدقة، أم أن عبء التنسيق سيهيمن على العملية؟
- تخصص الأدوار – قد يؤدي تعيين مهام محددة (مثل تركيز وكيل واحد على نظرية الأعداد، وآخر على التحسين) إلى تضخيم الفوائد مقارنة بالتعاون الحر.
- معايير قياسية أوسع – سيؤدي تطبيق نفس الإطار على تحديات توليد الكود، أو مجموعات تصحيح الأخطاء، أو بناء البرمجيات في العالم الحقيقي إلى اختبار ما إذا كانت المكاسب ستستمر خارج نطاق الألغاز الرياضية.
الخلاصة
يمكن للتعاون في الوقت الفعلي بين وكلاء البرمجة المدعومين بالذكاء الاصطناعي أن يرفع كلاً من معدلات النجاح والسرعة في المهام الخوارزمية، متفوقاً على المحاولات الفردية وحتى على تصويت الجمهور البسيط. يبدو هذا النهج واعداً، لكن قابليته للتوسع وفعاليته من حيث التكلفة تظل أسئلة مفتوحة ستحتاج الأبحاث المستقبلية إلى الإجابة عليها.
المصدر: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
