پنج عامل Gemini 3.5 Flash که بهصورت همزمان با یکدیگر همکاری میکردند، ۸۷٪ از یک مجموعه ۳۰ سوالی Project Euler را حل کردند؛ این نتیجه از پنج عامل که بهتنهایی کار میکردند (۷۲٪) و هر دو مدل پایه مبتنی بر رایگیری اکثریت (۸۰٪ برای حالت انفرادی و ۹۰٪ برای حالت مشارکتی) بهتر بود. اجرای مشارکتی همچنین زمان اجرای متوسط را چهار دقیقه کاهش داد و از ۱۴ دقیقه به ۱۰ دقیقه برای هر مسئله رساند، در حالی که اکثر پاسخها در کمتر از پنج دقیقه ارائه شدند.
چرا این آزمایش اهمیت دارد
دستیارهای کدنویسی هوش مصنوعی در حال حاضر قطعهکدها را پیشنویس میکنند، کدها را عیبیابی میکنند و برنامههای کامل تولید میکنند. پژوهشگران معمولاً یک مدل واحد را روی یک دستور (prompt) آزمایش کرده و پاسخ آن را ارزیابی میکنند. این آزمایش سوال متفاوتی را مطرح میکند: آیا گروهی از عاملها که یافتههای خود را در حین کار به اشتراک میگذارند، میتوانند از رویکرد «خرد جمعی» (wisdom of the crowd) که صرفاً پاسخهای مستقل را با هم جمع میکند، عملکرد بهتری داشته باشند؟
مسائل Project Euler به عنوان یک معیار استاندارد برای تفکر الگوریتمی عمل میکنند. آنها ترکیبی از بینش ریاضی و کدنویسی کارآمد هستند که آنها را به جایگزینی مناسب برای وظایف برنامهنویسی دنیای واقعی تبدیل میکند، جایی که صحت و سرعت اهمیت دارند.
نحوه طراحی آزمایش
- عاملها: پنج نمونه از Gemini 3.5 Flash که از طریق پلتفرم Antigravity در دسترس بودند.
- سناریوها:
- هر عامل بهتنهایی با هر مسئله روبرو شد و پاسخ خود را گزارش کرد.
- همان پنج عامل بهصورت همزمان با هم همکاری کردند، نتایج میانی را منتشر کردند و مراحل کار یکدیگر را تأیید نمودند.
- در هر دو حالت، یک تجمیعکننده ساده مبتنی بر رایگیری اکثریت، پنج پاسخ مستقل را با هم ترکیب کرد.
- معیارها: دقت (درصد پاسخهای صحیح) و زمان اجرا (میانگین زمان برای هر مسئله، به همراه توزیع زمانهای تکمیل).
آنچه اعداد نشان میدهند
- دقت انفرادی: ۷۲٪
- دقت مشارکتی: ۸۷٪
- دقت رایگیری اکثریت انفرادی: ۸۰٪
- دقت رایگیری اکثریت مشارکتی: ۹۰٪
زمان اجرا از میانگین ۱۴ دقیقه برای عاملهای انفرادی به ۱۰ دقیقه برای گروه مشارکتی کاهش یافت. اکثر اجراهای مشارکتی در کمتر از پنج دقیقه به پایان رسیدند، در حالی که تلاشهای انفرادی مکرراً به محدودیت زمانی ۳۰ دقیقهای برخورد میکردند.
مشاهدات کلیدی که این اختلاف را توضیح میدهند
- غیرممکن برای یک نفر، ممکن برای گروه – در یک مسئله خاص، تمام عاملهای انفرادی شکست خوردند، اما تیم مشارکتی نتایج جزئی را با هم تبادل کردند و در نهایت بهطور جمعی به پاسخ صحیح رسیدند.
- خطایابی از طریق بررسی متقابل – عاملهای انفرادی گاهی در تلههای منطقی میافتادند؛ اما گروه با مقایسه یادداشتها در لحظه، این اشتباهات را شناسایی کرد.
- همگرایی سریع – وقتی هر عاملی یک مقدار میانی حیاتی را کشف میکرد، آن یافته را منتشر میکرد و به دیگران اجازه میداد از کارهای تکراری صرفنظر کرده و سریعتر به راه حل نهایی همگرا شوند.
هزینهها و محدودیتهای پنهان
این آزمایش تنها از پنج عامل استفاده کرد؛ هنوز مشخص نیست که آیا همین کارایی در مقیاس دهها یا صدها عامل نیز حفظ میشود یا خیر. علاوه بر این، تجمیعکننده رایگیری اکثریت همچنان عملکرد خوبی داشت (۹۰٪ در حالت مشارکتی).
آنچه باید در آینده زیر نظر داشت
- آزمایشهای مقیاسپذیری – آیا صد عامل همچنان دقت را بهبود میبخشند یا هزینههای هماهنگی بر آن غلبه خواهد کرد؟
- تخصصیسازی نقشها – اختصاص وظایف خاص (مثلاً یک عامل بر نظریه اعداد و دیگری بر بهینهسازی تمرکز کند) میتواند مزایای همکاری را نسبت به همکاری آزادانه افزایش دهد.
- معیارهای گستردهتر – اعمال همین چارچوب بر چالشهای تولید کد، مجموعههای عیبیابی یا ساخت نرمافزارهای واقعی، نشان خواهد داد که آیا این دستاوردها فراتر از معماهای ریاضی نیز پابرجا میمانند یا خیر.
نتیجهگیری
همکاری همزمان میان عاملهای کدنویسی هوش مصنوعی میتواند هم نرخ موفقیت و هم سرعت را در وظایف الگوریتمی افزایش دهد و از تلاشهای انفرادی و حتی رایگیری ساده جمعی پیشی بگیرد. این رویکرد امیدوارکننده است، اما مقیاسپذیری و مقرونبهصرفه بودن آن همچنان سوالاتی باز هستند که تحقیقات آینده باید به آنها پاسخ دهند.
منبع: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
