پنج عامل Gemini 3.5 Flash که به‌صورت هم‌زمان با یکدیگر همکاری می‌کردند، ۸۷٪ از یک مجموعه ۳۰ سوالی Project Euler را حل کردند؛ این نتیجه از پنج عامل که به‌تنهایی کار می‌کردند (۷۲٪) و هر دو مدل پایه مبتنی بر رای‌گیری اکثریت (۸۰٪ برای حالت انفرادی و ۹۰٪ برای حالت مشارکتی) بهتر بود. اجرای مشارکتی همچنین زمان اجرای متوسط را چهار دقیقه کاهش داد و از ۱۴ دقیقه به ۱۰ دقیقه برای هر مسئله رساند، در حالی که اکثر پاسخ‌ها در کمتر از پنج دقیقه ارائه شدند.

چرا این آزمایش اهمیت دارد

دستیارهای کدنویسی هوش مصنوعی در حال حاضر قطعه‌کدها را پیش‌نویس می‌کنند، کدها را عیب‌یابی می‌کنند و برنامه‌های کامل تولید می‌کنند. پژوهشگران معمولاً یک مدل واحد را روی یک دستور (prompt) آزمایش کرده و پاسخ آن را ارزیابی می‌کنند. این آزمایش سوال متفاوتی را مطرح می‌کند: آیا گروهی از عامل‌ها که یافته‌های خود را در حین کار به اشتراک می‌گذارند، می‌توانند از رویکرد «خرد جمعی» (wisdom of the crowd) که صرفاً پاسخ‌های مستقل را با هم جمع می‌کند، عملکرد بهتری داشته باشند؟

مسائل Project Euler به عنوان یک معیار استاندارد برای تفکر الگوریتمی عمل می‌کنند. آن‌ها ترکیبی از بینش ریاضی و کدنویسی کارآمد هستند که آن‌ها را به جایگزینی مناسب برای وظایف برنامه‌نویسی دنیای واقعی تبدیل می‌کند، جایی که صحت و سرعت اهمیت دارند.

نحوه طراحی آزمایش

  • عامل‌ها: پنج نمونه از Gemini 3.5 Flash که از طریق پلتفرم Antigravity در دسترس بودند.
  • سناریوها:
    1. هر عامل به‌تنهایی با هر مسئله روبرو شد و پاسخ خود را گزارش کرد.
    2. همان پنج عامل به‌صورت هم‌زمان با هم همکاری کردند، نتایج میانی را منتشر کردند و مراحل کار یکدیگر را تأیید نمودند.
    3. در هر دو حالت، یک تجمیع‌کننده ساده مبتنی بر رای‌گیری اکثریت، پنج پاسخ مستقل را با هم ترکیب کرد.
  • معیارها: دقت (درصد پاسخ‌های صحیح) و زمان اجرا (میانگین زمان برای هر مسئله، به همراه توزیع زمان‌های تکمیل).

آنچه اعداد نشان می‌دهند

  • دقت انفرادی: ۷۲٪
  • دقت مشارکتی: ۸۷٪
  • دقت رای‌گیری اکثریت انفرادی: ۸۰٪
  • دقت رای‌گیری اکثریت مشارکتی: ۹۰٪

زمان اجرا از میانگین ۱۴ دقیقه برای عامل‌های انفرادی به ۱۰ دقیقه برای گروه مشارکتی کاهش یافت. اکثر اجراهای مشارکتی در کمتر از پنج دقیقه به پایان رسیدند، در حالی که تلاش‌های انفرادی مکرراً به محدودیت زمانی ۳۰ دقیقه‌ای برخورد می‌کردند.

مشاهدات کلیدی که این اختلاف را توضیح می‌دهند

  • غیرممکن برای یک نفر، ممکن برای گروه – در یک مسئله خاص، تمام عامل‌های انفرادی شکست خوردند، اما تیم مشارکتی نتایج جزئی را با هم تبادل کردند و در نهایت به‌طور جمعی به پاسخ صحیح رسیدند.
  • خطایابی از طریق بررسی متقابل – عامل‌های انفرادی گاهی در تله‌های منطقی می‌افتادند؛ اما گروه با مقایسه یادداشت‌ها در لحظه، این اشتباهات را شناسایی کرد.
  • همگرایی سریع – وقتی هر عاملی یک مقدار میانی حیاتی را کشف می‌کرد، آن یافته را منتشر می‌کرد و به دیگران اجازه می‌داد از کارهای تکراری صرف‌نظر کرده و سریع‌تر به راه حل نهایی همگرا شوند.

هزینه‌ها و محدودیت‌های پنهان

این آزمایش تنها از پنج عامل استفاده کرد؛ هنوز مشخص نیست که آیا همین کارایی در مقیاس ده‌ها یا صدها عامل نیز حفظ می‌شود یا خیر. علاوه بر این، تجمیع‌کننده رای‌گیری اکثریت همچنان عملکرد خوبی داشت (۹۰٪ در حالت مشارکتی).

آنچه باید در آینده زیر نظر داشت

  • آزمایش‌های مقیاس‌پذیری – آیا صد عامل همچنان دقت را بهبود می‌بخشند یا هزینه‌های هماهنگی بر آن غلبه خواهد کرد؟
  • تخصصی‌سازی نقش‌ها – اختصاص وظایف خاص (مثلاً یک عامل بر نظریه اعداد و دیگری بر بهینه‌سازی تمرکز کند) می‌تواند مزایای همکاری را نسبت به همکاری آزادانه افزایش دهد.
  • معیارهای گسترده‌تر – اعمال همین چارچوب بر چالش‌های تولید کد، مجموعه‌های عیب‌یابی یا ساخت نرم‌افزارهای واقعی، نشان خواهد داد که آیا این دستاوردها فراتر از معماهای ریاضی نیز پابرجا می‌مانند یا خیر.

نتیجه‌گیری

همکاری هم‌زمان میان عامل‌های کدنویسی هوش مصنوعی می‌تواند هم نرخ موفقیت و هم سرعت را در وظایف الگوریتمی افزایش دهد و از تلاش‌های انفرادی و حتی رای‌گیری ساده جمعی پیشی بگیرد. این رویکرد امیدوارکننده است، اما مقیاس‌پذیری و مقرون‌به‌صرفه بودن آن همچنان سوالاتی باز هستند که تحقیقات آینده باید به آن‌ها پاسخ دهند.

منبع: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0