پانچ Gemini 3.5 Flash ایجنٹس نے ریئل ٹائم میں مل کر کام کرتے ہوئے Project Euler کے 30 سوالات کے سیٹ کا 87% حصہ حل کر لیا، جو کہ اکیلے کام کرنے والے پانچ ایجنٹس (72%) اور دونوں میجورٹی ووٹ (majority-vote) بیس لائنز (80% اکیلے، 90% اشتراکی) سے بہتر رہا۔ اشتراکی عمل (collaborative run) نے اوسط ایگزیکیوشن ٹائم میں بھی چار منٹ کی کمی کی، جو کہ فی مسئلہ 14 منٹ سے کم ہو کر 10 منٹ رہ گیا، جبکہ زیادہ تر حل پانچ منٹ سے بھی کم وقت میں حاصل ہو گئے۔

یہ تجربہ کیوں اہم ہے

AI کوڈنگ اسسٹنٹ پہلے ہی کوڈ کے ٹکڑے (snippets) تیار کرنے، کوڈ ڈی بگ کرنے اور مکمل پروگرام بنانے کی صلاحیت رکھتے ہیں۔ محققین عام طور پر ایک پرامپٹ پر کسی ایک ماڈل کا تجربہ کرتے ہیں اور اس کے جواب کو درجہ بندی کرتے ہیں۔ یہ ٹیسٹ ایک مختلف سوال پوچھتا ہے: کیا ایجنٹس کا ایک ایسا گروپ جو کام کے دوران اپنی دریافت کردہ معلومات ایک دوسرے کے ساتھ شیئر کرتا ہے، "wisdom of the crowd" (ہجوم کی دانائی) کے اس طریقے سے بہتر کارکردگی دکھا سکتا ہے جو محض آزادانہ جوابات کا مجموعہ ہوتا ہے؟

Project Euler کے مسائل الگورتھمک سوچ کے لیے ایک معیاری بینچ مارک کے طور پر کام کرتے ہیں۔ یہ ریاضیاتی بصیرت اور موثر کوڈنگ کا امتزاج ہیں، جو انہیں حقیقی دنیا کے پروگرامنگ کے کاموں کے لیے ایک بہترین متبادل بناتے ہیں جہاں درستگی اور رفتار اہمیت رکھتی ہے۔

ٹیسٹ کیسے ترتیب دیا گیا

  • ایجنٹس: Antigravity پلیٹ فارم کے ذریعے حاصل کردہ Gemini 3.5 Flash کے پانچ انسٹنس۔
  • مختلف صورتحال (Scenarios):
    1. ہر ایجنٹ نے ہر مسئلے کو اکیلے حل کیا اور اپنا جواب رپورٹ کیا۔
    2. وہی پانچ ایجنٹس ریئل ٹائم میں مل کر کام کرتے رہے، درمیانی نتائج (intermediate results) کو براڈکاسٹ کرتے رہے اور ایک دوسرے کے اقدامات کی تصدیق کرتے رہے۔
    3. دونوں سیٹ اپس کے لیے، ایک سادہ میجورٹی ووٹ ایگریگیٹر (majority-vote aggregator) نے پانچوں آزادانہ جوابات کو یکجا کیا۔
  • میٹرکس: درستگی (درست جوابات کا فیصد) اور رن ٹائم (فی مسئلہ اوسط وقت، نیز تکمیل کے اوقات کی تقسیم)۔

اعداد و شمار کیا ظاہر کرتے ہیں

  • اکیلے کی درستگی: 72 %
  • اشتراکی درستگی: 87 %
  • اکیلے میجورٹی ووٹ کی درستگی: 80 %
  • اشتراکی میجورٹی ووٹ کی درستگی: 90 %

اوسط رن ٹائم اکیلے ایجنٹس کے لیے 14 منٹ سے کم ہو کر اشتراکی گروپ کے لیے 10 منٹ رہ گیا۔ زیادہ تر اشتراکی کوششیں پانچ منٹ سے کم میں مکمل ہو گئیں، جبکہ اکیلے کیے گئے تجربات اکثر 30 منٹ کی ٹائم آؤٹ حد تک پہنچ جاتے۔

اہم مشاہدات جو اس فرق کی وضاحت کرتے ہیں

  • ایک کے لیے ناممکن، سب کے لیے ممکن – ایک ہی مسئلے پر تمام اکیلے ایجنٹس ناکام رہے، لیکن اشتراکی ٹیم نے جزوی نتائج کا تبادلہ کیا اور اجتماعی طور پر درست جواب تک پہنچ گئے۔
  • کراس چیکنگ کے ذریعے غلطیوں کی نشاندہی – انفرادی ایجنٹس کبھی کبھار منطقی جالوں میں پھنس جاتے تھے؛ گروپ نے ریئل ٹائم میں معلومات کا موازنہ کر کے ان غلطیوں کو پکڑ لیا۔
  • تیز رفتار ہم آہنگی (Rapid convergence) – جب بھی کسی ایجنٹ کو کوئی اہم درمیانی ویلیو (intermediate value) ملتی، تو وہ اس دریافت کو براڈکاسٹ کر دیتا، جس سے دوسرے ایجنٹس غیر ضروری کام سے بچ جاتے اور تیزی سے حتمی حل تک پہنچ جاتے۔

پوشیدہ اخراجات اور حدود

اس تجربے میں صرف پانچ ایجنٹس استعمال کیے گئے؛ یہ اب بھی غیر واضح ہے کہ کیا یہی کارکردگی درجنوں یا سینکڑوں ایجنٹس تک بڑھائی جا سکتی ہے۔ مزید برآں، میجورٹی ووٹ ایگریگیٹر نے اب بھی اچھی کارکردگی دکھائی (اشتراک کے ساتھ 90%)۔

آگے کیا دیکھنا ہے

  • اسکیلنگ کے تجربات – کیا سو ایجنٹس سے بھی درستگی میں بہتری آئے گی، یا کوآرڈینیشن کا بوجھ (coordination overhead) غالب آ جائے گا؟
  • کردار کی تخصیص (Role specialization) – مخصوص کام سونپنا (مثلاً ایک ایجنٹ نمبر تھیوری پر توجہ دے، دوسرا آپٹیمائزیشن پر) آزادانہ اشتراک کے مقابلے میں فوائد کو بڑھا سکتا ہے۔
  • وسیع تر بینچ مارکس – اسی فریم ورک کو کوڈ جنریشن کے چیلنجز، ڈی بگنگ سویٹس، یا حقیقی دنیا کے سافٹ ویئر بلڈز پر لاگو کرنے سے یہ معلوم ہوگا کہ آیا یہ فوائد ریاضیاتی پہیلیوں سے آگے بھی برقرار رہتے ہیں۔

خلاصہ

AI کوڈنگ ایجنٹس کے درمیان ریئل ٹائم اشتراک الگورتھمک کاموں پر کامیابی کی شرح اور رفتار دونوں کو بڑھا سکتا ہے، جو کہ اکیلے کیے گئے تجربات اور یہاں تک کہ سادہ کراؤڈ ووٹ سے بھی بہتر ہے۔ یہ طریقہ کار امید افزا ہے، لیکن اس کی اسکیل ایبلٹی (scalability) اور لاگت کا مؤثر ہونا (cost-effectiveness) اب بھی ایسے سوالات ہیں جن کا جواب مستقبل کی تحقیق کو دینا ہوگا۔

ماخذ: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0