ஐந்து Gemini 3.5 Flash ஏஜெண்டுகள் நிகழ்நேரத்தில் இணைந்து செயல்பட்டதன் மூலம், 30 கேள்விகளைக் கொண்ட Project Euler தொகுப்பில் 87% விடையளித்துள்ளன. இது தனித்தனியாக இயங்கிய ஐந்து ஏஜெண்டுகளை (72%) விடவும், பெரும்பான்மை வாக்கு (majority-vote) அடிப்படையிலான இரண்டு முறைகளை (தனித்தனியாக 80%, கூட்டாக 90%) விடவும் சிறப்பானது. இந்த கூட்டுச் செயல்பாடு சராசரிச் செயல்பாட்டு நேரத்தையும் நான்கு நிமிடங்கள் குறைத்துள்ளது; ஒரு பிரச்சனைக்குத் தேவைப்பட்ட 14 நிமிடங்களில் இருந்து 10 நிமிடங்களாகக் குறைந்துள்ளது, மேலும் பெரும்பாலான தீர்வுகள் ஐந்து நிமிடங்களுக்குள்ளேயே கிடைத்துள்ளன.
இந்தச் சோதனை ஏன் முக்கியமானது
AI கோடிங் உதவியாளர்கள் ஏற்கனவே குறியீட்டுத் துண்டுகளை (snippets) உருவாக்குதல், பிழைகளைத் திருத்துதல் (debug) மற்றும் முழுமையான நிரல்களை உருவாக்குதல் போன்ற பணிகளைச் செய்கின்றனர். ஆராய்ச்சியாளர்கள் பொதுவாக ஒரு தூண்டுதலுக்கு (prompt) ஒரு தனித்த மாதிரியை (model) சோதித்து அதன் பதிலைப்評ிக்கின்றனர். ஆனால் இந்தச் சோதனை ஒரு மாறுபட்ட கேள்வியைக் கேட்கிறது: வேலை செய்யும்போதே தங்களின் கண்டுபிடிப்புகளைப் பகிர்ந்து கொள்ளும் ஏஜெண்டுகளின் குழு, வெறும் தனித்த பதில்களை மட்டும் கணக்கிடும் "கூட்டத்தின் ஞானம்" (wisdom of the crowd) அணுகுமுறையை விடச் சிறப்பாகச் செயல்படுமா?
Project Euler பிரச்சனைகள் அல்காரிதமிக் சிந்தனைக்கான (algorithmic thinking) ஒரு தரமான அளவுகோலாகச் செயல்படுகின்றன. அவை கணித நுண்ணறிவு மற்றும் திறமையான கோடிங் ஆகிய இரண்டையும் கலந்து வைத்துள்ளதால், துல்லியம் மற்றும் வேகம் முக்கியத்துவம் வாய்ந்த நிஜ உலக புரோகிராமிங் பணிகளுக்கு ஒரு சிறந்த பிரதிநிதியாக அமைகின்றன.
சோதனை எவ்வாறு அமைக்கப்பட்டிருந்தது
- ஏஜெண்டுகள் (Agents): Antigravity தளத்தின் மூலம் அணுகப்பட்ட ஐந்து Gemini 3.5 Flash மாதிரிகள்.
- சூழல்கள் (Scenarios):
- ஒவ்வொரு ஏஜெண்டும் ஒவ்வொரு பிரச்சனையையும் தனித்தனியாகக் கையாண்டு, அதன் சொந்தப் பதிலைத் தெரிவித்தது.
- அதே ஐந்து ஏஜெண்டுகளும் நிகழ்நேரத்தில் இணைந்து செயல்பட்டு, இடைநிலை முடிவுகளைப் பகிர்ந்து கொண்டு, ஒருவருக்கொருவர் படிநிலைகளை உறுதிப்படுத்திக் கொண்டன.
- இரண்டு அமைப்புகளுக்கும், ஒரு எளிய பெரும்பான்மை வாக்கு (majority-vote) முறை மூலம் ஐந்து தனித்த பதில்கள் ஒருங்கிணைக்கப்பட்டன.
- அளவீடுகள் (Metrics): துல்லியம் (சரியான பதில்களின் சதவீதம்) மற்றும் இயக்க நேரம் (ஒரு பிரச்சனைக்கான சராசரி நேரம் மற்றும் முடிவடைவதற்கான நேரப் பரவல்).
புள்ளிவிவரங்கள் எதைக் காட்டுகின்றன
- தனித்த துல்லியம்: 72%
- கூட்டுத் துல்லியம்: 87%
- தனித்த பெரும்பான்மை வாக்கு துல்லியம்: 80%
- கூட்டுப் பெரும்பான்மை வாக்கு துல்லியம்: 90%
தனித்த ஏஜெண்டுகளுக்கான சராசரி இயக்க நேரம் 14 நிமிடங்களிலிருந்து, கூட்டு குழுவிற்கான 10 நிமிடங்களாகக் குறைந்தது. பெரும்பாலான கூட்டுச் செயல்பாடுகள் ஐந்து நிமிடங்களுக்குக் குறைவாகவே முடிவடைந்தன, ஆனால் தனித்த முயற்சிகள் அடிக்கடி 30 நிமிட காலக்கெடுவை (timeout limit) எட்டின.
இடைவெளியை விளக்கும் முக்கிய அவதானிப்புகள்
- ஒன்றிற்குச் சாத்தியமற்றது, பலருக்குச் சாத்தியமானது – ஒரு குறிப்பிட்ட பிரச்சனைக்கு அனைத்துத் தனித்த ஏஜெண்டுகளும் தோல்வியடைந்தன, ஆனால் கூட்டுத் குழு இடைநிலை முடிவுகளைப் பகிர்ந்து கொண்டு கூட்டாகச் சரியான விடையைக் கண்டறிந்தது.
- ஒப்பீடு செய்வதன் மூலம் பிழைகளைக் கண்டறிதல் – தனித்த ஏஜெண்டுகள் சில நேரங்களில் தர்க்கரீதியான சிக்கல்களில் (logical traps) சிக்கிக்கொண்டன; குழு நிகழ்நேரத்தில் தகவல்களை ஒப்பிடுவதன் மூலம் இந்தத் தவறுகளைக் கண்டறிந்தது.
- விரைவான ஒருங்கினைப்பு (Rapid convergence) – ஏதேனும் ஒரு ஏஜெண்ட் ஒரு முக்கியமான இடைநிலை மதிப்பைக் கண்டறிந்தால், அது அந்தத் தகவலைப் பரப்பியது, இது மற்றவர்கள் தேவையற்ற வேலைகளைத் தவிர்த்து இறுதித் தீர்வை விரைவாக அடைய உதவியது.
மறைமுகச் செலவுகள் மற்றும் வரம்புகள்
இந்தச் சோதனையில் ஐந்து ஏஜெண்டுகள் மட்டுமே பயன்படுத்தப்பட்டன; இதே போன்ற செயல்திறன் டஜன் கணக்கிலான அல்லது நூற்றுக்கணக்கான ஏஜெண்டுகளுக்கும் பொருந்தும் என்பது இன்னும் தெளிவாகத் தெரியவில்லை. மேலும், பெரும்பான்மை வாக்கு முறை (majority-vote aggregator) கூட்டாகச் செயல்படும்போது சிறப்பாகச் செயல்பட்டது (90%).
அடுத்துக் கவனிக்க வேண்டியவை
- அளவிடுதல் சோதனைகள் (Scaling experiments) – நூறு ஏஜெண்டுகள் இன்னும் துல்லியத்தை மேம்படுத்துமா அல்லது ஒருங்கிணைப்புச் சுமை (coordination overhead) அதிகமாகிவிடுமா?
- பணிச் சிறப்பு (Role specialization) – குறிப்பிட்ட பணிகளை ஒதுக்குவது (உதாரணமாக, ஒரு ஏஜெண்ட் எண் கோட்பாட்டில் (number theory) கவனம் செலுத்துவது, மற்றொருவர் உகப்பாக்கத்தில் (optimization) கவனம் செலுத்துவது) சுதந்திரமான ஒத்துழைப்பை விடப் பலன் தரும்.
- விரிவான அளவுகோல்கள் (Broader benchmarks) – இதே கட்டமைப்பை குறியீடு உருவாக்கம் (code-generation), பிழைத்திருத்தம் (debugging) அல்லது நிஜ உலக மென்பொருள் உருவாக்கங்களுக்குப் பயன்படுத்துவது, இந்த முன்னேற்றங்கள் கணிதப் புதிர்களைத் தாண்டி நிலைத்திருக்குமா என்பதைச் சோதிக்கும்.
சுருக்கம்
AI கோடிங் ஏஜெண்டுகளுக்கு இடையிலான நிகழ்நேர ஒத்துழைப்பு, அல்காரிதமிக் பணிகளில் வெற்றி விகிதத்தையும் வேகத்தையும் அதிகரிக்க முடியும்; இது தனித்த முயற்சிகள் மற்றும் எளிய கூட்டுக் கருத்து முறைகளை விடச் சிறந்தது. இந்த அணுகுமுறை நம்பிக்கையளிக்கிறது, ஆனால் அதன் அளவிடுதல் மற்றும் செலவுத் திறன் ஆகியவை எதிர்கால ஆய்வுகள் பதிலளிக்க வேண்டிய கேள்விகளாக உள்ளன.
மூலம்: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
