Vijf Gemini 3.5 Flash-agents die in realtime samenwerken, hebben 87% van een Project Euler-set van 30 vragen opgelost. Hiermee versloegen ze vijf solo-agents (72%) en beide majority-vote baselines (80% solo, 90% collaboratief). De collaboratieve run verkortte bovendien de gemiddelde uitvoeringstijd met vier minuten, van 14 minuten per probleem naar 10 minuten, waarbij de meeste oplossingen in minder dan vijf minuten binnen waren.
Waarom het experiment ertoe doet
AI-code-assistenten schrijven al codefragmenten, debuggen code en genereren volledige programma's. Onderzoekers testen meestal een enkel model op een prompt en beoordelen het antwoord. Deze test stelt een andere vraag: kan een groep agents die bevindingen delen terwijl ze werken, beter presteren dan een "wisdom of the crowd"-aanpak die simpelweg onafhankelijke antwoorden optelt?
Project Euler-problemen dienen als een standaard benchmark voor algoritmisch denken. Ze combineren wiskundig inzicht met efficiënte codering, waardoor ze een goede afspiegeling zijn van programmeertaken in de echte wereld waar juistheid en snelheid cruciaal zijn.
Hoe de test is opgezet
- Agents: Vijf instanties van Gemini 3.5 Flash, toegankelijk via het Antigravity-platform.
- Scenario's:
- Elke agent pakte elk probleem alleen aan en rapporteerde zijn eigen antwoord.
- Dezelfde vijf agents werkten in realtime samen door tussenresultaten te delen en elkaars stappen te bevestigen.
- Voor beide opstellingen combineerde een eenvoudige majority-vote aggregator de vijf onafhankelijke antwoorden.
- Metrics: Nauwkeurigheid (percentage correcte antwoorden) en runtime (gemiddelde tijd per probleem, plus de verdeling van de voltooiingstijden).
Wat de cijfers onthullen
- Solo-nauwkeurigheid: 72%
- Collaboratieve nauwkeurigheid: 87%
- Solo majority-vote nauwkeurigheid: 80%
- Collaboratieve majority-vote nauwkeurigheid: 90%
De runtime daalde van gemiddeld 14 minuten voor solo-agents naar 10 minuten voor de collaboratieve groep. De meeste collaboratieve runs waren binnen vijf minuten klaar, terwijl solo-pogingen vaak de tijdslimiet van 30 minuten bereikten.
Belangrijke observaties die het verschil verklaren
- Onmogelijk voor één, mogelijk voor velen – Bij een specifiek probleem faalden alle solo-agents, maar het collaboratieve team wisselde tussenresultaten uit en kwam gezamenlijk tot het juiste antwoord.
- Foutdetectie door kruiscontrole – Individuele agents trapten soms in logische vallen; de groep ontdekte deze misstappen door in realtime de bevindingen met elkaar te vergelijken.
- Snelle convergentie – Wanneer een agent een cruciale tussenwaarde ontdekte, werd dit gedeeld, waardoor anderen redundant werk konden overslaan en sneller tot de definitieve oplossing kwamen.
De verborgen kosten en beperkingen
Het experiment gebruikte slechts vijf agents; het blijft onduidelijk of dezelfde efficiëntie schaalbaar is naar tientallen of honderden agents. Bovendien presteerde de majority-vote aggregator nog steeds goed (90% bij samenwerking).
Waar we de komende tijd op moeten letten
- Schaalbaarheidsexperimenten – Zullen honderd agents de nauwkeurigheid nog steeds verbeteren, of zal de coördinatie-overhead de overhand nemen?
- Rolspecialisatie – Het toewijzen van specifieke taken (bijv. de ene agent richt zich op getaltheorie, de andere op optimalisatie) zou de voordelen kunnen vergroten ten opzichte van vrije samenwerking.
- Breder gebruik van benchmarks – Het toepassen van hetzelfde framework op uitdagingen in code-generatie, debugging-suites of softwarebouw in de echte wereld zal uitwijzen of de winst ook buiten wiskundige puzzels standhoudt.
Conclusie
Realtime samenwerking tussen AI-code-agents kan zowel de succesratio's als de snelheid bij algoritmische taken verhogen, waarbij ze solo-pogingen en zelfs een eenvoudige crowd vote verslaan. De aanpak is veelbelovend, maar de schaalbaarheid en kosteneffectiviteit blijven openstaande vragen die toekomstig onderzoek moet beantwoorden.
Bron: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
