Fünf Gemini 3.5 Flash-Agenten, die in Echtzeit zusammenarbeiteten, lösten 87 % eines 30-teiligen Project-Euler-Satzes und übertrafen damit fünf einzeln arbeitende Agenten (72 %) sowie beide Majority-Vote-Baselines (80 % solo, 90 % kollaborativ). Der kollaborative Durchlauf verkürzte zudem die durchschnittliche Ausführungszeit um vier Minuten – von 14 Minuten pro Problem auf 10 Minuten –, wobei die meisten Lösungen in weniger als fünf Minuten vorlagen.
Warum das Experiment wichtig ist
KI-Coding-Assistenten erstellen bereits Code-Snippets, debuggen Code und generieren ganze Programme. Forscher testen üblicherweise ein einzelnes Modell anhand eines Prompts und bewerten dessen Antwort. Dieser Test stellt eine andere Frage: Kann eine Gruppe von Agenten, die ihre Erkenntnisse während der Arbeit teilen, einen „Wisdom of the Crowd“-Ansatz übertreffen, der lediglich unabhängige Antworten zusammenzählt?
Project-Euler-Probleme dienen als Standard-Benchmark für algorithmisches Denken. Sie kombinieren mathematische Einsicht mit effizienter Programmierung und sind daher ein guter Stellvertreter für reale Programmieraufgaben, bei denen Korrektheit und Geschwindigkeit entscheidend sind.
Aufbau des Tests
- Agenten: Fünf Instanzen von Gemini 3.5 Flash, aufgerufen über die Antigravity-Plattform.
- Szenarien:
- Jeder Agent bearbeitete jedes Problem allein und lieferte seine eigene Antwort.
- Dieselben fünf Agenten arbeiteten in Echtzeit zusammen, indem sie Zwischenergebnisse übermittelten und die Schritte der jeweils anderen bestätigten.
- Bei beiden Setups kombinierte ein einfacher Majority-Vote-Aggregator die fünf unabhängigen Antworten.
- Metriken: Genauigkeit (Prozentsatz korrekter Antworten) und Laufzeit (durchschnittliche Zeit pro Problem sowie die Verteilung der Abschlusszeiten).
Was die Zahlen zeigen
- Solo-Genauigkeit: 72 %
- Kollaborative Genauigkeit: 87 %
- Solo-Majority-Vote-Genauigkeit: 80 %
- Kollaborative Majority-Vote-Genauigkeit: 90 %
Die Laufzeit sank von durchschnittlich 14 Minuten bei Solo-Agenten auf 10 Minuten bei der kollaborativen Gruppe. Die meisten kollaborativen Durchläufe waren in weniger als fünf Minuten abgeschlossen, während Solo-Versuche häufig das 30-minütige Timeout-Limit erreichten.
Zentrale Beobachtungen, die die Differenz erklären
- Unmöglich für einen, möglich für viele – Bei einem einzelnen Problem scheiterten alle Solo-Agenten, doch das kollaborative Team tauschte Teilergebnisse aus und fand gemeinsam die richtige Antwort.
- Fehlererkennung durch Cross-Checking – Einzelne Agenten tappten manchmal in logische Fallen; die Gruppe erkannte diese Fehltritte durch den Echtzeit-Abgleich der Ergebnisse.
- Schnelle Konvergenz – Sobald ein Agent einen entscheidenden Zwischenwert entdeckte, übermittelte er diesen Fund, sodass die anderen redundante Arbeit überspringen und schneller zur endgültigen Lösung gelangen konnten.
Versteckte Kosten und Grenzen
Das Experiment nutzte nur fünf Agenten; es bleibt unklar, ob sich dieselbe Effizienz auf Dutzende oder Hunderte von Agenten skalieren lässt. Zudem schnitt der Majority-Vote-Aggregator weiterhin gut ab (90 % bei Kollaboration).
Worauf man als Nächstes achten sollte
- Skalierungsexperimente – Werden hundert Agenten die Genauigkeit noch steigern oder wird der Koordinationsaufwand dominieren?
- Rollenspezialisierung – Die Zuweisung spezifischer Aufgaben (z. B. ein Agent konzentriert sich auf Zahlentheorie, ein anderer auf Optimierung) könnte die Vorteile gegenüber einer freien Zusammenarbeit verstärken.
- Breitere Benchmarks – Die Anwendung desselben Frameworks auf Code-Generierungs-Herausforderungen, Debugging-Suites oder reale Software-Builds wird zeigen, ob die Gewinne über mathematische Rätsel hinaus Bestand haben.
Fazit
Die Echtzeit-Zusammenarbeit zwischen KI-Coding-Agenten kann sowohl die Erfolgsraten als auch die Geschwindigkeit bei algorithmischen Aufgaben erhöhen und dabei Solo-Versuche sowie eine einfache Abstimmung durch die Menge übertreffen. Der Ansatz ist vielversprechend, aber seine Skalierbarkeit und Kosteneffizienz bleiben offene Fragen, die die zukünftige Forschung beantworten muss.
Quelle: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
