Pięciu agentów Gemini 3.5 Flash współpracujących ze sobą w czasie rzeczywistym rozwiązało 87% zestawu 30 zadań z Project Euler, pokonując pięciu agentów działających solo (72%) oraz oba modele bazowe oparte na głosowaniu większościowym (80% solo, 90% we współpracy). Współpraca skróciła również średni czas wykonywania o cztery minuty, spadając z 14 minut na problem do 10 minut, przy czym większość rozwiązań pojawiała się w czasie krótszym niż pięć minut.

Dlaczego ten eksperyment jest istotny

Asystenci programowania AI już teraz tworzą fragmenty kodu, debugują go i generują całe programy. Badacze zazwyczaj testują pojedynczy model na podstawie promptu i oceniają jego odpowiedź. Ten test stawia inne pytanie: czy grupa agentów, którzy dzielą się swoimi odkryciami w trakcie pracy, może osiągnąć lepsze wyniki niż podejście typu „mądrość tłumu”, które jedynie sumuje niezależne odpowiedzi?

Zadania Project Euler służą jako standardowy punkt odniesienia dla myślenia algorytmicznego. Łączą one wgląd matematyczny z wydajnym kodowaniem, co czyni je dobrym przybliżeniem rzeczywistych zadań programistycznych, w których liczy się poprawność i szybkość.

Jak przygotowano test

  • Agenci: Pięć instancji Gemini 3.5 Flash dostępnych poprzez platformę Antigravity.
  • Scenariusze:
    1. Każdy agent rozwiązywał każdy problem samodzielnie, podając własną odpowiedź.
    2. Ta sama piątka agentów współpracowała w czasie rzeczywistym, przesyłając wyniki pośrednie i potwierdzając kroki pozostałych.
    3. W obu konfiguracjach prosty agregator oparty na głosowaniu większościowym łączył pięć niezależnych odpowiedzi.
  • Metryki: Dokładność (procent poprawnych odpowiedzi) oraz czas wykonania (średni czas na problem, wraz z rozkładem czasów ukończenia).

Co mówią liczby

  • Dokładność solo: 72%
  • Dokładność we współpracy: 87%
  • Dokładność solo przy głosowaniu większościowym: 80%
  • Dokładność we współpracy przy głosowaniu większościowym: 90%

Średni czas wykonania spadł z 14 minut dla agentów działających solo do 10 minut dla grupy współpracującej. Większość sesji we współpracy kończyła się w czasie poniżej pięciu minut, podczas gdy próby solo często osiągały limit 30 minut czasu oczekiwania (timeout).

Kluczowe obserwacje wyjaśniające tę różnicę

  • Niemożliwe dla jednego, możliwe dla wielu – W przypadku pojedynczego problemu wszyscy agenci solo zawiedli, jednak zespół współpracujący wymieniał wyniki pośrednie i wspólnie dotarł do poprawnej odpowiedzi.
  • Wykrywanie błędów poprzez wzajemną weryfikację – Pojedynczy agenci czasami wpadali w pułapki logiczne; grupa wyłapywała te błędy, porównując notatki w czasie rzeczywistym.
  • Szybka zbieżność – Gdy jakikolwiek agent odkrył kluczową wartość pośrednią, przesyłał ją dalej, co pozwalało pozostałym pominąć zbędną pracę i szybciej dotrzeć do ostatecznego rozwiązania.

Ukryte koszty i ograniczenia

W eksperymencie wykorzystano tylko pięciu agentów; nie jest jasne, czy ta sama wydajność skaluje się do dziesiątek lub setek. Co więcej, agregator oparty na głosowaniu większościowym wciąż radził sobie dobrze (90% przy współpracy).

Na co warto zwrócić uwagę w przyszłości

  • Eksperymenty ze skalowaniem – Czy sto agentów nadal zwiększy dokładność, czy może narzut związany z koordynacją przeważy?
  • Specjalizacja ról – Przypisanie konkretnych zadań (np. jeden agent skupia się na teorii liczb, inny na optymalizacji) mogłoby zwiększyć korzyści w porównaniu do współpracy o swobodnej strukturze.
  • Szersze benchmarki – Zastosowanie tej samej metody do wyzwań związanych z generowaniem kodu, zestawów do debugowania czy budowania rzeczywistego oprogramowania pozwoli sprawdzić, czy zyski te utrzymają się poza zagadkami matematycznymi.

Podsumowanie

Współpraca w czasie rzeczywistym między agentami AI do programowania może zwiększyć zarówno skuteczność, jak i szybkość rozwiązywania zadań algorytmicznych, przewyższając próby solo, a nawet proste głosowanie większościowe. Podejście to zapowiada się obiecująco, ale jego skalowalność i opłacalność pozostają otwartymi pytaniami, na które przyszłe badania będą musiały odpowiedzieć.

Źródło: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0