Cinco agentes Gemini 3.5 Flash trabalhando juntos em tempo real resolveram 87% de um conjunto de 30 questões do Project Euler, superando cinco agentes operando individualmente (72%) e ambos os baselines de votação majoritária (80% individual, 90% colaborativo). A execução colaborativa também reduziu quatro minutos no tempo médio de execução, caindo de 14 minutos por problema para 10 minutos, com a maioria das soluções chegando em menos de cinco minutos.
Por que o experimento é importante
Assistentes de codificação por IA já elaboram trechos de código, depuram códigos e geram programas inteiros. Pesquisadores geralmente testam um único modelo em um prompt e avaliam sua resposta. Este teste faz uma pergunta diferente: um grupo de agentes que compartilha descobertas enquanto trabalha pode superar uma abordagem de "sabedoria das multidões" que apenas contabiliza respostas independentes?
Os problemas do Project Euler servem como um benchmark padrão para o pensamento algorítmico. Eles misturam percepção matemática e codificação eficiente, tornando-os um bom indicador para tarefas de programação do mundo real, onde a correção e a velocidade importam.
Como o teste foi configurado
- Agentes: Cinco instâncias do Gemini 3.5 Flash acessadas através da plataforma Antigravity.
- Cenários:
- Cada agente enfrentou cada problema sozinho, relatando sua própria resposta.
- Os mesmos cinco agentes colaboraram em tempo real, transmitindo resultados intermediários e confirmando as etapas uns dos outros.
- Para ambas as configurações, um agregador simples de votação majoritária combinou as cinco respostas independentes.
- Métricas: Precisão (porcentagem de respostas corretas) e tempo de execução (tempo médio por problema, além da distribuição dos tempos de conclusão).
O que os números revelam
- Precisão individual: 72%
- Precisão colaborativa: 87%
- Precisão de votação majoritária individual: 80%
- Precisão de votação majoritária colaborativa: 90%
O tempo de execução caiu de uma média de 14 minutos para agentes individuais para 10 minutos para o grupo colaborativo. A maioria das execuções colaborativas terminou em menos de cinco minutos, enquanto as tentativas individuais frequentemente atingiam o limite de tempo de 30 minutos.
Observações principais que explicam a diferença
- Impossível para um, possível para muitos – Em um único problema, todos os agentes individuais falharam, mas a equipe colaborativa trocou resultados parciais e chegou coletivamente à resposta correta.
- Detecção de erros por verificação cruzada – Agentes individuais às vezes caíam em armadilhas lógicas; o grupo detectou esses erros comparando notas em tempo real.
- Convergência rápida – Quando qualquer agente descobria um valor intermediário crucial, ele transmitia a descoberta, permitindo que os outros pulassem o trabalho redundante e convergissem para a solução final mais rapidamente.
Os custos e limites ocultos
O experimento utilizou apenas cinco agentes; ainda não está claro se a mesma eficiência escala para dezenas ou centenas. Além disso, o agregador de votação majoritária ainda teve um bom desempenho (90% com colaboração).
O que observar a seguir
- Experimentos de escala – Cem agentes ainda melhorarão a precisão ou a sobrecarga de coordenação dominará?
- Especialização de funções – Atribuir tarefas específicas (por exemplo, um agente focado em teoria dos números, outro em otimização) poderia ampliar os benefícios em relação à colaboração de forma livre.
- Benchmarks mais amplos – Aplicar o mesmo framework a desafios de geração de código, suítes de depuração ou builds de software do mundo real testará se os ganhos se mantêm além de quebra-cabeças matemáticos.
Conclusão
A colaboração em tempo real entre agentes de codificação de IA pode aumentar tanto as taxas de sucesso quanto a velocidade em tarefas algorítmicas, superando tentativas individuais e até mesmo uma simples votação coletiva. A abordagem é promissora, mas sua escalabilidade e custo-benefício permanecem como questões em aberto que pesquisas futuras precisarão responder.
Fonte: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
