Testei modelos locais em dez pequenos contratos Solidity, inserindo bugs como:
- Reentrância em funções de saque
- Falta de modificadores de acesso
- Erros de arredondamento ERC4626
- Verificações de assinatura falhas
- Bugs de lógica sutis
Comparei o Qwen2.5-Coder com o DeepSeek-Coder em modelos de 7B (ou menores) via Ollama no WSL2. Se você usa modelos de 33B, ignore isto.
Para cada contrato, enviei três prompts:
- Uma revisão de segurança geral
- Uma verificação direcionada para reentrância e controle de acesso
- Um relatório estruturado com tags de severidade
Seguimento de Instruções
O Qwen 7B vence aqui. Ele obedece a regras de formatação rigorosas quase todas as vezes. O DeepSeek frequentemente adiciona texto extra ou ignora limites. Quando você insere a saída do modelo em um pipeline automatizado, a consistência do Qwen é fundamental — uma falha de parsing é inútil.
Verificações Direcionadas
O Qwen mantém o foco. Pergunte sobre reentrância e ele responderá sobre reentrância. O DeepSeek se perde em otimização de gas ou notas de estilo, adicionando ruído.
Qualidade da Explicação
O Qwen detalha as sequências de ataque de forma clara, mostrando como um exploit se desenrola. O DeepSeek oferece respostas genéricas de livro didático. Ambos estão corretos, mas o detalhamento do Qwen ajuda na redação de relatórios.
Ceticismo e Alucinação
O DeepSeek sinaliza mais problemas, agindo como um “gerador de suspeitas”. Ele também inventa problemas em códigos limpos.
O Qwen, por outro lado, fica em silêncio quando o código não tem bugs. Já o DeepSeek afirma a existência de bugs que não existem.
Um falso alarme custa minutos; um bug ignorado pode custar tudo. Eu utilizo o DeepSeek para levantar pontos de investigação, mas confio no Qwen para automação.
Meu Veredito Final
O tamanho do modelo importa mais do que a marca. Um modelo de 1.5B não consegue raciocinar sobre bugs de múltiplas etapas ou manter a formatação.
Em 7B, ambos lidam com falhas básicas, mas nenhum substitui um auditor humano para lógica de negócios complexa. Pense neles como assistentes de triagem, não como auditores.
Minha configuração:
- Qwen 7B: Padrão para revisões estruturadas e pipelines.
- DeepSeek: Segunda opinião para capturar o que o Qwen deixa passar.
- Qwen 1.5B: Apenas filtragem rápida e de baixo risco.
Compre o maior modelo que seu hardware puder rodar. Depois, preocupe-se com a marca.
Você prefere um modelo que seja suspeito ou um modelo que seja preciso?
Optional learning community: https://t.me/GyaanSetuAi
