Testei modelos locais em dez pequenos contratos Solidity, inserindo bugs como:

  • Reentrância em funções de saque
  • Falta de modificadores de acesso
  • Erros de arredondamento ERC4626
  • Verificações de assinatura falhas
  • Bugs de lógica sutis

Comparei o Qwen2.5-Coder com o DeepSeek-Coder em modelos de 7B (ou menores) via Ollama no WSL2. Se você usa modelos de 33B, ignore isto.

Para cada contrato, enviei três prompts:

  • Uma revisão de segurança geral
  • Uma verificação direcionada para reentrância e controle de acesso
  • Um relatório estruturado com tags de severidade

Seguimento de Instruções

O Qwen 7B vence aqui. Ele obedece a regras de formatação rigorosas quase todas as vezes. O DeepSeek frequentemente adiciona texto extra ou ignora limites. Quando você insere a saída do modelo em um pipeline automatizado, a consistência do Qwen é fundamental — uma falha de parsing é inútil.

Verificações Direcionadas

O Qwen mantém o foco. Pergunte sobre reentrância e ele responderá sobre reentrância. O DeepSeek se perde em otimização de gas ou notas de estilo, adicionando ruído.

Qualidade da Explicação

O Qwen detalha as sequências de ataque de forma clara, mostrando como um exploit se desenrola. O DeepSeek oferece respostas genéricas de livro didático. Ambos estão corretos, mas o detalhamento do Qwen ajuda na redação de relatórios.

Ceticismo e Alucinação

O DeepSeek sinaliza mais problemas, agindo como um “gerador de suspeitas”. Ele também inventa problemas em códigos limpos.

O Qwen, por outro lado, fica em silêncio quando o código não tem bugs. Já o DeepSeek afirma a existência de bugs que não existem.

Um falso alarme custa minutos; um bug ignorado pode custar tudo. Eu utilizo o DeepSeek para levantar pontos de investigação, mas confio no Qwen para automação.

Meu Veredito Final

O tamanho do modelo importa mais do que a marca. Um modelo de 1.5B não consegue raciocinar sobre bugs de múltiplas etapas ou manter a formatação.

Em 7B, ambos lidam com falhas básicas, mas nenhum substitui um auditor humano para lógica de negócios complexa. Pense neles como assistentes de triagem, não como auditores.

Minha configuração:

  • Qwen 7B: Padrão para revisões estruturadas e pipelines.
  • DeepSeek: Segunda opinião para capturar o que o Qwen deixa passar.
  • Qwen 1.5B: Apenas filtragem rápida e de baixo risco.

Compre o maior modelo que seu hardware puder rodar. Depois, preocupe-se com a marca.

Você prefere um modelo que seja suspeito ou um modelo que seja preciso?

Source: https://dev.to/pavelespitia/qwen25-coder-vs-deepseek-coder-for-solidity-review-what-i-actually-see-locally-4jh8

Optional learning community: https://t.me/GyaanSetuAi