Я протестировал локальные модели на десяти крошечных Solidity-контрактах, намеренно внедрив в них такие ошибки, как:

  • Reentrancy в функциях вывода средств
  • Отсутствие модификаторов доступа
  • Ошибки округления в ERC4626
  • Ошибки проверки подписи
  • Тонкие логические ошибки

Я сравнивал Qwen2.5-Coder и DeepSeek-Coder на моделях размером 7B (или меньше) через Ollama на WSL2. Если вы используете модели 33B, пропустите этот момент.

Для каждого контракта я использовал три промпта:

  • Общий аудит безопасности
  • Целевая проверка на reentrancy и контроль доступа
  • Структурированный отчет с тегами критичности

Соблюдение инструкций

Здесь побеждает Qwen 7B. Она почти всегда соблюдает строгие правила форматирования. DeepSeek часто добавляет лишний текст или игнорирует ограничения. Когда вы передаете вывод модели в автоматизированный конвейер, согласованность Qwen имеет решающее значение — ошибка парсинга делает результат бесполезным.

Целевые проверки

Qwen придерживается темы. Спросите её о reentrancy, и она ответит именно о reentrancy. DeepSeek уходит в сторону оптимизации газа или замечаний по стилю, создавая лишний шум.

Качество объяснений

Qwen четко расписывает последовательность атаки, показывая, как разворачивается эксплойт. DeepSeek дает общие ответы из учебников. Оба варианта верны, но детализация Qwen помогает при написании отчетов.

Скептицизм и галлюцинации

DeepSeek находит больше проблем, работая как «генератор подозрений». Она также выдумывает ошибки в чистом коде.

Qwen, напротив, «молчит», когда код содержит ошибки. DeepSeek же заявляет о багах, которых не существует.

Ложная тревога стоит минут; пропущенный баг может стоить всего. Я использую DeepSeek, чтобы подсветить моменты для проверки, но для автоматизации полагаюсь на Qwen.

Мой окончательный вердикт

Размер модели важнее бренда. Модель 1.5B не способна рассуждать о многоступенчатых багах или придерживаться формата.

На уровне 7B обе модели справляются с базовыми недостатками, однако ни одна из них не заменит человека-аудитора при анализе сложной бизнес-логики. Считайте их помощниками для первичной сортировки (triage), а не полноценными аудиторами.

Мой сетап:

  • Qwen 7B: Основная модель для структурированных обзоров и конвейеров.
  • DeepSeek: Второе мнение, чтобы поймать то, что упустила Qwen.
  • Qwen 1.5B: Только для быстрой фильтрации в некритичных задачах.

Выбирайте самую большую модель, которую может запустить ваше железо. А уже потом беспокойтесь о бренде.

Вы предпочитаете модель, которая подозрительна, или модель, которая точна?

Source: https://dev.to/pavelespitia/qwen25-coder-vs-deepseek-coder-for-solidity-review-what-i-actually-see-locally-4jh8

Optional learning community: https://t.me/GyaanSetuAi