Saya menguji model lokal pada sepuluh kontrak Solidity kecil, dengan menyisipkan bug seperti:
- Reentrancy pada fungsi withdraw
- Modifier akses yang hilang
- Kesalahan pembulatan ERC4626
- Pemeriksaan tanda tangan yang cacat
- Bug logika yang halus
Saya menjalankan Qwen2.5-Coder melawan DeepSeek-Coder pada model 7B (atau lebih kecil) melalui Ollama di WSL2. Jika Anda menggunakan model 33B, abaikan bagian ini.
Untuk setiap kontrak, saya memberikan tiga prompt:
- Tinjauan keamanan umum
- Pemeriksaan terarah untuk reentrancy dan kontrol akses
- Laporan terstruktur dengan tag tingkat keparahan
Kepatuhan Instruksi
Qwen 7B menang di sini. Ia mematuhi aturan format yang ketat hampir setiap saat. DeepSeek sering menambahkan teks ekstra atau mengabaikan batasan. Saat Anda memasukkan output model ke dalam pipeline otomatis, konsistensi Qwen sangatlah penting—kegagalan parsing tidak akan berguna.
Pemeriksaan Terarah
Qwen tetap pada topik. Tanyakan tentang reentrancy dan ia akan menjawab tentang reentrancy. DeepSeek melantur ke optimasi gas atau catatan gaya penulisan, sehingga menambah noise.
Kualitas Penjelasan
Qwen menjabarkan urutan serangan dengan jelas, menunjukkan bagaimana sebuah eksploitasi terjadi. DeepSeek memberikan jawaban teks buku yang generik. Keduanya benar, tetapi detail dari Qwen membantu dalam penulisan laporan.
Skeptisisme dan Halusinasi
DeepSeek menandai lebih banyak masalah, bertindak seperti “generator kecurigaan.” Ia juga mengada-ada masalah pada kode yang bersih.
Sebaliknya, Qwen akan diam saat kode memiliki bug. Di sisi lain, DeepSeek mengklaim adanya bug yang sebenarnya tidak ada.
Alarm palsu membuang waktu beberapa menit; bug yang terlewat bisa merugikan segalanya. Saya mengandalkan DeepSeek untuk memunculkan hal-hal yang perlu diselidiki, tetapi saya mengandalkan Qwen untuk otomatisasi.
Putusan Akhir Saya
Ukuran model lebih penting daripada merek. Model 1.5B tidak dapat menalar bug multi-langkah atau mematuhi format.
Pada skala 7B, keduanya dapat menangani cacat dasar, namun tidak ada yang bisa menggantikan auditor manusia untuk logika bisnis yang kompleks. Anggaplah mereka sebagai asisten triase, bukan auditor.
Setup saya:
- Qwen 7B: Default untuk tinjauan terstruktur dan pipeline.
- DeepSeek: Pendapat kedua untuk menangkap apa yang terlewatkan oleh Qwen.
- Qwen 1.5B: Hanya untuk penyaringan cepat dengan risiko rendah.
Belilah model terbesar yang dapat dijalankan oleh perangkat keras Anda. Baru setelah itu pikirkan soal merek.
Apakah Anda lebih menyukai model yang penuh kecurigaan atau model yang presisi?
Komunitas pembelajaran opsional: https://t.me/GyaanSetuAi
