मी दहा लहान Solidity कॉन्ट्रॅक्ट्सवर स्थानिक मॉडेल्सची चाचणी घेतली, ज्यामध्ये मी खालीलप्रमाणे बग्स (bugs) टाकले होते:

  • withdraw फंक्शन्समध्ये Reentrancy
  • Access modifiers चा अभाव
  • ERC4626 राउंडिंग एरर्स (rounding errors)
  • दोषपूर्ण सिग्नेचर चेक (signature checks)
  • सूक्ष्म लॉजिक बग्स (logic bugs)

मी WSL2 वर Ollama द्वारे 7B (किंवा त्यापेक्षा लहान) मॉडेल्सवर Qwen2.5-Coder आणि DeepSeek-Coder ची तुलना केली. जर तुम्ही 33B मॉडेल्स वापरत असाल, तर याकडे दुर्लक्ष करा.

प्रत्येक कॉन्ट्रॅक्टसाठी मी तीन प्रॉम्प्ट्स दिले:

  • एक सामान्य सुरक्षा पुनरावलोकन (security review)
  • reentrancy आणि access control साठी लक्ष्यित तपासणी
  • severity tags सह एक संरचित अहवाल (structured report)

सूचनांचे पालन (Instruction Following)

Qwen 7B येथे विजयी ठरतो. तो जवळजवळ प्रत्येक वेळी कडक फॉरमॅटिंग नियमांचे पालन करतो. DeepSeek अनेकदा अतिरिक्त मजकूर जोडतो किंवा मर्यादांकडे दुर्लक्ष करतो. जेव्हा तुम्ही मॉडेलचे आउटपुट ऑटोमेटेड पाइपलाइनमध्ये वापरता, तेव्हा Qwen ची सुसंगतता महत्त्वाची ठरते—पार्शिंग-फेल (parsing-fail) म्हणजे निरुपयोगी.

लक्ष्यित तपासणी (Targeted Checks)

Qwen विषयावर ठाम राहतो. तुम्ही त्याला reentrancy बद्दल विचारले तर तो reentrancy बद्दलच उत्तर देतो. DeepSeek मात्र gas optimization किंवा स्टाईल नोट्सकडे वळतो, ज्यामुळे गोंधळ निर्माण होतो.

स्पष्टीकरणाचा दर्जा (Explanation Quality)

Qwen हल्ल्याचा क्रम (attack sequences) स्पष्टपणे सांगतो आणि एक्सप्लॉइट (exploit) कसा घडतो हे दाखवतो. DeepSeek सामान्य पाठ्यपुस्तकी उत्तरे देते. दोन्ही बरोबर आहेत, परंतु Qwen चे तपशील अहवाल लिहिण्यास मदत करतात.

संशय आणि भ्रम (Skepticism and Hallucination)

DeepSeek अधिक समस्या दर्शवतो, जणू तो "संशय जनरेटर" (suspicion generator) आहे. तो स्वच्छ कोडमध्येही समस्या शोधून काढतो.

याउलट, Qwen कोडमध्ये बग असल्यास शांत राहतो. दुसरीकडे, DeepSeek अस्तित्वात नसलेले बग्स असल्याचे सांगतो.

चुकीचा इशारा (false alarm) काही मिनिटे वाया घालवतो; पण सुटलेला बग सर्व काही नष्ट करू शकतो. मी तपासणीसाठी गोष्टी समोर आणण्यासाठी DeepSeek वर अवलंबून असतो, परंतु ऑटोमेशनसाठी मी Qwen वर विश्वास ठेवतो.

माझा अंतिम निष्कर्ष (My Final Verdict)

ब्रँडपेक्षा मॉडेलचा आकार जास्त महत्त्वाचा आहे. 1.5B मॉडेल बहु-स्तरीय (multi-step) बग्स समजून घेऊ शकत नाही किंवा फॉरमॅट पाळू शकत नाही.

7B वर, दोन्ही मॉडेल्स मूलभूत त्रुटी हाताळतात, तरीही जटिल बिझनेस लॉजिकसाठी (business logic) यांपैकी कोणीही मानवी ऑडिटरची जागा घेऊ शकत नाही. त्यांना ऑडिटर म्हणून न बघता, 'ट्रायज असिस्टंट' (triage assistants) म्हणून पहा.

माझी सेटअप:

  • Qwen 7B: संरचित पुनरावलोकने आणि पाइपलाइनसाठी डीफॉल्ट.
  • DeepSeek: Qwen कडून सुटलेल्या गोष्टी पकडण्यासाठी दुसरी मते (second opinion).
  • Qwen 1.5B: फक्त जलद आणि कमी जोखमीचे फिल्टरिंग.

तुमचे हार्डवेअर जेवढे मोठे मॉडेल चालवू शकते तेवढे मोठे मॉडेल खरेदी करा. त्यानंतर ब्रँडचा विचार करा.

तुम्हाला संशयी मॉडेल आवडते की अचूक मॉडेल?

स्रोत: https://dev.to/pavelespitia/qwen25-coder-vs-deepseek-coder-for-solidity-review-what-i-actually-see-locally-4jh8

ऐच्छिक लर्निंग कम्युनिटी: https://t.me/GyaanSetuAi