Ich habe lokale Modelle an zehn winzigen Solidity-Smart-Contracts getestet und dabei Bugs wie folgende eingebaut:
- Reentrancy in Withdraw-Funktionen
- Fehlende Access-Modifier
- ERC4626-Rundungsfehler
- Fehlerhafte Signaturprüfungen
- Subtile Logikfehler
Ich habe Qwen2.5-Coder gegen DeepSeek-Coder bei 7B-Modellen (oder kleineren) via Ollama auf WSL2 getestet. Wenn Sie 33B-Modelle verwenden, ignorieren Sie dies bitte.
Für jeden Contract habe ich drei Prompts verwendet:
- Ein allgemeiner Security-Review
- Eine gezielte Prüfung auf Reentrancy und Access Control
- Ein strukturierter Bericht mit Severity-Tags
Befolgung von Anweisungen
Qwen 7B gewinnt hier. Es hält sich fast jedes Mal an strikte Formatierungsregeln. DeepSeek fügt oft zusätzlichen Text hinzu oder ignoriert Limits. Wenn man den Output eines Modells in eine automatisierte Pipeline einspeist, ist die Konsistenz von Qwen entscheidend – ein Parsing-Fehler ist nutzlos.
Gezielte Prüfungen
Qwen bleibt beim Thema. Fragt man es nach Reentrancy, antwortet es über Reentrancy. DeepSeek schweift in Richtung Gas-Optimierung oder Stil-Hinweise ab und erzeugt so Rauschen.
Qualität der Erklärungen
Qwen erläutert Angriffsszenarien klar und zeigt auf, wie ein Exploit abläuft. DeepSeek liefert eher generische Lehrbuchantworten. Beide sind korrekt, aber die Detailtiefe von Qwen hilft beim Schreiben der Berichte.
Skepsis und Halluzinationen
DeepSeek markiert mehr Probleme und agiert wie ein „Verdacht-Generator“. Es erfindet zudem Probleme in sauberem Code.
Qwen hingegen schweigt, wenn der Code fehlerhaft ist. DeepSeek hingegen behauptet, Bugs zu finden, die gar nicht existieren.
Ein Fehlalarm kostet Minuten; ein übersehener Bug kann alles kosten. Ich nutze DeepSeek, um Dinge aufzuspüren, die es zu untersuchen gilt, aber für die Automatisierung verlasse ich mich auf Qwen.
Mein abschließendes Urteil
Die Modellgröße ist wichtiger als die Marke. Ein 1,5B-Modell kann keine mehrstufigen Bugs durchdenken oder das Format einhalten.
Bei 7B bewältigen beide grundlegende Mängel, doch keines von beiden ersetzt einen menschlichen Auditor für komplexe Geschäftslogik. Betrachten Sie sie als Triage-Assistenten, nicht als Auditoren.
Mein Setup:
- Qwen 7B: Standard für strukturierte Reviews und Pipelines.
- DeepSeek: Zweitmeinung, um das zu finden, was Qwen übersieht.
- Qwen 1.5B: Nur für schnelles Filtern mit geringem Risiko.
Kaufen Sie das größte Modell, das Ihre Hardware ausführen kann. Machen Sie sich erst danach Gedanken über die Marke.
Bevorzugen Sie ein Modell, das misstrauisch ist, oder ein Modell, das präzise ist?
Optional learning community: https://t.me/GyaanSetuAi
