Probé modelos locales en diez contratos de Solidity diminutos, introduciendo errores como:
- Reentrada en funciones de retiro
- Falta de modificadores de acceso
- Errores de redondeo en ERC4626
- Verificaciones de firma defectuosas
- Errores de lógica sutiles
Comparé Qwen2.5-Coder con DeepSeek-Coder en modelos de 7B (o menores) a través de Ollama en WSL2. Si utilizas modelos de 33B, ignora esto.
Para cada contrato, realicé tres prompts:
- Una revisión de seguridad general
- Una comprobación específica de reentrada y control de acceso
- Un informe estructurado con etiquetas de severidad
Seguimiento de instrucciones
Qwen 7B gana aquí. Obedece reglas de formato estrictas casi siempre. DeepSeek suele añadir texto extra o ignorar los límites. Cuando introduces la salida del modelo en un pipeline automatizado, la consistencia de Qwen es crucial: un error de parsing lo hace inútil.
Comprobaciones específicas
Qwen se mantiene en el tema. Pregúntale sobre reentrada y responderá sobre reentrada. DeepSeek se desvía hacia la optimización de gas o notas de estilo, añadiendo ruido.
Calidad de la explicación
Qwen detalla las secuencias de ataque con claridad, mostrando cómo se desarrolla un exploit. DeepSeek ofrece respuestas genéricas de libro de texto. Ambos son correctos, pero el nivel de detalle de Qwen ayuda en la redacción de informes.
Escepticismo y alucinación
DeepSeek señala más problemas, actuando como un «generador de sospechas». También inventa problemas en código limpio.
Qwen, por el contrario, se queda en silencio cuando el código no tiene errores. DeepSeek, por otro lado, afirma que existen errores que no existen.
Una falsa alarma cuesta minutos; un error pasado por alto puede costarlo todo. Me apoyo en DeepSeek para detectar cosas que investigar, pero confío en Qwen para la automatización.
Mi veredicto final
El tamaño del modelo importa más que la marca. Un modelo de 1.5B no puede razonar sobre errores de múltiples pasos ni mantener el formato.
En 7B, ambos manejan fallos básicos, pero ninguno reemplaza a un auditor humano para la lógica de negocio compleja. Piensa en ellos como asistentes de triaje, no como auditores.
Mi configuración:
- Qwen 7B: Predeterminado para revisiones estructuradas y pipelines.
- DeepSeek: Segunda opinión para detectar lo que Qwen pasa por alto.
- Qwen 1.5B: Solo para filtrado rápido y de bajo riesgo.
Compra el modelo más grande que tu hardware pueda ejecutar. Luego preocúpate por la marca.
¿Prefieres un modelo que sea suspicaz o un modelo que sea preciso?
Comunidad de aprendizaje opcional: https://t.me/GyaanSetuAi
