La maggior parte dei team di ingegneria valuta ancora gli agenti AI nello stesso modo in cui corregge i compiti di matematica. Guardano l'output finale. Se la risposta è corretta, danno il via libera al rilascio e vanno avanti. Questa è una scorciatoia pericolosa. Una risposta corretta può nascondere un sistema profondamente