Perché l'attuale SWE-bench non è sufficiente

L'originale SWE-bench valuta gli agenti in base alla percentuale di casi di test che vengono eseguiti senza errori dopo una modifica. Nella maggior parte dei codebase commerciali, una suite di test "green" funge da sostituto della correttezza funzionale; gli sviluppatori si fidano dei test per codificare il comportamento previsto.

Il software scientifico segue regole diverse. Il suo obiettivo è generare prove: numeri che rispettino le leggi fisiche, preservino le unità di misura e convergano verso soluzioni analitiche note. Un test che controlla solo la forma di un array o la presenza di un file non garantisce che la fisica rimanga intatta. SWE-bench Science sostituisce la metrica generica basata solo sui test con una valutazione in due fasi:

  1. Correttezza ingegneristica – l'agente deve far superare la suite di test fornita.
  2. Validità scientifica – il codice corretto viene eseguito su problemi di riferimento con risposte analitiche, e i risultati vengono confrontati con il comportamento fisico atteso (ad es., conservazione dell'energia in un modello climatico, tassi di convergenza corretti in uno schema a differenze finite).

Solo quando entrambi i criteri sono soddisfatti l'agente

  • Progetta valutazioni specifiche per il dominio. Oltre ai generici unit test, crea controlli che sondino il nucleo scientifico del software: bilanci energetici per i modelli climatici, leggi di conservazione per la fluidodinamica o soluzioni analitiche note per problemi di benchmark.
  • Valida rispetto alle evidenze, non solo rispetto alle asserzioni. Esegui il codice corretto su casi in cui il risultato atteso è noto analiticamente e confronta i tassi di convergenza o le norme di errore con gli standard pubblicati.
  • Cattura il ragionamento dell'agente. Se l'agente registra una modifica come "regolata la tolleranza per far superare il test", considerala un segnale di allarme e revisiona manualmente la modifica.
  • Disaggrega le metriche di performance. Riporta i tassi di successo per dominio scientifico anziché un unico punteggio aggregato, in modo che i fallimenti nascosti diventino visibili.

Seguire questi passaggi trasforma la valutazione da un binario pass/fail in una valutazione sfumata sulla capacità del codice di fare ciò che la scienza richiede.

Cosa osservare in seguito

SWE-bench Science è un primo tentativo di allineare la valutazione degli agenti IA con le realtà del software scientifico. Il lavoro futuro probabilmente espanderà la suite di task specifici per dominio, aggiungerà invarianti fisiche più sofisticate ed esplorerà modi automatizzati per generare soluzioni di riferimento. I ricercatori dovrebbero prestare attenzione agli studi di follow-up che quantificano come diverse tecniche di prompt engineering o architetture di modelli influenzino la validità scientifica, nonché agli standard emergenti per la revisione del codice assistita dall'IA in ambienti di ricerca.

In sintesi

Se permetti a un agente IA di modificare codice di ricerca, conferma che i risultati scientifici sopravvivano alla modifica, non solo la suite di test. Solo allora l'automazione accelererà davvero la scoperta invece di metterla a rischio.