OpenAI afferma che il suo modello GPT-5.6 Sol ha raggiunto un tasso di successo del 38,3% nel benchmark di ragionamento logico ARC-AGI-3, superando il Claude Opus 5 di Anthropic, fermo al 30,2%. Il vantaggio emerge solo quando il modello viene eseguito tramite la Responses API personalizzata di OpenAI, che aggiunge due trucchi durante l'inferenza che l'harness di test ufficiale non consente.

L'antefatto: una corsa agli armamenti tra benchmark

ARC-AGI-3 sonda la capacità di un modello di risolvere problemi nuovi e multi-fase senza fare affidamento su fatti memorizzati. All'inizio di quest'anno, Anthropic ha annunciato un salto quadruplo nel benchmark, portando Opus 5 in cima alla classifica pubblica. Quel risultato ha stabilito un nuovo punto di riferimento per la capacità "pura" del modello, poiché l'harness ufficiale scarta ogni ragionamento intermedio dopo ogni passaggio, costringendo il modello a ricominciare da capo ogni volta.

L'affermazione di OpenAI si inserisce nello stesso clima competitivo. Pubblicando un punteggio più alto, l'azienda segnala che la sua ultima generazione può non solo eguagliare, ma superare le prestazioni logiche del suo principale rivale. Il titolo, tuttavia, maschera una sfumatura tecnica che sta cambiando il modo in cui la comunità interpreta le tabelle dei benchmark.

Cosa significano realmente i numeri

Quando GPT-5.6 Sol viene valutato con lo stesso harness ufficiale ARC-AGI-3 che ha dato a Opus 5 il risultato del 30,2%, il modello crolla a un tasso di successo del 7,8%. Lo scarto non è un glitch; è il risultato di due funzionalità ingegnerizzate che OpenAI integra con il modello:

  • Retained Reasoning – invece di cancellare la catena di pensiero (chain-of-thought) dopo ogni sotto-task, il sistema mantiene in vita il testo intermedio, permettendo al modello di fare riferimento alle deduzioni precedenti e costruire un argomento cumulativo.
  • Compaction – invece di troncare il contesto precedente per rimanere entro i limiti dei token, il wrapper comprime i passaggi precedenti in un breve riassunto, preservando il filo logico e mantenendo gestibile la dimensione del prompt.

Entrambi i meccanismi risiedono nella Responses API proprietaria. Fornendo al modello un contesto più ricco e continuo, OpenAI aumenta efficacemente la "memoria" del modello e gli permette di riutilizzare il proprio ragionamento. L'harness ufficiale, al contrario, impone una modalità "stateless" rigorosa che elimina tali vantaggi.

Perché la metodologia è importante

L'episodio evidenzia una crescente divisione nella valutazione dell'IA: punteggi puri del modello rispetto alle prestazioni a livello di sistema. OpenAI sostiene che un benchmark dovrebbe riflettere l'intero stack che gli sviluppatori implementeranno effettivamente: modello, pipeline di inferenza e gestione della memoria. Da questo punto di vista, un punteggio del 38,3% comunica a un team di prodotto che l'offerta combinata può risolvere più compiti nel mondo reale rispetto a un modello valutato in isolamento.

I critici sostengono che questo confonda il progresso scientifico. Se ogni laboratorio aggiunge wrapper personalizzati, la classifica diventa un mosaico di trucchi ingegneristici piuttosto che un confronto pulito dell'intelligenza del modello. L'harness ufficiale ARC-AGI-3 esiste per livellare il campo di gioco, garantendo che un numero più alto indichi un modello sottostante genuinamente più forte, e non un wrapper più intelligente.

Implicazioni per sviluppatori e investitori

Per le startup che costruiscono prodotti basati sull'IA, la distinzione è pratica. Un modello in grado di mantenere il ragionamento e compattare il contesto potrebbe richiedere meno prompt engineering, una latenza di inferenza inferiore e meno chiamate API per raggiungere una soluzione. Ciò si traduce in costi di calcolo più bassi e un'esperienza utente più fluida. Le aziende che forniscono un sistema "chiavi in mano" – modello più uno strato di inferenza ottimizzato – ottengono un vantaggio competitivo dove velocità e costi sono fondamentali.

Gli investitori osservano la scalata nei benchmark come indicatori dei ricavi futuri. Un vantaggio che attira i titoli dei giornali può far aumentare la valutazione di un'azienda, anche se la capacità pura del modello sottostante è pari a quella dei rivali. Il dibattito su ciò che i numeri rappresentano influenza quindi il modo in cui il capitale fluisce nel settore dell'IA.

Alcuni ricercatori definiscono l'uso di API personalizzate come “benchmark gaming”, sostenendo che ciò gonfi i punteggi senza far progredire la comprensione fondamentale del modello. Evidenziano che un modello che crolla a prestazioni a una sola cifra sotto vincoli rigorosi è ancora lontano dall'obiettivo dell'AGI. La preoccupazione è che il settore possa iniziare a premiare scorciatoie ingegneristiche piuttosto che veri e propri salti di qualità nella capacità di ragionamento.

La posizione di OpenAI sottolinea che il confine tra modello e sistema è sempre più artificiale. Le moderne applicazioni di IA raramente eseguono un modello nel vuoto; si trovano sempre dietro uno strato di servizio (serving layer) che gestisce il caching, il context stitching e il post-processing dell'output. Da questo punto di vista, misurare l'intera pipeline è un modo più onesto per rappresentare ciò che gli utenti sperimentano realmente.

In sintesi

La storia di GPT-5.6 Sol dimostra che le vittorie nei benchmark odierni dipendono dall'ingegneria dell'inferenza tanto quanto dalle dimensioni del modello. Se la comunità accetterà i punteggi a livello di sistema o porrà dei limiti ai wrapper personalizzati determinerà come leggeremo il prossimo titolo riguardante le “leaderboard”. Per chiunque costruisca o finanzi prodotti di IA, la lezione è chiara: i numeri puri contano, ma il software circostante può essere il fattore decisivo nelle prestazioni nel mondo reale.