Kimi K3 si è esaurito mentre GPT-5.6-SOL ha tagliato il traguardo su tre prompt impegnativi: un problema di probabilità, uno scenario di inerzia di una carrucola e uno script Python intricato per un problema di zaino. Il divario mostra perché la gestione del budget di token e la latenza siano fondamentali quando si ha bisogno di un modello in grado di ragionare attraverso matematica, fisica e codice multi-step senza bloccarsi.

Perché il benchmark è importante

Sviluppatori e ricercatori spesso scelgono un LLM basandosi sui punteggi pubblicizzati, non su come si comporta sotto pressione nel mondo reale. In questo test comparativo, ogni modello ha affrontato un problema che richiede una lunga catena di ragionamento. GPT-5.6-SOL ha fornito risposte complete e corrette in tutti e tre i domini; Kimi K3 ha esaurito il suo budget di token o è andato in timeout prima di produrre qualsiasi cosa di utilizzabile.

Configurazione del test

  • Matematica – una domanda di probabilità che richiedeva il calcolo della probabilità di sovrapposizione di un pattern e sia il valore atteso che la varianza (secondi momenti).
  • Fisica – modellazione dell'inerzia di una carrucola e della perdita di energia quando un cavo in tensione elastica si allenta.
  • Programmazione – scrittura di una soluzione Python per un problema di riempimento di uno zaino con dipendenze complesse e regole di spareggio, verificando poi l'output rispetto a sei casi di test indipendenti.

Cosa dicono i numeri

GPT-5.6-SOL

  • Matematica – ha prodotto una soluzione completa e corretta con il valore atteso e la varianza chiaramente esposti.
  • Fisica – ha costruito correttamente il modello di inerzia e ha tenuto conto della perdita di energia, corrispondendo alla risposta analitica.
  • Programmazione – ha generato codice che è stato compilato, eseguito e ha superato tutti i sei controlli esterni. Un'asserzione di test interna era errata, ricordandoci che i test generati dai modelli non sono infallibili.

Kimi K3

  • Matematica – ha raggiunto il limite di token (prima a 6.500 token, poi a 10.000) e si è fermato senza mostrare alcuna risposta.
  • Fisica – ha esaurito i token prima che apparisse qualsiasi output visibile.
  • Programmazione – è andato in timeout dopo 245 secondi, senza fornire nulla da valutare.

Efficienza del ragionamento vs potenza pura

L'implicazione è chiara per chiunque stia costruendo pipeline di produzione: un modello che consuma token senza fornire output può bloccare i processi a valle, aumentare i costi e frustrare gli utenti.

Affidabilità e il costo nascosto del codice "perfetto"

Anche il modello vincitore ha commesso un errore: il caso di test generato autonomamente da GPT-5.6-SOL conteneva un'asserzione errata. Questo dimostra che la validazione prodotta dal modello non è un sostituto della revisione umana. Quando un modello scrive codice, è comunque necessario eseguire controlli indipendenti.

Cosa monitorare in futuro

  • Monitoraggio del motivo di fine (finish reason) – registrare se una risposta termina perché raggiunge il limite di token, un timeout o una fine naturale.
  • Conteggio dei token di ragionamento – confrontare quanti token ogni modello spende per la deliberazione interna rispetto all'output finale.
  • Monitoraggio della latenza – misurare il tempo effettivo per ogni passaggio; un modello che impiega minuti per query potrebbe non essere adatto ad applicazioni interattive.

Gli sviluppatori dovrebbero trattare queste metriche come segnali prioritari, non solo come la risposta finale.

In sintesi

GPT-5.6-SOL supera Kimi K3 in completezza. Il test ci ricorda anche che anche un modello che "indovina" può comunque produrre controlli interni errati, quindi la supervisione umana rimane essenziale. Monitorare i motivi di fine, l'uso dei token e la latenza ti aiuterà a scegliere lo strumento giusto per il lavoro senza rimanere intrappolato in un timeout silenzioso.