Un nuovo benchmark di 20 modelli linguistici di grandi dimensioni (LLM) mostra che nessun singolo modello domina ogni tipo di carico di lavoro nel 2026. Instradare ogni compito a uno specialista può ridurre i costi e velocizzare la consegna. Lo studio ha confrontato Anthropic, OpenAI, Google, xAI, Meta e diversi laboratori cinesi, rilevando che scegliere il modello sbagliato spreca tempo e denaro.
Perché un singolo LLM non funziona più
Un anno fa, la maggior parte degli sviluppatori sceglieva un unico modello per tutto, dal codice alle risposte di ricerca. Il divario tra i modelli progettati per la programmazione, l'orchestrazione di strumenti, il ragionamento profondo e il puro rapporto costo-efficacia si è ampliato a tal punto che un approccio universale ora danneggia più di quanto aiuti.
Come è stato costruito il benchmark
Ho eseguito lo stesso set di attività su tutti i 20 modelli, ignorando le dichiarazioni di marketing dei fornitori e concentrandomi su dati indipendenti e riproducibili. Le attività sono state suddivise in quattro categorie:
- Coding e autonomia – generare codice di livello produzione, gestire loop agentici.
- Uso di strumenti e orchestrazione – chiamare API esterne, manipolare file, pilotare un computer.
- Ragionamento e scienza – risolvere problemi matematici, interpretare dati di ricerca.
- Valore – fornire una qualità accettabile al minor costo possibile.
La matrice risultante consente agli ingegneri di abbinare la natura di un compito alla forza di un modello, invece di affidarsi per impostazione predefinita al nome più pubblicizzato.
Quali modelli guidano ogni categoria
Coding e autonomia – Claude Opus 5 e Fable 5 hanno dominato costantemente la classifica, gestendo la generazione di codice complesso e i loop multi-step con il minor numero di tentativi. GPT-5.6 Sol si è posizionato subito dietro, offrendo un'alternativa solida quando i primi due non sono disponibili.
Uso di strumenti e orchestrazione – Muse Spark 1.1 di Meta si è dimostrato il più affidabile nell'invocare strumenti esterni, mentre Gemini 3.6 Flash ha eccelso in scenari di puro utilizzo del computer, come la manipolazione di fogli di calcolo e l'automazione dell'interfaccia utente (UI).
Ragionamento e scienza – GPT-5.6 Sol e Gemini 3.1 Pro sono stati le scelte principali per matematica e ricerca.
Massimo valore – I modelli cinesi open-weight — GLM-5.2 e DeepSeek V4 — hanno raggiunto una qualità di livello frontier a una frazione del prezzo per token delle offerte flagship. I team che possono tollerare un modesto calo nella rifinitura ottengono il miglior rapporto qualità-prezzo.
Leader open-weight – Kimi K3 è attualmente il modello rilasciato apertamente più forte. Llama 4 di Meta è rimasto indietro.
La conclusione: il modello più "intelligente" non è sempre il più economico o il più veloce per un determinato compito.
Strategia di routing per i sistemi di produzione
- Instrada, non standardizzare – Tratta la selezione del modello come una decisione dinamica, non come un'impostazione statica predefinita.
- Parti dal modello economico, scala in caso di errore – Inizia con il modello a costo più basso in grado di gestire il compito; se fallisce, passa a un modello di livello superiore.
- Separa il pianificatore dall'esecutore – Usa un modello di ragionamento forte (ad es. Opus 5) per scomporre un problema in passaggi, quindi affida i sotto-compiti ripetitivi a un esecutore più economico (ad es. Gemini Flash).
- Misura il successo, non solo l'uso dei token – Un modello economico che richiede tre tentativi può costare più di un modello costoso che indovina al primo colpo.
Cosa monitorare in seguito
Gli sviluppatori dovrebbero considerare la mappa di routing come un documento in continua evoluzione e rivedere le scelte dei modelli a ogni rilascio importante.
Conclusione
Nel 2026, il vantaggio competitivo spetta ai team che trattano gli LLM come una cassetta degli attrezzi piuttosto che come un singolo coltellino svizzero. Abbinando i compiti al modello che eccelle in essi, le organizzazioni riducono le spese per l'IA e ottengono risultati più velocemente. La vera vittoria non è un nuovo modello di punta; è una strategia di routing disciplinata che colloca l'intelligenza giusta dove conta di più.
