Anthropic presenta Claude Opus 5: prestazioni d'élite a metà prezzo
Anthropic ha lanciato ufficialmente Claude Opus 5, un nuovo modello flagship progettato per scuotere il mercato degli LLM di fascia alta, offrendo prestazioni quasi paritarie al premium Claude Fable 5 a un prezzo significativamente inferiore. Questa mossa strategica mira a neutralizzare la pressione sui prezzi dei concorrenti come GPT-5.6 Sol, fornendo al contempo agli sviluppatori uno strumento più efficiente per la programmazione e il lavoro cognitivo complesso.
Scuotere la frontiera del rapporto prezzo-prestazioni
La caratteristica più sorprendente di Claude Opus 5 è la sua aggressiva struttura di prezzi. Mentre il modello di fascia alta Claude Fable 5 costa 10 $ per un milione di token in ingresso e 50 $ per un milione di token in uscita, Opus 5 dimezza queste tariffe, con prezzi di 5 $ per un milione di token in ingresso e 25 $ per un milione di token in uscita.
Per soddisfare le esigenze di latenza, Anthropic ha introdotto anche una "Fast Mode", che aumenta la velocità di elaborazione di 2,5 volte, sebbene ciò comporti il raddoppio del prezzo dei token. Questa struttura di prezzi a livelli, combinata con una massiccia finestra di contesto da 1 milione di token, posiziona Opus 5 come il nuovo modello predefinito per Claude Max e l'opzione più capace per gli utenti di Claude Pro.
Supremazia nei benchmark di programmazione e ragionamento
Opus 5 non è una semplice alternativa economica; è una potenza in termini di prestazioni in domini specifici. Nella programmazione terminale agentica tramite Frontier-Bench v0.1, Opus 5 ha raggiunto un punteggio del 43,3%, superando significativamente sia Fable 5 (33,7%) che GPT-5.6 Sol (34,4%). Ha inoltre dimostrato la sua superiorità nel lavoro cognitivo, guidando il benchmark GDPval-AA v2 con un punteggio Elo di 1.861.
Forse la statistica più sbalorditiva proviene dal benchmark ARC-AGI-3, che misura la capacità di risolvere problemi nuovi. Opus 5 ha ottenuto un punteggio del 30,2%, quasi quadruplicando il 7,8% raggiunto da GPT-5.6 Sol. Ciò suggerisce un salto enorme nella capacità del modello di gestire compiti che esulano dai pattern dei suoi dati di addestramento.
Scalabilità intelligente dell'impegno ed efficienza
Anthropic ha introdotto un sofisticato sistema di "effort" (impegno), che consente agli utenti di passare tra cinque impostazioni: low, medium, high, xhigh e max. Ciò consente un compromesso granulare tra il consumo di token e la profondità del ragionamento.
Mentre Anthropic raccomanda le impostazioni "low" e "medium" per i compiti generali al fine di ottimizzare i costi, consiglia di utilizzare "xhigh" per la programmazione agentica complessa. Curiosamente, l'azienda ha notato un rendimento decrescente con l'impostazione "max"; sia su Frontier-Bench v0.1 che sull'Artificial Analysis Coding Agent Index, Opus 5 ha registrato un leggero calo delle prestazioni con l'impegno massimo nonostante il costo più elevato, suggerendo che l'impostazione "xhigh" possa essere l'attuale punto di equilibrio ottimale per l'efficienza.
Sicurezza e autonomia migliorate
In risposta diretta ai feedback degli utenti, Anthropic ha perfezionato i classificatori di sicurezza per Opus 5. I filtri cyber del modello si attivano circa l'85% in meno rispetto a quelli di Fable 5, rispondendo alle critiche precedenti riguardanti il blocco eccessivo di ricerche legittime. Sebbene impedisca ancora la generazione di exploit e la scansione basata su binari, è molto più permissivo per la ricerca sulle vulnerabilità del codice sorgente.
Inoltre, Opus 5 mostra capacità di autocorrezione potenziate. Nei test nel mondo reale, il modello ha costruito con successo un modello 3D in FreeCAD scrivendo la propria pipeline di computer vision per interpretare la geometria, un compito che ha messo in difficoltà tutti gli altri modelli concorrenti.
Punti chiave
- Riduzione drastica dei costi: Opus 5 offre prestazioni di livello flagship al 50% del costo dei token di Claude Fable 5.
- Svolta nel ragionamento: Il modello ha mostrato un enorme vantaggio di 4 volte rispetto ai concorrenti nel benchmark ARC-AGI-3 per la risoluzione di problemi nuovi.
- Workflow degli sviluppatori ottimizzato: Grazie ai classificatori di sicurezza migliorati e alle impostazioni di "effort" specializzate, Opus 5 offre un'esperienza più fluida per la programmazione agentica e la ricerca.
