Alibaba’s Qwen2.5-Max e DeepSeek’s V3-Flash sono arrivati sul mercato questa settimana, ognuno seguendo una strada diversa per rendere l'inferenza AI più economica. Alibaba attiva solo circa 95 miliardi di parametri per query con il suo design mixture-of-experts (MoE) da 2,4 trilioni di parametri; DeepSeek snellisce l'architettura per tagliare il prezzo per token. La corsa agli armamenti dell'IA si misura ora in dollari per token, non solo in dimensioni del modello.

Da “Più Parametri” a “Meno Costi”

Per anni, la metrica principale nello sviluppo dei modelli linguistici di grandi dimensioni (LLM) è stata il numero di parametri. OpenAI, Google e altri si sono vantati di aver superato la barriera dei trilioni di parametri, presupponendo che "più grande" significasse "più intelligente". Alibaba e DeepSeek dimostrano che il calcolo è cambiato.

Qwen2.5-Max di Alibaba punta ancora sulla scala, ma aggiunge un trucco per il risparmio sui costi. In un modello denso, ogni parametro viene eseguito durante ogni inferenza, trasformando una rete da 2,4 trilioni di parametri in un mostro vorace di energia. Il sistema MoE suddivide la rete in molti "esperti" e indirizza ogni richiesta a un sottoinsieme. Il router di Qwen2.5-Max seleziona circa 95 miliardi di parametri per ogni prompt, offrendo la potenza di ragionamento di un sistema da un trilione di parametri pur mantenendo sotto controllo latenza ed energia.

DeepSeek rinuncia completamente all'ambizione dei trilioni di parametri. Il suo modello V3-Flash è progettato per funzionare in modo economico, veloce e su larga scala. L'azienda commercializza il modello puntando su "prezzi di inferenza ultra-bassi", rivolgendosi a sviluppatori che elaborano milioni di token al giorno senza prosciugare il budget. Il prezzo esatto non è stato rivelato, ma il messaggio è chiaro: se una startup non può permettersi le tariffe per token occidentali, V3-Flash diventa un'alternativa valida.

Perché il costo dell'inferenza sta diventando un vantaggio competitivo

Il costo dell'inferenza diventa cruciale quando i modelli escono dal laboratorio ed entrano in produzione. Le aziende che integrano gli LLM in chatbot, pipeline di analisi documentale o motori di raccomandazione scoprono rapidamente che la tariffazione a livello di token domina le spese operative. Un modello che costa la metà per token può raddoppiare il budget per altre iniziative: più dati, traffico più elevato o funzionalità extra.

Le due aziende cinesi si rivolgono a segmenti di mercato differenti. Il sistema MoE di Alibaba promette prestazioni elevate per compiti complessi e basati sul ragionamento, mantenendo al contempo un budget di calcolo per richiesta modesto. Nel frattempo, il modello più snello di DeepSeek attira carichi di lavoro ad alto volume e sensibili alla latenza, dove la potenza bruta conta meno di un costo prevedibile.

Entrambe le strategie potrebbero erodere la quota di mercato dei fornitori occidentali che accoppiano modelli di grandi dimensioni a prezzi premium. Se gli sviluppatori ottengono risultati comparabili con un prezzo per token più basso, l'incentivo a rimanere legati ad API costose si indebolisce.

Le sfide per l'ecosistema globale dell'IA

  • Startup e PMI: I costi di inferenza più bassi abbassano la barriera d'ingresso per i prodotti basati sull'IA. I team che un tempo necessitavano di capitale extra per le fatture delle API possono ora prototipare e lanciare prodotti con budget più ristretti.
  • Imprese: Le grandi corporazioni che gestiscono servizi di IA interni possono ridurre le spese operative, liberando fondi per l'acquisizione di dati, il fine-tuning dei modelli o ulteriore potenza di calcolo.
  • Fornitori occidentali: I loro modelli di ricavo si basano su addebiti per token. Uno spostamento verso alternative focalizzate sui costi li costringe ad abbassare i prezzi o a differenziarsi con capacità che i modelli più economici non possono ancora eguagliare.
  • Regolatori e decisori politici: Un'IA più accessibile potrebbe accelerare l'adozione in vari settori, sollevando questioni sulla supervisione, la privacy dei dati e il ritmo dell'automazione.

Compromessi e controargomentazioni

I modelli MoE come Qwen2.5-Max non sono una soluzione senza costi. La logica di routing aggiunge complessità ingegneristica e l'attivazione sparsa può produrre prestazioni non uniformi tra i diversi tipi di query. Se il router sbaglia, una richiesta potrebbe coinvolgere esperti sub-ottimali, degradando la qualità dell'output. Inoltre, l'hardware favorisce ancora il calcolo denso; gli acceleratori specializzati per l'inferenza MoE non sono ancora diffusi, il che potrebbe limitare i guadagni di efficienza nel mondo reale.

Anche la filosofia di DeepSeek, orientata prima al costo, comporta dei rischi. Prezzi aggressivi spesso significano vincoli più stretti sulla dimensione del modello e sui dati di addestramento, limitando potenzialmente le prestazioni. Per le applicazioni che richiedono un ragionamento sfumato, il modello più economico potrebbe non essere all'altezza, spingendo gli utenti verso alternative più grandi e costose.

Infine, l'"intelligenza per dollaro" è solo un asse della competizione. Latenza, affidabilità, supporto dell'ecosistema e conformità alle normative regionali rimangono fattori decisivi. Le aziende che offriranno un pacchetto equilibrato in tutte queste dimensioni probabilmente domineranno il mercato, non solo quelle che vinceranno la guerra dei prezzi.

Cosa osservare in seguito

  • Pubblicazione di benchmark: Valutazioni indipendenti sull'efficienza del routing MoE di Qwen2.5-Max e sul costo per token di V3-Flash riveleranno se l'entusiasmo si tradurrà in risparmi misurabili.
  • Sviluppi hardware: L'adozione di acceleratori ottimizzati per l'attivazione sparsa potrebbe amplificare i vantaggi del MoE, mentre le GPU di uso generale potrebbero mantenere competitivi i modelli densi.
  • Risposte dei prezzi: I fornitori occidentali potrebbero regolare i propri livelli di offerta o aggiungere funzionalità di risparmio sui costi, come sconti sull'inferenza batch o licenze on-premise.
  • Misure normative: Con la diffusione di un'IA più economica, i governi potrebbero introdurre standard di trasparenza e sicurezza che potrebbero influenzare il modo in cui questi modelli vengono implementati su larga scala.

In sintesi

Il modello Qwen2.5-Max di Alibaba basato su MoE e il low-cost V3-Flash di DeepSeek dimostrano che la corsa all'IA si gioca ora tanto su un foglio di calcolo del budget quanto sul numero di parametri. Le aziende che offrono capacità linguistiche sofisticate mantenendo basso il costo per token renderanno l'IA accessibile a un pubblico più vasto, rimodellando le dinamiche competitive che per lungo tempo hanno favorito i modelli più grandi e costosi.