Oltre i Transformer: le startup che stanno ridefinendo la prossima era degli LLM

L'era dei transformer sta affrontando un collo di bottiglia fondamentale, poiché le richieste computazionali dei modelli linguistici di grandi dimensioni (LLM) stanno raggiungendo un punto critico. Sebbene il paper "Attention Is All You Need" del 2017 abbia gettato le basi per l'attuale boom dell'IA, una nuova generazione di startup sta correndo per sostituire o reinventare l'architettura principale al fine di raggiungere una vera efficienza.

Il collo di bottiglia dei Transformer: perché la dense attention sta fallendo

Per quasi un decennio, il transformer è stato il motore dell'industria dell'IA, alimentato da un meccanismo noto come "dense attention". Questo processo confronta ogni token in un blocco di testo con ogni altro token tramite moltiplicazioni su scala massiccia. Sebbene sia incredibilmente accurato nel catturare il significato semantico, la complessità matematica scala in modo inefficiente.

Ad esempio, un documento di 10.000 parole può richiedere a un transformer di eseguire circa 50 milioni di moltiplicazioni. Questa crescita quadratica del calcolo porta a due sfide enormi: un consumo energetico alle stelle e finestre di contesto limitate. Con OpenAI che, secondo le indiscrezioni, spenderà 50 miliardi di dollari in calcolo quest'anno e la domanda di elettricità per i data center che si prevede raddoppierà entro il 2030, il settore si sta scontrando con un muro fatto sia di costi che di leggi fisiche.

Ripensare l'attenzione: l'ascesa dei meccanismi sparse

Per risolvere la crisi dell'efficienza, diverse startup stanno cercando di passare dalla dense attention alla "sparse attention". Invece di calcolare ogni possibile coppia di parole, la sparse attention si concentra solo sulle connessioni più rilevanti, riducendo significativamente il carico computazionale.

La startup Subquadratic, con sede a Miami, è leader in questo settore con il suo modello SubQ. A differenza dei precedenti meccanismi sparse che faticavano a mantenere l'accuratezza, Subquadratic afferma che la sua tecnologia rivaleggia con i principali LLM in compiti specializzati come la programmazione e la ricerca. Il loro approccio prevede un sistema dinamico che identifica in tempo reale quali parole siano effettivamente importanti per un determinato testo, invece di sprecare cicli su token irrilevanti.

Power Retention: verso i riassunti progressivi

Un altro approccio prevede di abbandonare completamente il meccanismo di attenzione. Manifest AI, con sede a San Francisco, sta facendo da pioniere in una tecnica chiamata "power retention". Mentre i modelli di sparse attention come SubQ cercano ancora di mantenere un quadro approssimativo dell'intera finestra di contesto, la power retention funziona fornendo al modello un riassunto progressivo (rolling summary) della propria memoria.

Man mano che nuove informazioni entrano nella finestra di contesto, il modello identifica e scarta i dati meno rilevanti, garantendo che il carico computazionale rimanga gestibile indipendentemente dalla dimensione dell'input. Manifest AI ha già dimostrato la fattibilità di questo approccio:

  • Convertendo il modello open-source StarCoder in PowerCoder utilizzando la power retention.
  • Rilasciando Brumby, un modello che, secondo l'azienda, rivaleggia con i popolari modelli open-source Qwen di Alibaba.

La capacità di adattare i modelli transformer esistenti in modelli di power retention con un minimo di riaddestramento suggerisce che la transizione verso gli "LLM+" — la prossima generazione di modelli — potrebbe avvenire molto più velocemente di quanto previsto.

Punti chiave

  • Il limite dei Transformer: La scalabilità quadratica della dense attention rende gli attuali LLM incredibilmente costosi da eseguire e difficili da scalare per dataset massicci o ragionamenti a lungo termine.
  • Sparse vs. Retention: Le startup stanno affrontando il problema da due fronti: Subquadratic sta ottimizzando l'attenzione tramite calcoli sparsi (SubQ), mentre Manifest AI la sta sostituendo con riassunti progressivi (Power Retention).
  • Imperativo economico: Poiché i costi computazionali dell'IA raggiungono decine di miliardi di dollari, il vincitore della prossima era dell'IA sarà probabilmente colui che risolverà il problema dell'efficienza piuttosto che della semplice scala bruta.