Voorbij Transformers: De startups die het volgende tijdperk van LLM's herdefiniëren
Het tijdperk van de transformer staat voor een fundamentele flessenhals nu de rekenkundige eisen van large language models (LLM's) een breekpunt bereiken. Hoewel het "Attention Is All You Need"-paper uit 2017 de basis legde voor de huidige AI-boom, strijden een nieuwe generatie startups nu om de kernarchitectuur te vervangen of opnieuw uit te vinden om echte efficiëntie te bereiken.
De Transformer-flessenhals: Waarom dense attention tekortschiet
Al bijna een decennium is de transformer de motor van de AI-industrie, aangedreven door een mechanisme dat bekend staat als "dense attention". Dit proces vergelijkt elk token in een tekstblok met elk ander token via vermenigvuldigingen op enorme schaal. Hoewel het ongelooflijk nauwkeurig is in het vastleggen van de semantische betekenis, schaalt de wiskundige complexiteit slecht.
Een document van bijvoorbeeld 10.000 woorden kan van een transformer vereisen dat deze ongeveer 50 miljoen vermenigvuldigingen uitvoert. Deze kwadratische groei in rekenkracht leidt tot twee enorme uitdagingen: een explosief stijgend energieverbruik en beperkte context windows. Nu OpenAI naar verluidt dit jaar 50 miljard dollar aan rekenkracht gaat uitgeven en de elektriciteitsvraag van datacenters tegen 2030 naar verwachting zal verdubbelen, loopt de industrie tegen een muur van zowel kosten als natuurkunde aan.
Attention heroverwegen: De opkomst van sparse mechanisms
Om de efficiëntiecrisis op te lossen, proberen verschillende startups af te stappen van dense attention ten gunste van "sparse attention". In plaats van elke mogelijke woordcombinatie te berekenen, richt sparse attention zich alleen op de meest relevante verbindingen, wat de rekenlast aanzienlijk vermindert.
De in Miami gevestigde startup Subquadratic is een leider in dit veld met zijn SubQ-model. In tegenstelling tot eerdere sparse mechanisms die moeite hadden om de nauwkeurigheid te behouden, beweert Subquadratic dat hun technologie wedijvert met mainstream LLM's in gespecialiseerde taken zoals coderen en zoeken. Hun aanpak omvat een dynamisch systeem dat ter plekke identificeert welke woorden er echt toe doen voor een gegeven tekst, in plaats van rekenkracht te verspillen aan irrelevante tokens.
Power Retention: De beweging naar rolling summaries
Een andere aanpak is om volledig af te stappen van het attention-mechanisme. De in San Francisco gevestigde Manifest AI is een pionier in een techniek genaamd "power retention". Waar sparse attention-modellen zoals SubQ nog steeds proberen een ruw beeld van het volledige context window te behouden, werkt power retention door het model een 'rolling summary' van zijn geheugen te geven.
Naarmate nieuwe informatie het context window binnenkomt, identificeert het model minder relevante gegevens en laat deze vallen, waardoor de rekenlast beheersbaar blijft, ongeacht de invoergrootte. Manifest AI heeft de haalbaarheid van deze aanpak al aangetoond door:
- Het open-source StarCoder-model om te zetten in PowerCoder met behulp van power retention.
- Het uitbrengen van Brumby, een model dat naar eigen zeggen wedijvert met de populaire open-source Qwen-modellen van Alibaba.
Het vermogen om bestaande transformer-modellen met minimale hertraining aan te passen naar power retention-modellen suggereert dat de overgang naar "LLM's+" — de volgende generatie modellen — veel sneller zou kunnen gaan dan verwacht.
Belangrijkste conclusies
- De Transformer-limiet: De kwadratische schaling van dense attention maakt huidige LLM's extreem duur in gebruik en moeilijk schaalbaar voor enorme datasets of langdurige redeneringen.
- Sparse vs. Retention: Startups pakken het probleem van twee kanten aan: Subquadratic optimaliseert attention via sparse berekeningen (SubQ), terwijl Manifest AI dit vervangt door rolling summaries (Power Retention).
- Economische noodzaak: Nu de kosten voor AI-rekenkracht de tientallen miljarden dollars bereiken, zal de winnaar van het volgende AI-tijdperk waarschijnlijk degene zijn die efficiëntie oplost in plaats van alleen maar brute schaal.
