Poza Transformery: Startupy redefiniujące kolejną erę LLM
Era transformerów napotyka fundamentalne wąskie gardło, gdy zapotrzebowanie obliczeniowe dużych modeli językowych (LLM) osiąga punkt krytyczny. Choć publikacja „Attention Is All You Need” z 2017 roku położyła fundamenty pod obecny boom na AI, nowa generacja startupów bierze udział w wyścigu o zastąpienie lub wynalezienie na nowo rdzennej architektury, aby osiągnąć prawdziwą wydajność.
Wąskie gardło transformerów: Dlaczego gęsta uwaga (dense attention) zawodzi
Od niemal dekady transformer stanowi silnik branży AI, napędzany mechanizmem znanym jako „dense attention”. Proces ten porównuje każdy token w bloku tekstu z każdym innym tokenem poprzez mnożenie na masową skalę. Choć jest on niezwykle dokładny w uchwytywaniu znaczenia semantycznego, jego złożoność matematyczna słabo skaluje się wraz ze wzrostem danych.
Na przykład dokument liczący 10 000 słów może wymagać od transformera wykonania około 50 milionów mnożeń. Ten kwadratowy wzrost obliczeń prowadzi do dwóch ogromnych wyzwań: gwałtownego wzrostu zużycia energii oraz ograniczonych okien kontekstowych. Przy doniesieniach, że OpenAI zamierza wydać w tym roku 50 miliardów dolarów na moc obliczeniową, a zapotrzebowanie centrów danych na energię elektryczną ma się podwoić do 2030 roku, branża uderza w ścianę kosztów i praw fizyki.
Nowe podejście do uwagi: Rozkwit mechanizmów rzadkich (sparse mechanisms)
Aby rozwiązać kryzys wydajności, kilka startupów próbuje odejść od gęstej uwagi na rzecz „sparse attention” (uwagi rzadkiej). Zamiast obliczać każde możliwe połączenie słów, uwaga rzadka skupia się jedynie na najbardziej istotnych relacjach, co znacząco zmniejsza obciążenie obliczeniowe.
Startup Subquadratic z siedzibą w Miami jest liderem w tej dziedzinie dzięki swojemu modelowi SubQ. W przeciwieństwie do wcześniejszych mechanizmów rzadkich, które miały trudności z zachowaniem dokładności, Subquadratic twierdzi, że ich technologia dorównuje głównym modelom LLM w specjalistycznych zadaniach, takich jak programowanie i wyszukiwanie. Ich podejście opiera się na dynamicznym systemie, który „w locie” identyfikuje, które słowa są faktycznie istotne dla danego fragmentu tekstu, zamiast marnować cykle procesora na nieistotne tokeny.
Power Retention: Kierunek ku podsumowaniom kroczącym (rolling summaries)
Inne podejście polega na całkowitym odejściu od mechanizmu uwagi. Firma Manifest AI z San Francisco pioniersko rozwija technikę zwaną „power retention”. Podczas gdy modele rzadkiej uwagi, takie jak SubQ, wciąż starają się zachować ogólny obraz całego okna kontekstowego, power retention działa poprzez dostarczanie modelowi „kroczącego” podsumowania jego pamięci.
W miarę wprowadzania nowych informacji do okna kontekstowego, model identyfikuje i odrzuca mniej istotne dane, zapewniając, że obciążenie obliczeniowe pozostaje na zarządzalnym poziomie, niezależnie od rozmiaru danych wejściowych. Manifest AI udowodniło już wykonalność tego podejścia poprzez:
- Konwersję modelu open-source StarCoder w PowerCoder przy użyciu techniki power retention.
- Wypuszczenie Brumby, modelu, który ich zdaniem dorównuje popularnym modelom open-source Qwen od firmy Alibaba.
Możliwość adaptacji istniejących modeli transformerowych do modeli typu power retention przy minimalnym dotrenowaniu sugeruje, że przejście do „LLMs+” — kolejnej generacji modeli — może nastąpić znacznie szybciej, niż przewidywano.
Kluczowe wnioski
- Limit transformerów: Kwadratowe skalowanie gęstej uwagi sprawia, że obecne modele LLM są niezwykle kosztowne w eksploatacji i trudne do skalowania dla ogromnych zbiorów danych lub długofalowego rozumowania.
- Sparse vs. Retention: Startupy atakują problem z dwóch stron: Subquadratic optymalizuje uwagę poprzez obliczenia rzadkie (SubQ), podczas gdy Manifest AI zastępuje ją podsumowaniami kroczącymi (Power Retention).
- Imperatyw ekonomiczny: W miarę jak koszty obliczeń AI sięgają dziesiątek miliardów dolarów, zwycięzcą kolejnej ery AI zostanie prawdopodobnie ten, kto rozwiąże problem wydajności, a nie tylko surowej skali.
