Поза межами трансформерів: стартапи, що переосмислюють наступну еру LLM
Ера трансформерів стикається з фундаментальним вузьким місцем, оскільки обчислювальні потреби великих мовних моделей (LLM) досягають критичної межі. Хоча стаття 2017 року «Attention Is All You Need» заклала основу для сучасного буму ШІ, нове покоління стартапів зараз змагається за те, щоб замінити або переосмислити основну архітектуру для досягнення справжньої ефективності.
Вузьке місце трансформерів: чому щільна увага (dense attention) не справляється
Майже десятиліття трансформер залишався двигуном індустрії ШІ завдяки механізму, відомому як «щільна увага» (dense attention). Цей процес порівнює кожен токен у блоці тексту з кожним іншим токеном за допомогою масштабного множення. Хоча цей метод надзвичайно точно вловлює семантичне значення, його математична складність зростає неефективно.
Наприклад, документ на 10 000 слів може вимагати від трансформера виконання приблизно 50 мільйонів операцій множення. Таке квадратичне зростання обчислень призводить до двох величезних проблем: стрімкого зростання споживання енергії та обмежених вікон контексту. Оскільки, за повідомленнями, OpenAI планує витратити 50 мільярдів доларів на обчислення цього року, а попит на електроенергію для центрів обробки даних, як очікується, подвоїться до 2030 року, індустрія впирається в стіну як з точки зору вартості, так і з точки зору фізики.
Переосмислення уваги: розквіт розріджених механізмів (sparse mechanisms)
Щоб вирішити кризу ефективності, кілька стартапів намагаються відійти від щільної уваги до «розрідженої уваги» (sparse attention). Замість того, щоб обчислювати всі можливі пари слів, розріджена увага зосереджується лише на найбільш релевантних зв'язках, значно знижуючи обчислювальне навантаження.
Стартап Subquadratic із Маямі є лідером у цій галузі зі своєю моделлю SubQ. На відміну від попередніх розріджених механізмів, які мали труднощі з підтримкою точності, Subquadratic стверджує, що їхня технологія конкурує з основними LLM у спеціалізованих завданнях, таких як програмування та пошук. Їхній підхід передбачає динамічну систему, яка «на льоту» визначає, які саме слова є важливими для конкретного тексту, замість того, щоб витрачати ресурси на нерелевантні токени.
Power Retention: перехід до ковзних резюме (rolling summaries)
Інший підхід полягає в повному відмові від механізму уваги. Базований у Сан-Франциско стартап Manifest AI впроваджує техніку під назвою «power retention». У той час як моделі розрідженої уваги, такі як SubQ, все ще намагаються зберегти загальну картину всього вікна контексту, power retention працює шляхом надання моделі ковзного резюме (rolling summary) її пам'яті.
Коли нова інформація надходить у вікно контексту, модель ідентифікує та видаляє менш релевантні дані, забезпечуючи кероване обчислювальне навантаження незалежно від розміру вхідних даних. Manifest AI вже продемонстрував життєздатність цього підходу, виконуючи наступне:
- Перетворення моделі з відкритим кодом StarCoder на PowerCoder за допомогою power retention.
- Випуск Brumby — моделі, яка, за їхніми словами, конкурує з популярними моделями з відкритим кодом Qwen від Alibaba.
Здатність адаптувати існуючі моделі трансформерів до моделей power retention з мінімальним перенавчанням свідчить про те, що перехід до «LLMs+» — наступного покоління моделей — може відбутися набагато швидше, ніж очікувалося.
Основні висновки
- Обмеження трансформерів: Квадратичне масштабування щільної уваги робить поточні LLM неймовірно дорогими в експлуатації та важкими для масштабування під масивні набори даних або тривалі логічні міркування.
- Розрідженість проти збереження: Стартапи атакують проблему з двох боків: Subquadratic оптимізує увагу через розріджені обчислення (SubQ), тоді як Manifest AI замінює її ковзними резюме (Power Retention).
- Економічний імператив: Оскільки витрати на обчислення ШІ сягають десятків мільярдів доларів, переможцем наступної ери ШІ, ймовірно, стане той, хто вирішить питання ефективності, а не просто масштабу.
