За пределами трансформеров: стартапы, переосмысляющие следующую эру LLM
Эпоха трансформеров сталкивается с фундаментальным «узким местом», так как вычислительные потребности больших языковых моделей (LLM) достигают критической точки. Хотя статья 2017 года «Attention Is All You Need» заложила основу нынешнего бума ИИ, новое поколение стартапов сейчас стремится заменить или переосмыслить базовую архитектуру, чтобы достичь истинной эффективности.
Узкое место трансформеров: почему плотное внимание (dense attention) не справляется
На протяжении почти десятилетия трансформер был двигателем индустрии ИИ, работающим на механизме, известном как «плотное внимание» (dense attention). Этот процесс сравнивает каждый токен в блоке текста с каждым другим токеном с помощью масштабного умножения. Несмотря на невероятную точность в улавливании семантического смысла, математическая сложность масштабируется плохо.
Например, документ объемом 10 000 слов может потребовать от трансформера выполнения примерно 50 миллионов операций умножения. Такой квадратичный рост вычислений приводит к двум серьезным проблемам: стремительному росту энергопотребления и ограниченному окну контекста. По сообщениям, OpenAI планирует потратить 50 миллиардов долларов на вычисления в этом году, а спрос на электроэнергию для дата-центров, как ожидается, удвоится к 2030 году — индустрия упирается в барьер как стоимости, так и физики.
Переосмысление внимания: расцвет разреженных механизмов (sparse mechanisms)
Чтобы решить кризис эффективности, несколько стартапов пытаются отойти от плотного внимания в сторону «разреженного внимания» (sparse attention). Вместо того чтобы вычислять все возможные пары слов, разреженное внимание фокусируется только на наиболее релевантных связях, значительно снижая вычислительную нагрузку.
Базирующийся в Майами стартап Subquadratic является лидером в этой области со своей моделью SubQ. В отличие от предыдущих разреженных механизмов, которые с трудом поддерживали точность, Subquadratic утверждает, что их технология не уступает основным LLM в специализированных задачах, таких как программирование и поиск. Их подход включает динамическую систему, которая «на лету» определяет, какие слова действительно важны для данного фрагмента текста, вместо того чтобы тратить циклы на нерелевантные токены.
Power Retention: переход к скользящим резюме (rolling summaries)
Другой подход заключается в полном отказе от механизма внимания. Сан-Францисский стартап Manifest AI внедряет технику под названием «power retention». В то время как модели разреженного внимания, такие как SubQ, все еще пытаются сохранить общую картину всего окна контекста, power retention работает, предоставляя модели скользящее резюме (rolling summary) её памяти.
По мере поступления новой информации в окно контекста модель идентифицирует и отбрасывает менее важные данные, гарантируя, что вычислительная нагрузка остается управляемой независимо от размера входных данных. Manifest AI уже продемонстрировала жизнеспособность этого подхода, выполнив следующее:
- Преобразовав модель с открытым исходным кодом StarCoder в PowerCoder с помощью технологии power retention.
- Выпустив Brumby — модель, которая, по их утверждению, конкурирует с популярными моделями с открытым исходным кодом Qwen от Alibaba.
Способность адаптировать существующие модели трансформеров в модели с power retention с минимальным переобучением позволяет предположить, что переход к «LLMs+» — следующему поколению моделей — может произойти гораздо быстрее, чем ожидалось.
Основные выводы
- Предел трансформеров: Квадратичное масштабирование плотного внимания делает текущие LLM невероятно дорогими в эксплуатации и затрудняет их масштабирование для огромных наборов данных или длинных логических рассуждений.
- Разреженность против удержания: Стартапы атакуют проблему с двух сторон: Subquadratic оптимизирует внимание с помощью разреженных вычислений (SubQ), в то время как Manifest AI заменяет его скользящими резюме (Power Retention).
- Экономический императив: Поскольку затраты на вычисления ИИ достигают десятков миллиардов долларов, победителем следующей эры ИИ, скорее всего, станет тот, кто решит вопрос эффективности, а не простого масштабирования.
