Transformerを超えて:LLMの次世代を再定義するスタートアップたち
Transformerの時代は、大規模言語モデル(LLM)の計算需要が限界に達しつつある中で、根本的なボトルネックに直面しています。2017年の論文「Attention Is All You Need」が現行のAIブームの礎を築きましたが、現在は真の効率性を実現するために、コアアーキテクチャを置き換える、あるいは再発明しようとする新世代のスタートアップがしのぎを削っています。
Transformerのボトルネック:なぜ高密度アテンションは限界を迎えているのか
約10年間にわたり、Transformerは「高密度アテンション(dense attention)」と呼ばれるメカニズムによって、AI業界のエンジンとしての役割を果たしてきました。このプロセスでは、テキストブロック内のすべてのトークンを、大規模な乗算を通じて他のすべてのトークンと比較します。意味的な内容を捉える能力は非常に高いものの、数学的な複雑さが課題となります。
例えば、1万語の文書を処理する場合、Transformerは約5,000万回の乗算を行う必要があります。この計算量の二次関数的な増加は、2つの大きな課題を引き起こします。それは、急増するエネルギー消費と、限られたコンテキストウィンドウです。OpenAIが今年、計算に500億ドルを投じると報じられており、データセンターの電力需要は2030年までに倍増すると予想されている中で、業界はコストと物理学の両面における壁に突き当たっています。
アテンションの再考:「疎なメカニズム」の台頭
効率性の危機を解決するため、いくつかのスタートアップが「高密度アテンション」から「疎なアテンション(sparse attention)」への移行を試みています。疎なアテンションは、考えられるすべての単語の組み合わせを計算する代わりに、最も関連性の高い接続のみに焦点を当てることで、計算負荷を大幅に軽減します。
マイアミを拠点とするスタートアップ Subquadratic は、SubQ モデルを携えてこの分野をリードしています。精度を維持することに苦労した従来の疎なメカニズムとは異なり、Subquadraticは、コーディングや検索などの専門的なタスクにおいて、主流のLLMに匹敵する技術であると主張しています。彼らのアプローチは、無関係なトークンに計算資源を浪費するのではなく、与えられたテキストにおいて実際に重要となる単語を動的に特定するシステムを採用しています。
パワー・リテンション:ローリング・サマリーへの移行
もう一つのアプローチは、アテンション・メカニズムから完全に脱却することです。サンフランシスコを拠点とする Manifest AI は、「パワー・リテンション(power retention)」と呼ばれる手法を先駆けています。SubQのような疎なアテンション・モデルは、依然としてコンテキストウィンドウ全体の概略を保持しようとしますが、パワー・リテンションは、モデルにメモリの「ローリング・サマリー(逐次的な要約)」を提供することで機能します。
新しい情報がコンテキストウィンドウに入ると、モデルは関連性の低いデータを特定して破棄し、入力サイズに関わらず計算負荷を管理可能な状態に保ちます。Manifest AIは、以下の方法ですでにこのアプローチの実現可能性を証明しています。
- パワー・リテンションを用いて、オープンソースの StarCoder モデルを PowerCoder に変換。
- Alibabaの人気あるオープンソースモデルである Qwen に匹敵すると主張するモデル Brumby をリリース。
既存のTransformerモデルを最小限の再学習でパワー・リテンション・モデルへと適応できる能力は、次世代モデルである「LLMs+」への移行が、予想よりもはるかに早く起こる可能性を示唆しています。
主なポイント
- Transformerの限界: 高密度アテンションの二次関数的なスケーリングにより、現在のLLMは実行コストが極めて高く、大規模なデータセットや長文の推論への拡張が困難になっています。
- 疎なアテンション vs. リテンション: スタートアップは2つの側面からこの問題に取り組んでいます。Subquadraticは疎な計算(SubQ)を通じてアテンションを最適化しており、一方でManifest AIはそれをローリング・サマリー(Power Retention)に置き換えようとしています。
- 経済的必然性: AIの計算コストが数百億ドルに達する中、次のAI時代の勝者は、単なる規模の拡大ではなく、効率性の問題を解決した者になるでしょう。
