10ドルのチップで動く1億8000万パラメータのLLM
p-for-llmという新しいプロジェクトが、驚くべきことを成し遂げています。これはESP32-P4マイクロコントローラー上で、1億8090万パラメータのモデルを動作させます。このチップの価格は6ドルから10ドルの間です。
小型チップを用いたAIプロジェクトの多くは、単純なタスクに焦点を当てています。短い物語を書くモデルなどを披露するものですが、それらのモデルはパラメータ数が非常に少なく、実用性に欠けることが多々あります。
p-for-llmは違います。このプロジェクトは「有用性」を目指しています。
仕組みは以下の通りです:
- Mixture-of-Experts (MoE) アーキテクチャを採用しています。
- 各トークンに対して、ルーターが29個のエキスパートの中から1つを選択します。
- 残りの28個のエキスパートは使用されません。
- これにより、高い知識量を維持しつつ、計算リソースを節約できます。
- モデルを限られたメモリに収めるため、ternary weights(三値重み)を使用しています。
- モデルは約毎秒9トークンを生成します。
学習プロセスも注目に値します。開発者は、単一のコンシューマー向けグラフィックスカードであるRTX 5060 Tiを使用しました。巨大な研究所も膨大な予算もありません。あるのは、ミドルレンジのGPUと忍耐強さを持った一人の人間だけです。
一つ知っておくべき注意点があります。このモデルはまだ完全な自律動作はしません。起動時にUSB経由で重みデータをボードに転送する必要があります。SDカードから読み込むスタンドアロンデバイスにはまだなっていません。
また、これはクラウドを使ったデモでもありません。計算はチップ上でローカルに行われます。これは、単にデータをサーバーにストリーミングするだけのプロジェクトとは一線を画す、大きな進歩です。
なぜこれが重要なのでしょうか?
小型モデルは通常、限界に突き当たります。愛嬌はあるかもしれませんが、指示に従うことはできません。p-for-llmはその壁を乗り越えようとしています。ChatMLプロンプトをサポートしており、ツール呼び出し(tool calling)の初期兆候も見せています。
このプロジェクトは、真の進歩はしばしば静かに起こるということを示しています。バイラルなプロジェクトがヘッドラインを追い求める一方で、真剣なビルダーたちは自らの限界や注釈を公開しているのです。
これらの数値を検証するため、私自身でこのハードウェアをテストする予定です。
オプションの学習コミュニティ: https://t.me/GyaanSetuAi
