10ドルのチップで動く1億8000万パラメータのLLM

p-for-llmという新しいプロジェクトが、驚くべきことを成し遂げています。これはESP32-P4マイクロコントローラー上で、1億8090万パラメータのモデルを動作させます。このチップの価格は6ドルから10ドルの間です。

小型チップを用いたAIプロジェクトの多くは、単純なタスクに焦点を当てています。短い物語を書くモデルなどを披露するものですが、それらのモデルはパラメータ数が非常に少なく、実用性に欠けることが多々あります。

p-for-llmは違います。このプロジェクトは「有用性」を目指しています。

仕組みは以下の通りです:

  • Mixture-of-Experts (MoE) アーキテクチャを採用しています。
  • 各トークンに対して、ルーターが29個のエキスパートの中から1つを選択します。
  • 残りの28個のエキスパートは使用されません。
  • これにより、高い知識量を維持しつつ、計算リソースを節約できます。
  • モデルを限られたメモリに収めるため、ternary weights(三値重み)を使用しています。
  • モデルは約毎秒9トークンを生成します。

学習プロセスも注目に値します。開発者は、単一のコンシューマー向けグラフィックスカードであるRTX 5060 Tiを使用しました。巨大な研究所も膨大な予算もありません。あるのは、ミドルレンジのGPUと忍耐強さを持った一人の人間だけです。

一つ知っておくべき注意点があります。このモデルはまだ完全な自律動作はしません。起動時にUSB経由で重みデータをボードに転送する必要があります。SDカードから読み込むスタンドアロンデバイスにはまだなっていません。

また、これはクラウドを使ったデモでもありません。計算はチップ上でローカルに行われます。これは、単にデータをサーバーにストリーミングするだけのプロジェクトとは一線を画す、大きな進歩です。

なぜこれが重要なのでしょうか?

小型モデルは通常、限界に突き当たります。愛嬌はあるかもしれませんが、指示に従うことはできません。p-for-llmはその壁を乗り越えようとしています。ChatMLプロンプトをサポートしており、ツール呼び出し(tool calling)の初期兆候も見せています。

このプロジェクトは、真の進歩はしばしば静かに起こるということを示しています。バイラルなプロジェクトがヘッドラインを追い求める一方で、真剣なビルダーたちは自らの限界や注釈を公開しているのです。

これらの数値を検証するため、私自身でこのハードウェアをテストする予定です。

出典: https://dev.to/aiexplore369zoho/the-180m-parameter-llm-running-on-a-10-microcontroller-and-almost-nobody-noticed-4d3n

オプションの学習コミュニティ: https://t.me/GyaanSetuAi