1500億パラメータのMixture-of-Expertsモデルは、標準的な開発者用ノートPCでテキスト生成が可能です。実験の結果、パフォーマンスの真の制限要因はSSDの速度ではなく、RAMであることが明らかになりました。これは、クラウドコンピューティングに費用をかけずとも、最先端規模のモデルをローカル環境でテストできることを証明しています。

テスト内容

REAPで枝刈りされた150BパラメータのMoEであるDeepSeek V4 Flashモデルを、オープンソースのColibrì推論エンジンで実行しました。使用したハードウェアは、61GBのRAMと1TBのNVMe SSDを搭載したAMD Ryzen AI 9 365ノートPCです。3分間の生成実行時間を計測し、すべてのディスクアクセスを記録しました。

数値が示すこと

  • ディスクアクティビティは最小限でした。 3分間の生成中、SSDの読み取り時間は11秒未満でした。たとえドライブが瞬時にデータを読み取れたとしても、全体の処理能力(スループット)はわずか6%程度しか向上しません。
  • RAMのサイズが速度に直接影響しました。 RAMキャッシュを半分にすると、スループットは約15%低下しました。CPUは、ディスクの待機時間と同じくらい多くの時間を、キャッシュミスへの対応(デクオンタイズ、コピー、データ管理)に費やしていました。

これらの数値は、ノートPCにおける大規模モデルの推論において、ストレージの帯域幅が主要なボトルネックであるという一般的な認識を覆すものです。

なぜSSDよりもRAMが重要なのか

モデルのパラメータがRAM上に存在しない場合、システムは以下の手順を踏む必要があります:

  1. SSDからデータを読み出す。
  2. データをデコードし、計算のためにCPUレジスタに移動する。

どちらのステップもサイクルを消費します。最初のステップはSSDの帯域幅によって制限されますが、2番目のステップでは、データの到着速度に関わらずCPUがデータをデクオンタイズする必要があるため、ほぼ同等の遅延が発生します。したがって、SSDを高速化しても収益は逓減しますが、RAMを増設すればより多くのモデルデータをメモリ上に保持でき、コストのかかるデータの往復を排除できます。

開発者への示唆

  • ストレージではなくメモリに投資する。
  • ローカルテストが現実的になる。 開発者は既存の端末でオープンウェイトのMoEモデルを実行し、クラウドクレジットを支払うことなく、スタイル、ツール呼び出し(tool-calling)の挙動、および出力の品質を確認できます。
  • バッチ評価が可能になる。 リアルタイムのチャットは依然として鈍く感じられるかもしれませんが、研究用に数十のプロンプトを生成するといったキュー待ちのジョブは、ノートPCで快適に実行できます。

想定される反論

新しいエキスパートの重みを繰り返しロードするワークロードにおいては、SSDのレイテンシが依然として重要であるという意見もあるかもしれません。

今後の注目点

  • メモリ効率の高いモデルのバリエーション。
  • より大きなオンチップキャッシュを搭載したハードウェア。
  • ソフトウェアレベルのキャッシング戦略。

結論は明確です。ノートPCで大規模なMoEモデルを試したい開発者は、RAMを増設すべきです。SSDのアップグレードによる改善は数パーセントに過ぎませんが、メモリの増設は推論時間を2桁のパーセンテージで短縮できる可能性があります。これにより、AIプロトタイピングのコスト計算が変わり、以前は専用のクラウドクラスターが必要だと考えられていたモデルの、ローカルかつコストのかからないテストへの道が開かれます。