AWSはAmazon SageMaker Inferenceに「prefix-aware routing」オプションを追加しました。これにより、独自のインフラストラクチャで大規模言語モデル(LLM)を実行する顧客に対し、キャッシュヒット率の向上と、顕著なレイテンシの低減を約束します。この変更は、レイテンシの低下とGPU計算コストの削減を実現するという点で非常に重要です。

なぜLLMのレイテンシが重要なのか

LLMがリクエストを受け取ると、通常、プロンプト全体に対してアテンション(attention)を再計算します。これは、トークンが追加されるたびに計算コストが増大する工程です。もしモデルが以前のリクエストのアテンション・キャッシュを再利用できれば、テキストの新しい部分だけを処理すれば済みます。同じシステムプロンプトを繰り返し送信したり、会話履歴を維持したりするワークロードは、キャッシュ再利用の主要な候補となります。

デフォルトのSageMakerの設定では、着信リクエストは推論インスタンスのプールにランダムに分散されます。ランダムな分散は、ウォームキャッシュ(warm cache)にヒットするはずのリクエストが、しばしばコールドインスタンス(cold instance)に割り当てられ、フル再計算を強制されることを意味します。その結果、レイテンシが高まり、余分なGPUサイクルが発生し、それが直接的なコスト増につながります。

prefix-aware routingの仕組み

新しいルーティングモードは、最近のリクエストのプレフィックス(呼び出し間で一定に保たれる傾向のあるプロンプトの最初の部分)の軽量なマップを保持します。新しいリクエストが到着すると、SageMakerはそのマップを確認し、同じプレフィックスをすでに処理したことのあるインスタンスにリクエストを転送します。そのインスタンスが関連するアテンション・キャッシュを保持していれば、モデルは作業の大部分をスキップして、より速く回答を生成できます。

主なポイント:

  • コードの変更は不要 – この機能は完全に推論サービスレイヤーに実装されています。
  • セルフホスト型モデルにのみ適用 – OpenAIのAPIやAnthropicのサービスなどのマネージドサービスには影響しません。
  • アプリケーションに対して透過的 – 同一のSageMakerエンドポイントURLとAPIコントラクトがそのまま維持されます。

どのような層が恩恵を受けるか

SageMaker上でLLMをホストする企業は、データのプライバシーからコスト管理まで、さまざまな理由でそれを行っています。サポートチャットボット、セールスアシスタント、または固定のシステムプロンプトを繰り返し使用するインタラクティブなエージェントを運用している場合、このルーティングの調整によって平均応答時間を短縮できます。コスト面では、キャッシュがヒットするたびに、プロンプトの共有部分を再評価するためのGPUリソースを節約できます。

制限事項と注意点

このメリットは、繰り返されるプレフィックスが存在することにかかっています。一回限りのクエリや動的に生成されるシステムメッセージなど、変動の激しいプロンプトでは、同じようなキャッシュヒットの利点は得られません。

この機能はセルフホスト型のデプロイメントに限定されているため、マネージドLLMサービスを利用している顧客はこれを活用できません。

結論: prefix-aware routingは、SageMakerユーザーに対し、コードを一切変更することなく、繰り返しの多いLLMワークロードのレイテンシを最小限に抑え、同時にGPUコストを削減するシンプルな方法を提供します。すでにプラットフォーム上でモデルをホストしている組織にとって、このアップグレードは、ユーザーとのやり取りの高速化と請求額の削減につながる、リスクの低い改善策となります。