Amazon Web Servicesは2026年9月10日に、Amazon SageMaker Inferenceにおいて「prefix-aware routing(プレフィックスを考慮したルーティング)」を導入したと発表しました。この新機能は、LLM(大規模言語モデル)へのリクエストに含まれる共通の指示文やコンテキストを効率的に再利用し、応答の遅延を大幅に削減することを目的としています。
共通のプロンプトによる計算の重複を解消
LLMを用いたアプリケーションでは、リクエストの冒頭にシステム指示や会話履歴といった「固定部分」が含まれることが一般的です。従来のルーティングでは、複数のインスタンスにリクエストが分散するため、各インスタンスが同じ固定部分を繰り返し計算する必要がありました。新機能であるprefix-aware routingは、リクエストの冒頭部分を識別して同じインスタンスへ一貫して送信します。これにより、インスタンス内に蓄積された計算済みデータ(KVキャッシュ)の再利用が可能になります。
応答速度の大幅な向上とスループットの改善
Llama 3.1 70Bを用いたベンチマークでは、長いコンテキストを持つワークロードにおいて、最初のトークンが生成されるまでの時間(TTFT)のP50値が最大77%削減されました。また、スループットは最大16%向上しています。KVキャッシュのヒット率についても、従来の約25%から80%超へと大幅に改善されました。一方で、ルーティング処理自体によるオーバーヘッドは、1リクエストあたり1.3〜1.9ミリ秒と極めて軽微です。
負荷分散とスケーリングへの対応
本機能は、特定のプロンプトにリクエストが集中しても、設定した同時実行数の制限を超えた場合は、負荷の低い別のインスタンスへリクエストを逃がす保護機能を備えています。また、インスタンス数の増減が発生するスケーリング時においても、ほとんどのリクエストが以前と同じインスタンスへルーティングされるため、キャッシュの有効性が維持される仕組みとなっています。
RAGや対話型AIへの適用が効果的
この機能は、ドキュメントをコンテキストとして追加するRAG(検索拡張生成)や、会話履歴を繰り返し送る対話型ボット、コード補完などの用途で特に高い効果を発揮します。利用者は、エンドポイントの設定において、ルーティングの基準とする文字数や同時実行数の閾値を指定することで、ワークロードに応じた最適化が可能です。
