Amazon Web Servicesは2026年9月18日、Amazon SageMaker HyperPod Inference Gatewayをリリースしました。この機能は、Kubernetes環境においてGPUの稼働状況をリアルタイムで把握し、推論リクエストを最適なPodへ振り分けるルーティングシステムです。
GPUの稼働状況に基づいたインテリジェントなルーティング
従来のKubernetesによる標準的なロードバランシングでは、GPU内部のメモリ使用量や処理状況を把握できないため、リクエストの偏りやリソースの浪費が発生していました。これに対し、本サービスはGPUのリアルタイムな信号を利用して、最も適切なPodへリクエストを配置します。これにより、最初のトークンが生成されるまでの遅延(First-token latency)を最大82%削減できるとしています。
モデルやアダプタの所在を考慮した最適化
本システムは、リクエストの内容を解析して適切なモデルのプールへ振り分ける「マルチモデル・ルーティング」に対応しています。また、LoRA(Low-Rank Adaptation)アダプタを利用している場合、対象のアダプタがすでにGPUメモリにロードされているPodを優先的に選択します。これにより、アダプタの入れ替えに伴うコストの高い遅延を排除できます。
既存環境への容易な導入
導入はEKSのマネージドアドオンとして実行でき、アプリケーション側のコード変更やサイドカーの設置は不要です。OpenAI互換のAPIエンドポイントとして公開されるため、既存のクライアントコードをそのまま利用できます。また、KVキャッシュの利用率やキューの深さ、プロンプトのキャッシュヒット率といった指標に基づき、用途に合わせてルーティングの挙動を調整することも可能です。
