AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

AWS、GPUの状態を検知するSageMaker HyperPod Inference Gatewayを発表

Amazon SageMaker HyperPod Inference Gatewayの機能概要を示す、リクエストがGPUリソースへ最適にルーティングされる仕組みの図解。

https://d2908q01vomqb2.cloudfront.net/f1f836cb4ea6efb2a0b1b99f41ad8b103eff4b59/2026/09/16/ML-21822-featured-image-2.png

Amazon Web Servicesは2026年9月18日、Amazon SageMaker HyperPod Inference Gatewayをリリースしました。この機能は、Kubernetes環境においてGPUの稼働状況をリアルタイムで把握し、推論リクエストを最適なPodへ振り分けるルーティングシステムです。

GPUの稼働状況に基づいたインテリジェントなルーティング

従来のKubernetesによる標準的なロードバランシングでは、GPU内部のメモリ使用量や処理状況を把握できないため、リクエストの偏りやリソースの浪費が発生していました。これに対し、本サービスはGPUのリアルタイムな信号を利用して、最も適切なPodへリクエストを配置します。これにより、最初のトークンが生成されるまでの遅延(First-token latency)を最大82%削減できるとしています。

モデルやアダプタの所在を考慮した最適化

本システムは、リクエストの内容を解析して適切なモデルのプールへ振り分ける「マルチモデル・ルーティング」に対応しています。また、LoRA(Low-Rank Adaptation)アダプタを利用している場合、対象のアダプタがすでにGPUメモリにロードされているPodを優先的に選択します。これにより、アダプタの入れ替えに伴うコストの高い遅延を排除できます。

既存環境への容易な導入

導入はEKSのマネージドアドオンとして実行でき、アプリケーション側のコード変更やサイドカーの設置は不要です。OpenAI互換のAPIエンドポイントとして公開されるため、既存のクライアントコードをそのまま利用できます。また、KVキャッシュの利用率やキューの深さ、プロンプトのキャッシュヒット率といった指標に基づき、用途に合わせてルーティングの挙動を調整することも可能です。

発表元: https://aws.amazon.com/blogs/machine-learning/introducing-amazon-sagemaker-hyperpod-inference-gateway/