2026年8月27日、AWSとNVIDIAは共同で公開した技術記事において、Amazon EC2上で音声認識モデルを推論する際、NVIDIA MPSとTriton Inference Serverを組み合わせる手法を紹介している。これによりGPUインフラの要件を75%削減できる。
AWSとNVIDIAは、Amazon EC2上で音声認識モデルを推論する際のインフラ効率化手法を公開している。従来のCUDA環境では、1つの推論リクエストがGPUの計算資源を約20%しか利用せず、残りは待機状態になる。この非効率さが、厳格なレイテンシ要件を満たすために多数のGPUインスタンスを必要とする原因となっていた。
今回紹介される手法は、NVIDIA CUDA MPSとTriton Inference ServerをEC2のGPUインスタンス上で組み合わせる構成である。MPSは既存のCUDAアプリケーションの変更を必要とせず、複数のプロセスがGPUを同時に共有実行できるようにする。これにより、コンテキスト切り替えに伴うオーバーヘッドが解消され、GPUの空き資源を有効活用できる。
この技術構成を実装することで、GPUインフラの要件を75%削減できる。従来16台必要だったインスタンスを4台に集約できる。1台あたり秒間92リクエストの処理でも、1秒未満の応答速度を維持するとしている。医療会話記録などのリアルタイム処理が求められる業務において、推論コストの大幅な抑制とインフラの簡素化が期待できる。
