Amazon Web Servicesは2026年9月18日、Amazon SageMaker AIにおける2026年の新機能の振り返りを発表しました。生成AIの推論におけるレイテンシやリソース確保の課題を解決するため、13の新しい機能が導入されています。
推論の最適化とリソース確保の自動化
Amazon SageMaker AIは、モデルのデプロイから本番運用までの工程を効率化する機能を拡充しています。2026年4月には、モデルと目標性能に基づき最適なインスタンス構成を自動提案する「推論レコメンデーション」を開始しました。これにより、従来は数週間を要していたベンチマーク作業を自動化し、特定のモデルではスループットを2倍に向上させるなどの成果を実現しています。
また、2026年5月には、GPUリソースの不足によるエラーを防ぐ「キャパシティを考慮したインスタンスプール」を導入しました。利用者は優先順位を付けた最大5種類のインスタンスを指定でき、特定のタイプが不足している場合には、自動的に別のタイプでリクエストを処理できるようになります。
開発効率の向上とスケーリングの高速化
開発者の利便性を高める機能として、2026年5月にOpenAI互換のAPIサポートが開始されました。これにより、OpenAI SDKなどを使用した既存のアプリケーションは、エンドポイントのURLを変更するだけでSageMaker上のモデルへ移行できます。
さらに、2026年6月には「コンテナキャッシュ」機能が導入されました。オートスケーリング時に発生していた大規模なコンテナイメージのダウンロード待ちを解消します。実証例では、起動までのレイテンシが525秒から258秒へと51%削減されるなど、トラフィック急増時の対応力が大幅に向上しています。
