Amazon Web Servicesは2026年9月15日に、Amazon SageMaker AIの学習および処理ジョブにおいて、使用するインスタンスの優先順位を指定できる「Instance preference lists」を発表しました。この機能により、希望するGPUリソースが不足している場合でも、設定した候補の中から利用可能なリソースを自動的に選択してジョブを開始できます。
GPU確保の待ち時間を削減
AIモデルの学習では、需要のピーク時に希望するGPUインスタンスの確保が困難になる課題があります。これまでは、特定のインスタンスタイプを指定している場合、そのリソースが空くまで待機するか、手動で別のタイプを試す必要がありました。この機能により、最大5つまでのインスタンスタイプを優先順位とともに指定でき、Amazon SageMaker AIがリストを順に確認して、最初に利用可能なリソースでジョブを起動します。
自動的なフォールバックとリトライ
ジョブの作成時に、適切なインスタンスタイプを自動的に評価することで、手動での再試行や複雑な監視スクリプトの作成が不要になります。リストにあるすべてのタイプでキャパシティが確保できない場合は、指定した制限時間内に自動的にリトライを行う仕組みも備わっています。なお、このリトライ機能は、ml.p、ml.g、ml.trnファミリーなどのアクセラレーテッドコンピューティングインスタンスをリクエストする場合に適用されます。
学習プランとの連携
割引価格でGPU容量を予約できる「Flexible Training Plans (FTP)」との連携も可能です。予約済みのリソースを優先的に使用し、もし予約分が利用できない場合には、リスト内の次の候補をオンデマンド容量で利用するといった運用が可能です。これにより、リソースの利用効率を高めつつ、モデル開発に集中できる環境を提供します。
