Amazon Web Servicesは2026年9月10日に、Amazon SageMaker HyperPodにおいて推論のコールドスタートを短縮するモデルキャッシュ機能の提供を開始したと発表しました。この機能により、大規模言語モデル(LLM)のデプロイに伴う待ち時間を大幅に削減できます。
推論開始までの時間を劇的に短縮
従来のAmazon SageMaker HyperPodでは、推論用のポッドを起動する際、コンテナイメージの取得とモデルウェイトのダウンロードという2つの工程が必要でした。特にDeepSeek-R1のような600GBを超える巨大なモデルでは、リクエストの受け付けが可能になるまでに30分以上を要する課題がありました。新機能のモデルキャッシュを有効にすると、ポッドはネットワーク経由ではなく、ローカルのNVMeストレージから約7GB/sの速度でデータを読み取れるようになります。これにより、通常は数十分かかっていた起動時間が、わずか数秒へと短縮されます。
2つのキャッシュ機能による最適化
本機能は、ウェイトキャッシュとイメージキャッシュの2種類を提供しています。ウェイトキャッシュは、モデルの重みデータを事前に各ノードのローカルNVMeストレージへダウンロードしておく仕組みです。イメージキャッシュは、推論サーバーのコンテナイメージを事前にノードへプルしておくことで、ECRからのダウンロード待ちを解消します。これらを併用することで、オートスケーリングによるリソース拡張時の待ち時間を最小限に抑えられます。
柔軟な運用と幅広い対応ソース
キャッシュ機能は、既存のリソース設定に設定を追加するだけで利用可能です。キャッシュされたデータがあるノードを優先的に使用する仕組みですが、キャッシュがないノードに割り当てられた場合でも、従来通りネットワーク経由でデータを取得するため、処理が失敗することはありません。対応するソースには、Amazon S3、Amazon FSx for Lustre、HuggingFace Hub、Amazon SageMaker JumpStartが含まれます。
