Amazon Web Services(AWS)は、基盤学習モデルの訓練と推論向けインフラ「SageMaker HyperPod」において、分散 Python フレームワーク「Ray」との統合機能を公開した。データサイエンティストが SageMaker Studio から Ray クラスターの作成や監視、ジョブ送信を直接操作できる環境を提供する。
AWS は 2026年8月24日付で、SageMaker HyperPod と Ray の新統合機能を発表した。
Ray は分散 Python ワークロードを GPU クラスタ上でスケールさせるためのオープンソースフレームワークである。従来、Kubernetes で Ray を運用するには YAML マニフェストの記述や Docker イメージの再ビルド、kubectl によるポートフォワーディング、Prometheus や Grafana の手動設定などが必要だった。
今回の統合により、データサイエンティストは SageMaker Studio のコンソールから Ray クラスターの作成や管理を行える。Kubernetes マニフェストや kubectl コマンドの記述が不要になる。クラスター作成フォームではインスタンス種別やワーカー数などを指定可能で、デフォルトで AWS が管理する SageMaker Distribution イメージが使用される。
作成したクラスターの健康状態や実行中のジョブを視覚化する Ray Dashboard や、Amazon Managed Grafana の監視ダッシュボードも Studio から直接開ける。IAM 認証による一時的な URL が生成され、安全にリモートアクセスできる。
本番環境向けの分散ジョブ送信では、Python パッケージを通じて標準的な Ray API を利用可能だ。エンドポイントの解決や EKS API 資格情報の生成はパッケージが自動化する。さらに JupyterLab や Code Editor のワークスペースをクラスターに接続でき、ノートブックから直接分散ワークロードを実行できる。
訓練ジョブには HyperPod のノード監視機能による自動フォールトトレランスと、階層型ストレージを活用したチェックポイントの高速復旧が適用される。モデル推論では KV キャッシュのオフロードにも対応する。既存のスクリプトや KubeRay 標準 API と互換性があり、変更なしで利用可能である。
詳細なセットアップ手順については AWS の公式ドキュメントを参照すること。
