AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

AWS、SkyRLを用いたマルチモーダル強化学習の高速化を実現

,
Amazon SageMaker HyperPodとSkyRLを組み合わせた、マルチモーダル強化学習の効率化に関する技術解説の図解。

https://d2908q01vomqb2.cloudfront.net/f1f836cb4ea6efb2a0b1b99f41ad8b103eff4b59/2026/09/23/ML-21828-featured-image.png

Amazon Web Servicesは2026年9月25日、Amazon SageMaker HyperPod上でオープンソースの強化学習フレームワーク「SkyRL」を活用し、マルチモーダル強化学習のトレーニングを加速させる手法を発表しました。大規模な計算リソースを必要とする強化学習において、インフラの可用性と効率性を向上させています。

強化学習におけるインフラの課題を解決

大規模な言語モデルエージェントの構築において、強化学習による事後学習は標準的な工程となっています。しかし、数百GPU時間にも及ぶロールアウト(試行)を伴う大規模な実行には、継続的なクラスター基盤が必要です。ハードウェアの故障によるプロセスの停止を防ぎ、進捗を維持しながら学習を継続できる環境が求められています。

Amazon SageMaker HyperPodは、Amazon EKS上で動作する大規模機械学習ワーク動線向けのインフラを提供します。クラスターの回復力(レジリエンス)を備えており、ノードの異常を継続的に監視して故障したノードを自動的に置き換えます。チェックポインティング機能と組み合わせることで、ハードウェア故障が発生しても、最初からではなく最後に保存されたステップから学習を再開できます。

SkyRLによる視覚言語モデルの性能向上

本手法をオープンソースの強化学習フレームワークであるSkyRLと組み合わせることで、視覚と言語を扱うモデルの学習を効率化できます。具体例として、視覚言語モデル「Qwen3-VL-8B」を用いた迷路のナビゲーション学習において、その効果が示されています。

グループ相対方策最適化(GRPO)を用いた事後学習の結果、迷路の解決率は43.75%から95%以上に向上しました。この学習では、SkyRLが推論と学習を同じGPU上で実行し、Amazon FSx for Lustreを介してLoRAアダプターの重みを同期させる構成をとっています。これにより、大規模なマルチモーダル強化学習を効率的に実行することが可能になります。

発表元: https://aws.amazon.com/blogs/machine-learning/accelerate-multimodal-rl-training-with-skyrl-on-amazon-sagemaker-hyperpod/