AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

AWS、MoEモデルの強化学習を高速化する新アーキテクチャを発表

,
AWSの新しいアーキテクチャによる、MoEモデルの強化学習を最適化する構成図。

https://d2908q01vomqb2.cloudfront.net/f1f836cb4ea6efb2a0b1b99f41ad8b103eff4b59/2026/09/24/ML-21346-featured-image.png

Amazon Web Servicesは2026年9月25日に、Amazon EKS、EFA、およびDeepEPを組み合わせることで、MoE(混合専門家)モデルの大規模な強化学習においてスループットを40%向上させるアーキテクチャについて発表しました。

MoEモデルの強化学習における課題

MoEモデルを用いた大規模な強化学習では、ロールアウト生成(推論)とポリシー訓練(学習)という、性質の異なるワークロードを同時に最適化する必要があります。MoEモデルは、エキスパート並列化(EP)によってデバイス間でトークンを動的にルーティングするため、従来のモデルに比べて通信負荷が高まる傾向にあります。特に、ジョブが単一インスタンスを超えてスケールすると、通信がノード間のリンクへと移行し、通信のボトルネックが発生しやすくなります。

スループットを40%向上させる最適化

今回のアーキテクチャでは、DeepEPをEFA(Elastic Fabric Adapter)上で動作させることで、エキスパート並列通信を最適化しています。これにより、MoEモデルの強化学習におけるロールアウトスループットを40%向上させることが可能になります。EFAは、GPUメモリ間でデータを直接転送する機能により、通信経路におけるCPUやオペレーティングシステムの関与を低減します。

Amazon EKSによるリソース管理

Amazon EKSを活用することで、強化学習の各フェーズに最適化されたノードグループを管理できます。具体的には、GPUアクセラレータを搭載したインスタンスでロールアウト生成やポリシー訓練を行い、CPUインスタンスで環境構築や前処理を実行します。また、メモリ最適化インスタンスを経験バッファとして使用することで、ストレージへの直接アクセスを避け、データの交換を効率化します。

スケーラブルなインフラ構成

この構成は、Amazon EKSによるオーケストレーション、EFAによる高性能通信、Amazon S3による耐久性のあるストレージを組み合わせたものです。各レイヤーが独立してスケールできるため、大規模な強化学習ワークロードにおけるリソースの不均衡を解消し、ハードウェアのアイドル時間を抑制することを目指しています。

発表元: https://aws.amazon.com/blogs/machine-learning/scaling-moe-reinforcement-learning-on-amazon-eks-with-efa-and-deepep-with-40-more-throughput/