Amazon Web Servicesは2026年9月25日に、Amazon EKS、EFA、およびDeepEPを組み合わせることで、MoE(混合専門家)モデルの大規模な強化学習においてスループットを40%向上させるアーキテクチャについて発表しました。
MoEモデルの強化学習における課題
MoEモデルを用いた大規模な強化学習では、ロールアウト生成(推論)とポリシー訓練(学習)という、性質の異なるワークロードを同時に最適化する必要があります。MoEモデルは、エキスパート並列化(EP)によってデバイス間でトークンを動的にルーティングするため、従来のモデルに比べて通信負荷が高まる傾向にあります。特に、ジョブが単一インスタンスを超えてスケールすると、通信がノード間のリンクへと移行し、通信のボトルネックが発生しやすくなります。
スループットを40%向上させる最適化
今回のアーキテクチャでは、DeepEPをEFA(Elastic Fabric Adapter)上で動作させることで、エキスパート並列通信を最適化しています。これにより、MoEモデルの強化学習におけるロールアウトスループットを40%向上させることが可能になります。EFAは、GPUメモリ間でデータを直接転送する機能により、通信経路におけるCPUやオペレーティングシステムの関与を低減します。
Amazon EKSによるリソース管理
Amazon EKSを活用することで、強化学習の各フェーズに最適化されたノードグループを管理できます。具体的には、GPUアクセラレータを搭載したインスタンスでロールアウト生成やポリシー訓練を行い、CPUインスタンスで環境構築や前処理を実行します。また、メモリ最適化インスタンスを経験バッファとして使用することで、ストレージへの直接アクセスを避け、データの交換を効率化します。
スケーラブルなインフラ構成
この構成は、Amazon EKSによるオーケストレーション、EFAによる高性能通信、Amazon S3による耐久性のあるストレージを組み合わせたものです。各レイヤーが独立してスケールできるため、大規模な強化学習ワークロードにおけるリソースの不均衡を解消し、ハードウェアのアイドル時間を抑制することを目指しています。
