AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

AWS、EKSとNVRxを用いた分散学習の障害耐性向上手法を発表

,
AWS、NVRx、Amazon EKS、NVIDIA H100 GPU、Amazon FSx for Lustreなどの技術要素が組み合わさった分散学習のアーキテクチャ図。

https://d2908q01vomqb2.cloudfront.net/f1f836cb4ea6efb2a0b1b99f41ad8b103eff4b59/2026/09/08/ML-20900-featured-image.png

Amazon Web Servicesは2026年9月16日に、Amazon EKS上でNVIDIA Resiliency Extension (NVRx) を活用し、大規模な分散学習の効率を高める手法を発表しました。この手法は、GPUの故障やネットワークの断絶による学習の中断、およびチェックポイント保存に伴う待ち時間を削減することを目的としています。

学習の停止を防ぐ2段階のリカバリ機能

NVRxを導入することで、プログラムの実行中に発生するエラーに対して、2つの異なるレベルでの自動復旧が可能になります。一つは、例外処理や通信エラーなどのソフトな故障に対し、コンテナを再起動せずにプロセス内で復旧する「in-process restart」です。もう一つは、メモリ不足(OOM)やOSレベルのハングアップといったハードな故障に対し、ワーカーを自動的に再生成する「ft_launcher」によるリカバリです。これにより、単一のGPU故障が原因で学習全体が停止する事態を防ぎます。

非同期チェックポイントによるI/O待ちの解消

従来の同期的なチェックポイント保存では、データの書き込み中にすべての計算プロセスが待機状態となり、クラスター規模によっては全実行時間の最大40%がこの待ち時間に費やされていました。NVRxの「async checkpointing」は、データの保存をバックグラウンドプロセスに委ねることで、計算とI/Oを並行して実行します。各ランクが自身のデータを直接書き込む仕組みにより、特定のノードに負荷が集中するボトルネックも解消されます。

Amazon EKSによるインフラ基盤の提供

このソリューションは、Amazon EKSが提供する高度なスケジューリング機能と組み合わせて運用します。具体的には、NVIDIA H100 GPUを搭載したp5.48xlargeインスタンスを使用し、高帯域なEFAネットワークとAmazon FSx for Lustreによる共有ストレージを組み合わせます。これにより、故障が発生した際も、ワーカーが最新のチェックポイントから迅速に学習を再開できる環境を構築できます。

発表元: https://aws.amazon.com/blogs/machine-learning/fault-tolerant-distributed-training-on-amazon-eks-using-nvrx/