AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

AWS、Qwen3.8 2.4TモデルのSageMaker HyperPodへの展開手法を公開

,
Amazon SageMaker HyperPod上でQwen3.8-2.4Tモデルを運用するための、NVIDIA B300 GPUを用いたデプロイ構成の図解。

https://d2908q01vomqb2.cloudfront.net/f1f836cb4ea6efb2a0b1b99f41ad8b103eff4b59/2026/09/09/ML-21725-featured-image.png

Amazon Web Servicesは2026年9月9日、Alibabaが開発した大規模モデル「Qwen3.8-2.4T-A95B」を、Amazon SageMaker HyperPod上で展開する方法を公開しました。このモデルは、2.4兆個のパラメータを持つオープンウェイトのモデルであり、高度な推論やエージェント機能への対応を特徴としています。

大規模なMoEアーキテクチャと推論の効率化

Qwen3.8-2.4T-A95Bは、総パラメータ数2.4兆、トークンあたりの活性化パラメータ数950億を持つ混合専門家(MoE)アーキテクチャを採用しています。ハイブリッドなアテンション設計により、コンテキストウィンドウは標準で262,144トークン、最大で101万トークンまで拡張可能です。また、ネイティブなマルチトークン予測(MTP)機能を備えており、別のモデルを使用することなく投機的デコードを実現しています。

SageMaker HyperPodによる運用管理

2.4兆パラメータという巨大なモデルのホスティングには、専用のGPUインフラと最適化されたサービングスタックが必要です。Amazon SageMaker HyperPodは、Amazon EKSを制御面として使用し、モデルのダウンロードからコンテナのスケジューリング、ノードのヘルスチェック、オートスケーリングまでを自動化します。これにより、ハードウェアの故障が発生した際も、ノードの自動置き換えを通じて継続的な推論ワークロードを維持できます。

NVIDIA B300を活用したデプロイ構成

本発表では、8枚のNVIDIA B300 Blackwell Ultra GPUを搭載した「ml.p6-b300」インスタンスでの展開に焦点を当てています。BF16精度ではメモリ容量を超えるモデルですが、NVFP4量子化を用いることで、重みを約1.2TBまで圧縮できます。これにより、インスタンスの合計GPUメモリである2.1TBの範囲内にモデルを収め、推論を実行することが可能になります。

発表元: https://aws.amazon.com/blogs/machine-learning/deploying-qwen3-8-2-4t-a95b-on-amazon-sagemaker-hyperpod-with-vllm/