Amazon Web Servicesは2026年9月9日、Alibabaが開発した大規模モデル「Qwen3.8-2.4T-A95B」を、Amazon SageMaker HyperPod上で展開する方法を公開しました。このモデルは、2.4兆個のパラメータを持つオープンウェイトのモデルであり、高度な推論やエージェント機能への対応を特徴としています。
大規模なMoEアーキテクチャと推論の効率化
Qwen3.8-2.4T-A95Bは、総パラメータ数2.4兆、トークンあたりの活性化パラメータ数950億を持つ混合専門家(MoE)アーキテクチャを採用しています。ハイブリッドなアテンション設計により、コンテキストウィンドウは標準で262,144トークン、最大で101万トークンまで拡張可能です。また、ネイティブなマルチトークン予測(MTP)機能を備えており、別のモデルを使用することなく投機的デコードを実現しています。
SageMaker HyperPodによる運用管理
2.4兆パラメータという巨大なモデルのホスティングには、専用のGPUインフラと最適化されたサービングスタックが必要です。Amazon SageMaker HyperPodは、Amazon EKSを制御面として使用し、モデルのダウンロードからコンテナのスケジューリング、ノードのヘルスチェック、オートスケーリングまでを自動化します。これにより、ハードウェアの故障が発生した際も、ノードの自動置き換えを通じて継続的な推論ワークロードを維持できます。
NVIDIA B300を活用したデプロイ構成
本発表では、8枚のNVIDIA B300 Blackwell Ultra GPUを搭載した「ml.p6-b300」インスタンスでの展開に焦点を当てています。BF16精度ではメモリ容量を超えるモデルですが、NVFP4量子化を用いることで、重みを約1.2TBまで圧縮できます。これにより、インスタンスの合計GPUメモリである2.1TBの範囲内にモデルを収め、推論を実行することが可能になります。
