AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

AWS、Qwen3-TTSをSageMakerでリアルタイム展開可能に

,
Amazon SageMaker JumpStartのロゴと、Qwen3-TTSモデルの提供開始を知らせるリリース元の引用画像。

https://d2908q01vomqb2.cloudfront.net/f1f836cb4ea6efb2a0b1b99f41ad8b103eff4b59/2026/09/08/ML-20646-featured-image.png

Amazon Web Servicesは2026年9月25日、Alibaba Cloudが開発した音声合成モデル「Qwen3-TTS」を、Amazon SageMaker JumpStartを通じてデプロイできることを発表しました。これにより、数秒間の音声サンプルから特定の人物の声を模倣する「ボイスクローニング」を、フルマネージドな環境で実現できます。

特定の声を再現するボイスクローニング

Amazon SageMaker JumpStartから利用可能になった「Qwen3-TTS-12Hz-1.7B-Base」は、モデルの再学習なしに、短い参照音声からターゲットとなる話者の音色、ピッチ、抑揚を再現します。ユーザーが提供する数秒間の音声と、その書き起こしテキストを使用することで、新しいテキストをその人の声で合成できます。

このモデルは、ある言語で取得した声を、その人のアイデンティティを維持したまま別の言語で生成する「クロスリンガル・クローニング」にも対応しています。対応言語は、日本語、英語、中国語を含む10言語です。

管理コストの低減とデータの制御

Amazon SageMaker AIを利用することで、インフラのプロビジョニングやヘルスモニタリング、自動スケーリングをフルマネージドで行えます。利用者はGPUサーバーの管理を行う必要がなく、計算リソースの使用量に応じたコスト管理が可能です。

また、セルフホスト型のモデルを使用するため、音声データを自身のAWS環境内に留めることができ、データの制御性を確保できます。これにより、メディア制作におけるローカライズや、カスタマーサービスでのブランドボイスの維持、eラーニングなどの多様な用途への活用が期待されます。

発表元: https://aws.amazon.com/blogs/machine-learning/deploying-real-time-personalized-speech-with-qwen3-tts-on-amazon-sagemaker-ai/