Amazon Web Servicesは2026年9月25日、Alibaba Cloudが開発した音声合成モデル「Qwen3-TTS」を、Amazon SageMaker JumpStartを通じてデプロイできることを発表しました。これにより、数秒間の音声サンプルから特定の人物の声を模倣する「ボイスクローニング」を、フルマネージドな環境で実現できます。
特定の声を再現するボイスクローニング
Amazon SageMaker JumpStartから利用可能になった「Qwen3-TTS-12Hz-1.7B-Base」は、モデルの再学習なしに、短い参照音声からターゲットとなる話者の音色、ピッチ、抑揚を再現します。ユーザーが提供する数秒間の音声と、その書き起こしテキストを使用することで、新しいテキストをその人の声で合成できます。
このモデルは、ある言語で取得した声を、その人のアイデンティティを維持したまま別の言語で生成する「クロスリンガル・クローニング」にも対応しています。対応言語は、日本語、英語、中国語を含む10言語です。
管理コストの低減とデータの制御
Amazon SageMaker AIを利用することで、インフラのプロビジョニングやヘルスモニタリング、自動スケーリングをフルマネージドで行えます。利用者はGPUサーバーの管理を行う必要がなく、計算リソースの使用量に応じたコスト管理が可能です。
また、セルフホスト型のモデルを使用するため、音声データを自身のAWS環境内に留めることができ、データの制御性を確保できます。これにより、メディア制作におけるローカライズや、カスタマーサービスでのブランドボイスの維持、eラーニングなどの多様な用途への活用が期待されます。
