Sunoは2026年10月1日に、音声と音楽を一つのトラックとして同時に生成できるオーディオモデル「Speech」のベータ版提供を開始したと発表しました。従来の音楽生成に加え、言葉と背景音楽を組み合わせた新しい表現形式をユーザーに提供します。
Sunoが発表した「Speech」は、入力したアイデアや詩、テキストに対して、指定した声のトーンと音楽スタイルを組み合わせた音声を生成する技術です。音声と音楽を個別に作るのではなく、一つのまとまったトラックとして同時に生成できる点が大きな特徴です。
この機能により、テキストに基づいたドラマチックな朗読や、ボイスメモに壮大なスコアを添えた音源、瞑想用音声、詩の朗読、読み聞かせの物語などが作成可能になります。ユーザーは、テキストの内容と、どのような声でどのような音楽を流したいかを記述するだけで、パーソナルな音声を生成できます。
現在はベータ版としてすべてのユーザーに公開されています。開発プロセスにおいて、アクセントが意図せず変化したり、間の取り方が極端になったりする可能性があるとしています。Sunoは、コミュニティからのフィードバックを通じて、機能の継続的な改善を進める方針です。
