Microsoft AIは2026年10月1日に、リアルタイム文字起こしモデル「MAI-Transcribe-2-Streaming」と、2つの新しい音声モデル「MAI-Voice-2.1」および「MAI-Voice-2.1-Flash」を発表しました。これらにより、精度と速度を両立させた対話型体験の構築が可能になります。
リアルタイム文字起こしの高速化
MAI-Transcribe-2-Streamingは、60言語に対応し、継続的な言語の自動検出をサポートしています。音声を受信してから100ミリ秒強で最初の仮説(Partials)を出力するため、話者が話し終える前にアプリケーションが動作を開始できます。社内評価では、競合他社と比較して2倍の速さで文字が表示されるとしています。価格は、今年いっぱい、音声1時間あたり0.54ドルで提供されます。
多言語対応と高速な音声合成
新たに登場したMAI-Voice-2.1は、23言語と26のロケールをサポートする多言語対応モデルです。単一の「声」で、各言語に合わせた自然なアクセントでの発話が可能です。価格は100万文字あたり22ドルに設定されています。
また、高ボリュームかつ低遅延が求められる用途向けに、MAI-Voice-2.1-Flashが発表されました。45秒間の音声を、わずか150ミリ秒の終端遅延で生成できます。MAI-Voice-2.1と比較して、モデルの推論速度が55%向上し、価格も100万文字あたり15ドルと、約60%安価になっています。
音声エージェントへの応用
これらのモデルは、数秒の参照音声から声のクローニングを行うことができ、悪用を防ぐための同意管理機能も備えています。これらを組み合わせることで、話者の言葉をリアルタイムで書き起こしながら、自然な音声で応答するカスタマーサービスや、多言語アシスタントなどの構築が可能になると説明しています。
