Microsoft AIは2026年9月3日に、新しい音声認識モデル「MAI-Transcribe-2」を発表しました。このモデルは、60言語において高い精度と、競合モデルを上回る処理速度を両立させています。
高い精度と圧倒的な処理速度
MAI-Transcribe-2は、Artificial Analysisの評価において、精度とレイテンシ(遅延)のパレート境界を定義しています。FLEURSベンチマークの60言語において、平均単語誤り率(WER)5.2%で第1位を獲得しました。また、Artificial Analysisの単語誤り率リーダーボードでは第2位にランクされています。
処理速度については、競合モデルと比較して大幅な向上を実現しています。OpenAIのGPT-Transcribeと比較して最大10倍、ElevenLabsのScribe v2と比較して7倍、Gemini 3.5 Transcribeと比較して5倍高速であると説明しています。これにより、特に長尺の音声における処理時間を短縮できます。
多様な機能と実用性
本モデルは、話者を識別する「話者ダイアリゼーション」や、単語単位のタイムスタンプ付与、キーワードのバイアス設定などの機能を備えています。また、フィラー(言い淀み)を含めて書き起こす「逐語的」な設定と、読みやすさを重視して不要な言葉を除く「クリーン」な設定の2つのスタイルを選択可能です。さらに、言語の自動識別や、複数の言語が混在する会話への対応も行います。
コストパフォーマンスと利用方法
高い効率性を活かした価格設定が行われています。リリース時の価格として、年末までの期間限定で1時間あたり0.10ドルで提供されるとしています。現在は、Microsoft Foundry、MAI Playground、Open Routerを通じてデモ版の利用が可能です。
