Metaは2026年9月1日に、リアルタイムでの音声認識を可能にする音声知覚モデル「Muse Voice Transcribe」を発表しました。同社のSuperintelligence Labsが開発したこのモデルは、ストリーミング形式の音声書き出しや話者識別などの機能を備えています。
リアルタイム性と精度の両立を実現
Muse Voice Transcribeは、音声の断片を80ミリ秒ごとに処理する自己回帰型のマルチモーダルモデルです。特筆すべきは、強化学習を用いて「遅延」を動的に変化させる「アダプティブ・ディレイ(適応型遅延)」を採用している点です。これにより、単語の難易度に応じて精度と速度の最適なバランスを自動的に調整し、最終的な書き出しまでの時間における速度と精度のトレードオフを最適化しています。
多言語対応と高度な識別機能
本モデルは70以上の言語で学習されており、そのうち25の言語については検証済みです。文中での言語の切り替え(コードスイッチング)にもネイティブに対応しています。また、20人以上の話者を識別する話者識別(ダイアライゼーション)や、発話の開始と終了を検知するエンドポインティングの機能も備えています。これらはASR(自動音声認識)と同時に学習されることで、高度な処理を実現しています。
幅広いアプリケーションへの展開
Muse Voice Transcribeは、1時間を超える長い音声入力にも対応しており、事前の後処理を必要としません。現在は、Meta Model API、Meta AI for Mac、およびMuse Codeを通じて利用可能です。Meta AIやMuse Codeにおける音声入力機能にも、このモデルが採用されています。
