xAIは2026年9月18日に、最新の音声文字起こしモデル「Grok Voice Transcribe 2.0」をリリースしました。同モデルは、前世代のモデルと比較して、価格を維持したまま精度を2倍に向上させています。
リアルな音声環境での精度向上
Grok Voice Transcribe 2.0は、ノイズの多い環境や多言語が混在する音声データの学習を通じて、実環境における高い書き起こし精度を実現しています。従来のモデルでは困難だった、電話回線の不安定な音声や、複数の話者が混在する会話、アクセントのある話し方などに対しても、高い精度で対応します。
多言語対応と複雑な音声への強さ
特に多言語対応において、前世代モデルから大幅な改善が見られます。言語の自動検知に加え、録音の途中で話される言語が変わった場合でも、一回の処理で正確に書き起こすことが可能です。短い音声コマンドの書き起こしにおいては、単語誤り率が20.6%から6.8%へと劇的に低下しました。
既存ユーザーへの継続的な提供
価格設定は前世代から変更されておらず、バッチ処理は音声1時間あたり0.10ドル、ストリーミング処理は0.20ドルとなっています。ダイアライゼーション(話者分離)やタイムスタンプ、キーワード抽出の機能も含まれます。既存のAPI連携を利用しているユーザーは、コードの変更なしでこの新しい精度を適用できます。
