AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

xAI、精度が2倍に向上した音声文字起こしモデルを公開

,
xAIが公開した新しい音声文字起こしモデル「Grok Voice Transcribe 2.0」に関する公式のリリース情報。

https://x.ai/images/news/og-grok-voice-transcribe-2-0.webp

xAIは2026年9月18日に、最新の音声文字起こしモデル「Grok Voice Transcribe 2.0」をリリースしました。同モデルは、前世代のモデルと比較して、価格を維持したまま精度を2倍に向上させています。

リアルな音声環境での精度向上

Grok Voice Transcribe 2.0は、ノイズの多い環境や多言語が混在する音声データの学習を通じて、実環境における高い書き起こし精度を実現しています。従来のモデルでは困難だった、電話回線の不安定な音声や、複数の話者が混在する会話、アクセントのある話し方などに対しても、高い精度で対応します。

多言語対応と複雑な音声への強さ

特に多言語対応において、前世代モデルから大幅な改善が見られます。言語の自動検知に加え、録音の途中で話される言語が変わった場合でも、一回の処理で正確に書き起こすことが可能です。短い音声コマンドの書き起こしにおいては、単語誤り率が20.6%から6.8%へと劇的に低下しました。

既存ユーザーへの継続的な提供

価格設定は前世代から変更されておらず、バッチ処理は音声1時間あたり0.10ドル、ストリーミング処理は0.20ドルとなっています。ダイアライゼーション(話者分離)やタイムスタンプ、キーワード抽出の機能も含まれます。既存のAPI連携を利用しているユーザーは、コードの変更なしでこの新しい精度を適用できます。

発表元: https://x.ai/news/grok-voice-transcribe-2