xAIは2026年7月29日、次世代の音声対話モデル「Grok Voice Think Fast 2.0」を発表した。従来モデルに比べ推論速度や会話能力を向上させ、ノイズ環境での認識精度も強化されている。
発表の内容
xAIは2026年7月29日、「Grok Voice Think Fast 2.0」を発表した。これは音声入力から音声を出力するモデルで、推論性能や会話能力が向上している。
同社は、このモデルが従来の専用音声認識モデルを上回る精度を示すと説明している。特に騒音のある環境では認識誤差が大幅に改善されているという。
また、音声出力と同時に内部的な推論を行うアーキテクチャを採用しており、待ち時間を増やさずに高度な処理を実現している。これにより、ツールの呼び出しなどの実行速度も向上している。
これまでとの違い
Grok Voice Think Fast 2.0は、以前のバージョン「1.0」と比較して以下の点が改善されている。
会話の品質が向上し、より自然で簡潔な応答を行うよう学習されている。ユーザーへの負担を減らすため、一度に一つの質問をするなど、人間らしい対話パターンが採用されている。
ベンチマークでは、音声対話の総合品質や双方向の会話ダイナミクスにおいて、他社の主要モデルを上回る数値を示している。
実務への影響
このモデルは既存のプロンプトを変更せずに性能向上が期待できる。xAIによると、スターリンクのサポート業務でのA/Bテストでは、販売転換率やサポート対応率が有意に改善されたという。
2026年8月5日、「grok-voice-latest」のバージョンが「1.0」から「2.0」に切り替わる。アップグレードには特別な操作は不要で、従来版を維持する場合は事前にバージョンを固定する必要がある。
料金体系は明確化され、オーディオ1分あたり0.08ドルで利用可能となる。
残る論点
具体的な導入手順や動作環境に関する詳細情報は、リリース元を参照する必要がある。また、商用利用における具体的な条件や制限事項については言及がない。
