Google DeepMindは2026年9月15日、音声エージェントの構築を支援する新しいモデル「Gemini 3.8 Live」および「Gemini 3.8 Live Extended Thinking」を発表しました。これらは、AIとの対話をより直感的かつインテリジェントにするために開発されています。
音声対話の進化と高度な推論
Gemini 3.8 Liveは、会話の知性と流暢な対話、視覚情報の理解を兼ね備えたモデルです。会話の途中で97の言語を自動的に検出し、切り替えることが可能です。また、バックグラウンドでツールやAPIの実行を行いながら会話を継続できるため、タスクの完了を待たずにやり取りを進められます。
一方、Gemini 3.8 Live Extended Thinkingは、複雑なタスクに対応する高度な推論能力を備えています。このモデルは、推論と発話を同時に行うことができ、「確認します」といった自然な口調による応答や、進行中のタスクを実況するように説明する機能を備えています。これにより、複雑なワークフローにおいても会話の流れを途切れさせません。
優れたベンチマーク性能
Gemini 3.8 Live Extended Thinkingは、Speech to Speech Quality Indexにおいて82.6というスコアを記録し、1位を獲得しました。また、Big Bench Audioでは97.7%のスコアを出し、強力な推論能力を示しています。Gemini 3.8 Liveは、Speech Agent Arenaで2位を獲得するなど、ユーザーからも高い支持を得ています。
開発者と企業への提供開始
これらのモデルは、開発者向けにはGemini APIおよびGoogle AI Studioを通じて提供が開始されています。企業向けには、Gemini Enterpriseにおいてプライベートプレビューが開始されており、今後Google Workspaceのビジネス顧客などへも展開される予定です。なお、生成されたすべての音声には、誤情報の拡散を防ぐための電子透かし「SynthID」が適用されます。
