Googleは2026年9月23日、Geminiファミリーに2つの新しいテキスト読み上げ(TTS)モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しました。これらのモデルにより、自然言語による指示を用いた音声のカスタマイズや、感情表現を含む詳細な演技指導が可能になります。
創造的な音声設計と効率的なスケーリング
Gemini 3.8 Flash TTSは、キャラクターデザインや深いクリエイティブな指示に特化したモデルです。自然言語によるプロンプトを用いて、ゼロから全く新しい声を生成できます。これに対し、Gemini 3.8 Flash-Lite TTSは、大量の音声制作やコスト効率を重視した設計となっており、音声エージェントなどの用途に適しています。
演技の細部まで制御するディレクション機能
両モデルは、セリフごとに演技の演出を指示できる機能を備えています。指示文やスクリプトの合図を用いることで、ささやき声から穏やかな対話まで、トーンやペースを細かく制御できます。また、笑い声やため息、相槌といった非言語的な要素を加えて、会話のリアリティを高めることも可能です。
多言語展開と音声の複製
100以上の言語と方言に対応しており、2,000種類以上の既存音声ライブラリからも選択できます。また、30秒の音声サンプルから特定の声を複製する機能も提供されます。この複製機能には、音声所有者の同意確認や、AI生成音声であることを示すSynthIDによる電子透かしなどの安全策が組み込まれています。
利用可能な環境
開発者向けには、本日よりGemini APIおよびGoogle AI Studioを通じて提供が開始されています。一般ユーザー向けには、Gemini NotebookやGoogle Vidsでの展開が予定されています。企業向けには、Gemini Enterprise経由でのAPI提供が近日中に予定されています。
