Google DeepMindは2026年9月24日、対話モデルにリアルタイムの視覚的プレゼンスを加えた「Gemini 3.8 Live with Live Avatar」を発表しました。この機能は、音声とビデオ生成を組み合わせることで、動的なビジュアルを持つアバターによる自然な対話を実現します。
視覚と音声を同期させた自然な対話
Live Avatarは、音声とビデオをほぼリアルタイムで生成し、正確なリップシンク(口の動きの同期)と自然な表情を実現します。これにより、従来のテキストや音声のみのやり取りとは異なり、視覚的な情報を含めたより豊かなコミュニケーションが可能になります。
また、バックグラウンドでのツール実行にも対応しています。会話を中断させることなく、裏側でデータの取得やツールの呼び出しを並行して行うことができるため、ホテルのチェックイン業務のような複雑なタスクもスムーズに処理できます。
多言語対応とブランドに合わせたカスタマイズ
この機能は97の言語に対してネイティブな音声・音声間同期を備えています。会話の途中で言語を切り替えても、ビデオの品質を維持したまま、リップシンクや表情を動的に適応させることが可能です。
さらに、企業は自社のブランドに合わせたアバターの作成も行えます。プリセットのライブラリを利用できるほか、高品質な参照画像から、ブランドのスタイルやキャラクターのアイデンティティを維持したまま、アニメーション化されたアバターを生成できます。なお、カスタムアバターの作成は、現在エンタープライズ向けのホワイトリスト登録を通じてのみ提供されています。
セキュリティと透明性の確保
生成されたコンテンツの透明性を保つため、すべての出力にはSynthIDによるウォーターマーク(電子透かし)が適用されます。これは音声とビデオに直接組み込まれる目に見えないもので、AIによって生成されたコンテンツであることを検知できるように設計されています。
