OpenAIは6ヶ月で開発したリアルタイムの音声AIシステム「GPT-Live」を公開した。音声モデルが聴取と発話を同時に行う全二重方式を採用し、会話のリズムに即応するレスポンスを実現している。
音声モデルによる双方向の対話
OpenAIは、音声AIシステム「GPT-Live」の開発について解説した。従来の音声AIはターンベースのアーキテクチャを採用しており、ターン検出器が会話の切り替えを判断する仕組みだった。この方式では、検出が早すぎると会話が途切れる恐れがあり、遅すぎると応答に遅延が生じる課題があった。
GPT-Liveは音声モデルからターン検出器を排除した全二重のシステムである。これにより、より直接的で自然な会話体験を提供している。さらに、深い推論やツールの使用が必要な場合は、GPT-5.5などの最先端モデルに非同期で相談できる仕組みも備えている。
レイテンシを最小化する新アーキテクチャ
このシステムはスケーラビリティと低レイテンシを実現するため、新しいアーキテクチャを採用している。音声のストリーミング入力と音声合成による出力を行いながら、委任処理は非同期パスで実行する設計だ。
メディアフローとアプリケーションロジックを明確に分離したことで、応答性に影響を与えることなくカスタマイズが可能となっている。この基盤により、ChatGPTデスクトップアプリでのPC制御やエージェントの調整といった機能が実現している。
継続的な会話を支える技術
音声モデルへのストリーミング推論に加え、信頼性の高い音声配信とステートフルな管理が求められた。メディアフロントエンドと推論ロジックはGoで実装され、フレーム配送の滑らかさが大幅に改善された。通信には低レイテンシメディア用のWebRTCを採用し、パケット損失やクロックドリフトにも対応している。
また、セッションの継続に伴うコンテキストの肥大化に対応するため、モデルインスタンス間のシームレスなハンドオフ機構を実装した。コンテキスト圧縮も別の管理対象として扱い、元のインスタンスが会話を維持する間に新しいインスタンスを準備し、メディアの中断なく切り替えられるようにしている。
