OpenAIは2026年9月10日に、開発者向けのAPIとして音声モデル「GPT-Live-1」をリリースしました。このモデルは、音声の聞き取りと発話を同時に行うことができ、より自然な対話体験の構築を可能にします。
自然な対話を実現する単一モデル
GPT-Live-1は、音声のテキスト化、推論、音声合成という従来のプロセスを一つのモデルで統合しています。これにより、従来のシステムで課題となっていた音声変換の工程間における遅延や、対話のリズムの乱れを解消しています。
評価実験では、従来のターン制システムと比較して、学習者が考える時間を確保できる割合が増え、中断が約80%減少したことが示されています。また、Full Duplex Benchの性能において、前世代のGPT-Realtime-2.1から30パーセントポイント向上しました。
柔軟なカスタマイズと高度な推論
開発者はシステムプロンプトを通じて、エージェントの口調や話す速度、会話スタイルを調整できます。また、複雑な推論やツール実行が必要な場合は、GPT-6 Astraなどのバックエンドモデルへ処理を委譲することも可能です。
これにより、予約受付のような定型業務には高速なモデルを、複雑な顧客対応には高度な推論モデルを組み合わせるといった、用途に応じた使い分けが実現します。音声の聞き取りにおいても、背景ノイズや沈黙を適切に処理し、会話を中断させない仕組みを備えています。
利用料金と提供形態
フロントエンドの音声レイヤーとして、1分あたり0.05ドルで提供されています。電話応対などのフルデュプレックス(全二重)音声エージェントの構築にも対応しており、アクセントや方言、言語の選択肢も拡大しています。
