AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

ByteDance、音声と映像を同時処理するLLM「SeedRealtime」を公開

ByteDanceが発表した、音声と映像を同時に処理してリアルタイムな対話を実現するLLM「SeedRealtime」の紹介記事。

ByteDanceは2026年8月5日、音声・映像・テキストを単一のアーキテクチャで統合した、ネイティブな音声・映像フルデュプレックスLLM「SeedRealtime」を発表しました。これにより、ユーザーの「見て、聞いて、話す」という一連の動作に対し、リアルタイムで自然な対話を行う体験が可能になります。

音声と映像の統合による高度な理解

SeedRealtimeは、音声と映像、そして時間の経過に伴う情報を一つのモデル内で統合して処理します。従来のモデルのように、音声をテキストに変換してから映像を解析するといった段階的な処理(カスケード方式)ではなく、知覚、理解、意思決定、表現を並行して行うことが可能です。

この設計により、視覚情報を用いた音声の曖昧さの解消や、映像内の時間的な参照への正確な応答を実現しています。例えば、ユーザーが「これ」と指し示した対象を、周囲の状況やジェスチャーと組み合わせて即座に特定できます。

自律的なインタラクションと会話のタイミング

本モデルは、周囲の状況を継続的に認識し、ユーザーからの問いかけを待たずに自ら話しかける「プロアクティブなインタラクション」を備えています。映像内に特定の対象が現れた際に提醒を行ったり、会話の流れに合わせて適切なタイミングで発言したりすることが可能です。

対話のタイミングについても、ユーザーの会話の状態やペースをリアルタイムで検知します。これにより、会話の途中で言葉を遮ってしまう問題や、沈黙後の反応の遅れ、背景ノイズによる誤作動といった課題を、従来のモデルと比較して半分に軽減しています。

発表元: https://seed.bytedance.com/en/blog/seedrealtime-audio-visual-full-duplex-llm-released-toward-omni-modal-natural-interaction