Amazon Web Servicesは2026年9月10日、TwelveLabsの「Marengo Embed 3.0」がAmazon Bedrockのナレッジベースで一般提供を開始したと発表しました。これにより、動画や画像、音声といったマルチモーダルな資産に対して、自然言語を用いた高度な検索ができるようになります。
動画や画像の内容を意味で検索可能に
これまで、動画やメディア資産から特定の瞬間を見つけ出すには、文字起こしやフレーム抽出、ベクトルデータベースの構築といった複雑なパイプラインを自前で用意する必要がありました。Amazon BedrockのナレッジベースでMarengo Embed 3.0が利用可能になったことで、これらのインフラ管理をすることなく、自然言語によるセマンティック検索(意味に基づいた検索)が実現します。
マルチモーダルな情報を統合的に処理
Marengo Embed 3.0は、動画、音声、画像、テキストを512次元のベクトル空間に同時にエンコードするマルチモーダル埋め込みモデルです。Amazon Bedrockのマネージドな機能により、動画内の視覚情報、テキスト、音声信号が統合された表現として処理されます。
管理されたナレッジベースは、MP4やMOVといった動画ファイル、JPEGやPNGなどの画像、音声トラックをサポートしています。データの取り込み時には、フレームのサンプリングや音声の文字起こし、埋め込みの生成、インデックスへの書き込みといった工程が自動的に行われます。
幅広い業界での活用を想定
この技術により、スポーツ解析における特定のプレーの特定や、メディア業界でのアーカイブ検索、セキュリティカメラ映像からの事象検索などが可能になります。教育現場での講義セグメントの特定や、小売業における製品デモ動画の検索など、膨大なメディア資産を持つ分野での活用が期待されています。
