AWSは2026年8月21日、Amazon BedrockでRAGアプリケーションの実行コストを削減するための新しいアーキテクチャパターンを発表した。この手法は、回答の品質を維持しつつ、大規模言語モデルに入力されるトークン数を削減し、費用対効果を改善する。
Amazon Bedrockでは、検索拡張生成(RAG)アプリケーションにおいて、ユーザーからのクエリに対して返された多くのチャンクが主要な基盤モデルの入力として送られるため、コストが大きな要因となっている。
この課題に対し、AWSは「Query-Aware Compression」と呼ばれる新しいパターンを提供している。これは、取得されたチャンクをそのまま主要なモデルに渡すのではなく、その前に小さな低コストのモデルでフィルタリングし、クエリに関連する部分のみを抽出して渡す仕組みだ。
具体的には、ユーザーがクエリを入力すると、まずレトリーバーが関連するチャンクを取得する。その後、AWS Lambda関数がそれらのチャンクとクエリを小さなモデル(例:Claude Haiku)に送り、関連する情報のみに圧縮する。この圧縮されたコンテキストのみが主要なモデル(例:Claude Sonnet)に入力され、最終的な回答が生成される。
このアプローチの経済的メリットは、大きなモデルへの入力トークン数を削減できる点にある。小さなモデルのコストは低く、主要なモデルに送られるデータ量も減るため、全体のコストを下げることができる。また、関連のないコンテキストを除去することで、誤情報(ハルシネーション)のリスクも軽減される。
実装面では、既存のRAGフローにこの圧縮ステップを追加するだけで対応できる。AWS Lambda関数内でAmazon BedrockのConverse APIを用いて2回のモデル呼び出しを行うシンプルな構成となっている。
