Amazon Web Servicesは2026年8月26日、Amazon Bedrock AgentCoreの新しい評価機能「AgentCore Evaluations」を発表した。この機能により、開発者は利用しているエージェントフレームワークを問わず、標準的な手法でAIエージェントの性能を評価できるようになる。
フレームワークに依存しない評価を実現
Amazon Web Servicesは2026年8月26日、Amazon Bedrock AgentCoreの新しい評価機能「AgentCore Evaluations」を発表した。この機能により、開発者は利用しているエージェントフレームワークを問わず、標準的な手法でAIエージェントの性能を評価できるようになる。
多くのチームがLangGraphやLlamaIndex、OpenAI Agents SDKなど異なるフレームワークを選択してエージェントを開発している。しかし従来の評価システムは特定のSDKやLLMクライアントに依存しており、互換性のない環境では評価パイプラインが機能しないという課題があった。
AgentCore Evaluationsはこの断片化を解消するために設計された。すべての主要なフレームワークはOpenTelemetryをサポートしているため、テレメトリーデータがこの標準プロトコルを通じて流れていれば、基盤のSDKに関係なく評価サービスがスコアリングを行える。
トレースデータの解釈とセッション構築
評価サービスはCloudWatchからエージェントのspanとイベントレコードを取得し、セッションを再構築する。session.idでグループ化された各traceが1つのユーザーターンを表す。サービスは受信したすべてのspanを分類し、必要な値を抽出して評価者に渡す。
この処理は完全にフレームワーク非依存であり、同じ評価器がすべてのフレームワークに対して一様にスコアリングを行う。開発者は追加の設定を行わずとも、インストールした instrumentation パッケージに応じて正しい処理が自動的に有効化される。現在対応しているのはStrands Agents、LangGraph、OpenAI Agents SDK、LlamaIndex、Google ADK、Claude Agent SDKなどである。
拡張性と要件
サポート対象外のフレームワークについても、scope name が特定のプレフィックスに従っていれば汎用パスで読み取られる。エージェントのspanにはsession.id属性が含まれており、これがランタイムセッションIDと一致することでspanがtraceに、traceがsessionに組み立てられる。
データソースにはメッセージコンテンツも含まれる必要がある。統合された観測可能性を持つエージェントでは自動的に処理されるが、既存の設定を使用している場合はスパンとメッセージコンテンツが別々のロググループに格納されている場合がある。
