Amazon Web Servicesは2026年9月10日に、複数回のやり取りが発生する対話型エージェントの品質を測定する新しい指標「Agent Evaluation Metric (AEM)」を発表しました。従来の評価手法では困難だった、対話の途中で発生するエラーの根本原因の特定を可能にします。
エラーの連鎖を特定する新しい評価手法
対話型エージェントにおいて、初期の段階で発生した誤りがその後のすべてのやり取りに悪影響を及ぼす「エラーの連鎖」は、品質評価における課題となっています。従来のタスク単位の評価では、最終的な結果が失敗であったことは分かっても、どのやり取りが原因で失敗したのかを特定することが困難でした。AEMは、品質を分解可能なサブ指標として定義し、やり取りの段階(ターン)ごとに測定するアプローチを採用しています。
正確性を「真実性」と「網羅性」に分解
AEMは、エージェントの「正確性(correctness)」を、独立して測定可能な2つのサブ指標に分解して評価します。1つ目は、生成された値が事実と一致しているかを確認する「真実性(Truthfulness)」、2つ目は、必要な要素がすべて含まれているかを確認する「網羅性(Completeness)」です。これにより、品質の低下が事実誤認によるものか、情報の不足によるものかを区別して把握できます。
ターンごとの詳細な判定プロセス
評価は、ユーザーへの回答を行う「レスポンス・ターン」と、ツールを実行する「アクション・ターン」の両方に対して行われます。レスポンス・ターンでは、回答が質問の内容をカバーしているか、事実と整合しているかを検証します。アクション・ターンでは、実行に必要なパラメータのキーが揃っているか、その値が意味的に正しいかを検証します。判定にはセマンティックな比較が用いられ、意味的な同等性を評価します。
