Googleは2026年8月24日、開発者向けツールキットであるADKにおいて、音声ベースのライブエージェントを評価するためのネイティブな機能を導入したと発表しました。これにより、開発者はシミュレートされたユーザーとの音声会話を通じて、エージェントの挙動を自動的に測定できるようになります。
音声会話の品質を自動で測定
従来のテキストベースの評価とは異なり、音声エージェントは会話のタイミングや、割り込みへの対応、文脈の維持といった要素が重要となります。新たに導入された機能では、シミュレートされたユーザーが音声で発話し、それに対するエージェントの音声回答をスコア化することが可能です。このプロセスは、既存のテキストエージェント向けの評価ループ内で行えます。
2つのテストシナリオに対応
評価には、2種類のテスト手法が用意されています。一つは「会話シナリオ」です。これは、目標やペルソナを設定すると、シミュレーターが即興で会話を進める手法です。ペルソナの設定により、質問を待つ「初心者」といった振る舞いを再現できます。もう一つは「固定の会話」です。ユーザーの発言内容をあらかじめ定義した通りに再現し、厳密なテストを行うことができます。
自然言語による評価基準の適用
評価の基準には、自然言語を用いたルーブリック(評価指標)が使用されます。「本人確認を最初に行っているか」といった人間が行うような基準を一度設定すれば、自動的にすべての会話に適用して判定できます。また、Geminiの音声合成技術を利用して、シミュレーターの音声やアクセント、言語を変更してテストすることも可能です。
開発パイプラインへの統合
この評価機能は、コマンドラインインターフェース(CLI)から実行できるほか、プログラムを介してCI/CDパイプラインに組み込むことも可能です。これにより、モデルの更新によってエージェントの挙動が変化していないかを、リリース前に継続的に確認できるようになります。また、ADK Webのデバッグ機能でも、音声によるライブ評価の実行が可能です。
