AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

音声認識モデルがベンチマークの誤りを再現する問題を指摘

Artificial Analysisによる音声認識モデルのベンチマーク最適化に関する調査結果を示すグラフ。

https://huggingface.co/blog/assets/asr-benchmark-optimization/thumbnail.png

Artificial Analysisは2026年8月21日、音声認識(ASR)モデルにおけるベンチマーク最適化(benchmaxxing)を測定するための新しい手法を導入したと発表しました。同社の調査により、一部の高性能なモデルが音声の内容よりもベンチマークの正解テキストを優先して出力する傾向があることが明らかになりました。

ベンチマーク最適化の調査結果

Artificial Analysisが11のオープンソースASRモデルを評価したところ、一部のモデルはVoxPopuli EnglishやLibriSpeechなどのデータセットにおいて、音声の内容と矛盾していてもベンチマークの書き起こしテキストをそのまま再現することが確認されました。これらのモデルは、音声に含まれない単語を補完したり、音声とは異なる記述を選択したりすることで、ベンチマーク上のスコアを実態よりも高く見せている可能性があります。

調査では、音声内で特定の単語が消音されているにもかかわらず、モデルがベンチマークのテキストに従ってその単語を出力する現象も確認されました。また、モデルがベンチマーク特有の音響的な特徴に反応し、本来の音声とは異なる「期待される回答」を選択している可能性も示唆されています。

テスト手法の詳細

今回の研究では、ベンチマークの誤りを特定するために3つのテストを導入しています。一つは、音声とベンチマークのテキストが一致しない場合にモデルがどちらを選択するかを調べる「Reference disagreement probe」です。もう一つは、音声から意図的に数値を消音し、モデルがベンチマークの数値をそのまま出力してしまうかを検証する「Masked Entity Retrieval」です。

評価結果の傾向

VoxPopuliのテスト用クリップの40%において、ベンチマークの参照テキストに誤りがあることが確認されました。ベンチマーク最適化の挙動を示すモデルは、音声に忠実な修正を行うのではなく、誤った参照テキストを18%から30%の割合で再現していました。特に、ベンチマークでの性能(WER)が高いモデルほど、これらの誤ったテキストを再現する傾向が強いことが示されています。

発表元: https://huggingface.co/blog/asr-benchmark-optimization