AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

arXiv、AIエージェントの性能を最大化する学習手法を発表

,
Refer to caption

https://arxiv.org/html/2609.09134v1/co_evolution_overview_editable.png

arXivは2026年9月8日、AIエージェントの性能向上において、モデルの重み更新と環境(ハーネス)の最適化をどのように組み合わせるべきかに関する研究結果を発表しました。従来の模倣学習では、最適化された環境下においてモデルの性能が低下するという課題を、新たな修正手法によって解決しています。

模倣学習による性能低下の課題

AIエージェントの能力は、モデル本体の性能だけでなく、システムプロンプトやツールセットといった「ハーネス(環境)」に大きく依存します。研究では、まず弱いモデルに合わせてハーネスを最適化し、その後に強力な専門家モデルの行動を模倣させる手法を検証しました。しかし、最適化済みのハーネスを用いた場合、専門家の軌跡を模倣して微調整を行うと、7つのエンタープライズタスクすべてにおいて成功率が4〜30ポイント低下するという、予期せぬ結果が示されました。

原因はモデルと環境の不一致

この性能低下は、モデルが専門家の計画戦略をコピーしながらも、それを実行する能力が追いついていないために発生します。モデルが専門家の戦略を採用したことで、もともとのモデルの計画スタイルに合わせて最適化されていたハーネスとの適合性が失われる「計画戦略のドリブティング」が原因であると分析されています。なお、ハーネスを最適化していない標準的な環境下では、同様の模倣学習は効果を発揮します。

解決策となるオンポリシー修正

この不一致を解消するため、研究チームは「オンポリシー・エキスパート・コリクション(専門家による修正)」という手法を開発しました。これは、モデル自身の実行プロセスの中で失敗した場面を特定し、その場面のみを専門家モデルに書き換えさせる手法です。モデル自身の計画スタイルを維持したまま専門家の知識を取り入れられるため、ハーネスとの適合性を保ったまま性能を向上させることが可能になります。

発表元: https://arxiv.org/html/2609.09134