AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

EvoHarness-RLがLLMエージェントの外部記憶利用を自律学習

,
EvoHarness-RLがLLMエージェントの外部記憶利用を自律学習する仕組みの概念図。

2026年8月5日、arXivに発表されたEvoHarness-RLは、長期対話タスクで活動するLLMエージェントが外部記憶やツールの利用方法を自律的に学習する手法です。エージェントは従来の定型プロンプトに頼らず、タスクの進捗や経験に応じて外部ワークスペースを動的に構成・参照できるようになります。

長期対話タスクにおいて、LLMエージェントは外部の記憶やツールを必要とします。環境の状態把握や過去の経験の再利用に役立てるためです。従来の手法では、これらの外部リソースの使い方はプロンプトで固定されていました。エージェント自体が柔軟に制御できない点が課題でした。

本研究で提案されたEvoHarness-RLは、外部ワークスペースの運用ポリシーを自ら学習する仕組みです。外部状態をBelief、Progress、Experienceの3要素に統一します。まず教師あり学習で扱い方を習得させます。その後にコストを考慮した強化学習で、いつ外部状態を参照するかを最適化します。

実験では、Qwen3-8Bを用いたテストでALFWorld環境において96.9%の成功率を記録しました。エージェントは学習を通じて、定型の外部呼び出しから選択的な参照へと行動を移行します。外部ワークスペースは経験の統合によってタスクに適したコンパクトな状態に進化します。単に記憶容量を増やすだけでなく、エージェントが外部リソースを自律的に扱えるようになります。

発表元: https://arxiv.org/html/2608.05446v1