AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

Amazon Nova Forgeでマルチターン強化学習のカスタム報酬関数を設計

,
Amazon Nova Forgeの技術ブログの引用元を示すロゴ画像。

https://d2908q01vomqb2.cloudfront.net/f1f836cb4ea6efb2a0b1b99f41ad8b103eff4b59/2026/08/14/ml-20735.png

2026年8月14日、AWSはAmazon Nova Forgeの技術ブログを更新し、マルチターン強化学習におけるカスタム報酬関数の設計手法を紹介した。同機能はBring Your Own Orchestration(BYOO)を通じてユーザー環境で報酬ロジックを実行できる。

マルチターン強化学習における報酬関数の重要性

Amazon Nova Forgeの強化学習微調整(RFT)では、カスタム報酬関数がモデルが学習する内容を決定する。誤った報酬設計は、トレーニング曲線が健全に見えていても間違った行動を学習させる原因となる。マルチターンやエージェント型タスクにおいて、複数ターンにわたって機能する報酬の設計は高度な課題である。

BYOOによるユーザー環境での実行

Amazon Nova ForgeはBring Your Own Orchestration(BYOO)機能を通じて、報酬ロジックをユーザー自身の環境で実行する。これにより、ロールアウトやメッセージのやり取り、ターン間の会話状態管理をNova Forgeが調整し、ユーザーは結果の品質基準に集中できる。また、サーバーレス版マルチターン強化学習も一般提供されている。

報酬関数の構造と評価プロセス

RFTでは、現在のモデルから生成された出力を報酬関数で採点する。Amazon Nova Forgeでは、報酬関数は別個の学習済みモデルではなくコードとして実装される。ルールベースの評価やLLM-as-Judgeアプローチが利用可能である。

マルチターンタスクでは、ロールアウトは単一の応答ではなく一連のターンからなるエピソードとなる。報酬関数はタスクロジックを実行し、完成したトラジェクトリを複数の報酬コンポーネントで採点する。最終的に各サンプルに対する合計報酬スコア(aggregate_reward_score)とオプションのコンポーネント別スコアのリスト(metrics_list)を返す。

報酬信号の設計原則

単一のスカラー報酬や終端のみでの報酬は、マルチターンタスクでは学習が困難な場合がある。実用的なマルチターン報酬は通常、結果報酬、行動報酬、ペナルティの3つの信号を組み合わせて設計される。結果報酬は最終的な目標達成を捉え、行動報酬は中間的な望ましい挙動を shaping し、ペナルティは失敗モードを抑制する。

GRPOアルゴリズムでは、報酬信号はグループ内のサンプル間の差を通じてのみ学習に影響を与える。同じ値を取る報酬成分は、グループ内のばらつきを生まないため、勾配計算に寄与しない。この性質を理解し、各コンポーネントを検証可能に設計することが重要である。

発表元: https://aws.amazon.com/blogs/machine-learning/custom-reward-functions-for-multi-turn-reinforcement-learning-with-amazon-nova-forge/