OpenAIは2026年7月29日、GPT-5.6 SolがARC-AGI-3ベンチマークで低得点だった理由と改善策を発表した。モデルの「推論の保持」と「コンパクション」を有効化することで、スコアが約3倍に向上し、出力トークン数が6分の1に削減されたことを明らかにした。
OpenAIは2026年7月29日、GPT-5.6 SolがARC-AGI-3ベンチマークで示した低得点の要因と、その改善策を詳細に分析して発表した。当初、同モデルは数学的な難問やゲームでの実績がある一方で、2Dパズルゲームの推論を試すARC-AGI-3ではGPT-5.6 Solが7.8%、GPT-5.5が0.4%という低いスコアしか記録していなかった。この結果はモデル自体の能力不足ではなく、ベンチマークの実行環境であるharnessの設定に起因することが判明した。
OpenAIの調査によれば、harnessには2つの大きな問題があった。まず、各ゲームアクションのたびにモデルの内部的な推論過程が破棄されていたため、モデルは過去の思考を参照できず、毎回ゲームの状態を一から解釈せざるを得なかった。また、会話履歴が長くなると古い情報が自動的に削除される「ローリングトリケーション」が採用されており、過去の行動や観察結果そのものも失われていた。
これらの問題を解消するためにOpenAIは、自社のプロダクトであるChatGPTやCodexで採用されているのと同じ設定をベンチマークに適用した。具体的には、「Responses API」を用いてモデルの内部的な推論プロセス(プライベートリゾーニング)を会話履歴として保持し、かつ「コンパクション」と呼ばれる設定を有効化した。
この2つの設定の有効化により、GPT-5.6 Solはゲームのルールや戦略を時間とともに学習できるようになり、各アクション前に思考する時間も短縮された。その結果、スコアが約3倍に向上し、同時に出力に必要なトークン数が6分の1に削減されるという高い効率化も実現した。
OpenAIはこの調査を通じて、ベンチマークのスコアはモデル単体の能力だけでなく、APIの設定やharnessの設計といった目に見えない要素にも大きく左右されることを示唆している。同社は、最大限のパフォーマンスを引き出すためには、自社のプロダクション環境と同じ「Responses API」の使用、「推論の保持」、そして「コンパクション」の有効化を推奨している。
