Amazon Web Servicesは2026年9月11日に、Amazon Bedrock上で提供されるOpenAIのモデルについて、トークン単価ではなく「正しい回答を得るためのコスト」という観点から評価した結果を公開しました。従来のトークン単価に基づく比較では見えてこない、実務におけるコスト効率を分析しています。
正解を得るための実質的なコスト
Amazon Web Servicesは、Amazon Bedrock上のOpenAIモデル(gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol)と、OpenAI APIのモデル(gpt-5.4-mini、gpt-5.4-nano)を比較しました。数学や科学などのベンチマークを用いた検証では、トークン単価が最も低いモデルよりも、正解を得るために必要なコストが低いモデルが存在することが示されました。
具体的には、Amazon Bedrockのgpt-5.6-lunaは、AIME(数学ベンチマーク)において、OpenAI APIのgpt-5.4-miniと比較して、正解1件あたりのコストが0.0021ドルと、0.0139ドルを大幅に下回る結果となりました。これは、モデルの回答精度とトークン利用効率の組み合わせによって、実質的なコストが決定されることを示しています。
エージェント業務におけるターン数の影響
Webリサーチなどの複数回のやり取りを必要とするエージェント業務では、会話のターン数が増えるほど入力トークン量が増大する特性があります。検証の結果、gpt-5.4-miniは1問あたりの平均ターン数が7.6回と最も多く、コンテキストの蓄積により入力トークン量がterraの2.3倍に達しました。
このターン数の多さはコストに直結します。gpt-5.6-lunaは、gpt-5.4-miniと比較して、正解1件あたりのコストが0.05ドルとなり、miniの0.40ドルよりも低い数値となりました。エージェントがツールを繰り返し呼び出すようなワークロードでは、ターン数の効率が重要なコスト要因となります。
プロフェッショナルな成果物の評価
実務における成果物の品質を測るため、専門家が作成した文書を基準とした評価(GDPval)も実施されました。この検証では、単なる正誤判定ではなく、業務上の要件を満たす「成果物」としての品質が測定されています。各モデルの具体的な合格率やコストの詳細は、リポジトリで公開されている結果ファイルに記載されています。
