LangChainは、NVIDIAのオープンソースライブラリ「NVIDIA NeMo Switchyard」を用いた評価結果を公開しました。このライブラリは、エージェントのワークフローにおけるモデル選択を自動化し、タスクの難易度に応じて最適なモデルへ振り分けます。
モデルの使い分けによるコスト削減
NVIDIA NeMo Switchyardを用いた評価の結果、すべてのタスクを高性能なモデルに送るのではなく、モデルを使い分けることで大幅なコスト削減が可能であることが示されました。評価では、Claude Opus 4.8のみを使用した場合と比較して、NVIDIA Nemotron 3.5 Lightningを組み合わせることで、総コストを74%削減できました。一方で、精度は93%を維持しています。
効率的なリソース配分の実態
評価スイートを用いた測定では、全モデル呼び出しのうち、高性能モデルが占める割合はわずか7%にとどまりました。この7%の呼び出しが、全体の費用の68.4%を占めています。残りの93%の呼び出しは、30Bパラメータのモデルによって処理されました。これにより、簡単なタスクに高価なモデルを割り当てる無駄を省けることが示されています。
Switchyardの仕組み
Switchyardは、構成した戦略に基づき、クローズドモデルとオープンモデルを組み合わせてクエリを自動的にルーティングするライブラリです。エージェントのプロキシとして、あるいはミドルウェアとして動作します。手法として、小さな判定用モデルが判断を下す「LLM classifier」や、ワークフローの段階に応じてルーティングする「Stage router」などが提供されています。
精度とコストのトレードオフ
ルーティングの導入には、精度とコストのバランスを考慮する必要があります。今回の評価では、ルーティングによってコストを74%削減しましたが、精度は6ポイント低下しました。また、判定用のモデルが費用の21.2%を占めることも明らかになっています。コスト削減を最大化するには、判定モデルの最適化や、高性能モデルへの切り替え条件の調整が重要となります。
