CodeRabbitは2026年8月11日に、NVIDIA Nemotron 3.5 Lightningを用いた事後学習により、コードレビューのルーティング精度を向上させたと発表しました。NVIDIAおよびBasetenと協力して実施したこの検証では、小規模なモデルでも高精度な処理が可能であることを示しています。
事後学習による精度向上とコスト削減
CodeRabbitは、NVIDIA Nemotron 3.5 Lightningに対し、2段階の事後学習を実施しました。具体的には、教師ありファインチューニング(SFT)と、検証可能な報酬による強化学習(RLVR)を組み合わせています。このプロセスにより、従来のGPTクラスのモデルよりも約4%高い精度を達成しました。
実験の結果、正確なルート一致率は75.8%から80.7%へと向上しました。また、出力の一致度を示す指標であるCohenのkappaは0.544に達しています。さらに、推定される推論コストを約50%削減できることも明らかになりました。
短期間かつ低コストでの検証を実現
今回の実験は、非常に効率的なリソースで完了しました。事後学習にかかった時間は3時間未満であり、コストも100ドル未満に抑えられています。学習には知識蒸留を用いて、より強力なモデルが生成した参照判断を学習データとして活用しました。
推論環境とパフォーマンス
最終的なモデルは、NVIDIA A100システム上で動作します。推論コストの比較では、OpenAIの公開価格に基づくコストが2.34ドルであるのに対し、測定されたピーク時のコストは1.16ドルとなりました。スループットは、8つの同時リクエストにおいて合計314.82出力トークン/秒を記録しています。
