2026年8月4日、異なるサイズの同一モデルファミリー間で、プロフィル処理のKVキャッシュを再利用し、推論速度を大幅に向上させる手法が発表された。これにより、コストと品質の切り替え時に再計算の手間を省ける可能性がある。
大規模言語モデル(LLM)の運用では、コストと精度のバランスを取るため、同一ファミリー内の異なるサイズのモデル間で処理を切り替えるケースが増えている。しかし、従来の手法では、新しいモデルに引き継ぐ際、すべての入力情報を最初から再計算する必要があり、時間とリソースが浪費されていた。
今回提案されたのは「クロスモデルKVキャッシュ転送」と呼ばれる手法だ。これは、異なるサイズのモデル間でKVキャッシュを再利用し、プロフィル処理の段階をスキップさせる技術である。研究チームは、同一ファミリー内のモデル間でKVキャッシュ間に線形な構造が存在することを見出した。例えばQwen3 14Bから32Bへの移行では、ソースモデルの特定の層がターゲットモデルのキーとバリューの分散をそれぞれ56%と32%説明できることが確認された。
この発見に基づき、リッジ回帰を用いた線形マッピングが開発された。手法は3段階で構成され、まずターゲットモデルに最も予測力の高いソースモデルの層を選択してKVキャッシュを結合する。次に、位置情報を示すRoPEを除去し、任意のコンテキスト長に対応可能にする。最後に、少量のデータセットを用いて回帰モデルを学習させる。
実験では6つのモデルペアで評価が行われた結果、4つのペアにおいてターゲットモデル単独での推論精度の73%から98%を維持することに成功した。また、処理速度は再プロフィルに比べて2.7倍から25倍高速化された。一部のケースで精度が低下した場合は、非線形な多層パーセプトロンを追加することで最大37ポイントの改善が見られた。
この技術により、モデル切り替え時のオーバーヘッドを大幅に削減できる可能性がある。特に複数回の対話ターンをまたぐ処理において安定性も確認されており、実用的な応用が期待される。
