AI Artificial Intelligence

ニュースリリースを伝えるニュースサイト

異なるサイズのLLM間でKVキャッシュを転送する技術

,
研究論文の引用元を示す、テキストを含む画像。

https://arxiv.org/static/browse/0.3.4/images/arxiv-logo-fb.png

2026年8月4日、異なるサイズの同一モデルファミリー間で、プロフィル処理のKVキャッシュを再利用し、推論速度を大幅に向上させる手法が発表された。これにより、コストと品質の切り替え時に再計算の手間を省ける可能性がある。

大規模言語モデル(LLM)の運用では、コストと精度のバランスを取るため、同一ファミリー内の異なるサイズのモデル間で処理を切り替えるケースが増えている。しかし、従来の手法では、新しいモデルに引き継ぐ際、すべての入力情報を最初から再計算する必要があり、時間とリソースが浪費されていた。

今回提案されたのは「クロスモデルKVキャッシュ転送」と呼ばれる手法だ。これは、異なるサイズのモデル間でKVキャッシュを再利用し、プロフィル処理の段階をスキップさせる技術である。研究チームは、同一ファミリー内のモデル間でKVキャッシュ間に線形な構造が存在することを見出した。例えばQwen3 14Bから32Bへの移行では、ソースモデルの特定の層がターゲットモデルのキーとバリューの分散をそれぞれ56%と32%説明できることが確認された。

この発見に基づき、リッジ回帰を用いた線形マッピングが開発された。手法は3段階で構成され、まずターゲットモデルに最も予測力の高いソースモデルの層を選択してKVキャッシュを結合する。次に、位置情報を示すRoPEを除去し、任意のコンテキスト長に対応可能にする。最後に、少量のデータセットを用いて回帰モデルを学習させる。

実験では6つのモデルペアで評価が行われた結果、4つのペアにおいてターゲットモデル単独での推論精度の73%から98%を維持することに成功した。また、処理速度は再プロフィルに比べて2.7倍から25倍高速化された。一部のケースで精度が低下した場合は、非線形な多層パーセプトロンを追加することで最大37ポイントの改善が見られた。

この技術により、モデル切り替え時のオーバーヘッドを大幅に削減できる可能性がある。特に複数回の対話ターンをまたぐ処理において安定性も確認されており、実用的な応用が期待される。

発表元: https://arxiv.org/abs/2608.03893