KVキャッシュ転送とは?Nvidiaが示した「モデル乗り換え時の再計算ゼロ化」を解説
Nvidiaの研究チームが、あるLLMで作ったKVキャッシュを別サイズのモデルへ線形代数で写し替える手法を公開しました。32,768トークンのキャッシュをQwen3 14Bから32Bへ278ミリ秒で転送し、通常の再プリフィル(約7秒)比で2.7〜25倍高速、精度は対象モデル単独実行の最大98%を維持しています。
Nvidiaの研究チームが、あるLLMで作ったKVキャッシュを別サイズのモデルへ線形代数で写し替える手法を公開しました。32,768トークンのキャッシュをQwen3 14Bから32Bへ278ミリ秒で転送し、通常の再プリフィル(約7秒)比で2.7〜25倍高速、精度は対象モデル単独実行の最大98%を維持しています。
中国DeepSeekがMITライセンスで公開したDSparkは、LLMの出力を変えずにユーザー単位の推論速度を最大85%、厳しい遅延要件下での総スループットを600%超まで引き上げる投機的デコーディング基盤です。V4-Flash(284B)、V4-Pro(1.6T)に加え、QwenやGemmaにも適用検証されており、オープンウェイトを自社運用する企業のコスト構造に直接効く出来事です。