KVキャッシュ転送とは?Nvidiaが示した「モデル乗り換え時の再計算ゼロ化」を解説
Nvidiaの研究チームが、あるLLMで作ったKVキャッシュを別サイズのモデルへ線形代数で写し替える手法を公開しました。32,768トークンのキャッシュをQwen3 14Bから32Bへ278ミリ秒で転送し、通常の再プリフィル(約7秒)比で2.7〜25倍高速、精度は対象モデル単独実行の最大98%を維持しています。
Nvidiaの研究チームが、あるLLMで作ったKVキャッシュを別サイズのモデルへ線形代数で写し替える手法を公開しました。32,768トークンのキャッシュをQwen3 14Bから32Bへ278ミリ秒で転送し、通常の再プリフィル(約7秒)比で2.7〜25倍高速、精度は対象モデル単独実行の最大98%を維持しています。
ストレージ企業Wekaが、AI推論のGPUメモリ枯渇を安価なNANDフラッシュで補う新ソフト「NeuralMesh 6」と自社設計ハード「Wekapod 3」を発表しました。計算済みトークンを100%キャッシュして再計算をなくし、既存GPU投資の稼働率を高めるのが狙いです。
NvidiaがCMXとして定式化した「コンテキスト階層」が、GPUメモリとバルクストレージの間に新設されつつあります。SolidigmはこのKVキャッシュ専用のSSDを開発しており、AI推論のボトルネックは計算力からコンテキスト保持へと移りつつあります。
LLMの推論コストを左右する「KVキャッシュ」の役割と実装方法を、PyTorchベースのGPTモデル改修例で示した解説記事が公開されました。MultiHeadAttentionへのバッファ追加とposition管理だけで、トークン生成のたびに過去系列を再計算する無駄を解消できます。