#KVキャッシュ の記事一覧(4)

AI
2026-08-21 ・ VentureBeat

KVキャッシュ転送とは?Nvidiaが示した「モデル乗り換え時の再計算ゼロ化」を解説

Nvidiaの研究チームが、あるLLMで作ったKVキャッシュを別サイズのモデルへ線形代数で写し替える手法を公開しました。32,768トークンのキャッシュをQwen3 14Bから32Bへ278ミリ秒で転送し、通常の再プリフィル(約7秒)比で2.7〜25倍高速、精度は対象モデル単独実行の最大98%を維持しています。

AI
2026-07-21 ・ VentureBeat

Weka「NeuralMesh 6」とは?NANDフラッシュにAIトークンをキャッシュしGPU負荷を下げる仕組みを解説

ストレージ企業Wekaが、AI推論のGPUメモリ枯渇を安価なNANDフラッシュで補う新ソフト「NeuralMesh 6」と自社設計ハード「Wekapod 3」を発表しました。計算済みトークンを100%キャッシュして再計算をなくし、既存GPU投資の稼働率を高めるのが狙いです。

AI
2026-06-22 ・ VentureBeat

KVキャッシュとは?AI推論で台頭する「第3のストレージ階層」CMXをNvidiaとSolidigmの動きから読み解く

NvidiaがCMXとして定式化した「コンテキスト階層」が、GPUメモリとバルクストレージの間に新設されつつあります。SolidigmはこのKVキャッシュ専用のSSDを開発しており、AI推論のボトルネックは計算力からコンテキスト保持へと移りつつあります。

AI
2025-06-17 ・ Ahead of AI

KVキャッシュとは?LLM推論を高速化する仕組みをPyTorch実装で解説

LLMの推論コストを左右する「KVキャッシュ」の役割と実装方法を、PyTorchベースのGPTモデル改修例で示した解説記事が公開されました。MultiHeadAttentionへのバッファ追加とposition管理だけで、トークン生成のたびに過去系列を再計算する無駄を解消できます。

← タグ一覧へ