#KVキャッシュ の記事一覧(3)

AI
2026-07-21 ・ VentureBeat

Weka「NeuralMesh 6」とは?NANDフラッシュにAIトークンをキャッシュしGPU負荷を下げる仕組みを解説

ストレージ企業Wekaが、AI推論のGPUメモリ枯渇を安価なNANDフラッシュで補う新ソフト「NeuralMesh 6」と自社設計ハード「Wekapod 3」を発表しました。計算済みトークンを100%キャッシュして再計算をなくし、既存GPU投資の稼働率を高めるのが狙いです。

AI
2026-06-22 ・ VentureBeat

KVキャッシュとは?AI推論で台頭する「第3のストレージ階層」CMXをNvidiaとSolidigmの動きから読み解く

NvidiaがCMXとして定式化した「コンテキスト階層」が、GPUメモリとバルクストレージの間に新設されつつあります。SolidigmはこのKVキャッシュ専用のSSDを開発しており、AI推論のボトルネックは計算力からコンテキスト保持へと移りつつあります。

AI
2025-06-17 ・ Ahead of AI

KVキャッシュとは?LLM推論を高速化する仕組みをPyTorch実装で解説

LLMの推論コストを左右する「KVキャッシュ」の役割と実装方法を、PyTorchベースのGPTモデル改修例で示した解説記事が公開されました。MultiHeadAttentionへのバッファ追加とposition管理だけで、トークン生成のたびに過去系列を再計算する無駄を解消できます。

← タグ一覧へ