Weka「NeuralMesh 6」とは?NANDフラッシュにAIトークンをキャッシュしGPU負荷を下げる仕組みを解説
ストレージ企業Wekaが、AI推論のGPUメモリ枯渇を安価なNANDフラッシュで補う新ソフト「NeuralMesh 6」と自社設計ハード「Wekapod 3」を発表しました。計算済みトークンを100%キャッシュして再計算をなくし、既存GPU投資の稼働率を高めるのが狙いです。
ストレージ企業Wekaが、AI推論のGPUメモリ枯渇を安価なNANDフラッシュで補う新ソフト「NeuralMesh 6」と自社設計ハード「Wekapod 3」を発表しました。計算済みトークンを100%キャッシュして再計算をなくし、既存GPU投資の稼働率を高めるのが狙いです。
NvidiaがCMXとして定式化した「コンテキスト階層」が、GPUメモリとバルクストレージの間に新設されつつあります。SolidigmはこのKVキャッシュ専用のSSDを開発しており、AI推論のボトルネックは計算力からコンテキスト保持へと移りつつあります。
LLMの推論コストを左右する「KVキャッシュ」の役割と実装方法を、PyTorchベースのGPTモデル改修例で示した解説記事が公開されました。MultiHeadAttentionへのバッファ追加とposition管理だけで、トークン生成のたびに過去系列を再計算する無駄を解消できます。