DSparkとは?DeepSeekの投機的デコーディングで推論速度を最大85%高速化する新手法を解説
中国のDeepSeekが、AIモデルの1ユーザーあたり応答速度を60〜85%高速化する新フレームワーク「DSpark」を公開しました。北京大学と共同開発され、Hugging Face・GitHub上でMITライセンスで提供されます。
中国のDeepSeekが、AIモデルの1ユーザーあたり応答速度を60〜85%高速化する新フレームワーク「DSpark」を公開しました。北京大学と共同開発され、Hugging Face・GitHub上でMITライセンスで提供されます。
中国DeepSeekがMITライセンスで公開したDSparkは、LLMの出力を変えずにユーザー単位の推論速度を最大85%、厳しい遅延要件下での総スループットを600%超まで引き上げる投機的デコーディング基盤です。V4-Flash(284B)、V4-Pro(1.6T)に加え、QwenやGemmaにも適用検証されており、オープンウェイトを自社運用する企業のコスト構造に直接効く出来事です。