MoEとMLAとは?DeepSeek V3が示す2025年LLMアーキテクチャの到達点
DeepSeek V3は256エキスパート・総パラメータ671B(うち推論時37B)というMixture-of-Experts(MoE)構成と、KVキャッシュを圧縮するMulti-Head Latent Attention(MLA)を採用し、Llama 3の405Bを上回る性能を示しました。GPT-2から7年、骨格は驚くほど変わらない一方、注意機構と正規化の細部が静かに刷新されています。
DeepSeek V3は256エキスパート・総パラメータ671B(うち推論時37B)というMixture-of-Experts(MoE)構成と、KVキャッシュを圧縮するMulti-Head Latent Attention(MLA)を採用し、Llama 3の405Bを上回る性能を示しました。GPT-2から7年、骨格は驚くほど変わらない一方、注意機構と正規化の細部が静かに刷新されています。