#Multi-Head Latent Attention の記事一覧(1)

AI
2025-07-19 ・ Ahead of AI

MoEとMLAとは?DeepSeek V3が示す2025年LLMアーキテクチャの到達点

DeepSeek V3は256エキスパート・総パラメータ671B(うち推論時37B)というMixture-of-Experts(MoE)構成と、KVキャッシュを圧縮するMulti-Head Latent Attention(MLA)を採用し、Llama 3の405Bを上回る性能を示しました。GPT-2から7年、骨格は驚くほど変わらない一方、注意機構と正規化の細部が静かに刷新されています。

← タグ一覧へ