オープンウェイトLLMの構造を読み解く実践手法とは?config・参照実装から学ぶワークフロー
AI解説者Sebastian Raschka氏が、自身のLLM-Galleryや記事制作で使うLLMアーキテクチャ把握の手順を公開しました。技術レポートが詳細を欠く中、Hugging Face Model Hub上のconfigファイルとtransformersライブラリの参照実装を直接読むという、あえて手動の方法です。
AI解説者Sebastian Raschka氏が、自身のLLM-Galleryや記事制作で使うLLMアーキテクチャ把握の手順を公開しました。技術レポートが詳細を欠く中、Hugging Face Model Hub上のconfigファイルとtransformersライブラリの参照実装を直接読むという、あえて手動の方法です。
機械学習研究者のSebastian Raschka氏が、現行の主要オープンウェイトLLM45種を網羅する「アーキテクチャ図鑑」を公開し、KVキャッシュ削減で主流となったGrouped-Query Attention(GQA)と、DeepSeekが採用するMulti-head Latent Attention(MLA)の使い分けを解説した。同じSarvamでも30BはGQA、105BはMLAと選択が分かれており、モデル規模で最適解が変わる実態が浮き彫りになっている。
Qwen3-Next、Kimi Linear、MiniMax-M1など、計算量をO(n²)からO(n)に下げる「線形アテンション」を採用したLLMが2025年6月以降相次いで登場。Qwen3-Nextは262kトークンのネイティブ文脈長を実現し、長文処理のコスト構造を塗り替えつつあります。
DeepSeek V3は256エキスパート・総パラメータ671B(うち推論時37B)というMixture-of-Experts(MoE)構成と、KVキャッシュを圧縮するMulti-Head Latent Attention(MLA)を採用し、Llama 3の405Bを上回る性能を示しました。GPT-2から7年、骨格は驚くほど変わらない一方、注意機構と正規化の細部が静かに刷新されています。
State Space Model(SSM)の系譜に連なる「Mamba」が、Transformerと同等の性能を保ちながら推論を最大5倍高速化し、100万トークン級の長文処理を現実的な計算量で可能にしました。GuとDaoによる本アーキテクチャは、3Bパラメータで同サイズのTransformerを上回り、2倍規模のモデルに匹敵する評価を示しています。