#LLMアーキテクチャ の記事一覧(5)

AI
2026-04-18 ・ Ahead of AI

オープンウェイトLLMの構造を読み解く実践手法とは?config・参照実装から学ぶワークフロー

AI解説者Sebastian Raschka氏が、自身のLLM-Galleryや記事制作で使うLLMアーキテクチャ把握の手順を公開しました。技術レポートが詳細を欠く中、Hugging Face Model Hub上のconfigファイルとtransformersライブラリの参照実装を直接読むという、あえて手動の方法です。

AI
2026-03-22 ・ Ahead of AI

GQAとMLAの違いとは?最新LLMアテンション機構の選び方をRaschka氏の図鑑から読み解く

機械学習研究者のSebastian Raschka氏が、現行の主要オープンウェイトLLM45種を網羅する「アーキテクチャ図鑑」を公開し、KVキャッシュ削減で主流となったGrouped-Query Attention(GQA)と、DeepSeekが採用するMulti-head Latent Attention(MLA)の使い分けを解説した。同じSarvamでも30BはGQA、105BはMLAと選択が分かれており、モデル規模で最適解が変わる実態が浮き彫りになっている。

AI
2025-11-04 ・ Ahead of AI

線形アテンションとは?Qwen3-NextやKimi LinearがLLMの常識を変える理由

Qwen3-Next、Kimi Linear、MiniMax-M1など、計算量をO(n²)からO(n)に下げる「線形アテンション」を採用したLLMが2025年6月以降相次いで登場。Qwen3-Nextは262kトークンのネイティブ文脈長を実現し、長文処理のコスト構造を塗り替えつつあります。

AI
2025-07-19 ・ Ahead of AI

MoEとMLAとは?DeepSeek V3が示す2025年LLMアーキテクチャの到達点

DeepSeek V3は256エキスパート・総パラメータ671B(うち推論時37B)というMixture-of-Experts(MoE)構成と、KVキャッシュを圧縮するMulti-Head Latent Attention(MLA)を採用し、Llama 3の405Bを上回る性能を示しました。GPT-2から7年、骨格は驚くほど変わらない一方、注意機構と正規化の細部が静かに刷新されています。

AI
2024-03-28 ・ The Gradient

Mambaとは?Transformerを超える状態空間モデルが100万トークン処理と5倍速を実現する仕組み

State Space Model(SSM)の系譜に連なる「Mamba」が、Transformerと同等の性能を保ちながら推論を最大5倍高速化し、100万トークン級の長文処理を現実的な計算量で可能にしました。GuとDaoによる本アーキテクチャは、3Bパラメータで同サイズのTransformerを上回り、2倍規模のモデルに匹敵する評価を示しています。

← タグ一覧へ