#Sebastian Raschka の記事一覧(2)

AI
2026-04-18 ・ Ahead of AI

オープンウェイトLLMの構造を読み解く実践手法とは?config・参照実装から学ぶワークフロー

AI解説者Sebastian Raschka氏が、自身のLLM-Galleryや記事制作で使うLLMアーキテクチャ把握の手順を公開しました。技術レポートが詳細を欠く中、Hugging Face Model Hub上のconfigファイルとtransformersライブラリの参照実装を直接読むという、あえて手動の方法です。

AI
2026-03-22 ・ Ahead of AI

GQAとMLAの違いとは?最新LLMアテンション機構の選び方をRaschka氏の図鑑から読み解く

機械学習研究者のSebastian Raschka氏が、現行の主要オープンウェイトLLM45種を網羅する「アーキテクチャ図鑑」を公開し、KVキャッシュ削減で主流となったGrouped-Query Attention(GQA)と、DeepSeekが採用するMulti-head Latent Attention(MLA)の使い分けを解説した。同じSarvamでも30BはGQA、105BはMLAと選択が分かれており、モデル規模で最適解が変わる実態が浮き彫りになっている。

← タグ一覧へ