#Mixture-of-Experts の記事一覧(7)

AI
2026-07-21 ・ VentureBeat

Laguna S 2.1とは?西側発の1180億パラメータ・オープンコーディングモデルをPoolsideが公開、その狙いを解説

米AIラボPoolsideが7月21日、オープンウェイトのコーディングモデル「Laguna S 2.1」を公開しました。1180億パラメータのMixture-of-Experts(MoE)ながら実行時は80億パラメータのみを使い、Terminal-Bench 2.1で70.2%を記録。中国勢が席巻するオープンウェイト市場に「西側が信頼して自社環境で動かせるモデルを」と対抗する戦略製品です。

AI
2026-07-16 ・ Simon Willison

Inklingとは?Mira Muratiのthinking machinesが公開したオープンウェイトAIを解説

Mira Murati率いるThinking Machines Labが初のオープンウェイトモデル「Inkling」を公開しました。総パラメータ975B・アクティブ41BのApache-2.0ライセンスの多モーダルMoEで、45兆トークンで学習。フロンティアではなく「微調整のための強力なベース」と位置づけられています。

AI
2026-07-15 ・ VentureBeat

Inklingとは?元OpenAI CTOムラティ率いるThinking Machinesの初オープンソースLLMを解説

元OpenAI CTOのMira Murati氏が創業したThinking Machinesが、初の主力モデル「Inkling」をApache 2.0ライセンスでオープンソース公開しました。総パラメータ9,750億・アクティブ410億のネイティブマルチモーダルMoEで、テキスト・画像・音声を横断して推論し、推論量を0.2〜0.99で調整できる「制御可能な思考努力」でコストを抑えられる点が特徴です。

AI
2026-06-24 ・ VentureBeat

Qwen-AgentWorldとは?AlibabaがAIエージェントに「環境予測モデル」を導入した狙いを解説

AlibabaのQwenチームが火曜日に公開したQwen-AgentWorldは、エージェントを「動かす」のではなく「環境がどう応答するか」を予測させる発想で訓練したモデルです。35BのMoE(活性3B)を含む2モデルが、7領域・1,000万件超の軌跡データで学習され、7つのベンチマークで性能向上を示しました。

AI
2025-09-06 ・ Ahead of AI

Qwen3とは何か?PyTorchでゼロから実装する記事から読み解くオープンウェイトLLMの実力

Apache 2.0ライセンスで公開されているQwen3は、235B-Instruct版がLMArenaで8位、Claude Opus 4と同順位に並ぶ実力派です。PyTorchによるフルスクラッチ実装を解説した「Ahead of AI」の記事を起点に、その存在感と事業活用の現実を整理します。

AI
2025-08-09 ・ Ahead of AI

gpt-oss-120b/20bとは?OpenAIが6年ぶりに公開したオープンウェイトLLMの中身を解説

OpenAIが2019年のGPT-2以来となるオープンウェイトモデル「gpt-oss-120b」「gpt-oss-20b」を公開しました。20bは16GBのコンシューマGPUで、120bは80GBのH100単体で動かせる設計で、Mixture-of-ExpertsやGrouped Query Attentionなど現代的なアーキテクチャを採用しています。

AI
2025-07-19 ・ Ahead of AI

MoEとMLAとは?DeepSeek V3が示す2025年LLMアーキテクチャの到達点

DeepSeek V3は256エキスパート・総パラメータ671B(うち推論時37B)というMixture-of-Experts(MoE)構成と、KVキャッシュを圧縮するMulti-Head Latent Attention(MLA)を採用し、Llama 3の405Bを上回る性能を示しました。GPT-2から7年、骨格は驚くほど変わらない一方、注意機構と正規化の細部が静かに刷新されています。

← タグ一覧へ