#オープンウェイトLLM の記事一覧(12)

AI
2026-07-21 ・ VentureBeat

Laguna S 2.1とは?西側発の1180億パラメータ・オープンコーディングモデルをPoolsideが公開、その狙いを解説

米AIラボPoolsideが7月21日、オープンウェイトのコーディングモデル「Laguna S 2.1」を公開しました。1180億パラメータのMixture-of-Experts(MoE)ながら実行時は80億パラメータのみを使い、Terminal-Bench 2.1で70.2%を記録。中国勢が席巻するオープンウェイト市場に「西側が信頼して自社環境で動かせるモデルを」と対抗する戦略製品です。

AI
2026-07-17 ・ The Decoder

Kimi K3とは?中国製2.8兆パラメータAIが崩す「計算力=性能」の常識

中国Moonshot AIの新モデル「Kimi K3」が、西側AI業界の前提だった「計算力が能力を決める」という考えを揺さぶっています。1タスク平均0.94ドルとGPT 5.6 Solの1.04ドルに肉薄し、MITとGoogle Deepmindの研究者は「蒸留だけでは説明不可能」「異常なほど良い」と評価しました。

GLM-5.2とは?中国Z.aiのMITライセンス7530億パラメータLLMがコーディング性能でGPT-5.5を超えた意味
2026-06-16 ・ VentureBeat

GLM-5.2とは?中国Z.aiのMITライセンス7530億パラメータLLMがコーディング性能でGPT-5.5を超えた意味

中国のZ.ai(旧Zhipu AI)が7530億パラメータの大規模言語モデル「GLM-5.2」をMITライセンスで公開し、SWE-bench Proで62.1点とGPT-5.5(58.6点)を上回りました。API出力料金は100万トークンあたり4.40ドルで、Claude Opus 4.8(25ドル)やGPT-5.5(30ドル)の数分の一に収まっています。

AI
2026-04-18 ・ Ahead of AI

オープンウェイトLLMの構造を読み解く実践手法とは?config・参照実装から学ぶワークフロー

AI解説者Sebastian Raschka氏が、自身のLLM-Galleryや記事制作で使うLLMアーキテクチャ把握の手順を公開しました。技術レポートが詳細を欠く中、Hugging Face Model Hub上のconfigファイルとtransformersライブラリの参照実装を直接読むという、あえて手動の方法です。

AI
2026-03-05 ・ Interconnects

Olmo Hybridとは?Ai2が公開した7Bハイブリッドモデルが示す「Transformer後」の現実

Ai2が、Gated DeltaNet(GDN)とAttentionを3:1で混ぜた7Bオープンモデル「Olmo Hybrid」を公開し、ハイブリッド構造がTransformerを理論・実証の両面で上回ると主張する論文を同時に発表しました。事前学習段階でOlmo 3比約2倍の学習効率を達成した一方、推論ツールの未成熟により効率優位は現場では消えるという、重要な「但し書き」も明らかになっています。

AI
2026-02-25 ・ Ahead of AI

オープンウェイトLLMの2026年初頭動向:Trinity・Kimi K2.5・Qwen3-Coder-Nextが示す設計の収束

2026年1〜2月にArcee AIのTrinity Large(400B)、Moonshot AIのKimi K2.5(1兆パラメータ)、StepFunのStep 3.5 Flash、Qwen3-Coder-Nextなど10種のオープンウェイトLLMが相次いで公開され、MoE・スライディングウィンドウ注意・MTPといった設計要素が事実上の標準として収束しつつあります。

AI
2025-12-03 ・ Ahead of AI

DeepSeek V3.2とは?スパースアテンション搭載のオープンウェイトモデルを解説

DeepSeekは2026年元旦付けで、フラッグシップのオープンウェイトモデル「V3.2」を公開しました。独自のスパースアテンション機構「DSA」を搭載し、GPT-5やGemini 3.0 Proに匹敵する性能と長文脈での効率改善を両立した点が特徴です。

AI
2025-09-06 ・ Ahead of AI

Qwen3とは何か?PyTorchでゼロから実装する記事から読み解くオープンウェイトLLMの実力

Apache 2.0ライセンスで公開されているQwen3は、235B-Instruct版がLMArenaで8位、Claude Opus 4と同順位に並ぶ実力派です。PyTorchによるフルスクラッチ実装を解説した「Ahead of AI」の記事を起点に、その存在感と事業活用の現実を整理します。

AI
2025-08-09 ・ Ahead of AI

gpt-oss-120b/20bとは?OpenAIが6年ぶりに公開したオープンウェイトLLMの中身を解説

OpenAIが2019年のGPT-2以来となるオープンウェイトモデル「gpt-oss-120b」「gpt-oss-20b」を公開しました。20bは16GBのコンシューマGPUで、120bは80GBのH100単体で動かせる設計で、Mixture-of-ExpertsやGrouped Query Attentionなど現代的なアーキテクチャを採用しています。

AI
2025-07-19 ・ Ahead of AI

MoEとMLAとは?DeepSeek V3が示す2025年LLMアーキテクチャの到達点

DeepSeek V3は256エキスパート・総パラメータ671B(うち推論時37B)というMixture-of-Experts(MoE)構成と、KVキャッシュを圧縮するMulti-Head Latent Attention(MLA)を採用し、Llama 3の405Bを上回る性能を示しました。GPT-2から7年、骨格は驚くほど変わらない一方、注意機構と正規化の細部が静かに刷新されています。

← タグ一覧へ