中国オープンウェイトAIモデルの新潮流:Qwen 3.5・GLM-5・MiniMax 2.5が示す勢力図
Qwen 3.5、GLM-5、MiniMax-M2.5、Step-3.5-Flash、Ant Lingなど中国勢が直近1か月でフロンティア級のオープンウェイトモデルを相次いで投入。DeepSeek V4の登場も近いと噂され、米国勢が公開モデルで苦戦する構図が鮮明になっています。
Qwen 3.5、GLM-5、MiniMax-M2.5、Step-3.5-Flash、Ant Lingなど中国勢が直近1か月でフロンティア級のオープンウェイトモデルを相次いで投入。DeepSeek V4の登場も近いと噂され、米国勢が公開モデルで苦戦する構図が鮮明になっています。
2026年1〜2月にArcee AIのTrinity Large(400B)、Moonshot AIのKimi K2.5(1兆パラメータ)、StepFunのStep 3.5 Flash、Qwen3-Coder-Nextなど10種のオープンウェイトLLMが相次いで公開され、MoE・スライディングウィンドウ注意・MTPといった設計要素が事実上の標準として収束しつつあります。
Sayash KapoorとArvind Narayananらの研究チームが、OpenAI・Google・Anthropicの14モデルを18か月にわたり評価し、能力は急伸する一方で信頼性は小幅な改善にとどまることを示しました。論文『Towards a Science of AI Agent Reliability』では、信頼性を12次元に分解する評価枠組みを提示しています。
Lawfareに掲載された論考は、GPT-4が司法試験に合格しAIリーダーが知識労働の変革を予言する一方で、米国の法律サービス費用は自動的には下がらないと主張します。米大手法律事務所のパートナー時給は2024年中央値で1,050ドル、一部は2,300ドル超に達し、AI導入だけでは構造的に解消されないと指摘します。
Ahead of AIが、モデルの重みを変えずに推論時の計算量で回答精度を高める「推論時スケーリング(inference-time scaling)」の主要6カテゴリを整理しました。書籍『Build a Reasoning Model (From Scratch)』の実験では、ベースモデルの精度が約15%から約52%へと引き上げられたといいます。
Anthropic所属の著者がClaude Cowork等の研究エージェントに論文読解や分析レポート作成を任せ、約1週間分の作業を大幅短縮、数年間着手できなかったニュースレター10年分のベクトル検索構築も1時間未満で完了させた。Import AI 441は、こうした「複数エージェントによる自己multiplying」の到来と、それに対抗するPoison Fountainなどの反AI運動、Eric Drexlerの「サービス群としてのAI」構想までを横断する。
DeepSeek R1が2025年1月に持ち込んだ「検証可能な報酬による強化学習(RLVR)」とGRPOアルゴリズムが、2025年のLLM開発の主軸となりました。Ahead of AIはこの潮流を踏まえ、2026年は推論時スケーリングとRLVR拡張、2027年は継続学習が焦点になると予測しています。
AIニュースレターAhead of AIが、2025年7月から12月にかけてブックマークしたLLM関連の研究論文リストを公開しました。同日公開の年次レビュー「State of LLMs 2025: Progress, Problems, and Predictions」から分離された補完コンテンツで、推論モデルや効率的学習など10カテゴリに整理されています。
DeepSeekは2026年元旦付けで、フラッグシップのオープンウェイトモデル「V3.2」を公開しました。独自のスパースアテンション機構「DSA」を搭載し、GPT-5やGemini 3.0 Proに匹敵する性能と長文脈での効率改善を両立した点が特徴です。