VibeThinker-3Bとは?新浪微博の30億パラメータが大規模モデルに迫る理由とベンチマーク疑惑
中国・新浪微博の研究チームが、わずか30億パラメータの推論モデル「VibeThinker-3B」をarXivで公開し、AIME 2026で94.3点とDeepSeek V3.2(6710億パラメータ)に匹敵するスコアを記録しました。一方で、ベンチマークの妥当性を疑う声も噴出しています。
中国・新浪微博の研究チームが、わずか30億パラメータの推論モデル「VibeThinker-3B」をarXivで公開し、AIME 2026で94.3点とDeepSeek V3.2(6710億パラメータ)に匹敵するスコアを記録しました。一方で、ベンチマークの妥当性を疑う声も噴出しています。
2026年1月から5月までの言語モデルに関する研究論文がまとめられたリストを紹介します。
DeepSeek R1が2025年1月に持ち込んだ「検証可能な報酬による強化学習(RLVR)」とGRPOアルゴリズムが、2025年のLLM開発の主軸となりました。Ahead of AIはこの潮流を踏まえ、2026年は推論時スケーリングとRLVR拡張、2027年は継続学習が焦点になると予測しています。
AIニュースレターAhead of AIが、2025年7月から12月にかけてブックマークしたLLM関連の研究論文リストを公開しました。同日公開の年次レビュー「State of LLMs 2025: Progress, Problems, and Predictions」から分離された補完コンテンツで、推論モデルや効率的学習など10カテゴリに整理されています。
Ahead of AIが2025年1〜6月のLLM研究論文をトピック別に整理した読書リストを公開しました。Kimi k1.5、DeepSeek-R1、Qwen3、Magistralなど主要モデルから、検証可能な報酬による強化学習(RLVR)、推論時スケーリングまで、3カテゴリで全体像を俯瞰できます。