Olmoの生みの親Nathan LambertがAi2を退職、オープンAI研究の旗手はどこへ向かうのか
Olmoモデルの主要開発者であるNathan Lambert氏が、2023年10月から在籍したAllen Institute for AI(Ai2)を退職しました。RewardBenchやTülu 3でRLVRという概念を打ち出した同氏は、引き続きシアトルを拠点にオープンAIエコシステムでの活動を続けるとしています。
Olmoモデルの主要開発者であるNathan Lambert氏が、2023年10月から在籍したAllen Institute for AI(Ai2)を退職しました。RewardBenchやTülu 3でRLVRという概念を打ち出した同氏は、引き続きシアトルを拠点にオープンAIエコシステムでの活動を続けるとしています。
DeepSeek R1が2025年1月に持ち込んだ「検証可能な報酬による強化学習(RLVR)」とGRPOアルゴリズムが、2025年のLLM開発の主軸となりました。Ahead of AIはこの潮流を踏まえ、2026年は推論時スケーリングとRLVR拡張、2027年は継続学習が焦点になると予測しています。