RLVRとGRPOとは?2025年のLLM進化を振り返り2026年以降を読む
DeepSeek R1が2025年1月に持ち込んだ「検証可能な報酬による強化学習(RLVR)」とGRPOアルゴリズムが、2025年のLLM開発の主軸となりました。Ahead of AIはこの潮流を踏まえ、2026年は推論時スケーリングとRLVR拡張、2027年は継続学習が焦点になると予測しています。
DeepSeek R1が2025年1月に持ち込んだ「検証可能な報酬による強化学習(RLVR)」とGRPOアルゴリズムが、2025年のLLM開発の主軸となりました。Ahead of AIはこの潮流を踏まえ、2026年は推論時スケーリングとRLVR拡張、2027年は継続学習が焦点になると予測しています。