推論時スケーリングとは?LLMの精度を15%から52%へ引き上げる6つの手法を整理
Ahead of AIが、モデルの重みを変えずに推論時の計算量で回答精度を高める「推論時スケーリング(inference-time scaling)」の主要6カテゴリを整理しました。書籍『Build a Reasoning Model (From Scratch)』の実験では、ベースモデルの精度が約15%から約52%へと引き上げられたといいます。
Ahead of AIが、モデルの重みを変えずに推論時の計算量で回答精度を高める「推論時スケーリング(inference-time scaling)」の主要6カテゴリを整理しました。書籍『Build a Reasoning Model (From Scratch)』の実験では、ベースモデルの精度が約15%から約52%へと引き上げられたといいます。
DeepSeek R1が2025年1月に持ち込んだ「検証可能な報酬による強化学習(RLVR)」とGRPOアルゴリズムが、2025年のLLM開発の主軸となりました。Ahead of AIはこの潮流を踏まえ、2026年は推論時スケーリングとRLVR拡張、2027年は継続学習が焦点になると予測しています。