SRPOとは?Kuaishouが1/10の学習ステップでDeepSeek-R1-Zeroを超えた強化学習手法を解説
快手(Kuaishou)のKwaipilotチームが、純粋な強化学習のみで数学とコードの両領域を同時に攻略する新フレームワーク「SRPO」を公開しました。DeepSeek-R1-Zeroと同じQwen2.5-32Bをベースに、わずか1/10の学習ステップでAIME24=50、LiveCodeBench=41.6を達成し、モデルもHuggingFaceで開放されています。
快手(Kuaishou)のKwaipilotチームが、純粋な強化学習のみで数学とコードの両領域を同時に攻略する新フレームワーク「SRPO」を公開しました。DeepSeek-R1-Zeroと同じQwen2.5-32Bをベースに、わずか1/10の学習ステップでAIME24=50、LiveCodeBench=41.6を達成し、モデルもHuggingFaceで開放されています。