#SRPO の記事一覧(1)

AI
2025-04-24 ・ Synced

SRPOとは?Kuaishouが1/10の学習ステップでDeepSeek-R1-Zeroを超えた強化学習手法を解説

快手(Kuaishou)のKwaipilotチームが、純粋な強化学習のみで数学とコードの両領域を同時に攻略する新フレームワーク「SRPO」を公開しました。DeepSeek-R1-Zeroと同じQwen2.5-32Bをベースに、わずか1/10の学習ステップでAIME24=50、LiveCodeBench=41.6を達成し、モデルもHuggingFaceで開放されています。

← タグ一覧へ