#Qwen2.5 の記事一覧(2)

AI
2026-06-27 ・ The Decoder

拡散型LLM「iLLaDA」とは?ByteDanceと中国・人民大学の8Bモデルが示す可能性と限界

ByteDanceと中国・人民大学の研究チームが、8Bの拡散型言語モデル「iLLaDA」を公開しました。ベース性能では平均63.9点と同規模のQwen2.5 7Bを上回る一方、Instruct版では67.1点対77.1点と差を付けられ、強化学習アラインメントの不在が浮き彫りになっています。

AI
2025-04-24 ・ Synced

SRPOとは?Kuaishouが1/10の学習ステップでDeepSeek-R1-Zeroを超えた強化学習手法を解説

快手(Kuaishou)のKwaipilotチームが、純粋な強化学習のみで数学とコードの両領域を同時に攻略する新フレームワーク「SRPO」を公開しました。DeepSeek-R1-Zeroと同じQwen2.5-32Bをベースに、わずか1/10の学習ステップでAIME24=50、LiveCodeBench=41.6を達成し、モデルもHuggingFaceで開放されています。

← タグ一覧へ