#オフポリシー の記事一覧(1)

AI
2025-11-01 ・ BAIR (Berkeley)

Transitive RL(TRL)とは?BAIRが示した長期タスクに効く分割統治型・オフポリシー強化学習を解説

カリフォルニア大バークレー校のBAIRが、時間差分(TD)学習ではなく分割統治パラダイムで価値関数を学ぶオフポリシー強化学習「Transitive RL(TRL)」を公開しました。最大3,000ステップ規模の長期タスクを含むOGBenchで、TD・モンテカルロ・準距離学習の各ベースラインを上回る性能を示しています。

← タグ一覧へ