本文へ移動
原文
Berkeley AI Research·· 2025-11-01

TD学習を使わない強化学習:分割統治でオフポリシーRLを拡張

RL without TD learning

AI による要約

Berkeley AI ResearchはTD学習に依存しない分割統治のオフポリシー強化学習を提案した。Bellman再帰の回数を線形から対数へ減らし、長い期間のタスクへ拡張する。

入選の記録

入選せず二回の合計 65 < 基準の 2 倍 120

情報源の区分
公式・一次情報、この区分の基準は 60 点
予備審査
通過:强化学习算法研究,属AI技术

採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。

情報源:Berkeley AI Research · bair.berkeley.edu