Berkeley AI Research·· 2025-11-01
TD学習を使わない強化学習:分割統治でオフポリシーRLを拡張
RL without TD learning
AI による要約
Berkeley AI ResearchはTD学習に依存しない分割統治のオフポリシー強化学習を提案した。Bellman再帰の回数を線形から対数へ減らし、長い期間のタスクへ拡張する。
入選の記録
基準 60公式・一次情報1 回目 312 回目 34
入選せず二回の合計 65 < 基準の 2 倍 120
- 情報源の区分
- 公式・一次情報、この区分の基準は 60 点
- 予備審査
- 通過:强化学习算法研究,属AI技术
採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。
情報源:Berkeley AI Research · bair.berkeley.edu