跳到正文
原文
Berkeley AI Research·· 2025-11-01

不依赖 TD 学习的强化学习:用分治法扩展 off-policy RL

RL without TD learning

AI 导读

伯克利 AI 研究提出一种基于分治(divide and conquer)的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。

入选记录

未入选两次之和 65 < 门槛的两倍 120

信源等级
官方一手,这一级的门槛是 60 分
预筛
通过:强化学习算法研究,属AI技术

评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。

来源:Berkeley AI Research · bair.berkeley.edu