跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分30

Berkeley AI Research:不依赖 TD 学习的强化学习,用分治法扩展长时程任务

RL without TD learning

AI 导读

Berkeley AI Research 提出一种基于分治法(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。该工作与 Aditya 共同主导,在 goal-conditioned RL 上首次实现了分治法价值学习的规模化扩展,利用三角形不等式构造传递式 Bellman 更新规则。

来源:Berkeley AI Research · bair.berkeley.edu