Berkeley AI Research·· 2025-11-01AI 评分30
Berkeley AI Research:不依赖 TD 学习的强化学习,用分治法扩展长时程任务
RL without TD learning
AI 导读
Berkeley AI Research 提出一种基于分治法(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。该工作与 Aditya 共同主导,在 goal-conditioned RL 上首次实现了分治法价值学习的规模化扩展,利用三角形不等式构造传递式 Bellman 更新规则。
来源:Berkeley AI Research · bair.berkeley.edu