Berkeley AI Research·AI 评分38
无需 TD 学习的强化学习:分治法如何扩展到长时程任务
RL without TD learning
AI 导读
伯克利 AI 研究提出一种基于分治范式的 off-policy 强化学习算法,不依赖时序差分(TD)学习,理论上可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。
来源:Berkeley AI Research · bair.berkeley.edu
RL without TD learning
伯克利 AI 研究提出一种基于分治范式的 off-policy 强化学习算法,不依赖时序差分(TD)学习,理论上可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。
来源:Berkeley AI Research · bair.berkeley.edu