Key points are not available for this paper at this time.
摘要 强化学习将奖励最大化视为单一目标,因此痛苦的避免隐含在快乐的寻求中。然而,人类似乎拥有独立的神经系统来处理痛苦和快乐。本文通过网格世界实验探讨这种分离的计算优势。我们证明,采用独立最大和最小运算符进行价值传播的模块化架构在非平稳环境中优于整体模型。这种分离使得智能体能够同时增长和缩小已学习的价值而不产生干扰,从而实现高效的奖励收集和惩罚避免。此外,这些独立的系统可以使用类似情绪的机制动态裁决,以快速适应。我们的结果表明,独立的痛苦和快乐系统可能是为了在变化的环境中实现安全和高效的学习而进化的。大自然将人类置于痛苦和快乐这两位主宰的治理下。——杰里米·边沁
Dulberg等人(星期六)研究了这个问题。