第二章 Value-Based强化学习算法演进路线重点分析:Dynamic ProgrammingMonte CarloTemporal Difference LearningQ-LearningSARSADQNDouble DQNDueling DQNPrioritized Experience ReplayRainbow DQN并详细展开每个算法:产生背景;核心思想;数学公式;Loss;Mermaid结构图;经典论文;优点;缺点;后续演进方向。2.1 Value-Based方法整体思想在强化学习发展早期,研究者首先思考一个问题:如果我们知道每个状态、每个动作未来能够获得多少收益,那么是不是就可以选择价值最高的动作?于是产生了Value-Based方法。Value-Based方法的核心思想是:不直接学习动作,而是学习价值函数(Value Function),然后根据