RL-赵-(七)-不基于模型5:Q-Learning【TD算法】【离线】【基于RM算法在无模型条件下求解贝尔曼最优公式->直接计算出最优ActionValue->直接更新目标π】【无需PE与PI迭代】二、Off-policy、On-policy在深入研究Q-learning之前,我们首先介绍两个重要的概念,首先,在TD learning task中存在两个策略:第一个是behav