2、如何优化目标函数?答案:梯度下降当我们有了目标函数,下一步就是优化它。为了最小化目标函数J(w)J(w)J(w),我们可以使用gradient-descent算法:wk+1 = wk − αk∇wJ(wk ) \begin{aligned}w_{k+1}\:=\:w_k\:-\:\alpha_k\nabla_wJ(w_k\:)\end{aligned}wk+1​=wk​−αk​∇w​J(wk​)​真实梯度(true gradient)的表达式如下:∇wJ(w)=∇wE[(vπ(S)−v^(S,w))2]=E[∇w(vπ(S)−v^(S,w))2]=2E[(vπ(S)−v^(S,w))(−∇wv^(S,w))]=−2E[(vπ(S)−v^(S,w))∇wv^(S,w)]\begin{aligned} \nabla_wJ(w) =\nabla_w\mathbb{E}[(v_\pi(S)-\hat{v}(S,w))^2] \\ =\mathbb{E}[\nabla_w(v_\pi(S)-\hat{v}(S,w))^2] \\ =2\mathbb{E}[(v_\pi(S)-\hat{v}(S,w))(-\nabla_w\hat{v}(S,w))] \\ \begin{aligned}=-2\mathbb{E}[(v_\pi(S)-\hat{v}(S,w))\nabla_w\hat{v}(S,w)]\end{aligned} \end{aligned}∇w​J(w)​=∇w​E[(vπ​(S)−v^(S,w))2]=E[∇w​(vπ​(S)−v^