ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RL-赵-(七)-不基于模型2-时序差分/TD算法05-计算ActionValue:Q-Learning01【求贝尔曼最优公式⮕直接得最优ActionValue⮕直接更新目标π】【无需PE与PI迭代】

RL-赵-(七)-不基于模型2-时序差分/TD算法05-计算ActionValue:Q-Learning01【求贝尔曼最优公式⮕直接得最优ActionValue⮕直接更新目标π】【无需PE与PI迭代】 RL-赵-(七)-不基于模型5:Q-Learning【TD算法】【离线】【基于RM算法在无模型条件下求解贝尔曼最优公式->直接计算出最优ActionValue->直接更新目标π】【无需PE与PI迭代】直接求解q*(最优action value)得到最优策略,无需在PE与PI迭代来找最优策略。直接估计optimal action values,不需要进行policy evaluation和policy improvement相互迭代计算来找最优策略。接下来,我们介绍Q-learning,这是最广泛使用的强化学习算法之一。Sarsa基于一个给定的policy估计action value,它必须整合policy improvement step才能寻找最优策略。Q-learning直接估计optimal action values,从而找到最优策略。TD算法【用来计算State Valuevvv】:vt+1(st)⏟newestimate=vt(st)⏟currentestimate−αt(st)[vt(st)−[rt+1+γvt(st+1)⏟υˉtTDtargetvˉt]]⏞TDerrorδt\color{red}{ \underbrace{v_{t+1}(s_t)}_{\text{new estimate}} =\underbrace{v_t(s_t)}_{\text{current estimate}} - \alpha_t(s_t)[\overbrace{v_t(s_t)-[\underbrace{r_{t+1}+\gamma v_t(s_{t+1})}_{\bar{\upsilon}_t}^{\text{TD target }\bar{v}_t}]]}^{\text{TD error}\ \delta_t}}newestimatevt+1​(st​)​​=currentestimatevt​(st​)​​−αt​(st​)[vt​(st​)−[TDtargetvˉt​rt+1​+γvt​(s
返回列表