强化学习-赵世钰(二):贝尔曼/Bellman方程【用于计算给定π下的State Value:①线性方程组法、②迭代法】、Action Value【根据状态值求解得到;用来评价action优劣】
StateValue:theaverageReturnthatanagentcanobtainifitfollowsagivenpolicy/π【给定一个policy/π,所有可能的trajectorys得到的所有return的平均值/期望值:vπ(s)≐E[Gt∣St=s]v_\pi(s)\doteq\mathbb{E}[G_t|S_t=s]vπ(s)≐E[Gt∣St=s]】.Return:th