策略梯度方法是一类直接优化策略函数的强化学习算法,该函数将状态映射到行动。与先学习价值函数(如 Q-learning)再从中推导策略不同,策略梯度方法通过调整其参数来最大化预期奖励,直接学习最优策略。这通常通过估计预期奖励相对于策略参数的梯度,然后沿梯度方向更新参数来实现。
登录查看节点详情
首阶段节点可试读;登录后解锁全部路线图节点正文与进度同步。