CodeRoadMap
路线图课程知识库文章题库资源社区我的学习
CodeRoadMap

程序员的学习成长路线图。登录解锁全部课程,并同步路线图与课时进度。

学习

  • 路线图
  • 课程
  • 文章
  • 题库
  • 知识库

更多

  • 资源
  • 社区
  • 我的学习
  • 内容说明

© 2026 CodeRoadMap

津ICP备2026012044号-1·coderoadmap@126.com
开发路线图/机器学习工程师路线图/策略梯度
阶段三

策略梯度

策略梯度方法是一类直接优化策略函数的强化学习算法,该函数将状态映射到行动。与先学习价值函数(如 Q-learning)再从中推导策略不同,策略梯度方法通过调整其参数来最大化预期奖励,直接学习最优策略。这通常通过估计预期奖励相对于策略参数的梯度,然后沿梯度方向更新参数来实现。

登录查看节点详情

首阶段节点可试读;登录后解锁全部路线图节点正文与进度同步。

登录免费注册
← 上一节点什么是强化学习?下一节点 →演员-评论家方法