CodeRoadMap
路线图课程知识库文章题库资源社区我的学习
CodeRoadMap

程序员的学习成长路线图。登录解锁全部课程,并同步路线图与课时进度。

学习

  • 路线图
  • 课程
  • 文章
  • 题库
  • 知识库

更多

  • 资源
  • 社区
  • 我的学习
  • 内容说明

© 2026 CodeRoadMap

津ICP备2026012044号-1·coderoadmap@126.com
开发路线图/机器学习工程师路线图/Q-Learning
阶段三

Q-Learning

Q-Learning 是一种强化学习算法,旨在给定当前状态时找出最佳行动。它通过学习一个“Q 函数”来运作,该函数估算在特定状态采取特定行动并随后遵循最优策略所期望的累积奖励。这个 Q 函数会根据智能体的经验进行迭代更新,使其无需环境模型就能学习最优策略。

登录查看节点详情

首阶段节点可试读;登录后解锁全部路线图节点正文与进度同步。

登录免费注册
← 上一节点深度 Q 网络下一节点 →准确率