Q-Learning 是一种强化学习算法,旨在给定当前状态时找出最佳行动。它通过学习一个“Q 函数”来运作,该函数估算在特定状态采取特定行动并随后遵循最优策略所期望的累积奖励。这个 Q 函数会根据智能体的经验进行迭代更新,使其无需环境模型就能学习最优策略。
登录查看节点详情
首阶段节点可试读;登录后解锁全部路线图节点正文与进度同步。