课程价格: 0.00

支持花呗分期

  • 1:【视频】先导课:30分钟了解强化学习名词脉络
  • 第1章: 基本概念
  • 第1节: State、Action、Policy等
  • 2:【视频】State、Action、Policy等
  • 第2节: Reward、Return、MDP等
  • 3:【视频】Reward、Return、MDP等
  • 4:【作业】第1章作业
  • 第2章: 贝尔曼公式
  • 第1节: Return 的重要性
  • 5:【视频】Return 的重要性
  • 第2节: State Value 的定义
  • 6:【视频】State Value 的定义
  • 第3节: 贝尔曼公式的详细推导
  • 7:【视频】贝尔曼公式的详细推导
  • 第4节: 公式向量形式与求解
  • 8:【视频】公式向量形式与求解
  • 第5节: Action Value 的定义
  • 9:【视频】Action Value 的定义
  • 10:【作业】第2章作业
  • 第3章: 贝尔曼最优公式
  • 第1节: 如何改进策略
  • 11:【视频】如何改进策略
  • 第2节: 最优策略和公式推导
  • 12:【视频】最优策略和公式推导
  • 第3节: 公式求解以及最优性
  • 13:【视频】公式求解以及最优性
  • 第4节: 最优策略的有趣性质
  • 14:【视频】最优策略的有趣性质
  • 15:【作业】第3章作业
  • 第4章: 值迭代与策略迭代
  • 第1节: 值迭代算法
  • 16:【视频】值迭代算法
  • 第2节: 策略迭代算法
  • 17:【视频】策略迭代算法
  • 第3节: 截断策略迭代算法
  • 18:【视频】截断策略迭代算法
  • 19:【作业】第4章作业
  • 第5章: 蒙特卡洛方法
  • 第1节: 蒙特卡洛介绍
  • 20:【视频】蒙特卡洛介绍
  • 第2节: MC Basic 算法介绍
  • 21:【视频】MC Basic算法介绍
  • 第3节: MC Basic 算法例子
  • 22:【视频】MC Basic算法例子
  • 第4节: MC Exploring Starts 算法
  • 23:【视频】MC Exploring Starts算法
  • 第5节: MC Epsilon-Greedy 算法介绍
  • 24:【视频】MC Epsilon-Greedy算法介绍
  • 第6节: MC Epsilon-Greedy 算法例子
  • 25:【视频】MC Epsilon-Greedy算法例子
  • 26:【作业】第5章作业
  • 第6章: 随机近似与随机梯度下降
  • 第1节: 通过例子介绍 Iterative Mean Estimation
  • 27:【视频】通过例子介绍 Iterative Mean Estimation
  • 第2节: Robbins-Monro 算法介绍与例子
  • 28:【视频】Robbins-Monro 算法介绍与例子
  • 第3节: Robbins-Monro 算法收敛性及应用
  • 29:【视频】Robbins-Monro 算法收敛性及应用
  • 第4节: 随机梯度下降算法介绍
  • 30:【视频】随机梯度下降算法介绍
  • 第5节: 随机梯度下降例子与收敛性
  • 31:【视频】随机梯度下降例子与收敛性
  • 第6节: 随机梯度下降有趣的性质
  • 32:【视频】随机梯度下降有趣的性质
  • 第7节: 随机梯度下降对比BGD/MBGD/SGD
  • 33:【视频】随机梯度下降对比BGD/MBGD/SGD
  • 34:【作业】第6章作业
  • 第7章: 时序差分方法
  • 第1节: 时序差分方法例子
  • 35:【视频】时序差分方法例子
  • 第2节: TD 算法介绍
  • 36:【视频】TD 算法介绍
  • 第3节: TD 算法收敛性与 MC 的比较
  • 37:【视频】TD 算法收敛性与 MC 的比较
  • 第4节: Sarsa 算法
  • 38:【视频】Sarsa 算法
  • 第5节: Expected Sarsa 和 N-step Sarsa
  • 39:【视频】Expected Sarsa 和 N-step Sarsa
  • 第6节: Q-Learning 介绍、On-Policy vs Off-Policy
  • 40:【视频】Q-Learning 介绍、On-Policy vs Off-Policy
  • 第7节: Q-Learning 伪代码与例子
  • 41:【视频】Q-Learning 伪代码与例子
  • 第8节: TD 算法的统一形式和总结
  • 42:【视频】TD 算法的统一形式和总结
  • 43:【作业】第7章作业
  • 第8章: 值函数近似
  • 第1节: 曲线拟合例子
  • 44:【视频】曲线拟合例子
  • 第2节: 目标函数介绍
  • 45:【视频】目标函数介绍
  • 第3节: 优化算法和函数选择
  • 46:【视频】优化算法和函数选择
  • 第4节: 示例与分析
  • 47:【视频】示例与分析
  • 第5节: Sarsa 和 Q-Learning
  • 48:【视频】Sarsa 和 Q-Learning
  • 第6节: DQN 基本原理
  • 49:【视频】DQN 基本原理
  • 第7节: DQN Experience Replay
  • 50:【视频】DQN Experience Replay
  • 第8节: DQN 代码与例子
  • 51:【视频】DQN 代码与例子
  • 52:【作业】第8章作业
  • 第9章: 策略梯度方法
  • 第1节: 策略梯度的基本思路
  • 53:【视频】策略梯度的基本思路
  • 第2节: 策略梯度的目标函数 Average Value
  • 54:【视频】策略梯度的目标函数 Average Value
  • 第3节: 策略梯度的目标函数 Average Reward
  • 55:【视频】策略梯度的目标函数 Average Reward
  • 第4节: 目标函数的梯度计算
  • 56:【视频】目标函数的梯度计算
  • 第5节: 梯度上升算法和 REINFORCE
  • 57:【视频】梯度上升算法和 REINFORCE
  • 58:【作业】第9章作业
  • 第10章: Actor-Critic方法
  • 第1节: 最简单的 Actor-Critic(QAC)
  • 59:【视频】最简单的 Actor-Critic(QAC)
  • 第2节: Advantage Actor-Critic(A2C)
  • 60:【视频】Advantage Actor-Critic(A2C)
  • 第3节: 重要性采样和 Off-Policy Actor-Critic
  • 61:【视频】重要性采样和 Off-Policy Actor-Critic
  • 第4节: Deterministic Actor-Critic(DPG)
  • 62:【视频】Deterministic Actor-Critic(DPG)
  • 第5节: 再见
  • 63:【视频】再见
  • 64:【作业】第10章作业

相关推荐

具身智能与机器人 具身智能 机器人学基础 基础
具身智能与机器人 具身智能 四足机器人 进阶
具身智能与机器人 人形机器人 进阶
具身智能与机器人 具身智能 高级

未注册验证后自动登录,注册/登录则视为同意

《服务协议》《隐私协议》

请完善资料,让我们更好的为您服务!

+86  (手机号已绑定)

未注册验证后自动登录,注册/登录则视为同意

《服务协议》《隐私协议》