课程价格 :
¥0.00
剩余名额
290
课程价格:
¥0.00
支持花呗分期
剩余名额:
290个






- 1:【视频】先导课:30分钟了解强化学习名词脉络
- 第1章: 基本概念
- 第1节: State、Action、Policy等
- 2:【视频】State、Action、Policy等
- 第2节: Reward、Return、MDP等
- 3:【视频】Reward、Return、MDP等
- 4:【作业】第1章作业
- 第2章: 贝尔曼公式
- 第1节: Return 的重要性
- 5:【视频】Return 的重要性
- 第2节: State Value 的定义
- 6:【视频】State Value 的定义
- 第3节: 贝尔曼公式的详细推导
- 7:【视频】贝尔曼公式的详细推导
- 第4节: 公式向量形式与求解
- 8:【视频】公式向量形式与求解
- 第5节: Action Value 的定义
- 9:【视频】Action Value 的定义
- 10:【作业】第2章作业
- 第3章: 贝尔曼最优公式
- 第1节: 如何改进策略
- 11:【视频】如何改进策略
- 第2节: 最优策略和公式推导
- 12:【视频】最优策略和公式推导
- 第3节: 公式求解以及最优性
- 13:【视频】公式求解以及最优性
- 第4节: 最优策略的有趣性质
- 14:【视频】最优策略的有趣性质
- 15:【作业】第3章作业
- 第4章: 值迭代与策略迭代
- 第1节: 值迭代算法
- 16:【视频】值迭代算法
- 第2节: 策略迭代算法
- 17:【视频】策略迭代算法
- 第3节: 截断策略迭代算法
- 18:【视频】截断策略迭代算法
- 19:【作业】第4章作业
- 第5章: 蒙特卡洛方法
- 第1节: 蒙特卡洛介绍
- 20:【视频】蒙特卡洛介绍
- 第2节: MC Basic 算法介绍
- 21:【视频】MC Basic算法介绍
- 第3节: MC Basic 算法例子
- 22:【视频】MC Basic算法例子
- 第4节: MC Exploring Starts 算法
- 23:【视频】MC Exploring Starts算法
- 第5节: MC Epsilon-Greedy 算法介绍
- 24:【视频】MC Epsilon-Greedy算法介绍
- 第6节: MC Epsilon-Greedy 算法例子
- 25:【视频】MC Epsilon-Greedy算法例子
- 26:【作业】第5章作业
- 第6章: 随机近似与随机梯度下降
- 第1节: 通过例子介绍 Iterative Mean Estimation
- 27:【视频】通过例子介绍 Iterative Mean Estimation
- 第2节: Robbins-Monro 算法介绍与例子
- 28:【视频】Robbins-Monro 算法介绍与例子
- 第3节: Robbins-Monro 算法收敛性及应用
- 29:【视频】Robbins-Monro 算法收敛性及应用
- 第4节: 随机梯度下降算法介绍
- 30:【视频】随机梯度下降算法介绍
- 第5节: 随机梯度下降例子与收敛性
- 31:【视频】随机梯度下降例子与收敛性
- 第6节: 随机梯度下降有趣的性质
- 32:【视频】随机梯度下降有趣的性质
- 第7节: 随机梯度下降对比BGD/MBGD/SGD
- 33:【视频】随机梯度下降对比BGD/MBGD/SGD
- 34:【作业】第6章作业
- 第7章: 时序差分方法
- 第1节: 时序差分方法例子
- 35:【视频】时序差分方法例子
- 第2节: TD 算法介绍
- 36:【视频】TD 算法介绍
- 第3节: TD 算法收敛性与 MC 的比较
- 37:【视频】TD 算法收敛性与 MC 的比较
- 第4节: Sarsa 算法
- 38:【视频】Sarsa 算法
- 第5节: Expected Sarsa 和 N-step Sarsa
- 39:【视频】Expected Sarsa 和 N-step Sarsa
- 第6节: Q-Learning 介绍、On-Policy vs Off-Policy
- 40:【视频】Q-Learning 介绍、On-Policy vs Off-Policy
- 第7节: Q-Learning 伪代码与例子
- 41:【视频】Q-Learning 伪代码与例子
- 第8节: TD 算法的统一形式和总结
- 42:【视频】TD 算法的统一形式和总结
- 43:【作业】第7章作业
- 第8章: 值函数近似
- 第1节: 曲线拟合例子
- 44:【视频】曲线拟合例子
- 第2节: 目标函数介绍
- 45:【视频】目标函数介绍
- 第3节: 优化算法和函数选择
- 46:【视频】优化算法和函数选择
- 第4节: 示例与分析
- 47:【视频】示例与分析
- 第5节: Sarsa 和 Q-Learning
- 48:【视频】Sarsa 和 Q-Learning
- 第6节: DQN 基本原理
- 49:【视频】DQN 基本原理
- 第7节: DQN Experience Replay
- 50:【视频】DQN Experience Replay
- 第8节: DQN 代码与例子
- 51:【视频】DQN 代码与例子
- 52:【作业】第8章作业
- 第9章: 策略梯度方法
- 第1节: 策略梯度的基本思路
- 53:【视频】策略梯度的基本思路
- 第2节: 策略梯度的目标函数 Average Value
- 54:【视频】策略梯度的目标函数 Average Value
- 第3节: 策略梯度的目标函数 Average Reward
- 55:【视频】策略梯度的目标函数 Average Reward
- 第4节: 目标函数的梯度计算
- 56:【视频】目标函数的梯度计算
- 第5节: 梯度上升算法和 REINFORCE
- 57:【视频】梯度上升算法和 REINFORCE
- 58:【作业】第9章作业
- 第10章: Actor-Critic方法
- 第1节: 最简单的 Actor-Critic(QAC)
- 59:【视频】最简单的 Actor-Critic(QAC)
- 第2节: Advantage Actor-Critic(A2C)
- 60:【视频】Advantage Actor-Critic(A2C)
- 第3节: 重要性采样和 Off-Policy Actor-Critic
- 61:【视频】重要性采样和 Off-Policy Actor-Critic
- 第4节: Deterministic Actor-Critic(DPG)
- 62:【视频】Deterministic Actor-Critic(DPG)
- 第5节: 再见
- 63:【视频】再见
- 64:【作业】第10章作业
- 第11章: 期末作业
- 65:【作业】期末作业





