跳转至

强化学习总纲

以下是强化学习知识点教程框架。只有已经存在的知识页使用链接;其余术语先 保留在本页,待形成独立、可验证的内容后再拆分。


一、基础概念

  1. 核心要素
  2. 智能体(Agent):学习与决策的主体,通过与环境交互实现目标(如 AlphaGo 的决策模块)
  3. 环境(Environment):智能体外部的一切,包含状态转移与奖励机制
  4. 状态(State):描述环境的瞬时特征
  5. 动作(Action):智能体可执行的操作集合
  6. 奖励(Reward):标量反馈信号,驱动智能体优化策略

  7. 学习机制

  8. 策略(Policy):状态到动作的映射规则(确定性策略如$\mu(s)$,随机性策略如$\pi(a|s)$)
  9. 价值函数(Value Function):衡量状态或状态-动作对的长期期望回报($V(s)$和$Q(s,a)$)
  10. 探索与利用(Exploration vs. Exploitation):平衡尝试新动作与利用已知高回报动作的矛盾

  11. 理论框架

  12. 马尔可夫决策过程(MDP):基于状态转移概率和即时奖励的数学模型,包含状态、动作、转移概率、奖励函数和折扣因子
  13. 贝尔曼方程(Bellman Equation):递归表达价值函数的核心公式($V(s)=\max_a [R(s,a) + \gamma \sum_{s'} P(s'|s,a)V(s')]$)

二、核心算法

  1. 经典方法
  2. Q-learning:无模型的离策略算法,通过更新 Q 表逼近最优动作价值函数
  3. SARSA:同策略的 TD 控制方法,更新依赖实际执行动作而非最大值

  4. 深度强化学习

  5. DQN(深度 Q 网络):结合 Q-learning 与神经网络,引入经验回放和固定目标网络解决不稳定问题
  6. 策略梯度(Policy Gradient):直接优化策略参数,适用于连续动作空间
  7. PPO(近端策略优化):通过截断目标函数实现稳定训练
  8. SAC(软演员-评论家):引入最大熵框架平衡探索与利用

  9. 进阶变体

  10. CQL(保守 Q 学习):通过正则化防止 Q 值高估,提升离线强化学习性能
  11. TD3(双延迟深度确定性策略梯度):改进 DDPG,采用双 Q 网络与目标策略平滑

三、数学基础

  1. 必备工具
  2. 动态规划(Dynamic Programming):求解 MDP 的迭代方法
  3. 概率论与统计:理解状态转移分布、期望回报计算及探索策略设计
  4. 优化与梯度下降:策略网络参数更新与损失函数优化的核心技术

  5. 关键推导

  6. 贝尔曼最优性原理:证明最优策略对应的价值函数满足自洽方程
  7. 策略梯度定理:推导策略性能度量对参数的梯度表达式

四、进阶主题

  1. 复杂场景扩展
  2. 多智能体强化学习(MARL):处理竞争或协作环境。
  3. 逆强化学习(IRL):从专家示范中推断奖励函数。
  4. 分层强化学习(HRL):通过子策略分解解决长期信用分配问题。

  5. 前沿方向

  6. 基于 Transformer 的强化学习:利用注意力机制处理长序列决策。
  7. 元强化学习(Meta-RL):快速适应新任务的小样本学习框架。

五、应用场景

  1. 典型领域
  2. 游戏AI(Atari游戏、AlphaGo)
  3. 机器人控制(机械臂抓取、无人机导航)
  4. 推荐系统(动态调整推荐策略)
  5. 自动驾驶(路径规划、交通信号优化)

  6. 实践挑战

  7. 奖励设计(Reward Shaping):通过额外反馈缓解稀疏奖励,但必须避免改变原任务的最优策略。
  8. 部分可观测 MDP(POMDP):处理智能体无法直接观察完整环境状态的情况。

六、学习资源推荐

  • 入门:李宏毅《深度强化学习》视频(代码示例丰富)
  • 理论:David Silver课程(系统性框架+学术深度)
  • 数学:《深度强化学习(初稿)》(需线性代数/优化基础)
  • 实战:GitHub项目datawhalechina/easy-rl(13种算法PyTorch实现)

待扩展页面

  • 多智能体强化学习(MARL)
  • 奖励设计与稀疏奖励
  • 离线强化学习
  • 基于 Transformer 的强化学习
  • 部分可观测 MDP(POMDP)

只有在能够提供清晰定义、公式边界和可靠来源后,才把这些条目拆成独立页面。