No history yet

马尔可夫决策过程

决策的数学框架

在强化学习中,智能体通过与环境互动来学习。为了给这种互动提供一个清晰的数学结构,我们使用马尔可夫决策过程(Markov Decision Process, MDP)。它是一种形式化的方法,用来描述智能体在不确定环境中做出序贯决策的问题。

当你在业界遇到一个问题时,第一步也是最重要的一步,就是将该问题转化为马尔可夫决策过程(MDP)。

一个马尔可夫决策过程由五个核心要素组成,通常表示为一个五元组 (S,A,P,R,γ)(S, A, P, R, \gamma)。让我们逐一分解这些要素,看看它们如何协同工作,为智能体的学习之旅搭建舞台。

MDP的核心要素

想象一个简单的网格世界游戏。一个机器人(智能体)的目标是从起点移动到终点,同时避开障碍物。这个游戏就可以用MDP来建模。

状态(States, S) 状态是智能体在某个时刻所处环境的完整描述。在我们的网格游戏中,状态就是机器人在网格中的具体位置,例如坐标(1, 2)。状态集合 SS 是所有可能位置的集合。

状态

noun

对智能体所处环境的特定、瞬时描述。

动作(Actions, A) 动作是智能体可以在特定状态下执行的操作。在网格世界里,动作集合 AA 可能包括:向上、向下、向左、向右移动。在状态 ss 下可以执行的动作集合表示为 A(s)A(s)

转移概率(Transition Probability, P) 转移概率描述了环境的动态性。它定义了在状态 ss 执行动作 aa 后,转移到下一个状态 ss' 的概率。我们用 Pa(s,s)P_a(s, s') 来表示。例如,如果机器人在一个开阔的格子里选择“向上”移动,它有90%的概率成功移动到上面的格子,但有10%的概率因为“打滑”而留在原地。这种不确定性是许多现实世界问题的核心特征。

Pa(s,s)=P(St+1=sSt=s,At=a)P_a(s, s') = P(S_{t+1} = s' | S_t = s, A_t = a)

一个关键的假设是 马尔可夫性质:下一个状态 ss' 的概率只取决于当前状态 ss 和当前动作 aa,与过去的所有状态和动作都无关。这极大地简化了问题的建模。

奖励(Reward, R) 奖励函数 Ra(s,s)R_a(s, s') 定义了智能体在状态 ss 执行动作 aa 并转移到状态 ss' 后获得的即时奖励。奖励是智能体学习的目标信号。在我们的游戏中,到达终点可能会得到+10的奖励,撞到障碍物得到-5的惩罚,而每走一步则得到-0.1的小惩罚,以鼓励它尽快找到终点。

长期回报与折扣因子

智能体的目标不是最大化即时奖励,而是最大化从当前时刻开始的累积奖励,也称为“回报”(Return)。但未来的奖励真的和眼前的奖励一样重要吗?

折扣因子(Discount Factor, γ\gamma 折扣因子 γ\gamma 是一个介于0和1之间的数字,它决定了未来奖励的当前价值。一个靠近0的 γ\gamma 值意味着智能体更看重即时奖励(“短视”),而一个靠近1的 γ\gamma 值则意味着智能体更看重长期回报(“有远见”)。

回报 GtG_t 的计算方式是所有未来奖励的折扣总和:

Gt=Rt+1+γRt+2+γ2Rt+3+=k=0γkRt+k+1G_t = R_{t+1} + \gamma R_{t+2} + \gamma^2 R_{t+3} + \dots = \sum_{k=0}^{\infty} \gamma^k R_{t+k+1}

引入折扣因子有两个主要原因:

  1. 数学上的便利:它可以确保在无限过程中,回报的总和是一个有限值。
  2. 模拟现实:未来的不确定性使得即时奖励通常更有价值。例如,今天到手的$100通常比一年后承诺的$100更有价值。

将所有要素整合

让我们用一个具体的例子来形象化MDP的各个部分。假设一个3x3的网格世界:

  • 状态 SS: 9个格子,可以标记为 s1,s2,...,s9s_1, s_2, ..., s_9
  • 动作 AA: {上, 下, 左, 右}。
  • 奖励 RR: 目标格子(例如 s9s_9)提供+1的奖励,陷阱格子(例如 s6s_6)提供-1的奖励,其他移动消耗-0.01。
  • 转移概率 PP: 智能体有80%的概率朝预定方向移动,20%的概率向侧方随机移动(每个侧方10%)。如果撞墙,则停在原地。
  • 折扣因子 γ\gamma: 设为0.9,表示智能体比较看重长期回报。

有了这个MDP模型,强化学习算法的目标就是找到一个策略 π\pi。策略是一个从状态到动作的映射,它告诉智能体在每个状态下应该采取什么动作,以最大化其预期的累积折扣奖励。

MDP为我们提供了一个强大而灵活的框架,用于思考和解决涉及序贯决策的各种问题,从玩视频游戏到管理投资组合,再到控制机器人。

Quiz Questions 1/5

在马尔可夫决策过程 (MDP) 的标准五元组 (S,A,P,R,γ)(S, A, P, R, \gamma) 中,哪个要素不属于其核心组成部分?

Quiz Questions 2/5

马尔可夫性质的核心思想是:下一个状态的概率只取决于当前状态和当前动作,而与过去的所有状态和动作都无关。

理解了这些核心概念,你就为探索解决MDP的各种强化学习算法打下了坚实的基础。