第 2 课 · RL 基础

RL vs 监督学习:从“抄答案”到“试错得分”

RL → GRPO 课程 · 第 2/12 课 · 预计 14 分钟 · ← 上一课

上一课你拿到了地图。这课开始填第一站的词汇——RL 的六个基本术语。学完这课,你能把任何一个 LLM 训练场景拆成 状态 / 动作 / 奖励 / 回报 / 策略 / 回合,这是后面所有公式的字母表。

一、一句话讲清区别

监督学习:有一个标准答案 $y$,模型预测 $\hat{y}$,损失衡量两者差距。模型在模仿

强化学习:没有标准答案,模型(叫 agent)输出一个动作,世界回一个奖励标量,模型自己摸索“哪些动作得分高”。模型在试错

核心位移:从“对不对”变成了“好不好”。监督学习问“$\hat{y}$ 等不等于 $y$”;RL 问“$a$ 这个动作得了多少分”。分数是个连续标量,所以同一个状态下可以有很多“还不错”的动作——这是 RL 难、也是它灵活的根源。

二、RL 的基本循环

Agent 策略 π(a | s) Environment 世界 / 规则 动作 a 状态 s + 奖励 r
点击图中任一方框或箭头,看定义 + LLM 中的对应物。
选一个术语:点上方循环图里的 Agent / Environment / 动作 / 状态+奖励,或用下面按钮。

三、还有两个词:回报与回合

回报 $G$:一个回合里所有奖励的累计。最常用的是折扣累计

$$ G_t \;=\; r_t + \gamma\, r_{t+1} + \gamma^2 r_{t+2} + \cdots \;=\; \sum_{k=0}^{\infty} \gamma^{k}\, r_{t+k} $$

$\gamma \in (0,1]$ 是折扣因子,越远的奖励权重越小。LLM RLHF 里奖励常很稀疏(只在回答结束时给一次),这时 $G$ 往往就是那一个终末奖励。

回合(episode):一次完整的“状态→动作→…→结束”序列,也叫轨迹 $\tau = (s_0, a_0, r_0,\; s_1, a_1, r_1,\; \ldots)$。LLM 中:一条 prompt + 模型生成的完整回答 = 一个回合。

四、RL 的目标(一句话)

RL 目标:找到策略 $\pi$,使期望回报最大:

$$ \max_{\pi}\; \mathbb{E}_{\,\tau \sim \pi}\!\left[\, G \,\right] $$

期望 $\mathbb{E}$ 是对所有可能轨迹 $\tau$(按策略 $\pi$ 采样得到的)求平均。注意这个期望——这是第 4 课推导策略梯度定理的起点。

五、把 LLM 场景拆一遍(本课胜利)

场景:“用 GRPO 训模型解数学题,答对得 1 分,答错 0 分。”拆成六项:

状态 $s$数学题 prompt(题面)
动作 $a$模型生成的完整解答(含推理过程)
奖励 $r$答案对错:答对 $=1$,答错 $=0$(终末给一次)
回报 $G$就是这一个 $r$(稀疏奖励,单步回合)
策略 $\pi$语言模型:给定 $s$,输出 $a$ 的概率
回合 $\tau$$(\text{prompt},\, \text{生成回答},\, \text{终末奖励})$ 一条

你看,第 1 课地图里的 R1/GRPO 站,落到 RL 词汇上就这么具体。后面所有公式,都是在算“怎么调 $\pi$,让这个 $\mathbb{E}[G]$ 变大”。

六、自测

问题 1:在 LLM RLHF 里,“策略 π” 指的是?

问题 2:RL 与监督学习最本质的区别是?

七、推荐资源(正式化词汇)

Spinning Up · Part 1 的 (Optional) Formalism 小节。这页用数学符号把本课的 agent/environment/policy/return 正式写了一遍,正好和本课对应。读它来“校准”你的符号记忆。

提问邀请:读完告诉我你卡在哪个符号。常见卡点:“π(a|s) 为什么是概率而不是单个动作?”“γ 为什么要折扣?”“E 下标 τ~π 是什么意思?”——回答这些会决定第 3 课(MDP)我们要不要补概率论基础。

这是第 2 课。下一课预告:第 3 课 · MDP 与 RL 目标的正式化——把状态转移、折扣回报、期望回报写成 MDP 框架,为第 4 课策略梯度推导铺路。

任何不懂的词,直接问老师。