RL vs 监督学习:从“抄答案”到“试错得分”
上一课你拿到了地图。这课开始填第一站的词汇——RL 的六个基本术语。学完这课,你能把任何一个 LLM 训练场景拆成 状态 / 动作 / 奖励 / 回报 / 策略 / 回合,这是后面所有公式的字母表。
一、一句话讲清区别
监督学习:有一个标准答案 $y$,模型预测 $\hat{y}$,损失衡量两者差距。模型在模仿。
强化学习:没有标准答案,模型(叫 agent)输出一个动作,世界回一个奖励标量,模型自己摸索“哪些动作得分高”。模型在试错。
二、RL 的基本循环
三、还有两个词:回报与回合
回报 $G$:一个回合里所有奖励的累计。最常用的是折扣累计:
$$ G_t \;=\; r_t + \gamma\, r_{t+1} + \gamma^2 r_{t+2} + \cdots \;=\; \sum_{k=0}^{\infty} \gamma^{k}\, r_{t+k} $$
$\gamma \in (0,1]$ 是折扣因子,越远的奖励权重越小。LLM RLHF 里奖励常很稀疏(只在回答结束时给一次),这时 $G$ 往往就是那一个终末奖励。
回合(episode):一次完整的“状态→动作→…→结束”序列,也叫轨迹 $\tau = (s_0, a_0, r_0,\; s_1, a_1, r_1,\; \ldots)$。LLM 中:一条 prompt + 模型生成的完整回答 = 一个回合。
四、RL 的目标(一句话)
$$ \max_{\pi}\; \mathbb{E}_{\,\tau \sim \pi}\!\left[\, G \,\right] $$
期望 $\mathbb{E}$ 是对所有可能轨迹 $\tau$(按策略 $\pi$ 采样得到的)求平均。注意这个期望——这是第 4 课推导策略梯度定理的起点。五、把 LLM 场景拆一遍(本课胜利)
场景:“用 GRPO 训模型解数学题,答对得 1 分,答错 0 分。”拆成六项:
| 状态 $s$ | 数学题 prompt(题面) |
| 动作 $a$ | 模型生成的完整解答(含推理过程) |
| 奖励 $r$ | 答案对错:答对 $=1$,答错 $=0$(终末给一次) |
| 回报 $G$ | 就是这一个 $r$(稀疏奖励,单步回合) |
| 策略 $\pi$ | 语言模型:给定 $s$,输出 $a$ 的概率 |
| 回合 $\tau$ | $(\text{prompt},\, \text{生成回答},\, \text{终末奖励})$ 一条 |
你看,第 1 课地图里的 R1/GRPO 站,落到 RL 词汇上就这么具体。后面所有公式,都是在算“怎么调 $\pi$,让这个 $\mathbb{E}[G]$ 变大”。
六、自测
问题 1:在 LLM RLHF 里,“策略 π” 指的是?
问题 2:RL 与监督学习最本质的区别是?
七、推荐资源(正式化词汇)
读 Spinning Up · Part 1 的 (Optional) Formalism 小节。这页用数学符号把本课的 agent/environment/policy/return 正式写了一遍,正好和本课对应。读它来“校准”你的符号记忆。
这是第 2 课。下一课预告:第 3 课 · MDP 与 RL 目标的正式化——把状态转移、折扣回报、期望回报写成 MDP 框架,为第 4 课策略梯度推导铺路。
任何不懂的词,直接问老师。