第 1 课 · 全景图
从监督学习到 GRPO:训练推理模型的地图
在进入任何公式之前,先拿到一张地图。这张课的目标只有一个:让你能把任何一个新概念放到正确的位置。当你以后读到"SFT""奖励模型""PPO 裁剪""GRPO 组内优势""R1-Zero"时,知道它在这条线上的哪一站。
一、问题:监督学习为什么不够
语言模型预训练做的事极简:给上文,预测下一个 token。这是监督学习——有标准答案,照着学。
但一旦想让模型有用、诚实、无害,或让它一步步推理解数学题,监督学习就撞墙了:
- 没有"标准答案"可以抄——同一个问题,好的回答有很多种;
- "好"是个奖励问题,不是对错问题;
- 推理过程的对错,往往只能在最后才判定(答案对不对),中间步骤无法逐一标注。
于是思路转向:不让模型抄答案,而是让它试、给它打分、让它往高分方向改。这就是强化学习(RL)。
二、地图:一条线的五个站点
澄清:图中最后一站 R1 指的是 DeepSeek-R1(一个模型/论文的名字),它用的方法就是 RL(具体是 GRPO)。也就是说“R1”是地名(里程碑),“RL”是交通工具(算法),两者不冲突。
选一个站点:点击上方圆圈或下方按钮,看它"相对上一站,改变了什么"。
本课的胜利:你能复述这条线的叙事逻辑——每一站都是为解决上一站的痛点而生。SFT 给基线 → RM 把"好"变标量 → PPO 用奖励优化策略 → GRPO 砍掉贵部件 → R1 证明推理可涌现。后面所有公式,都是在为这条线某一段的"怎么做"做严格化。
三、自测:地图是否在你脑中
问题 1:RLHF 的三阶段顺序是?
问题 2:GRPO 相对 PPO 最关键的工程改动是?
四、推荐的第一个外部资源
在进入下一课前,强烈建议读一遍 OpenAI Spinning Up · Part 1: Key Concepts in RL。只读这一页,建立 RL 的基本词汇(agent / environment / state / action / reward / policy)。遇到不懂的词不用怕——第 2 课会逐个正式讲。
老师的提问邀请:读完上面那页后,回来问我任何没看懂的词。例如"policy 到底是函数还是策略?""reward 和 return 有什么区别?"——我会在你的最近发展区里回答,并据此决定下一课的起点。
这是本课程第 1 课。下一课预告:第 2 课 · RL vs 监督学习:从“抄答案”到“试错得分”,正式定义 agent/environment/policy/reward,开始铺第一个数学概念。
如果你对这课的内容有疑问,或想调整深度/节奏,直接告诉老师。