第 1 课 · 全景图

从监督学习到 GRPO:训练推理模型的地图

RL → GRPO 课程 · 第 1/12 课 · 预计 12 分钟

在进入任何公式之前,先拿到一张地图。这张课的目标只有一个:让你能把任何一个新概念放到正确的位置。当你以后读到"SFT""奖励模型""PPO 裁剪""GRPO 组内优势""R1-Zero"时,知道它在这条线上的哪一站。

一、问题:监督学习为什么不够

语言模型预训练做的事极简:给上文,预测下一个 token。这是监督学习——有标准答案,照着学。

但一旦想让模型有用、诚实、无害,或让它一步步推理解数学题,监督学习就撞墙了:

于是思路转向:不让模型抄答案,而是让它试、给它打分、让它往高分方向改。这就是强化学习(RL)。

二、地图:一条线的五个站点

SFT 监督微调 RM 奖励模型 PPO RLHF 优化 GRPO 去价值模型 R1 纯RL推理
点击上方任一圆圈或下方按钮,查看它解决了上一站的什么痛点。

澄清:图中最后一站 R1 指的是 DeepSeek-R1(一个模型/论文的名字),它用的方法就是 RL(具体是 GRPO)。也就是说“R1”是地名(里程碑),“RL”是交通工具(算法),两者不冲突。

选一个站点:点击上方圆圈或下方按钮,看它"相对上一站,改变了什么"。

本课的胜利:你能复述这条线的叙事逻辑——每一站都是为解决上一站的痛点而生。SFT 给基线 → RM 把"好"变标量 → PPO 用奖励优化策略 → GRPO 砍掉贵部件 → R1 证明推理可涌现。后面所有公式,都是在为这条线某一段的"怎么做"做严格化。

三、自测:地图是否在你脑中

问题 1:RLHF 的三阶段顺序是?

问题 2:GRPO 相对 PPO 最关键的工程改动是?

四、推荐的第一个外部资源

在进入下一课前,强烈建议读一遍 OpenAI Spinning Up · Part 1: Key Concepts in RL。只读这一页,建立 RL 的基本词汇(agent / environment / state / action / reward / policy)。遇到不懂的词不用怕——第 2 课会逐个正式讲。

老师的提问邀请:读完上面那页后,回来问我任何没看懂的词。例如"policy 到底是函数还是策略?""reward 和 return 有什么区别?"——我会在你的最近发展区里回答,并据此决定下一课的起点。

这是本课程第 1 课。下一课预告:第 2 课 · RL vs 监督学习:从“抄答案”到“试错得分”,正式定义 agent/environment/policy/reward,开始铺第一个数学概念。

如果你对这课的内容有疑问,或想调整深度/节奏,直接告诉老师。