强化学习系列

强化学习:从 RLHF 到 GRPO

工程复现 RLHF → PPO → GRPO 这条训练推理模型的技术演进路线——每一步都能跑代码、看懂完整数学推导。

课程目录

01

从监督学习到 GRPO:训练推理模型的地图

为什么监督学习训不出会推理的模型。一张地图串起 SFT → RM → PPO → GRPO → R1:每一站为解决上一站的什么痛点而生。建立后续所有公式的叙事坐标。

概念RLHFSFTGRPOR1
02

RL vs 监督学习:从“抄答案”到“试错得分”

RL 的六个基本术语:agent / environment / action / reward / return / policy / episode。监督学习的“对错”与 RL 的“好不好”本质区别在哪。把一个 GRPO 数学题场景拆成六项对照。

概念agentpolicyrewardreturn
03

MDP:把 RL 装进一个五元组

MDP 五元组与马尔可夫性,状态价值 V、动作价值 Q、优势 A 的定义与关系。为什么减基线能降方差——PPO 用学出的 V、GRPO 用组内平均估 A 的共同根源。拖滑块实时看 V 与 A 怎么动。

概念MDP价值函数优势baseline动手
04

策略梯度定理:第一个“怎么调 π”的推导

从 J(θ)=E[R(τ)] 出发六步推出 ∇θJ=E[∇log π·A]:对数导数技巧、reward-to-go、基线降方差。这条公式是 REINFORCE / PPO / GRPO 共同的地基。浏览器里训练 3-臂老虎机,看 π 把质量挪到最优动作。

策略梯度推导log-derivativebaseline动手
05

RLHF 三阶段:把策略梯度接进 LLM

RLHF 三阶段(SFT → 奖励模型 → PPO)把人类偏好变成可求导的奖励 r_φ,喂给第 4 课的策略梯度公式。阶段 3 目标相对第 4 课只多一个 KL 锚:更新式 θ+=α·∇log π·A 一字不差,只是奖励换了来源、多了防跑偏的 KL 罚项。拖 β 滑块看 KL 把 π 拉回 SFT 基线。

RLHF奖励模型KL策略梯度动手

参考资料