工程复现 RLHF → PPO → GRPO 这条训练推理模型的技术演进路线——每一步都能跑代码、看懂完整数学推导。
为什么监督学习训不出会推理的模型。一张地图串起 SFT → RM → PPO → GRPO → R1:每一站为解决上一站的什么痛点而生。建立后续所有公式的叙事坐标。
RL 的六个基本术语:agent / environment / action / reward / return / policy / episode。监督学习的“对错”与 RL 的“好不好”本质区别在哪。把一个 GRPO 数学题场景拆成六项对照。
MDP 五元组与马尔可夫性,状态价值 V、动作价值 Q、优势 A 的定义与关系。为什么减基线能降方差——PPO 用学出的 V、GRPO 用组内平均估 A 的共同根源。拖滑块实时看 V 与 A 怎么动。
从 J(θ)=E[R(τ)] 出发六步推出 ∇θJ=E[∇log π·A]:对数导数技巧、reward-to-go、基线降方差。这条公式是 REINFORCE / PPO / GRPO 共同的地基。浏览器里训练 3-臂老虎机,看 π 把质量挪到最优动作。
RLHF 三阶段(SFT → 奖励模型 → PPO)把人类偏好变成可求导的奖励 r_φ,喂给第 4 课的策略梯度公式。阶段 3 目标相对第 4 课只多一个 KL 锚:更新式 θ+=α·∇log π·A 一字不差,只是奖励换了来源、多了防跑偏的 KL 罚项。拖 β 滑块看 KL 把 π 拉回 SFT 基线。