# 强化学习 → GRPO 训练推理模型 · Resources

## Knowledge

### RL 基础
- [OpenAI Spinning Up in Deep RL](https://spinningup.openai.com/en/latest/)
  最权威的深度 RL 入门教材。重点看 Part 1（RL 关键概念）、Part 3（策略梯度推导：从最简策略梯度到 reward-to-go、baseline）。Use for: RL 核心概念、策略梯度定理推导。
- [Sutton & Barto — Reinforcement Learning: An Introduction (2nd, 2020)](http://incompleteideas.net/book/RLbook2020.pdf)
  RL 领域圣经。Use for: MDP、价值函数、策略梯度等概念的权威定义与出处。第 13 章策略梯度法。
- [Spinning Up — Key Papers in Deep RL](https://spinningup.openai.com/en/latest/spinningup/keypapers.html)
  精选深度 RL 论文清单。Use for: 按主题追溯算法谱系（model-free RL 等）。

### RLHF
- [InstructGPT — Training language models to follow instructions with human feedback (Ouyang et al., 2022)](https://arxiv.org/abs/2203.02155)
  RLHF 三阶段（SFT → 奖励模型 → PPO）的标准范式出处。Use for: 理解 LLM 时代 RLHF 的完整流程。
- [Christiano et al. — Deep RL from Human Preferences (2017)](https://arxiv.org/abs/1706.03741)
  从人类偏好学习奖励函数的奠基工作。Use for: 奖励建模的原始思想（比 InstructGPT 更早）。

### PPO
- [Proximal Policy Optimization Algorithms (Schulman et al., 2017)](https://arxiv.org/abs/1707.06347)
  PPO 原论文。Use for: clipped surrogate objective 的原始定义与动机。
- [Trust Region Policy Optimization (Schulman et al., 2015)](https://arxiv.org/abs/1502.05477)
  TRPO 原论文。Use for: 理解 PPO 在简化什么（KL 约束 → 裁剪）。
- [Spinning Up — PPO Background](https://spinningup.openai.com/en/latest/algorithms/ppo.html)
  OpenAI 官方对 PPO 的教学讲解。Use for: PPO 与策略梯度、TRPO 的关系梳理。

### GRPO & 推理模型
- [DeepSeekMath: Pushing the Limits of Mathematical Reasoning (Shao et al., 2024)](https://arxiv.org/abs/2402.03300)
  **GRPO 算法的提出论文**。Use for: GRPO 目标函数、相对优势、为何去掉 value model。
- [DeepSeek-R1: Incentivizing Reasoning Capability via RL (DeepSeek-AI, 2025)](https://arxiv.org/abs/2501.12948)
  用纯 RL 激励推理能力的里程碑工作（已发 Nature）。Use for: R1-Zero 的训练范式、GRPO 在推理上的应用、冷启动数据。

### 实现 / 框架
- [HuggingFace TRL — Transformer Reinforcement Learning](https://github.com/huggingface/trl)
  最主流的 LLM RLHF/GRPO 训练库。Use for: 动手实现 PPO/GRPO 微调。
- [verl — Volcano Engine RL (字节)](https://github.com/volcengine/verl)
  支持 GRPO 的大规模 RL 训练框架（R1 复现常用）。Use for: 大规模 GRPO 训练与调参。

## Wisdom (Communities)
- [r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/)
  讨论开源 LLM 训练/微调的高信号社区。Use for: RLHF/GRPO 实践经验、坑点。
- [HuggingFace Discourse (训练相关版块)](https://discuss.huggingface.co/)
  TRL/transformers 官方论坛。Use for: 框架使用问题、训练异常排查。

## Gaps
- 暂无：学习者数学基础待评估（梯度、期望、对数求导等），需在第一节数学课中实测并补齐。
- 暂无：实现阶段的 GPU 资源情况未知，届时再确认能否真机跑通。
