DeepSeek-R1 是如何炼成的:从 R1-Zero、GRPO 到多阶段训练
拆解 DeepSeek-R1-Zero 与 DeepSeek-R1 的训练差异、GRPO 的组内相对优势,以及规则奖励、冷启动和多阶段训练如何组合起来。
DeepSeek-R1 的价值不只在于跑分。更重要的是,它公开展示了一条可以复现思路、可以继续研究的推理模型训练路线:先用纯强化学习验证能力能否涌现,再用冷启动数据和多阶段训练解决可读性与通用能力问题。
讨论这套方法时,必须先把两个模型分开:
- DeepSeek-R1-Zero:从 DeepSeek-V3-Base 出发,不先做推理 SFT,直接进行大规模强化学习。
- DeepSeek-R1:不是“纯 RL 模型”。它先使用少量高质量长思维链数据冷启动,随后经历推理 RL、拒绝采样与 SFT、面向全场景的第二阶段 RL。

从最朴素的方案说起
如果要让语言模型学会显式推理,一个直观方案是收集大量带 Chain-of-Thought(CoT)的样本,再进行监督微调。这个方案有效,但高质量长推理轨迹很贵,而且会把能力上限绑定在人类或教师模型已经展示出来的路径上。
R1-Zero 选择了更激进的实验:不先提供人工标注的推理轨迹,只定义可以自动验证的奖励,让模型通过探索自行发现更长的思考、检查和回溯行为。
这里的关键不是简单地“把 RL 用在 LLM 上”,而是同时具备三项条件:
- 足够强的 base model,能产生可供筛选的候选答案;
- 数学、代码等可验证任务,可以低成本地产生相对可靠的奖励;
- 能承受多候选采样开销的策略优化方法。
第三项就是 GRPO。
GRPO:不用独立 Critic 的相对优势估计
GRPO 的全称是 Group Relative Policy Optimization。它沿用了 PPO 风格的策略比率裁剪,但不另外训练一个与策略模型体量相近的 value model。对同一个问题 ,旧策略一次采样 个回答 ,分别得到奖励 ,再在组内标准化:
表示该回答优于同组平均水平,训练会提高其 token 的生成概率;反之则降低。策略更新仍采用裁剪后的概率比率,并加入相对参考模型的 KL 惩罚。省略 token 维度的平均后,可以把核心写成:
其中 。
需要注意三点:
- “不使用 Critic”不等于“不使用基线”。组内平均奖励本身就在发挥 baseline 的作用。
- 相对优势依赖同题多次采样;省下 value model 的同时,也增加了生成侧的计算量。
- GRPO 不是无方差估计,更不自动保证训练稳定。奖励质量、组大小、KL 强度和采样分布仍然决定效果。
R1-Zero 的奖励到底是什么
R1-Zero 的第一阶段强调规则奖励,而不是为每一种理想行为手工设计奖励。论文明确列出的核心信号是:
- 准确性奖励:数学答案可以匹配最终结果,代码可以通过编译器和测试用例验证。
- 格式奖励:要求推理放在
<think>...</think>中,答案放在<answer>...</answer>中。
自我检查、回溯和更长的推理轨迹是训练中观察到的涌现行为,不能倒过来说成系统直接给了“反思奖励”或“可读性奖励”。这一区分很重要:前者是行为结果,后者是训练信号。
论文报告中,R1-Zero 在 AIME 2024 上的 pass@1 从 15.6% 提升到 71.0%,多数投票可达到 86.7%。但纯 RL 也暴露了明显问题:语言混杂、表达不稳定、推理虽可能正确却不适合人类阅读。
DeepSeek-R1 的四个训练阶段
正式的 DeepSeek-R1 用多阶段流程修补了 R1-Zero 的短板。
1. 冷启动 SFT
先用少量高质量长 CoT 数据微调 base model。数据来自少样本提示生成、对 R1-Zero 输出的整理,以及人工后处理。这一步给模型一个更稳定、可读的推理表达起点。
2. 推理导向的强化学习
在冷启动模型上继续使用 GRPO,提高数学、代码、科学等可验证任务的推理能力,并加入语言一致性信号,减少同一答案中随意切换语言的问题。
3. 拒绝采样与第二轮 SFT
使用已经增强的模型生成候选数据,通过规则奖励或生成式奖励模型筛选高质量样本,再混入 DeepSeek-V3 的通用监督数据进行 SFT。这一步把推理能力扩展到写作、问答等更广的任务。
4. 全场景强化学习
最后一轮 RL 同时处理推理和非推理场景。可验证任务继续使用规则奖励,一般场景则使用偏好模型,优化帮助性与安全性。
因此,对 R1 最准确的概括不是“抛弃监督学习”,而是:R1-Zero 证明纯 RL 可以激发推理能力;R1 再把这一发现纳入冷启动、SFT 与多阶段 RL 的完整工程流程。
开放权重不等于开放全部训练管线
DeepSeek 开放了模型权重和技术报告,使研究者能够部署、蒸馏和分析模型。这比只提供 API 前进了一大步。但它并不意味着训练数据、清洗规则、全部奖励实现和大规模训练基础设施都已完整公开。
理解这一边界,可以同时避免两种误判:既不低估开放权重的研究价值,也不把模型发布等同于训练过程已经可以逐字节复现。
最值得记住的三点
- 先做 R1-Zero,再做 R1:一个用于验证能力涌现,一个用于形成可用产品,两者承担的实验目标不同。
- 奖励可验证性是核心资产:规则奖励让探索规模化,但也会把能力集中在容易验证的任务上。
- 蒸馏与直接小模型 RL 的结论有边界:论文实验中,从强模型蒸馏到小模型通常优于直接在小模型上做同规模 RL;这不等于小模型 RL 在所有设置下都没有价值。