LLM
强化学习
DeepSeek
DeepSeek-R1 是如何炼成的:从 R1-Zero、GRPO 到多阶段训练
拆解 DeepSeek-R1-Zero 与 DeepSeek-R1 的训练差异、GRPO 的组内相对优势,以及规则奖励、冷启动和多阶段训练如何组合起来。
2025-02-059 min
Blog
关于 Agent、LLM 工程与产品化实践的文章。部分深度内容仅会员可读。
拆解 DeepSeek-R1-Zero 与 DeepSeek-R1 的训练差异、GRPO 的组内相对优势,以及规则奖励、冷启动和多阶段训练如何组合起来。
从策略梯度的更新失稳出发,推导 TRPO 的 KL 信赖域、自然梯度近似和回溯线搜索,再解释 PPO-Clip 为何更简单却没有硬约束保证。