LLM
强化学习
DeepSeek
DeepSeek-R1 是如何炼成的:从 R1-Zero、GRPO 到多阶段训练
拆解 DeepSeek-R1-Zero 与 DeepSeek-R1 的训练差异、GRPO 的组内相对优势,以及规则奖励、冷启动和多阶段训练如何组合起来。
2025-02-059 min
Blog
关于 Agent、LLM 工程与产品化实践的文章。部分深度内容仅会员可读。
拆解 DeepSeek-R1-Zero 与 DeepSeek-R1 的训练差异、GRPO 的组内相对优势,以及规则奖励、冷启动和多阶段训练如何组合起来。