Announcement
欢迎来到 Fangyu Li
个人 AI 课程与博客站正式上线。第一门课:Agent Architectures。
2026-08-151 min
Blog
关于 Agent、LLM 工程与产品化实践的文章。部分深度内容仅会员可读。
个人 AI 课程与博客站正式上线。第一门课:Agent Architectures。
拆解 DeepSeek-R1-Zero 与 DeepSeek-R1 的训练差异、GRPO 的组内相对优势,以及规则奖励、冷启动和多阶段训练如何组合起来。
从条件高斯分布出发推导 DDPM 的前向扩散、反向去噪与噪声预测目标,并补充 DDIM、CFG、潜空间扩散和 flow matching 的关系。
横向联邦学习不只是把分布式训练搬到手机上:本文从 FedAvg 出发,讨论 non-IID、设备异构、通信成本、梯度泄露与安全聚合。
从策略梯度的更新失稳出发,推导 TRPO 的 KL 信赖域、自然梯度近似和回溯线搜索,再解释 PPO-Clip 为何更简单却没有硬约束保证。
在延迟、带宽、一致性和反作弊之间,比较 lockstep 与状态同步,并解释客户端预测、服务端和解、插值和 lag compensation 如何协作。
用节点、边与全局属性统一描述图数据,再从 message、aggregation、update 三步推导 GNN,并比较 GCN、GraphSAGE、GAT 及常见失效模式。