JEV:目前公开的情报
从三个小问题出发,读懂 Jev 的概率、并行决策与 RLCD,再把创始人披露、黑箱实验和独立评测放回各自的位置。我们已经知道什么,又究竟还不知道什么?
Blog
关于 Agent、LLM 工程与产品化实践的文章。部分深度内容仅会员可读。
从三个小问题出发,读懂 Jev 的概率、并行决策与 RLCD,再把创始人披露、黑箱实验和独立评测放回各自的位置。我们已经知道什么,又究竟还不知道什么?
DeepSeek Harness 真正激进的地方,不是插件数量,而是把应用本身变成 Agent Runtime 的组成部分。它离操作系统还有多远?与 Codex、Deep Agents 和 Pi 相比,哪条路线更适合专业产品?
拆解 DeepSeek-R1-Zero 与 DeepSeek-R1 的训练差异、GRPO 的组内相对优势,以及规则奖励、冷启动和多阶段训练如何组合起来。
从条件高斯分布出发推导 DDPM 的前向扩散、反向去噪与噪声预测目标,并补充 DDIM、CFG、潜空间扩散和 flow matching 的关系。
横向联邦学习不只是把分布式训练搬到手机上:本文从 FedAvg 出发,讨论 non-IID、设备异构、通信成本、梯度泄露与安全聚合。
从策略梯度的更新失稳出发,推导 TRPO 的 KL 信赖域、自然梯度近似和回溯线搜索,再解释 PPO-Clip 为何更简单却没有硬约束保证。
在延迟、带宽、一致性和反作弊之间,比较 lockstep 与状态同步,并解释客户端预测、服务端和解、插值和 lag compensation 如何协作。
用节点、边与全局属性统一描述图数据,再从 message、aggregation、update 三步推导 GNN,并比较 GCN、GraphSAGE、GAT 及常见失效模式。
从 Shared-Bottom 的负迁移问题出发,拆解 MMoE 的共享专家、任务门控与任务塔,说明它为何有效、没有解决什么,以及推荐系统落地时真正需要关注的工程问题。
从小模型为什么要学习教师输出讲起,推导温度 softmax、软硬目标组合损失与 T² 缩放,再讨论蒸馏真正传递了什么、适用边界和常见误解。