JEV:目前公开的情报
从三个小问题出发,读懂 Jev 的概率、并行决策与 RLCD,再把创始人披露、黑箱实验和独立评测放回各自的位置。我们已经知道什么,又究竟还不知道什么?

TypeSafe AI 给了我们一个引人注意的产品:不写长篇回答,直接向程序交付分类、评分和概率。与此同时,宣传里的“System One”“RLCD”“并行采样”“零幻觉”,很容易让人以为底层技术已经解释清楚。实际上,接口长什么样、训练想达到什么目标、神经网络究竟怎么搭,是三个不同的问题。
这篇文章把它们拆开讲。你不需要先懂 Transformer,也不需要记住所有缩写。我们从一张普通的客服工单出发,逐步走到模型架构,再看看那些漂亮的概率到底值不值得信任。
情报截止:2026 年 9 月 22 日。文中区分官方披露、第三方实测与作者推断;所有教学示例均为虚构。本文核对了公开文档、代码和评测记录,没有自行调用 Jev 重新跑模型实验。
情报 01:先把“会说话的 AI”放到一边
假设你经营一家网店,收到这样一条消息:
“杯子到了,但把手断了。明天就要送人,能不能尽快补发?”
一个聊天模型可以写出很体贴的回复。但在回复之前,你的软件还得解决几个小问题:这张工单归谁?是否需要优先处理?客户有没有明确提出解决方案?
这些答案最终要进入 if、队列和数据库。程序更希望拿到 after_sales、一个数值,或一个是否成立的概率。
Jev 的公开接口正是围绕这种需求设计的:给它一份共享的 state(当前材料),再给它一组带有明确答案范围的 questions(问题)。它返回可直接由代码消费的结果。官方输入说明

图 1:基于公开接口的概念示意。中间的盒子代表服务,不是 Jev 的真实神经网络结构。
可以把它想成一个可编程的“语义判断函数”:你用自然语言定义问题和候选答案,模型负责理解材料,软件负责使用结果。
官方把这类模型称为 System One(系统一),借用的是快速、直觉式判断的意象。这里说的是产品希望擅长的任务,不是在宣称复制了人脑的某个区域,也不能从名字推导出神经网络结构。产品介绍
这里有一个细微但重要的变化。传统分类器往往先固定类别,再围绕这些类别训练;Jev 允许开发者在请求中描述新的分类标准。今天按“售前/售后”分流,明天按“物流/支付/商品问题”分流,接口依然相同。它承诺提供的是一种通用的判断能力,而不是只识别某一套标签的专用模型。
情报 02:三个基本积木,回答三类问题
Jev 目前公开的核心问题类型是 Choice、Score 和 Noul。名字看起来陌生,实际对应的都是程序员经常遇到的判断。
| 积木 | 想解决的问题 | 杯子工单的例子 |
|---|---|---|
| Choice | 从给定选项里选一个 | 售前、售后、物流,应该归哪组? |
| Score | 按有语义描述的等级评分 | 从“不紧急”到“必须立即处理”,处在哪一级? |
| Noul | 判断一个命题成立的概率 | 客户是否明确要求补发? |
Choice 是带概率的选择题。 开发者提供选项及其说明,模型返回选择、各选项概率和 confidence。选项说明值得认真写:“售后”只是一个名字,“商品破损、换货与维修”才是边界。Choice 文档
Score 是一把先定义刻度、再测量的尺子。 你需要描述每一级的含义。假设设定 0、1、2 三个等级,返回概率依次是 0.1、0.3、0.6,那么最终分数是:
1.5 是等级索引的加权平均。它不意味着系统真的提供了“第 1.5 个等级”,更不意味着模型天然懂得你的业务 KPI。刻度的语义和权重含义仍由开发者负责。Score 文档
Noul 可以理解为一个柔性的布尔值。 它给出“是”的概率。0.5 表示对是与否的判断接近各占一半,而不是“事情严重程度为一半”。如果问题是“是否构成投诉”,概率低也不代表投诉一旦成立就不严重。Noul 文档
这三个积木看似简单,却足以组合出分流、筛选、排序、内容评估等大量业务逻辑。复杂性不必全部塞进模型:一部分可以留在你看得懂、测得了的代码里。
情报 03:最容易混淆的,是概率、信心和正确
这三个词经常被放在同一句宣传语里,但回答的是不同问题。
概率是在候选答案之间分配的权重。假如三个选项得到 0.7、0.2、0.1,模型把最多权重放在第一个选项上。
confidence 描述概率分布的形状。官方说明,Choice 和 Score 的这个字段从分布中计算出来。因此,它不应被理解成另一个无所不知的裁判,站在模型之外告诉你“刚才那个答案有多可靠”;它也不等于最大的选项概率。Confidence 文档
正确性则需要拿答案与事实或人工标准对照。一张工单究竟该归哪组,不会因为模型特别自信就改变。
再引入一个真正重要的概念:校准。假设模型对很多道同类题都报“80%”,长期看,其中约 80% 答对,才符合校准的含义。它是一组预测上的统计性质,不是给某个单独答案盖章。概率校准研究
可以用天气预报理解这件事。一个预报员天天说“100% 下雨”,在雨季可能有很高的命中率,但仍然过度自信。另一个预报员谨慎地报概率,未必每一天都判断对,却可能更适合帮助你决定是否带伞。
对软件也是如此。我们真正希望知道的是:当模型拿不准时,概率能不能帮助我们识别这种情况,然后把任务交给更强的模型或人工?这个问题要靠数据检验,不能只看输出里有没有一个小数。
情报 04:快在哪里?先理解“少写字,多判断”
自回归文本模型通常要一步步生成输出 token。如果你要求它把多个判断写成一大段 JSON,就会有连续解码的工作。
TypeSafe 公开描述的 Jev 路线,是在同一请求里并行计算结构化答案。它不需要先把一段解释性文字写完,再让你的程序从中取出分类结果。公司把新的架构、并行 sampler 和 RLCD 列为其技术组成部分,但没有公开 sampler 的实现。发布文章

图 2:比较的是公开描述的计算与接口方式,不是实测时间轴。一次请求不等于一次神经网络前向传播。
“并行”也不是随便把问题打包就会自动产生推理链。Jev 的问题分别基于共享 state 判断;如果第二个问题必须知道第一个问题的答案,你需要在代码里接起来,或者提前展开各个可能分支,拿到结果后选择有用的分支。Fan-out 模式
例如,“这是不是售后问题”和“如果需要补发,地址是否完整”可以一起问;“根据上一题刚刚选择的处理方案继续推理”,却不能假定模型会自动读到上一题答案。
我认为这里的工程价值很朴素:尽量把可同时做的小判断放在一起,把真正有依赖的步骤留给程序安排。 这与数据库批量查询有相似之处。但并行带来的收益,仍会受到上下文长度、问题数量、服务负载和网络延迟影响。
情报 05:底层到底是什么模型?我们还没有那张设计图
目前最诚实的回答是:公开材料足以说明产品机制,还不足以还原 Jev 的神经网络。
| 问题 | 目前可以说到哪一步 |
|---|---|
| 输入、输出和问题类型 | 官方接口已公开 |
| 是否支持多个问题并行求值 | 官方有明确描述;内部并行方式仍未知 |
| 训练希望优化什么 | 官方称 RLCD,强调校准决策 |
| 是否利用已有模型能力 | 创始人的新访谈提供了明显线索 |
| 基座、参数量、层数、注意力结构 | 未在本次核查的材料中找到 |
| 是否为 MoE、扩散模型或 JEPA | 没有足够证据确认 |
| 奖励、损失函数和完整训练流程 | 尚不可复现 |
9 月 21 日,创始人 Diogo Almeida 在访谈里确认使用合成数据(22:15),用“Frankenstein’s monster of models”描述其路线(43:58),并表示即使获得十亿美元,也不愿去做预训练(1:49:33)。他同时确认 RLCD 尚无论文(25:05)。这些表述支持“利用和重组已有模型智能”的判断,却没有披露具体基座或组合方法;合成数据的说法也不能外推到所有祖先模型的预训练语料。创始人访谈
所以,我目前更倾向于把它理解成已有能力的改造与重组,加上面向决策任务的训练和推理工程。这是解释方向,不是已证实的结构图。权重融合、蒸馏、模块拼接、推理时集成,都是不同的技术,不能因为一句比喻就任选一个填进空白。
还有一份值得读、也必须谨慎读的材料:Archer Hume 于 9 月 17 日发布的黑箱研究。实验发现,把信息放进兄弟问题里与放进共享 state 里,效果不同;新增一个无关选项,也可能改变原有选项之间的概率比例。它支持问题隔离,并约束了“每个选项完全独立打分”的简单解释。但实验仍不足以识别具体网络,作者对稀疏 MoE 的判断尤其不确定。黑箱研究及数据
此外,SDK 是调用客户端;官方的 System One Adapter 是让其他 LLM 参与比较的适配器;仓库里的 LLaDA fork 也只是一个 fork。这三者都不能当作 Jev 底层源码。 官方代码组织 · 比较适配器
情报 06:RLCD 的新意,先看“训练目标”
RLCD 全称是 Reinforcement Learning for Calibrated Decisions。官方材料把它描述为面向校准决策的训练方向,并将其与偏好文本的训练目标区分开。官方机器学习说明
通俗地说,我们可以向模型提出两种不同要求:
- “请给出一个读起来令人满意的回答。”
- “请在这几个答案之间分配概率,而且长期来看要诚实。”
这两个目标有重叠,却不会自动相同。一个坚定、流畅、像专家的回答可能更讨人喜欢;一个适合自动化系统的概率,有时应该清楚表达不确定。
这也是我认为 Jev 最值得关注的地方:它把“如何向软件表达判断”放到了任务设计的中心。我们过去太习惯让模型先扮演一个会说话的人,再从它的话里提取机器要用的东西。
但这里不能再跨一步,把自己的机器学习知识替厂商补齐。我们还不知道 RLCD 用什么奖励、是否采用某个强化学习优化器、如何生成和筛选训练样本,也不知道怎样分担训练阶段与后处理阶段的校准工作。把 PPO、GRPO、Brier loss 或温度缩放写成 Jev 已确认的训练配方,都会超出公开证据。
情报 07:Kev 让一种可行方案变得看得见
虽然 Jev 的内部没有开源,社区已经做出了一个很有教学价值的项目:Jared Palmer 的 Kev。它是独立训练的 Jev 类模型,不是 Jev 的源码或权重;项目在 9 月 21 日更新,提供基于 Qwen3.5 的 0.8B、4B 和 9B 版本。Kev 项目
它的主要路线是:保留预训练基座,用 LoRA 适配,再加一个选项指针读出头。LoRA 可以简单理解为训练少量附加参数,让已有模型适应新任务。基座被冻结,适配器与读出头用分类目标训练,随后在开发集上做温度校准,调整概率分布的尖锐程度。

图 3:Kev 的实现示意。可以用它学习一种解决方案,不能把它反向当成 Jev 的架构披露。
“指针读出头”可以理解成一个选项匹配器:模型先把材料与候选项变成内部的语义向量,也就是隐藏表示,再比较最终决策位置与各选项结束位置的表示,算出各自分数。之后把分数变为概率。代码还能让多个问题复用状态,同时保持问题之间的隔离。Kev 模型代码
这说明一件重要的事:用语言模型学到的语义表示,直接做自然语言定义的判断,是一条可以实际实现的路线。 “输出不是一段文本”与“完全不继承语言模型能力”,是两回事。
Kev 还帮助我们摆正比较的尺度。一个原型跑通,说明机制可行;是否在广泛任务上足够准确、稳定、便宜,则是数据、训练、校准和服务系统共同决定的。Jev 的商业价值最终也需要在后面这些维度上接受检验。
情报 08:“零幻觉”到底保证了什么
先做一道极简单的题:假设合法答案只有“售前”和“售后”。模型永远只返回这两个词之一,能不能说明它永远判断正确?
显然不能。它仍然可能把维修申请送进售前队列。
TypeSafe 发布材料里的“零幻觉”,采用的是类型和 schema 层面的定义;官方明确承认,合法类别仍然可能选错。因此,类型安全解决的是答案形状的问题,语义正确解决的是答案是否符合事实的问题。 官方发布说明
这项保证有用。它减少了输出无法解析、字段跑偏和出现无效类别的麻烦。但它不能代替业务评测,正如一个数据库字段是合法整数,并不保证其中记录的年龄是真实的。
同样,官方展示的巨大速度和成本优势,也需要连同实验条件阅读。其四类工作流总览中,Jev 的平均一致率为 67.8%,耗时约 0.4 秒/例,成本约 0.0004 美元/例。这里的参考答案来自强模型概率共识,再经过工作流计算;它不是人工标注的通用正确率,也不是校准误差。图表对四个工作流等权平均。官方评测与方法
这些数据能说明 Jev 在该设置中的效率,却不能直接变成“任何任务都快几百倍”的承诺。比较时,问一个离散答案,还是要求对所有选项给出完整分布,也会改变其他模型的输出负担。
情报 09:独立数据,让概率的边界更清楚
相比口号,更有价值的是能下载下来重新计数的记录。
标注 9 月 18 日的 ASSAY-001 报告,用 Banking77 与 CLINC150 两组意图分类数据测试了 Jev。本文复算其公开原始响应,得到以下结果。表中的概率是 被选中选项的 probabilities[choice],不是 confidence。
| 数据集 | 有效样本 | 准确率 | 校准误差 ECE |
|---|---|---|---|
| Banking77 | 3,080 | 79.77% | 0.0936 |
| CLINC150,含范围外意图 | 5,496 | 88.12% | 0.0204 |
ECE 用分组后的预测概率与实际正确率之差衡量校准,越低越好。它不是错误率,也没有一个适用于所有业务的万能及格线。ASSAY 报告及原始材料

图 4:根据公开原始记录复算、按报告精度取整。两个条形使用同一尺度,不能将数值读成模型的错误率。
结果支持一个有边界的判断:Jev 在第二组数据上较为校准,在 Banking77 上则有明显过度自信。报告修订过两位小数概率的求和容差,上表采用修订后的全部有效响应。两组都是旧公开语料,是否出现在训练中未知;这也是单次 Choice 测试,不能推广到所有任务。
另一份独立研究提供了更直观的反例:200 个 Jev 回答中,102 个返回 confidence=1,其中仍有 6 个错误。这个计数也与公开原始记录相符。该研究主要测错误排序与模型转交策略,不能把它冒充另一项 ECE 校准实验。独立对照研究及勘误
所以,“模型很有信心”只是一条可利用的信息。它是否值得相信,取决于你的数据分布和错误成本。修复一条商品标签与自动批准一笔退款,需要的可靠性标准显然不同。
情报 10:把 Jev 放进软件,职责应该怎么分
回到那只断了把手的杯子。一个合理的系统可以这样工作:
- 代码整理事实。 查订单、收货时间、库存和已经生效的售后规则。
- Jev 判断语义。 识别客户意图、问题类型、缺少的信息和需要优先处理的信号。
- 代码执行确定规则。 校验订单状态、额度、权限和是否重复处理。
- 生成模型组织表达。 根据已确认的方案写一段自然的回复。
- 不确定或重要的情况转交复核。 用业务样本确定转交规则,再持续记录结果。

图 5:作者提出的应用设计示例,不是 TypeSafe 已发布的产品架构。任何实际退款仍应经过确定的权限与业务规则。
这可以看成一种应用层面的神经网络与符号逻辑分工:模型擅长处理难以写成穷尽规则的语义,代码擅长精确计算、校验和控制流程。它不说明 Jev 的神经网络内部藏着一个符号推理引擎。TypeSafe 的产品理念
对编程 Agent 也类似。让 Jev 判断某段上下文是否相关、任务该路由到哪个工具,是一种值得测试的用途;让它接替负责写代码和长程推理的模型,则超出了当前定位。官方近期新增的 coding agents 页面,也明确将它定位为可接入的判断组件。编程 Agent 使用说明
还有一个容易漏算的成本:为了做一次小判断,系统付出了多少数据准备和上下文搬运? 如果新增一个模型调用,却让前后两端反复读取同一大段上下文,单次调用便宜未必意味着整个任务便宜。评估应覆盖完整链路,包括被拒绝、重试和转交的任务。
情报 11:现在用它,哪些边界必须知道
截至本文核对时,官方模型页列出的版本仍是 jev-1.13.0,jev-latest 与 jev-preview 都指向它。请求总长度上限是 64k tokens,而 state 加最长单个问题的上限是 32k;输入为文本。英语是主要训练语言,中文等语言需单独验证。所有账户使用同一组模型权重,官方没有提供按客户数据微调 Jev 的服务。模型与价格说明
当时官方直连价格为每百万输入 tokens 0.042 美元,输出不收费。这个数字应连同日期、输入长度和调用次数阅读,不能自动代入其他网关的账单。
更值得读的是官方的能力边界说明。复杂数学、计数、日期、间接多步推理、长上下文干扰、互相冲突的判断标准和提示注入,都需要格外测试;几个看似逻辑相关的问题,也不保证独立回答后一定相互一致。Jev 1.13 已知局限
举个例子,你分别问“是否包含退款请求”和“是否完全没有退款请求”,业务上希望二者互补。但不要把这种关系交给两次独立判断去碰运气。能在代码里取反、计算和校验的关系,就在代码里明确表达。
9 月 21 日发布的 Python SDK v0.7.1,主要更新了密钥校验、日志保护和网关示例。它是客户端版本,不意味着 Jev 更换了神经网络。SDK 更新日志
情报 12:我认为真正值得带走的三个想法
第一,智能不一定以一段话的形式进入软件。
过去几年,我们很容易把 AI 接口想象成聊天框。Jev 提醒我们,概率、选项和有定义的评分,也可以成为智能与软件之间的接口。对大量业务流程而言,这种接口可能更容易组合,也更容易观察哪里出了错。
第二,限制答案空间,同时也是在重新分配责任。
当开发者规定只能选 A、B、C,模型确实失去了胡乱发明类别的机会。但如果真实情况是 D,系统依然可能被迫做错。因此,“其他”“信息不足”或转交机制是否存在,往往和模型本身有多强一样重要。类型安全不会自动修好一个设计错误的问题。
第三,校准是需要在目标环境中维护的能力。
即使一个模型在某个测试集上校准良好,换成中文、换一个行业、增加模糊标签或更换模型版本,都值得重新测量。最有用的落地问题通常不是“这个模型有没有信心”,而是:“当我只自动处理其中一部分任务时,剩下的错误有多少,节省了什么?”
如果准备试用,我会先选择一个范围明确、结果可核对的判断点:收集有代表性的真实样本,保留一部分用于最终验证,与现有规则、小模型和人工流程对照。先让系统只记录建议,再根据错误分布决定哪些结果可以自动执行。这样,模型的优势和成本才能落到具体数字上。
我们现在已经能清楚描述 Jev 想改变的接口,也能用第三方数据检验它的部分表现。真正的底层设计图、RLCD 的可复现配方,以及跨领域可靠性的答案,仍有待进一步披露和验证。
资料与核查说明
本文主要依据 TypeSafe 官方文档、创始人原始访谈、公开源代码及有原始记录的社区实验。9 月 21 日访谈与 Kev 更新属于近期新增材料;9 月 17—18 日的黑箱研究和独立测试是补充纳入的早期材料。文内各处链接对应具体论述,以下是建议的进一步阅读顺序:
- TypeSafe 官方文档:先了解 state、问题类型和使用边界。
- 创始人长访谈:了解研发思路,留意披露与愿景的区别。
- Kev 源码:学习一种可训练、可运行的类似实现。
- Jev 黑箱实验:观察如何用实验约束架构猜想。
- ASSAY-001 与 独立基线测试:阅读原始记录、评分方法和勘误,而不只看结论。
本文六幅插图为根据公开资料绘制的原创解释图。封面是情报档案的视觉隐喻;接口图、并行图和应用流程图均不是 Jev 的官方网络结构图。评测图来自公开记录的复算,其余图中的业务数据均为教学示例。