2026 年 9 月AI 圈被一个不会说话的模型刷屏了。它叫 Jev由 TypeSafe AI 发布——创始人是前 OpenAI 研究员 Diogo Almeida参与过 ChatGPT 的指令跟随方法。这个模型有个奇怪的特点它一个 token 的文本都不会生成。不聊天、不写文章、不写代码。你给它输入它只返回一个数、一个选项、一个概率。就是这样一款哑巴模型宣称比 GPT 快 193 倍、便宜 444 倍而且零幻觉。它是怎么做到的答案藏在两个反直觉的设计里。一、为什么传统 LLM 做决策又慢又贵先看传统 LLM 是怎么做一个决策的。假设你要让 GPT 判断这条用户评论是好评还是差评。它不会直接说好评。它得像写作文一样一个字一个字往外蹦这 这条 这条评 这条评论 这条评论是 这条评论是好 这条评论是好评一个 8 个字的答案要跑 8 次模型推理每次都要等上一个字蹦出来才能算下一个字。这种一个字一个字往外蹦的方式叫自回归生成autoregressive generation。更烦人的是模型可能在蹦到第 5 个字的时候改主意了——前面生成的都白费。为了稳妥实际工程里往往还要采样多次、投票表决比如让模型回答 8 次取多数成本直接乘 8。结果就是一个二选一的小决策可能要花 3 秒到 329 秒烧掉几千个 token。用写一篇文章的力气去回答一个是非题。这就是传统 LLM 做决策的荒诞之处。二、Jev 的第一刀把串行改成并行Jev 的核心设计是把一个字一个字蹦换成一次性全算出来。打个比方。传统 LLM 像一个学生面对选择题时要在草稿纸上把每个选项的答案都写一遍再挑一个。Jev 像一个练过多年速答的学生——所有选项在脑子里同时过一遍直接报出A 的可能性 73%B 的 27%。技术上Jev 的采样器是并行的不生成任何 token而是对所有候选答案一次性做评估单次前向传播就吐出完整的概率分布。它官网的说法是Generates all outputs in a single query。这就是它快的原因选择题不再需要写 8 个字也不需要回答 8 次投票。一次前向70 到 500 毫秒出结果。你的直觉不就是换个 LLM 头吗——对了一半。它确实把文本生成头换成了并行决策头。但这个头不是普通的分类层它连着整个采样方式的改变从自回归的串行生成变成了并行评估。三、Jev 的第二刀从讨好人类到概率要诚实光快还不够。传统 LLM 做决策还有个致命问题它的概率不可信。你问 GPT这个判断你有几成把握它说九成。但这个九成是它为了把话说得漂亮而生成的文字不是真的统计过——实际正确率可能只有六成。这叫不校准miscalibration说九成把握实际只有六成你敢拿它做自动决策吗传统 LLM 的训练目标是什么RLHF——强化学习对齐人类偏好。说白了就是让生成的文本人爱看通顺、礼貌、自信。它不关心说的概率和现实对不对得上。Jev 换了一个训练目标叫RLCDReinforcement Learning for Calibrated Decisions面向校准决策的强化学习。校准是什么意思一句话模型说八成把握时统计上就该有八成的正确率。没校准的模型说九成把握 → 实际对六成嘴硬 校准好的模型说七成把握 → 实际就是七成诚实RLCD 训练 Jev 的方式就是反复用真实结果去检验它的概率预测。预测80% 是好评论就把大量真实评论拿来对答案——如果实际只有 60% 是好评论就惩罚它。练到最后模型输出的每一个概率都是拿真实结果打磨过的、统计学意义上的诚实数字。数学上RLCD 的目标和 RLHF 有本质区别。RLHF 的目标是最大化奖励模型的打分人类觉得好不好目标(RLHF) 最大化 R(回答) —— R 是奖励模型给的人类偏好分RLCD 的目标是让预测概率等于真实频率校准。用的是统计学里一个老工具恰当评分规则proper scoring rule。它有个优雅的性质——只有诚实的模型才能拿到最高分任何虚报概率的行为都会被数学惩罚。对二元判断Noul就是交叉熵损失损失 −[ y·log(p) (1−y)·log(1−p) ] y 真实结果1 或 0 p 模型预测的概率对多选一Choice推广成分类交叉熵损失 −Σᵢ yᵢ·log(pᵢ) yᵢ 真实答案的 one-hot正确选项为 1其余为 0 pᵢ 模型给每个选项的概率为什么这个损失能逼出诚实看一个反例。模型预测80% 是好评论假设它想虚报成95%显得更自信诚实报 80%真实 80% 对、20% 错 期望损失 −[ 0.8·log(0.8) 0.2·log(0.2) ] ≈ 0.50 虚报 95%真实仍然是 80% 对、20% 错 期望损失 −[ 0.8·log(0.95) 0.2·log(0.05) ] ≈ 0.64虚报之后损失从 0.50 涨到了 0.64。嘴硬会被数学惩罚——这就是恰当评分规则的厉害之处最优策略就是说实话。校准的数学定义也因此变得清晰E[y | p] p 在所有模型说过概率为 p的样本里真实为 1 的比例恰好是 p说人话模型说过 100 次80% 把握统计下来就该有 80 次是对的。RLHF 训练的模型做不到这点它只说人类爱听的话RLCD 训练的 Jev 做到了。这个诚实是决策系统最珍贵的东西。因为有了可信的概率调用方才能做分层处理置信度 95% → 直接自动执行 置信度 70% → 交给人工确认 置信度 50% → 升级给更强的模型重新判断四、三个输出原语Jev 的输出只有三种都带着概率Noul二元判断“是/否” 一个 0 到 1 的概率。Choice多选一选中项 完整概率分布 置信度。比如把 10 条候选回答排出来谁最好、好多少一目了然。Score打分概率加权的连续值 分段概率。不是这个产品 8 分这种拍脑袋而是8.3 分其中 70% 概率落在 7 到 9 分区间。三种原语覆盖了智能体里绝大多数决策场景分类、路由、打分、抽取、分叉判断。TypeSafe 给它起了个外号“会思考的 if 语句”。五、零幻觉的真相零幻觉是 Jev 最响的卖点但需要掰开说清楚。Jev 的输出被约束在调用方预先定义的选项集里。你给它的选项是好评/差评它就只能回这两个之一——不可能给你蹦出个这条评论让我想起了外婆。格式上的幻觉结构上就杜绝了。但注意格式不错 ≠ 答案就对。它说差评实际是好评论——这仍可能发生。TypeSafe 自己也不断强调这点类型安全不保证选择正确。所以零幻觉的准确说法是它不会胡说但可能会选错。前者靠架构保证后者靠 RLCD 的校准能力尽量压低。六、System 1 和 System 2Jev 的定位用卡尼曼《思考快与慢》的框架说最清楚System 2慢思考深思熟虑写长文、解数学题、做复杂规划。这是 GPT、Claude 的战场——慢但能处理复杂任务。System 1快思考瞬间直觉“这条路堵不堵”“这个人靠不靠谱”。这是 Jev 的战场——快、便宜、概率诚实。TypeSafe 管 Jev 叫 “System One Model”。它没打算取代 GPT而是填一个空白智能体循环里那些每秒要做几百次的小判断。评论要不要精选这个问题该路由给哪个模型这个工具调用有没有风险这类判断用 GPT 做是杀鸡用牛刀用 Jev 做正合适。LangChain 已经集成了ModelRouterMiddleware按复杂度把请求路由给 Jev 或大模型和AutoModeMiddleware执行工具前先用 Jev 判断风险等级。Vercel 也加了直接调用 Jev 的接口。七、所以 Jev 到底是什么一句话Jev 是一个不做生成、只做判断的决策引擎。它砍掉了自回归生成换并行采样砍掉了人类偏好对齐换校准训练换来 200 倍速度和结构性的零幻觉。它不是 LLM 的替代品是 LLM 的互补品。大模型负责想Jev 负责判——一个管慢思考一个管快直觉。一个有趣的猜想留给读者如果智能体里的快判断都被 Jev 这类模型接管了那 Agent 的架构会怎么变路由、护栏、验证这些胶水层可能才是下一个竞争焦点。参考资料Introducing System One Models Jev — TypeSafe AIWhat Is Jev? — LangChainJev: TypeSafe’s System One Model Explained — DataCamp刚刚TypeSafe 发布反LLM新物种 JEV — tonybai