
最近两周刷到的 Jev 内容突然密集起来官方博客《Introducing System One Models Jev》在 2026-09-15 宣布 early access 开放入口是 console.typesafe.ai中文社区很快跟上鱼皮那期讲正式开放 保姆级教程 实战测评AIJasonZ 那期讲接进 3 个生产流程反欺诈、找客户、筛爆款。我这边收到的第一反应八成是同一个这是不是又一个更强的代码模型能不能把我那个编码 agent 背后的模型换成它第二反应也很一致——它既然这么快、输出还免费为什么不直接拿来做客服对话和工单摘要这两个问题看着都很合理其实都问反了。Jev 不生成文本它输出的是带类型的决定和概率。也就是说大家设想的第一个用法——“换个模型”——恰恰是官方文档里明确写做不到的那个用法。真正值得单独写一篇的是它换掉的那个默认假设一次模型调用总要返回一段能读的话。这个假设一破成本怎么算、延迟怎么比、能不能放进生产链路的关键分支全都要重新排一遍。这一篇就按读懂它的路子走先给它一句话定义再拆输出契约和三个原语然后把概率这层真正的卖点摊开最后对一遍价格、延迟和三种它不是接入细节留给第二篇官方自己列的失败模式留给第三篇。1. 它是怎么火的以及第一个问题几乎所有人都问反了这一章回答它的出处在哪最流行的那个误解错在哪。先把时间线钉住省得被二手信息带着走。时间事件口径本文怎么用这条2026-09-15官方博客《Introducing System One Models Jev》发布宣布 early access 开放入口 console.typesafe.ai官方口径作为它开始进入公众视野的起点同一时期官方 Models 页把 Jev 列为 TypeSafe 的旗舰模型并且是第一个 System One 模型官方口径定位依据正文第 2 章展开开放后一周内中文社区批量出现教程与测评视频讲上手、讲接进生产流程第三方内容只作为火的证据具体数字不采信为结论然后是那个问反了的问题。官方 introduction / coding-agents 页写得很直接Jev不是Claude Code、Cursor、opencode、Copilot 这类编码助手背后那个模型的即插即用替代品没有任何一个model: jev-latest之类的设置项能把你的 agent 变成Jev 驱动的 agent。误解里的用法你的编码 agent -- 把背后模型换成 jev-latest -- agent 照样聊天、照样写代码 ✗ 官方明确说做不到 实际里的用法你的编码 agent -- 帮你写调用 Jev 的代码 -- Jev 在生产链路里返回决定与概率 ✓ 官方给的正是这条Q1那它到底火了个什么火的不是更强的 coding而是换了交付物。以前一次模型调用要的是一段可以给人读的文字Jev 这次调用要的是一个可以直接进 if 分支的决定外加这个决定有多确定。这个差别足以让一批原本因为输出不可控而上不了生产的流程重新被评估一遍——这才是刷屏的原因跟它写代码厉不厉害没关系。Q2为什么说让编码 agent 帮我接 Jev才是正解因为两边分工本来就不同编码 agent 擅长产出文本和代码Jev 擅长产出决定。你的 agent 写一段调用 Jev 的代码代码里拿回choice和confidence去决定走哪条分支——这是官方反复强调的正确叠法。官方甚至还给了 TypeSafe 的 agent skillClaude Code 插件走claude plugin marketplace add typesafe-ai/skills再claude plugin install typesafetypesafe-ai也可以直接npx skills add typesafe-ai/skills --skill typesafe-ai。命令行细节、以及怎么把返回的概率落成代码分支都留给第二篇。这里只需要记住一句Jev 是你在生产里调用的一个服务不是你对话时选的那个模型。Q3网上流传的说法里哪几句要打折看零幻觉确实是官方博客的原话原文 “optimized for structured outputs and can’t hallucinate”DataCamp、Firecrawl 只是照抄。但官方文档里对同一件事用的是calibrated并且明确写了校准不保证单次——两处口径要分开引。准确表述在第 5 章末尾。“两个数量级”The model never makes type errors都是官方博客原话属于发布文口径官方那句延迟写的也确实是端到端70ms-500ms但倍率被限定在 “System One shaped queries”且没点名对照组模型第 5 章摊开对表。**“接进去就能省一大笔”**要看负载形状只按输入计费这件事决定了省不省取决于你往里塞多少 state、一次拿回几个决定。2. 一句话说清它是什么这一章回答谁提供的、名字从哪来、它背后那套世界观是什么。一句话版本Jev 是 TypeSafe 提供的旗舰模型也是它的第一个 System One 模型——读自然语言输出带类型的决定和概率不输出文本。官方发布文里那句更像人话也更值得抄进设计文档“Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out.”把 Jev 当成一次前沿智能的函数调用非结构化的 state 进去带类型的概率化决定出来。同一段里他们还交代了这套栈的构成——新的模型架构、一个并行采样器、以及一种他们叫RLCD的训练方法这三样分别对应第 3 章的并行和第 4 章的概率可用。这句话里有三个要各自拆开的东西。第一层提供者与模型 ID。提供方是 TypeSafe AI。当前线上模型 ID 是jev-1.13.0日常更常用的是两个别名jev-latestSDK 默认和jev-preview。这里有个坑官方文档写明了jev-preview目前和jev-latest指向同一个模型并不存在独立的 preview 版本。GET /v1/models可以列你账户可用的模型名目前列出来的也是别名不是带版本的 ID。第二层名字出处。“System One” 取自 Daniel Kahneman《思考快与慢》里的区分System 1 -- 快、直觉、并行、不需要解释 -- Jev 取的就是这一层快速、聚焦的判断 System 2 -- 慢、审慎、串行、边想边说 -- 传统 LLM 的长链推理更接近这一层官方 concepts/system-one 页强调命名取的是快速、聚焦的判断这层意思不是给模型编人格故事。第三层世界观。官方 AI primer 把整套主张叫Machine Native Intelligence核心判断是这句大规模 AI 自动化里约 99% 是机器与机器的交互只有 1% 与人的交互。既然 99% 的输出压根没有人在读优化目标就该从读起来舒服的回答换成在软件里行为可预期的输出。他们给自己的定位原话是“Building prod, not God”。维度通用 LLM 的典型优化目标Jev / System One 的优化目标官方口径落到接口上是什么反例服务对象那 1%输出给人读那 99%输出给代码消费字段名、类型、取值空间都是契约的一部分返回一段建议转给账务组因为……好输出的定义读着顺、信息全、带解释类型对、取值合法、概率可统计probabilities/confidence可直接参与判断解释很精彩但没法写成断言失败长什么样语气怪、答非所问、罗嗦分支走错、阈值判错、下游炸靠概率分档拦下来一段没人复审的自由文本进了工单系统成本压力输出 token 越多越贵只在输入侧计费输出长度不进账单为了说清楚点多烧钱这里容易搞混一点它不是另一个更便宜的通用大模型。TypeSafe 的立场是把回答这个交付物本身取消掉换成决定。顺带一条历史包袱能帮你看清这个选择的分量官方口径里RLHF 被用于训练 InstructGPT 与 ChatGPT而 TypeSafe 联合创始人 Diogo Almeida 参与了 RLHF 的共同发明。这家公司不是路过做工具它是在自己参与发明的那条路线旁边往反方向走了一步——差在哪第 4 章讲。3. 差别在输出契约不在聪明程度这一章回答一次调用到底给你什么东西。大多数人比模型比的是谁更聪明。Jev 和 LLM 的差别不在这——它一样吃自然语言不一样的是返回什么。官方 concepts/system-one 页的对比很干净与 LLM 一样理解自然语言输入但返回类型化决定和概率而不是生成文本不写回复、不产代码、不解释自己的推理过程。官方给自身的优势总结是七个词structure / reliability / observability / testability / speed / consistency / low cost。接口长这样POST https://api.typesafe.ai/v1/systemone Authorization: Bearer API_KEY请求官方 api.md 原文示例{state:Help! My payouts have been failing for 3 days.,model:jev-latest,questions:{department:{type:choice,instructions:Which team should handle this?,criteria:{billing:Payments, invoicing, refunds,technical:Bugs, outages, integrations,sales:Pricing, upgrades, new accounts}}}}响应官方示例注意model字段回的是带版本的 ID{model:jev-1.13.0,answers:{department:{type:choice,choice:billing,probabilities:{billing:0.88,technical:0.12,sales:0.0},confidence:0.81}},usage:{input_tokens:318,output_tokens:34}}先看这个响应里没有什么没有一段散文没有我认为应该转给 billing原因是支付失败通常归账务。想要理由得你自己从probabilities里读。这就是输出契约——选项空间由你定义它在这个空间里选并把有多确定一起交回来。三个原语各答什么问题原语它答的问题必填入参返回字段空间约束confidence典型用途noul是不是是非题instructionsnoul0 否1 是的概率只有真/假两面没有是否欺诈、是否可退款、是否需要人工choice选哪个从你给的集合里挑一个instructionscriteriachoice 全量probabilities和为 1每个 Choice 最多255个选项有工单路由、意图分类、分派团队score打几分按你给的有序等级instructions 等级定义scorelegendprobabilities至少2个、最多10个等级有风险分级、内容质量打分、优先级排序三条容易漏的细节instructions可以是字符串、对象或数组。用对象时可以一个字段放问题、其他字段放数据然后在问题里用反引号按名字引用那些字段。choice的criteria是选项 → 判据描述的 map某个选项可以给 null——不给判据让它自己按选项名理解。score返回的score是跨等级的概率加权值可以落在两级之间。这恰好是概率可用的副产品0.62 和 0.68 的差是有意义的而不是硬塞给你一个整数档位。Q1为什么 noul 没有 confidence因为它返回的本来就是一个连续概率0~1没有分布形状可算。置信度是从多选项分布的集中程度推出来的量所以只出现在 Choice 和 Score 的回答上。Q2一次问很多问题答案会互相污染吗官方 Models 页把这条性质写成了原文“Jev ingests the state once and evaluates every question against it in parallel”——state 只吞进去一次所有问题对着它并行评估而且每个问题独立评分不会因为你换了批处理策略就得到不同答案。官方并行问答 cookbook 用 5 次重复做过验证多数答案的标准差是 0.0。┌-- 问题A (noul) ─┐ state 只吞进去一次 ─┼-- 问题B (choice) ─┼-- 按 key 对齐回一个 answers ├-- 问题C (score) ─┤ └-- 问题D (noul) ─┘这个性质在工程上比看起来重要它意味着把 13 个问题打包成一个请求和发 13 个请求拿到的是同一批答案你纯粹是在成本和延迟上做选择不用担心批处理改变了判断本身。Q3问题的 key 会被模型读到吗不会。key 由调用方自定回答按同一个 key 返回key 本身不送进模型、不参与推理。它是给你自己代码用的对齐键叫q1还是叫shouldRefund都不影响判断结果。Q4出错的时候长什么样错误码四档401缺 key 或 key 错、422请求体校验失败、429超速率、529服务过载。SDK 默认做指数退避重试并遵守retry-after。4. 概率可用才是它真正的卖点这一章回答那些数字凭什么值得信以及能信到什么程度。这一块才是它和普通 LLM 最本质的差距。说白了普通 LLM 也能在你的 JSON 里输出一个 0.88但你不知道那个 0.88 是什么意思。先看三条后训练路线的概念差别这里只讲定位不涉及数字路线奖励信号来自哪优化目标产出更像什么和 Jev 的关系RLHF人类偏好标注与排序“读起来让人满意”更讨人喜欢的文本TypeSafe 联合创始人 Diogo Almeida 参与过它的共同发明官方口径Jev 没沿这条路走RLVR可自动验证的结果数学答案对不对、代码跑不跑得过有标准答案任务上的正确率更强的推理与解题和输出概率的可信度不是一回事RLCD官方全名Reinforcement Learning for Calibrated Decisions官方博客与 primer 页都点名了这条路线概率分布本身可不可信校准过的决定与概率而不是文本Jev 走的就是这条primer 原话是训练 TypeSafe 返回决定与校准概率而不是生成文本校准calibration到底承诺了什么。官方 concepts 页的原话要点是答案是校准的概率是拿结果反复校准出来的但校准是跨一批预测统计出来的性质不保证单次答案正确。这句话对着代码写的人有个非常具体的后果0.88 ≠ 这一次有 88% 的可能对 0.88 ≈ 长期看落在 0.88 附近的那一整批预测里大约 88% 最终是对的所以正确用法是把它当统计量、当路由信号而不是当保证。任何单次调用绝对可信的写法都是在要求一个官方明确没给的东西。置信度算的是分布的形状官方 confidence.mdconfidence是从概率分布形状算出来的统计量0~1只出现在 Choice 和 Score 的回答上分布越集中置信度越高。页面 demo 给的三选项近似式是(3 × 最大概率 − 1) / 2一般式是(n × maxP − 1) / (n − 1)。拿第 3 章那个响应手算一下(3 × 0.88 − 1) / 2 0.82而官方示例写的是0.81。这 0.01 的差是示例数值取近似导致的我把它记进文末待核实不影响怎么用。值得注意的是choice选的是 billing但如果三个选项是 0.34 / 0.33 / 0.33choice照样会给你一个答案只是confidence极低。这就是为什么只看choice不看confidence的代码比不看概率的 LLM 代码更危险——它给你一个看起来很确定的字段名。三档用法以及为什么阈值不是一个数官方立场很明确“I don’t know” 是有用的信号比硬猜一个选项对你更有价值。建议的用法是把置信度切三档置信度档位系统行为典型场景为什么要这么分落地形式高自动执行工单路由、批量打分、检索重排错了影响面小、可批量回滚代码里一个上界阈值中谨慎执行 / 请求人工确认有副作用但可撤销的操作需要人补一次判断双阈值 一条待确认队列低不执行转人工或换系统破坏性操作、无法回滚的写宁可不做也不要错做兜底分支永远要写但阈值不是一个数。官方特别强调同一个系统里只读操作和破坏性操作的门槛应该不同风险容忍度是由你的代码来编码的。给的建议是保守起步用自己的数据测过之后再往下调。这一章其实正好回答了它解决的痛点LLM 应用最难维护的从来不是能不能跑通而是**“这一步走错了谁负责”**。有了概率你在代码里写的是一条可回归、可测的阈值而不是一句可争议的提示词。5. 价格、延迟和三种它不是这一章回答钱花在哪、快在哪以及流传说法里必须修正的部分。官方口径models.md针对 jev-1.13项官方数值对你的代码意味着什么容易搞混的点价格$42/Btok $0.042/Mtok只按输入 token 计费输出 token 免费成本模型里只盯 state 问题的长度免费的是输出 token不是调用免费速率限制250,000 tokens/秒、1,200 requests/分钟两个维度独立限流都要算只按 QPS 规划会先撞上 token 上限上下文每请求64kstate 全部问题合计另有32kstate 最长的那一个问题是两个约束不是一个只按 64k 设计可能被 32k 那条卡住输入类型仅文本字符串 / JSON 对象 / 文本数组不支持图片、音频、视频多模态需求直接排除图片得先被别的模型转成文字才进得来语言英语是主要训练语言、准确率最好含 CJK 在内的其他语言能用但不等价官方要求上非英语负载前先用自家数据测中文场景没有开箱即同等这回事官方文档的示例全英文别按英文效果预估中文能不能微调不对客户数据做 fine-tune 或 LoRA所有账户用同一份权重只能通过 state / instructions / criteria 塑形行为想调它只能在提示结构上调它不是你的私有模型是一份公共权重数据不用客户请求与响应训练模型企业客户有 ZDR零数据保留合规评估可以直接引这两条ZDR 是企业客户口径还有一句要紧的官方自己警告当前需求量极大上述限额可能随时变化。这组数字要定期回去核别当成稳定合同。为什么输出免费是这个模式的结果不是促销是架构后果生成式调用输入 -- 逐个 token 生成不定长文本 -- 输出长度不可控、内容不可枚举 -- 只能按输出计费 Jev 调用 输入 -- 在你划定的选项空间里评分 -- 输出形状由你定义、长度可控 -- 输出免费输出侧不做写文案这件事成本主要压在把 state 和问题读进来的那一次前向。所以省不省钱不取决于它单价低取决于你的负载形状一次投进一大段 state、同时拿回好几个决定摊薄就成立官方并行问答 cookbook 的批量收益就是这条的证据反过来每次都塞一份完整上下文却只要一个布尔值那省不下什么。官方口径 vs 第三方实测指标官方口径第三方实测/解读这个差距该怎么读响应耗时官方发布文原文“End-to-end response time is 70ms-500ms”并称同等前沿智能水平下快40x~200x、总述为两个数量级verysmallwoods 端到端350ms ~ 1sAIJasonZ 那期视频称实测比目前便宜的 LLM 快 5 到 7 倍价格低 5 倍左右注意官方那句自己也说的是端到端只是限定在 “System One shaped queries” 且没点名对照组模型第三方含自家业务链路。倍率别写进 SLA批量收益cookbook约54,000字符的 GDPR 维基长文 13个问题8 个 noul / 2 个 choice / 3 个 score一次批量 vs 一问一请求12.2x 更便宜、10.0x 更快答案不变—官方实验但条件写得全可以当设计依据不能当承诺而且那个10.0x 是把 13 次单题请求耗时串行加总得到的官方自己标注你原本就并发的话时延差距会缩小检索重排cookbookCLERC 法律数据集3,565段法院意见文本BM25 先取30条候选覆盖40个查询重排后top-1 从 5% 提到 18%top-10 从 38% 提到 62%—数据集特定结论换到你的语料必须重测类型安全官方原句“The model never makes type errors.”所有答案都带校准概率与置信度TrueFoundry能防的是格式错误的输出防不了选错见下面零幻觉那节说明一句以上数字全部来自官方页面或别人的实测本文没有自行调用 API、没有计时。三种它不是“它不是”具体边界典型误用长什么样这个需求该怎么满足不是聊天 / 补全模型不写回复、不产代码、不解释推理第三方快讯TradingView/PAnews也直接说它不具备文本生成能力拿它做工单摘要、客服首答生成侧仍用 LLM让 Jev 只负责决定不是微调全租户同一份权重不 fine-tune 不 LoRA行为只能靠 state / instructions / criteria 塑形想喂一批历史工单让它学会我的业务把领域规则写进criteria的判据描述把上下文写进state不是多模态输入只有文本字符串 / JSON 对象 / 文本数组图片音频视频都不支持想让它读截图、读票据照片先由别的模型转成文字描述再进 state第三方解读在能力边界上的共识比较一致Firecrawl、Flowtivity 都提到强项是大批量分类、打分、路由、排序做不了文本生成、多步推理、视觉输入复杂逻辑上可能自信地答错。verysmallwoods 那句适合分类路由不适合需要解释的场景我觉得是这一篇里最实用的一句判断。零幻觉这个说法该怎么改先纠正一个容易传歪的点这句话是官方自己说的。发布文原文是 “While Jev gives up string generation, it’s optimized for structured outputs andcan’t hallucinate”DataCamp、Firecrawl 那些标题只是照抄。真正要区分的是官方内部的两处口径发布文用 “can’t hallucinate”文档里对同一件事用的是calibrated校准并且明确写了校准是跨一批预测统计出来的性质、不保证单次答案正确。所以引用时最好连官方那句英文一起带上别再自己加码成它不会出错。准确的表述要拆成两层层次成立吗为什么常见误写形状与取值不会越界成立选项空间、等级、字段全由你定义所以不会出现编出一个不存在的选项返回不合法 JSON这类失败“它不会出错”内容不会选错不成立它只是不会跳出你划定的选项在选项里面照样可能选错“它的判断可以无条件采信”一句话替掉零幻觉它把幻觉的可能从任意文本压缩到了合法的选项集合之内。压缩掉的那一半确实很有价值——你的解析代码不用再兜意外结构剩下那一半靠概率和置信度阈值来兜。另外官方还专门列了自己的已知失败模式model-jaggedness/jev-1.13 页这里只提一次不展开第三篇专门写它。最后总结这一章回答如果只记住三件事记哪三件。Jev 是决策模型不是聊天模型。它由 TypeSafe 提供、是第一个 System One 模型你换不掉编码 agent 背后那个模型你写的是调用它的代码。差别在输出契约不在聪明程度。输入 state 类型化问题输出带类型的决定 概率 置信度不写文案、不写代码、不解释推理。三个原语noul/choice/score覆盖是不是 / 选哪个 / 打几分state 只吞一次、问题并行且独立评分。概率可用才是卖点但它只在群体意义上可用。校准是跨一批预测统计出来的单次仍然会错所以风险容忍度必须由你的代码写成分档阈值而不是塞进提示词里祈祷。痛点、痒点、爽点分开看更实在层面它戳中的是哪一下靠哪个机制前提与代价痛点LLM 输出进不了生产的关键分支不可断言、不可回归、出错没人担责类型化输出 概率 置信度分档你得先把选项空间和阈值定义清楚痒点想少写一堆解析兜底代码又怕丢掉灵活性输出 token 免费、一请求多问题、key 自定灵活性确实换掉了它不给你解释爽点批量分类 / 路由 / 排序的耗时和成本一起下来state 吞一次、问题并行独立评分批量 12.2x 便宜 / 10.0x 快官方 cookbook 口径英语为主中文负载要自己测10.0x 的前提是单题请求原本串行发最后一句把它当成一个带概率的枚举函数来用这篇就没白读。参考资料 致谢[1] Introducing System One Models Jev-官方博客[2] System One 概念-官方文档[3] 三种原语 noul / choice / score-官方文档[4] Confidence 置信度-官方文档[5] Models、价格与限额-官方文档[6] API reference-官方文档[7] Parallel questions 并行问答 cookbook-官方文档[8] Re-ranking 重排 cookbook-官方文档[9] Jev 1.13 已知失败模式-官方文档[10] Jev 实战接进 3 个生产流程反欺诈、找客户、筛爆款一天只花 1 美元-B 站视频 AIJasonZ[11] 全网刷屏的 Jev 模型正式开放保姆级教程 实战测评-B 站视频 程序员鱼皮[12] 【Jev实测】Jev是什么怎么用二十分钟彻底给你讲清楚它的底层原理-B 站视频