
❝先说结论Jev Harness 不是一个具体产品而是一组围绕 TypeSafe 的专用决策模型 Jev 展开的「决策 / 生成 / 执行三权分立」思路外加多个开源实现把它落地成编码代理coding agent的 token 优化门控层。GitHub 上挂着至少三个同名或近名的仓库目的彼此并不相同把它当成单一工具去评会看走眼。本文分四块往下走1先把 Jev 与 Jev Harness 的边界画清——Jev 是模型Harness 是外壳与门控2拆解三权分立与 System One / System Two 的底层机制3看 token 经济学的具体数字与四类决策门4思考——命名通胀、作者自报基准、它到底不做什么以及你该不该接。【把拍板、动手、兜底分开系统才不容易在循环里把自己烧干】一、先定义Jev 是模型Jev Harness 是外壳与门控层先说一个误区很多人把「Jev」和「Jev Harness」当成一个东西。核心点在于二者处在不同的层。Jev 是一个模型准确说是 TypeSafe AI 的「System One」非自回归non-autoregressive决策模型。它不生成文本只回答结构化问题三种答案类型choice从给定选项里挑一个score给某个对象打一个分noul一个「无 / 空」判定no null 合并用来表达「这事我不做判断」。一次请求可以塞进多个问题独立的图节点还能并发跑。延迟在 70–300ms输出成本约$0.042 / 1M tokens——几乎不花 token。这个成本量级是后面所有 token 优化的前提。Jev Harness 是外壳与门控层分两层含义概念层TypeSafe 创始人 Diogo Almeida 的白皮书把编码智能体的「决策、生成、执行」三种角色彻底切开。大模型只负责写代码和深度推理System TwoHarness 负责工具调用等确定性动作Jev 专管路由、评分与拦截System One。工具层开源实现如ismaelsoilet/jev-harness的 Rust/Python/TS 三端、tianyucodings/JevHarness的研究型 harness把 Jev 包成决策门插在编码代理和测试 / 编译反馈之间做失败分流、循环中断、完成否决、模型路由。最值得记的是tianyucodings/JevHarness的 README 把这条边界讲得最清楚task adapter 拥有观察、合法动作、副作用、打分harness 拥有特征构造、Jev 判断、决策逻辑。这个边界让 harness 不能改写自己的 reward也不能读隐藏任务状态。它是「可审计、可冻结」的真正前提而不是一句口号。有趣的点又来了正因为边界清楚才能做到「author once, then execute」——作者 LLM 把策略写进显式代码后冻结运行时每个决策不再拉作者 LLM。二、三权分立与 System One / System Two 的底层机制关键点在于Jev Harness 把 Kahneman 的 System 1快、直觉、校准过/ System 2慢、深思、生成式范式直接挪到了 agentic engineering 上。System 1 Jev非自回归、并行、类型化决策70–300ms$0.042/1M tokens 输出。它干的是「下一步走哪条路」这类选择题根本不需要文本生成能力。System 2 前沿大模型GPT-6 Astra、Claude Fable 5.1写代码、解深层算法逻辑贵且慢。机制串起来是这样的agent 跑命令 / 测试 → 拿到输出 → 失败则进 jev-harness gateJev 决策约 70–300ms→ 若skip_llm True缺依赖 / 抖动 / 琐事就走确定性 shell 动作pip/npm install、重试一次0 前沿 token若skip_llm False深层逻辑 bug才把针对性 trace 送给前沿 LLM。实测口径下成本降约 80%。tianyucodings/JevHarness给了一个很能说明问题的样例宝可梦对战Pokémon battle。作者 LLM 先写一个针对该任务的 harnessPython 代码 Jev 问题用回合 12 的真实请求举例——harness 算出 Slowbro 在伤害竞速中落后给出四个合法动作Jev 返回switch:2换上 Scizor概率 0.72harness 接受这个选择。注意这些概率只是「动作选择概率」不是「胜率」。这个最小幻觉原则值得在别处也借鉴。经过 5 轮 reflection可选反思选定 harness 在 Eval 上的胜率从 25%3/12升到 75%9/12。但这个确实很重很有误差传播README 自己写明这是 selection Eval set 上的样例结果不是对 unseen game 的独立性能估计。把它当成年化收益会高估。三、token 经济学数字与四类决策门先看数字再下结论。白皮书给出两组实测数据都不来自二手自媒体来自原作者的工程追踪。其一大小模型交替反而更贵。Opus 走到一半切到 Sonnet再切回 Opus一轮任务总账单$6.19从头到尾只用 Opus反而只要$4.15。切换比不切贵近 50%。原因实在跨模型移交任务时下游模型必须把完整上下文重新处理一遍KV 缓存全部作废前一次的 token 计算成本相当于被扔掉。其二token 大头不在写代码。读文件 搜索检索占据了56.2%的工具调用轮次吃掉了46.5%的 token而真正的写代码动作token 占比不到 **10%**见图3。所以优化效率的核心战场是「检索过滤」——决定哪些文件值得读、哪些代码块值得保留、哪些搜索结果直接扔掉——不是生成速度。围绕这点白皮书给了一串工程技巧每一条都直指「把 token 花在相关处」先提问后压缩等用户提出具体问题再由 Jev 对代码块动态打分归入隐藏 / 短摘要 / 长摘要 / 完整保留四档粒度。工具三层渐进式暴露第一层常驻索引系统提示词里只放几百个工具的单行极简描述第二层按需解析Jev 判断某工具可能用到才动态拉完整 JSON Schema 注入第三层单次文档只在执行复杂调用时临时拉详细文档用完就走。工具库可以又大又全上下文代价不再线性增长。规则条件触发式注入规则不再常驻系统提示词而是按状态动态挂载——打开 tsx 文件自动挂前端组件规范进入 billing 目录自动挂支付风险规则。这样绕过了智能体自身的上下文压缩机制只要触发条件成立规则就一直挂在上下文里不会被误删。落到工具层ismaelsoilet/jev-harness把这套思路做成了四类决策门可经 CLI / MCP / Git-CI 钩子 / 类型化 SDK 调用triage_test_failure分类测试 / 编译错误缺依赖 / 抖动 / 逻辑缺陷判断能否跳过前沿 LLM 确定性修复本地判定 500µs远程走 Jev 70–300ms。abort_check比对拟执行下一步与历史失败记录检测 doom loop循环重构或死路建议停止。route_task给出最小够用的模型档确定性脚本 / 快速 flash / 重型前沿。verify_completion用证据核对验收标准判断步骤是否真完成避免无谓的复审循环。此外还有modulate_reasoning_effort推理强度调节与should_nudge_continuation判断是否该继续推一把。命令安全拦截则从黑白名单升级为语义级Jev 逐行读脚本内容判断是否碰生产数据库、删关键目录、外发数据再决定放行 / 追问 / 拒绝整个过程零生成 token、毫秒级。这个是实话它堵住了「命令名黑白名单只拦名字、拦不住名字无害脚本里藏rm -rf /」的语义漏洞。四、思考命名通胀、作者自报基准以及它到底不做什么先说结论式的提醒Jev Harness 这个词已经被用得有点通胀了。命名通胀至少三个 repo。GitHub 上同名 / 近名的至少有tianyucodings/JevHarness研究型写任务专属 harness 反思进化 GEPA 选父、ismaelsoilet/jev-harness实用 token 优化门控Rust/Python/TS CLI/MCP/SDK、AppitStudio/awesome-jev下的jev-harnessTypeScript 决策 harnesspolicy 置信门 shadow mode jev-eval离线 CLI且不隶属 TypeSafe。把它们混为一谈会看走眼——有的负责「让 LLM 写 harness 并进化」有的只是「失败分流的门」。基准多为作者自报。「提速 200 倍、降本 400 倍」「切换比不切贵近 50%」多来自原作者的实测 / 自报。社区尚未广泛独立复现开源榜的评测也明确写「指标来自 GitHub API 推断以官方 README / docs / Release 为准」。看数字时把「自报」和「独立复现」分两栏是基本素养。它到底不做什么边界要画清——它自己声明不是编码代理本身不是运行时监管那是 Foreman不是工具调用护栏jev-guard不是上下文筛子Winnow。它的定位是「编码代理与测试 / 编译反馈之间的 System 1.5 决策层」。真实接入门槛也有两点。其一实时模式会传输类型化问题和失败日志得按数据合规要求评估网络访问与日志内容离线 mock 模式不联网适合先试。其二Jev 模型本身依赖 TypeSafe API或 Vercel AI Gatewayprovider 行为不随模型别名锁定——stored responses 和 fresh calls 的可复现性保证不同真要上线得把这点算进 SLA。ROI 判断给一句话如果你的代理已经频繁把 token 烧在「缺依赖 / 抖动 / 循环」这类可确定性处理的事上加一层 System One 门控ROI 成立如果你的任务主要是深层算法推理这层帮不上多少反而多一层延迟与依赖。总结本文主要介绍了 Jev Harness 的两条线——概念层的「决策 / 生成 / 执行三权分立」与工具层的「System One token 优化门控」重点看了 Jev 的 choice/score/noul 机制、System One/System Two 的分工、token 经济学的实测数字46.5% 检索 token、4.15以及四类决策门的落地形态。可迁移的判断标准先分清楚「这是模型、是外壳、还是门控层」再谈选型任何把决策、生成、执行搅在一起的智能体优化第一刀都应该切在「哪些决策根本不需要昂贵生成」上。把决策的归决策、生成的归生成、执行的归执行系统要稳先得把权分清楚人也是懂得把「拍板」和「动手」分开的人才不容易在循环里把自己烧干。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】