【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址https://gitcode.com/gh_mirrors/je/jevgrep点击查看免费下载本篇文章系统讲解 Jevgrep 仓库中auto-research技能SKILL.md的完整工作流从恢复研究状态、澄清成功标准、建立基线、规划假设批次到逐个验证、组合晋级、按需扩展与重新规划以及五种持久化研究记录视图与证据纪律、停止规则。读完本文你将掌握一套「以单位时间信息增益最大化为目标」的可复现实验方法并能直接对照 Jevgrep 仓库中evals/目录下四轮真实 SWE-bench 评估研究relevance-threshold、source-first、speed、total-cost理解该方法论的落地形态。技能定位优化「单位时间的学习量」auto-research技能定义于仓库的.agents/skills/auto-research/SKILL.md其 frontmatter 声明Run fast, progressive experiments to map tunable parameters and their effects. Use when optimizing code, prompts, configurations, or other artifacts against a goal or benchmark, or when a long research run needs a planned hypothesis queue, focused trials, and durable findings.它的核心主张是优化「单位时间的学习量」learning per unit of time而非追求一次性的巨大跃迁。技能给出的研究节奏是先做一个快速且有揭示性的任务规划相互竞争的假设逐个单独测试组合验证过的赢家再扩大覆盖面。最终的可交付物是两份东西参数-效果图谱parameter-effect map每个被测试的参数或策略及其观测效果最佳已验证工件best verified artifact一轮实验后保留下来的、经过确认的候选。原文档还强调一个关键心智模型实验是一个检查点而不是终点An experiment is a checkpoint, not a stopping point.。每轮实验产出的不是「最终结论」而是「当前已知」——这恰好与 Jevgrep 仓库中evals/results/下四份研究报告的风格一致它们都以「这是一次测量而非最优性声明」收尾。在 Jevgrep 仓库中这一技能直接驱动了 evals/README.md 所描述的官方评估流程使用 SWE-bench 官方行为评分器behavioral grader在匹配的任务、源码、模型与测试框架上比较产品版本复用固定的 no-Jev 基线逐参数实验并沉淀图谱。工作流总览八步渐进式研究循环auto-research的工作流共八步形成一条完整的研究闭环恢复研究状态读取目标、用户反馈、项目指令与已有研究记录澄清成功标准先解决「什么算成功」再定义最小有用循环建立活跃任务基线运行一次未变更工件或复用兼容记录规划小批量假设列出瓶颈的不同解释与可测试参数按信息增益排序逐个测试假设在活跃任务上隔离候选、记录预测、对比观测组合与晋级兼容赢家组合测试通过回归集后再晋级取得进展后再扩展新增揭示新失败模式或图谱不确定效应的任务根据所学重新规划汇总图谱选择下一个信息量最大的批次。下面逐一展开并结合仓库中的真实研究记录作为实例。第 1 步恢复研究状态Recover the research state开始任何实验前先恢复现场读取目标、用户反馈、项目指令和已有研究记录把交接说明handoff与实际工件、运行中的任务对账在启动新尝试前先收拢待处理的尝试识别当前的最佳已验证工件即 incumbent、活跃任务、回归集regression set、假设队列和剩余预算并复用已有的记录位置而不是另起炉灶。Jevgrep 仓库对「恢复状态」的具体落实是 evals/README.md它明确说明四轮研究的身份neutral-skill 队列、source-first 队列、speed 研究、total-cost 重跑指明各研究保留在独立的结果文件中且历史报告保留其原始核算口径例如早期报告 Sol-only而 total-cost 报告 之后默认包含 Jev。这种「先对账、再开工」的做法正是第 1 步要求的 reconcile 行为同一研究领域里不同核算口径的分数不能混用。第 2 步先澄清「成功」的定义Clarify success before experimenting技能要求恢复已达成一致的标准不要要求用户重复如果评估器、指标、对比基线或所需改进量不明确则提出聚焦的问题并等待回答再编辑候选或启动评估——绝不默默替用户决定「成功」的含义。澄清的结果要写进研究契约research contract包括评估范围、聚合方式和回归门槛。原文档用一个具体例子说明歧义区分「通过正确性门槛」与「达到优化目标」并明确目标是绝对分数、绝对变化还是相对于具名基线的相对提升。例如「准确率提高 5%」是歧义的从 60% 起步5 个百分点意味着 65%而相对 5% 意味着 63%。必须澄清单位与方向必要时记录公式基线的取值可以之后测量但基线的身份和比较规则必须先行确定。只有当开放式的优化确实是用户的意图时才接受开放式优化不能自己发明阈值或用任何改进冒充所要求的改进。随后定义最小有用循环smallest useful loop记录可变更的参数与固定的评估器选择一个廉价的、能暴露待改进行为的任务测量其周转时间并从内环中移除不必要的设置、模型、用例和实现工作。若不确定性是架构层面的优先做架构 spikearchitectural spike。同时记录评估命令、超时、修复额度、资源限制、晋级规则与确认计划研究花费要与被优化的成本/运行时分开核算。「完成」意味着成功标准已解决、下一轮试验可以廉价运行且有明确的决策规则——不要在测试第一个假设前就搭建庞大的基准矩阵。Jevgrep 对此的仓库级落实是 cost-quality-policy.md官方 SWE-bench 任务完成度是主要结果primary outcome候选必须与前一产品版本在匹配任务上的已保存基准证据比较报告每次尝试的完整任务成本编码代理 Jev并明确「public skill 只教授 CLI 用法不得为刷分而塞入通用调试建议或代理专属工作流规则」——这正是「固定评估器、只动参数」原则的体现。第 3 步建立活跃任务的基线Establish the active tasks baseline运行一次未变更的工件或复用其兼容的已记录结果与轨迹验证评估器确实度量了预期的结果若探测能力未被证实使用一个已知会失败的对照组known failing control。基线在本次任务/模型/测试框架内保持固定不要为每个变体重跑。对噪声测量只规划区分效果所需的重复次数。保存精确输入、工件身份与原始输出。Jevgrep 仓库中这一原则执行得极为严格relevance-threshold 报告 声明「All eight baseline solves were retained. No baselines were rerun.」八个基线解决全部保留基线一律不重跑cost-quality-policy.md 也规定「每个任务/模型/测试框架只运行一次基线复用该固定结果候选变更不构成重跑基线的理由」。仓库把已保存的基线固化在 evals/implementation/swebench/fixed-baselines.json并保留每个基线的完整轨迹、补丁、官方评分与账单供后续队列直接引用。第 4 步规划小批量假设Plan a small hypothesis batch在编辑之前先列出对当前瓶颈的不同解释以及能测试这些解释的参数或策略。要检查真实的失败轨迹与匹配的基线行为而不是凭聚合分数猜测。每个假设需记录三件事参数/变更及其机制为什么它可能影响结果预测观察、证伪结果与最便宜的判别测试固定的比较父代parent、预期试验成本、与其他假设的依赖或可能相互作用。然后按「单位时间获得的信息」排序逐个对照同一父代测试备选方案使其效果可解释避免穷举参数网格保持队列短小并在结果出来后修订队列——规划属于每个研究周期而非一次性积压。Jevgrep 的 relevance-threshold 报告 就是一份完整的「假设批次 决策」实录其「Parameter-effect map」一节逐行记录参数或策略观察与决策即使实现有缺陷也予以接纳保留相关性必须包含对报告行为负责的代码将相关性、范围与具体引用精炼分离保留结合声明结构与有界局部调用上下文源码先于详细声明/调用位置保留更早冻结的队列保住了全部八个基线解决用查询、祖先文件夹与预览做排序保留无「源码无条件优先于文档」的规则文件接纳阈值从 0.25 提高到 0.5Django 从返回 51 个文件变为 10 个并通过增加测试模块建议Pytest 通过但成本高于父代未采纳移除可选测试体过滤Django 仍失败且输出被截断未采纳注意表中「未采纳」与「保留」并存——这正是技能要求的包含有害与无效效果harmful and null effects图谱不是只记录成功的榜单。第 5 步在活跃任务上逐个测试假设Test one hypothesis测试时必须保留 incumbent当前最佳已验证工件并把候选与无关工作隔离一次只改变一个概念性因素若必须捆绑耦合变更就把结果归因于该捆绑。运行前记录候选身份与预测先做便宜检查再做聚焦任务不要为每个变体跑完整测试套件保存有唯一标识的原始输出并检查相关轨迹约束崩溃与修复被修复的候选获得新身份缺失的结果是未知不是零。把观测与预测对比包括回归与零结果null result记录keep/discard/inconclusive/invalid四种判定并更新图谱。在备选方案之间恢复父代保留可复现的快照或补丁及回滚范围之外的证据。拒绝一个候选不等于推翻其整个策略如果证据支持诊断有前景的部分胜利并规划有针对性的后续。Jevgrep 的 source-first 报告 是典型示例表中「把当前实现当作证据即使它有缺陷」标注为「保留在组合候选内相关代码不得因与期望行为矛盾而被拒绝」「增加测试模块建议」因成本与命中问题「未采纳」「移除可选测试体过滤」因输出截断「未采纳」。同时该报告记录了「候选身份」管理精确的 npm 0.3.2 包、集成 CLI 与原始公开技能、仅改写技能段落的同一 CLI——三者是三个不同的测量工件绝不混入同一队列这正对应技能中「修复后的候选获得新身份」的要求。第 6 步组合与晋级Combine and promote把兼容的赢家组合起来对照最强单个候选测试。不要假设增益可加检查相互作用归因不清时一次只移除一个变更。组合结果劣于更简单候选的不能成为 incumbent。聚焦胜利只是临时状态。晋级前用已保存的基线与声明的容差把候选对照累计回归集此前已解决的任务检查拒绝或修复回归而不是把它们藏进平均值用计划中的证据确认噪声胜利包括所有计划尝试与成本将已验证候选入库并用相互作用与任务特定限制更新参数-效果图谱。Jevgrep 仓库对此的落实relevance-threshold 报告 声明「The candidate combines hierarchical discovery, content previews, relevance and scope classification, reference refinement, and source-first output」组合了分层发现、内容预览、相关性与范围分类、引用精炼、源码优先输出并明确「组合候选证据单个贡献未被隔离」——诚实标注哪些增益是组合证据、哪些是独立测量。该队列最终保住全部八个基线解决才被采纳。第 7 步取得进展后再扩展Expand only after progress当活跃任务达到其局部标准、且先前任务保持绿色后才新增一个任务或小批量探测新的失败模式或图谱中的不确定效果仅为这些任务建立缺失的基线。若新任务失败让它成为活跃任务回到假设规划把旧任务保留为回归检查调试单个失败时不要反复运行扩展套件。这个课程curriculum改变的是发现覆盖面而不是整体成功标准为更大覆盖面保留更宽泛的评估用于覆盖面扩展检查点与最终确认——单个任务的成功不能完成更广泛的目标。Jevgrep 的评估以固定十任务队列推进evals/README.md 描述的 installed-package harness见 installed.md支持单任务检查点或完整十任务队列且「tuned Python cohort 不能证明未触碰任务或跨语言泛化」——这正是技能「课程改变覆盖面而非成功标准」的仓库表达。第 8 步根据所学重新规划Replan from what was learned在一个假设批次、一次新失败或几次无改进试验之后汇总图谱并选择下一个信息量最大的批次当证据与怀疑的机制或实验设计矛盾时改变机制或设计不要无限调优同一家族或重跑同样测试只有前提改变时才重新审视被否决的想法无需在每个实验后询问是否继续。Jevgrep 的 speed 报告 展示了「学完即止」的典范其「Experiment findings」表逐项记录了 7 个策略的试验与决策——复用未变更的忽略规则重放从 82.6 秒降到 16.7 秒保留并在 v0.4.2 单独发布、复用编译后规则较慢未选、降低提供者并发 32→8更少 HTTP 失败但更慢保留 32、推迟富预览无增量增益保留为延期实验、原生二进制扫描微基准约 6.3× 快保留但不把微基准增益宣称到整个任务、每次尝试/缓存返回只验证一次保留、原生 TypeSafe 路由保留用于确认。报告以「This completes the planned speed comparison…no more paid trials are needed」收束对应技能的「plausible plateau → replan or stop」。持久化研究记录五种视图技能要求使用项目已有的格式保持紧凑并与证据相连共有五种视图Contract契约目标、固定评估规则、预算、当前任务与回归集、最终验证范围。协议变更要版本化不得混用不兼容的分数也不得放宽用户标准让结果通过。Hypothesis queue假设队列计划批次、优先级、依赖、预测以及已测/已拒/下一步状态图谱改善后淘汰过期条目。Parameter-effect map参数-效果图谱每个有意义的参数或策略一行——已测设置/范围、对质量/成本/运行时的影响、适用任务类型、权衡、相互作用、置信度、证据链接、剩余不确定性。区分已测效果与怀疑的机制包含有害与无效效果这是主要交付物不是榜单或按时间排列的实验日志。Attempt ledger尝试账本假设、父代/候选身份、协议版本、任务、命令/配置、指标、门槛结果、资源使用、判定、证据路径相关时捕获模型/提示/数据版本与随机种子。Handoff交接说明incumbent、活跃任务、待处理任务/输出位置、剩余预算、下一步具体测试及其理由。每个判定后、每个回合边界前更新绝不只留下「继续优化」。Jevgrep 仓库对五种视图的落实非常具体四份 results 目录 下的 Markdown 报告均配有机器可读 JSON如 relevance-threshold-2026-09-27.json 标识档案、公开技能、测试框架与每次尝试对应 attempt ledger 的持久化原始提示、Jev 请求/响应、模型面向工具包、补丁、官方评分与账单查询保留在被 Git 忽略的evals/runs/swebench/*目录且「研究名称与工件哈希」被提交进数据以便对账——图谱/账本指向证据证据本体留在本地这正是「compact and linked to evidence」的落地。证据纪律Evidence discipline优化真实结果更小的输出或更快的微基准只是诊断直到端到端质量与成本门槛通过缩小试验范围的同时保留被研究的行为绝不硬编码任务答案。保持对比匹配在队列内冻结候选、避免资源争用绝不选择有利基线或在看到分数后重跑。开发与确认分离反复调优过的用例是开发证据用未触碰的用例支撑泛化声明隐藏答案与评估器专属输入不得进入候选工作。失败计入花费失败试验与重试计入研究花费说明目标成本的包含/排除基础设施失败既不是胜利也不是被测候选的回归。及时披露重要发现立即披露工作流顺序不得推迟披露。Jevgrep 的 accounting.md 逐条呼应任务成本默认包含编码代理与 Jev各组件分开报告原生 TypeSafe Jev 按冻结运行时保留的公开费率从记录输入用量估算并明确标注为估算缺失用量即未知而非零Jev 令牌绝不加入编码代理令牌总数基础设施失败必须保持可见不得用更简单任务替换或计为行为成功。而 cost-quality-policy.md 规定「补充观察可以解释行为但不得改写官方解决结果」——与「绝不硬编码答案、不得用补充断言覆盖官方评分」一致。停止规则Stopping在授权的会话与限额内继续直到目标通过所需验证、用户停止、预算耗尽、或存在真正的外部阻塞。平台期plateau意味着重新规划而不是虚构最优性声明。跨续篇保留研究状态该技能本身不安排未来工作。到达停止边界时让 incumbent 可恢复、对账待处理任务并交付参数-效果图谱、基线对最佳已验证结果、覆盖面与限制、已消耗预算、停止原因以及未完成时的确切下一个实验。达到分数不能替代记录实验确立了什么未完成的运行仍留下一张有用的「已知什么」的图谱。Jevgrep 的 relevance-threshold 报告 提供了一个教科书式的停止段落「Stop here: the fixed ten-task comparison is complete, the public skill remains limited to CLI usage, and additional tuning would extend the research scope. The evidence supports adopting this artifact, not claiming it is optimal.」——明确停止原因十任务对比完成、覆盖限制公开技能限于 CLI 用法、以及「采纳而非最优」的边界同时列出研究账本fully billed 尝试、不完整尝试的已知费用、未对账请求、Jev 元数据合计把「已知」与「未知」全部透明呈现。结语在 Jevgrep 仓库中的应用闭环auto-research技能不是纸上谈兵——Jevgrep 的evals/目录就是它的完整实践以 cost-quality-policy.md 为契约以 fixed-baselines.json 固化不可重跑的基线以四轮研究source-first → relevance-threshold → speed → total-cost依次完成「测试假设 → 组合晋级 → 加速确认 → 计入 Jev 的全成本重算」最终以参数-效果图谱与「采纳而非最优」的停止声明收尾。如果你要在自己的项目中开展类似的参数优化或基准研究直接套用本文梳理的八步循环、五种记录视图与三条纪律基线不可重跑、开发与确认分离、未知即未知即可复现 Jevgrep 这种「信息密度高、可审计、可交接」的研究节奏。赞分享【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址https://gitcode.com/gh_mirrors/je/jevgrep点击查看免费下载相关推荐AutoResearchClaw 统计报告技能实战指南检验选择、假设检验与 APA 格式化的完整方法论AutoResearchClaw 统计报告技能实战指南检验选择、假设检验与 APA 格式化的完整方法论 导读本文围绕 AutoResearchClaw 内置人工智能大模型AI Agent自主智能体深度研究科研MCP 服务后端AutoResearchClaw 假设生成技能hypothesis-formulation实战指南从可证伪命题到实验设计的完整方法论AutoResearchClaw 假设生成技能hypothesis formulation实战指南从可证伪命题到实验设计的完整方法论 导读 本文以 Aut人工智能大模型AI Agent自主智能体深度研究科研MCP 服务后端iii 渐进式接入实战以函数封装、队列卸载与状态迁移分片改造存量系统iii 渐进式接入实战以函数封装、队列卸载与状态迁移分片改造存量系统 iii 是一个面向实时服务编排、扩展与可观测的运行时本仓库即其核心实现包含引擎、SD后端流程编排任务调度可观测性创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考