Codex Autoresearch 完全指南让 AI 编程助手自主迭代、自动保留改进并回滚失败的实验循环【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearchCodex Autoresearch 是一款面向 Codex AI 编程助手的自主迭代实验技能你只需给出一个可测量的目标它就会自主地一次改一件事、自动验证、保留改进、回滚失败并循环往复直到达成目标。灵感来自 Karpathy 的 autoresearch 概念它把试错变成了一条可信、可审计的工程循环。 什么是 Codex Autoresearch普通 AI 编程助手改完代码就结束了而 Codex Autoresearch 把任务变成一条受控的实验循环你告诉它想要的结果比如错误数降到 0它检查仓库、与你确认实验参数之后进入循环修改 → 验证 → 保留或回滚 → 重复直到达标。适用场景包括测试失败数、覆盖率、类型错误、Lint 警告、延迟、二进制体积、可复现的安全问题发现以及任何一条命令能测出数字的结果。 安装与快速开始环境要求最新版的 Codex CLI需支持 Skills 与 Goals 能力Python 3.11 或更高Git且已配置提交者身份一步安装把技能复制到用户级技能目录所有项目都能使用git clone https://gitcode.com/gh_mirrors/co/codex-autoresearch mkdir -p ~/.agents/skills cp -R codex-autoresearch ~/.agents/skills/codex-autoresearch启动第一个实验循环在干净的 Git 仓库中启动 Codex建议使用 Full Access因为每次实验要创建和回滚 Git 提交codex --dangerously-bypass-approvals-and-sandbox然后调用技能用一句话描述可测量的目标You: $codex-autoresearch Reduce python3 scripts/score.py error_count to 0. Codex: Baseline: 5 / Target: 0 / Scope: src/ / Verify: python3 scripts/score.py Run in foreground or background? You: Background. Go.写任何文件之前Codex 都会先展示实验方案等你确认——这是整个流程的安全前提。 实验循环是怎么运转的检查证据 → 修改一个聚焦的点 → 提交并测量 → 指标改善 且 防护通过 → 保留 → 否则 → git revert 回滚 → 追加一条审计事件 → 重复直到达标两个关键设计分工明确Codex 负责假设与代码改动内置控制脚本 scripts/autoresearch.py 负责提交、验证、回滚和状态管理。Git 就是实验记忆每次实验都是一个提交失败实验用git revert非破坏性回滚历史中永远留有可追溯的记录。️ 前台还是后台两种运行模式前台 Foreground后台 Background运行位置当前 Codex 任务独立的控制器进程适合场景实时盯着看、随时改方向长时间任务、挂机过夜控制方式用 Codex Goal 暂停/恢复直接对技能说 status / stop / resume想随时介入调整策略 → 选前台想让 Codex 过夜自己跑 → 选后台默认 Full Access因为 worker 需要写 Git 提交。 如何配置一个可靠的实验开始前Codex 会与你确认 7 个关键值参数含义示例Goal期望的结果消除类型错误Scope允许修改的文件/目录srcMetric数值化结果类型错误数Direction越小越好 / 越大越好lowerVerify输出指标的测量命令python3 scripts/score.pyTarget达到即完成0Guard可选的回归防护pytest -q新手最容易踩的两个坑Verify 命令必须始终退出码为 0。哪怕指标很差测量命令本身也要成功执行且最后一行非空输出必须是一个有限数字或一个 JSON 对象并显式指定其中某个数值键。Guard 是及格/不及格。指标改善了但防护失败这次实验照样会被回滚。 查看结果与实验历史运行产物保存在autoresearch-results/目录永不提交到 Git文件作用run.json不可变的实验配置events.jsonl只追加的状态历史唯一事实来源logs/完整的命令输出report.html按需生成的可视化快照一句话就能查看历史或生成报告$codex-autoresearch show experiment history $codex-autoresearch generate an HTML reportHTML 报告会展示指标走势曲线、每次实验的 keep/discard 决定、相关提交与日志链接️ 为什么敢让它无人值守每次实验都是 Git 提交——成败都可追溯失败自动回滚——未改善的实验或防护失败的实验自动 revert异常即停——越界编辑、分支变更、命令失败、超时会带着精确错误和日志路径停下运行拒绝静默恢复——技能绝不从旧文件或对话记忆里猜结果。这种严格是刻意的静默恢复会让长期自主运行变得不可信。✅ 哪些任务适合它适合有可重复数值指标的任务失败测试用例清零、类型/Lint 错误清零分支覆盖率提升到 90%p95 延迟降到 200 ms 以下二进制体积压缩、可复现安全发现清零不适合一次性小改动、主观设计评审、部署发布——这些用普通 Codex 即可。目标开放时先和 Codex 一起定义稳定基准再启动循环。注意Autoresearch 必须运行在 Git 仓库中一次运行只管理一个仓库——Git 正是它的实验记忆与回滚边界。 延伸阅读文档内容docs/INSTALL.md安装、更新与验证技能docs/GUIDE.md配置、生命周期、状态与排错docs/EXAMPLES.md实战示例与指标模式references/workflow.md完整工作流参考references/experiment.md实验契约与测量规范scripts/autoresearch.py控制脚本源码【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考