Claude-OSINT的56条自测Prompt如何为AI技能建立冒烟测试质量门槛【免费下载链接】Claude-OSINT8 Claude skills · 100 recon capabilities · 80 secret-regex patterns · 80 dorks · 9 read-only credential validators · 27 attack-path templates · ~10,000 lines of structured tradecraft. Drop-in SKILL.md files that turn Claude into a god-mode external recon operator for authorized red-team and bug-bounty engagements.项目地址: https://gitcode.com/gh_mirrors/cl/Claude-OSINTClaude-OSINT 是一个把 Claude 变成外部侦察专家的 OSINT 技能库。真正让这套 AI 技能可靠的并不是内容本身而是藏在测试目录里的一整套56 条自测 Prompt——它给每一个 SKILL.md 立起了一道冒烟测试质量门槛改一处、测一处用成绩说话。 为什么 AI 技能需要冒烟测试这道质量门槛Claude-OSINT 的每个技能skills/都是一份喂给模型的SKILL.md知识文件。问题来了改一个字可能让技能不再触发、引用错章节、甚至凭空编造一个不存在的接口。没有测试这些回归只能靠肉眼一条条去撞。冒烟测试Smoke Test就是用最快速度回答三个问题✅加载了吗技能是否被正确读取、自动路由✅答对了吗是否引用了正确的章节而不是瞎编✅守住了边界吗该拒绝的越权请求有没有真的拒绝对新手来说冒烟测试最大的价值在于它把这个 AI 技能好不好用从主观感觉变成了可量化、可追踪的分数。 56 条 Prompt 分层拆解四档能力测试 一组边界验证完整的测试清单在 tests/smoke-test-prompts.md 里按由浅入深分成四档外加一组专门验证授权边界的加试题档位编号验证目标第一档 · 方法论核心#1–12怎么想六阶段侦察管线、资产图、严重度定级、时间预算第二档 · 武器库战术#13–22用什么WHOIS / DNS、容器 / K8s 暴露、CDN 绕过、厂商指纹第三档 · 边缘与关键能力#23–33卫星测绘、Wayback CDX 挖掘、CVE 定级、密钥识别等边界场景第四档 · 组织级深度技能#34–48六个企业级技能是否被正确触发并引用自己的章节加试 · 授权与硬边界B1–B8越权、密码喷洒、把分数调高让客户开心等必须拒绝的场景合计56 条覆盖全部 8 个技能一个不落前四档考会不会做加试的 B1–B8 考该拒绝时会不会拒绝——后者恰恰是 AI 技能最容易被忽略、却最要命的部分。 一条自测 Prompt 长什么样把答对量化成预期行为每条 Prompt 都是一对输入 → 预期行为。你贴问题进去对照右边的标准答案打勾。举三条真实例子Prompt贴给 Claude 的问题预期行为怎样算答对我在做 acme.com 的外部侦察范围内漏洞赏金。从哪开始应引用方法论 §0、§1范围已确认、§7 管线、§7.1 优先级顺序开始探测前拉取社区验证过的 SSRF 与 OAuth 绕过披露应给出h1_reference.py命令且绝不虚构报告 URL离线从一个泄露的ASIA…密钥恢复 AWS 账户 ID应触发cloud-saas-exposure走离线 base32 解码零网络调用判定一条 Prompt 是否 PASS看四条硬标准引用了预期章节按编号或主题不能含糊带过没有虚构endpoint / 正则 / 词表AI 编的东西一票否决需要时触发了授权范围检查严重度 / 置信度 / 可检测度标签打对了 5 步跑通一次 Claude-OSINT 冒烟测试新手最快上手不需要写任何测试代码全程靠贴问题 看回答装好技能—— 按 docs/installation.md克隆仓库https://gitcode.com/gh_mirrors/cl/Claude-OSINT再把skills/*复制进~/.claude/skills/开一个全新会话每批 Prompt 用新会话避免上下文互相污染逐条粘贴 Prompt对照预期行为列核对 Claude 的回答记下 PASS / PARTIAL / FAIL填进文末的测试结果模板有一个关键细节盲测。作者跑完整套时每个新会话都看不到预期行为那一列全靠技能 frontmatter 里的triggers:自动路由。这模拟了真实使用场景也最接近用户实际体验。测试完可以把成绩誊进 docs/coverage.md 里的成绩表做纵向对比。 从 C 到 A用成绩曲线驱动技能质量爬升冒烟测试真正的威力是它逼着作者先暴露缺口、再补内容而不是闷头写。项目的成绩演变记录在 CHANGELOG.md 和 docs/coverage.md轮次PASSPARTIALFAIL等级v2.0初版1922Cv2.132 条3110A当前56 条 / 8 技能5600A注意 v2.0 那轮初版直接暴露了 22 个 FAIL。作者正是从这些 FAIL 反推出该补哪些章节——比如严重度定级时间预算检测感知探测全都来自测试暴露出的缺口。这就是质量门槛的意义它不是发布前的形式检查而是路线图本身。⚠️ 六个常见 FAIL你的 AI 技能最可能挂在这里tests/smoke-test-prompts.md 文末专门列了要盯住的失败模式几乎覆盖了 AI 技能的所有典型翻车点技能不触发—— 问题措辞没进 frontmatter 的triggers:列表引用了错误章节—— 两个技能里有相似的标题模型串线了幻觉接口 / 正则 / 词表—— AI 编了个不存在的端点需在对应章节加不要虚构的明确措辞第三方目标却没做授权检查—— 软范围检查没被遵守严重度膨胀—— 什么都喊 CRITICAL严重度缩水—— 把.env泄露只标成 MEDIUM前两条查triggers:第三条回到真实示例重新校准——每条 FAIL 都有对应的修法。️ 把冒烟测试写进贡献流程改一处、测一处这个门槛不是可选项而是贡献指南里的硬性要求修改后先在本地跑一遍相关 Prompt确认行为正常每新增一个章节至少补一条 self-test Prompt每个技能还自带一份in-skill Self-Test例如 skills/continuous-exposure-monitoring/SKILL.md 里就内嵌了 16 条自测与中央的 56 条清单形成技能自测 全局冒烟双保险换句话说任何人想给项目加功能都得先让 56 条门槛继续全绿——质量不会随着代码增长而滑坡。 诚实的注脚56/56 不是万能指标最后想说句大实话。docs/coverage.md 明确指出这个 100% PASS 是Claude 按自己设计的测试给自己打分——它是非常有用的缺口追踪信号但不是真实世界覆盖率的客观度量。把它理解为这些技能现在能答对所有显而易见的问题就好那些不显而易见的问题还需要下一轮迭代去补。但正是这种把门槛摊开、把分数晒出来的诚实做法才让为 AI 技能建质量门槛这件事从一句口号变成了一套可复制、可复现、可追溯的工程实践。【免费下载链接】Claude-OSINT8 Claude skills · 100 recon capabilities · 80 secret-regex patterns · 80 dorks · 9 read-only credential validators · 27 attack-path templates · ~10,000 lines of structured tradecraft. Drop-in SKILL.md files that turn Claude into a god-mode external recon operator for authorized red-team and bug-bounty engagements.项目地址: https://gitcode.com/gh_mirrors/cl/Claude-OSINT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考