深度解析NVIDIA-Verified认证背后的三层评测体系NVIDIA Agent Skills信任管线全景拆解【免费下载链接】skillsAgent Skills for NVIDIA products — install into Claude Code, Codex, and other coding agents to run Physical AI, robotics, simulation, CUDA, and RAG workflows end to end.项目地址: https://gitcode.com/gh_mirrors/skills36/skills想了解NVIDIA Agent Skills仓库里的技能凭什么打上NVIDIA-Verified认证答案是一套完整的Agent 技能信任管线安全扫描、语义去重、真实 Agent 实测三层评测外加 Skill Card 与 OMS 签名。本文用最少代码、最全证据为你拆解这套体系如何保证你安装的每一个技能既安全又真有用。为什么 Agent Skills 需要认证一个技能Skill就是一个可移植的目录里面有SKILL.md指令、脚本、参考资料和资产。它会被 Claude Code、Codex 等编码 Agent 加载进而替你执行命令、读写文件、调用工具——这使它天然成为一个新的供应链风险面技能可能包含提示注入、数据外传、权限过宽等隐患两个能力相同的技能可能换个名字重复发布污染目录一个技能即使安全也可能对 Agent 毫无帮助甚至让它变笨。NVIDIA 的做法是不信任作者的自我声明只信任可核查的证据。每个环节回答一个问题并留下一份证据详见官方文档 agent-skill-trust-pipeline.mdx问题证据执行者这个技能安全吗扫描报告SkillSpectorSkillEvaluator 第 1 层目录里已有相同技能吗语义重叠报告SkillEvaluator 第 2 层它能让 Agent 变得更好吗BENCHMARK.md分数SkillEvaluator 第 3 层它做什么、谁负责Skill Card作者填写、人工审核发布的就是被审过的版本吗目录级 OMS 签名OMS 签名三层评测体系Tier 1/2/3逐层拆解第 1 层验证与安全扫描——能不能放心跑由SkillSpector安全扫描器执行它本身就是 SkillEvaluator 的第 1 层而不是独立工具。检查内容包括确定性校验Schema 规范、许可证、PII 个人数据、Unicode 安全68 种漏洞模式、17 个类别提示注入、数据外传、权限提升、供应链问题、系统提示泄露、MCP 工具投毒等支持 OSV.dev 在线漏洞库查询离线环境自动降级。⚠️ 注意扫描作用域评测框架会把evals/、results/、node_modules/等目录和skill.oms.sig、skill-card.md等生成文件从扫描副本中剔除——只有扫描作用域内的高危发现才构成发布阻断项。规则详见 release-checklist.mdx。第 1 层是可以一票否决的关卡。第 2 层语义去重——目录里已经有它了吗对目录中已发布的技能做语义重叠检测防止同一能力换两个名字发布两次。该层结果为建议性不直接阻断发布但重叠报告会随发布包公开供审查者参考。第 3 层沙箱实测——它真的让 Agent 变强吗这是最有说服力的一层真实 Agent 在 K8s 沙箱中针对一套评测任务集跑两遍——加载技能 vs 不加载技能两者之差就是技能被量化的贡献。前置条件是技能必须自带评测任务集evals/evals.json或等价位置且应包含负向用例——即 Agent 正确行为是不要使用该技能的场景。没有任务集第 3 层直接跳过等于没有报告。五个评分维度维度回答的问题Security 安全性用起来安全吗Correctness 正确性答案对吗Discoverability 可发现性需要时选对了技能吗Effectiveness 有效性帮用户完成目标了吗Efficiency 效率有没有浪费工具调用和 TokenPASS 门槛至少一个受支持的 Agent 在所有维度上通过。实测提升值Uplift作为诊断证据报告但不单独推翻门槛。用一份真实的 BENCHMARK.md 看懂结果以 dicom-series-preflight 的 BENCHMARK.md 为例它记录了总体结论PASS — Recommended for publication对比表如 Correctness 维度Claude Code 从2.9% → 80.0%77.1 个百分点——没有技能时几乎不会做对加载技能后大幅跃升Token 用量表逐任务列出加载/未加载技能的实际 Token 消耗分层状态Tier 1「PASSED WITH OBSERVATIONS12 条发现」、Tier 2「PASSED0 条」、Tier 3「PASS2 个 Agent × 3 个任务」可折叠的评分方法学每个维度的信号来源、权重与阈值。 阅读技巧看基线 → 加载技能变化三元组。变化为正且各维度过线说明技能真的有价值若某维度大幅下降如样例中 Security -33.3 分审查者会重点关注。信任管线全景扫描、评测、签名各管一件事一个常见误区是以为扫干净了就可以发布。官方文档明确区分三者的职责见 scanning-agent-skills.mdx 与 signing-agent-skills.mdx扫描回答内容看起来安全吗评测回答它有用吗签名回答发布出去的就是被审过的那份吗Skill Card给人类看的身份证自动检查之外每个技能还要配一张 skill-card.md负责人、许可证、用例、部署地域、依赖凭据、已知风险与缓解措施、输出形态、评测 Agent 与指标、伦理考量。写作规范见 skill-cards.mdx。完成标准很硬核审查者不打开源码就能看懂技能的目的、归属、输出与风险。风险描述也要具体——技能可能写文件是弱描述技能只可能覆盖配置输出目录下的报告不得写目录外才是强描述。OMS 签名给整棵目录树盖章NVIDIA 采用 OpenSSF Model SigningOMS格式做分离式目录级签名skill.oms.sig放在技能目录顶层覆盖除签名文件外的全部文件。签名之后新增任何未签名文件严格校验就会失败——这正是目的让你知道安装目录是否被改过。skill-name/ ├── SKILL.md ├── scripts/ ├── references/ └── skill.oms.sig ← 分离式 OMS 签名消费侧验证只需三样技能目录、skill.oms.sig、NVIDIA 信任锚证书nv-agent-root-cert.pem一条model_signing verify命令即可完成详见 README.md 的 Verifying Skills 一节。成为 NVIDIA-Verified 的 8 步发布清单综合 release-checklist.mdx一个技能的完整旅程是以窄目标编写技能权限声明最小化在evals/evals.json提交评测任务集含负向用例对整个技能目录运行 SkillEvaluator内含第 1 层 SkillSpector 扫描修复扫描作用域内的高危发现或书面记录接受理由审阅BENCHMARK.md结论——不提升 Agent 性能的技能无论多安全都不发布补全 Skill Card负责人、许可、风险、输出等对通过审查的精确目录签名随技能发布skill.oms.sig消费者/CI 在安装前验证签名。仓库的同步流水线还做了最后一道硬门槛缺少skill.oms.sig、skill-card.md或 Tier-3 评测数据集的技能根本进不了skills/目录——这就是为什么你浏览目录时看到的每个技能都自带完整证据包。普通用户的安装与自查建议安装很简单无需手工 clonenpx skills add nvidia/skills用npx skills update保持更新npx skills add nvidia/skills --list浏览全目录。作为普通用户启用技能前建议做三件事消费侧清单✅ 确认目录中有skill.oms.sig并用nv-agent-root-cert.pem跑一次验证✅ 看一眼BENCHMARK.md的总体结论和五维度分数✅ 读一遍skill-card.md的已知风险和输出两节。总结认证不是徽章而是一条证据链NVIDIA Agent Skills 仓库的精髓是把这个技能可信吗从信任作者变成信任证据环节解决什么问题你看到的文件第 1 层扫描安不安全扫描报告Markdown/SARIF第 2 层去重是否重复重叠报告第 3 层实测有没有用BENCHMARK.mdSkill Card谁负责、边界在哪skill-card.mdOMS 签名发布版是否被篡改skill.oms.sig五份证据齐备技能才配得上NVIDIA-Verified的身份。下次安装任何 Agent 技能都可以用这套三层评测 一张卡 一份签名的标尺去衡量它。【免费下载链接】skillsAgent Skills for NVIDIA products — install into Claude Code, Codex, and other coding agents to run Physical AI, robotics, simulation, CUDA, and RAG workflows end to end.项目地址: https://gitcode.com/gh_mirrors/skills36/skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考