)
Claude Code Game Studios 质量评分标准如何为不同技能类别定义 PASS/FAIL 指标完整指南【免费下载链接】Claude-Code-Game-StudiosTurn Claude Code into a full game dev studio — 49 AI agents, 72 workflow skills, and a complete coordination system mirroring real studio hierarchy.项目地址: https://gitcode.com/GitHub_Trending/cl/Claude-Code-Game-StudiosClaude Code Game Studios 把一个 Claude Code 会话变成拥有 49 个 AI 代理、72 个工作流技能的游戏开发工作室。它的 quality-rubric.md 定义了一套质量评分标准为 9 个技能类别和 6 个 Agent 角色类别各定义 4~5 条二元 PASS/FAIL 指标用/skill-test category一键打分。本文带你读懂这套评分体系并学会为自己的技能类别定义专属的 PASS/FAIL 指标。Claude Code Game Studios 质量评分标准与 PASS/FAIL 指标分类表为什么需要「分类别」的评分标准通用检查只能回答技能文件格式对不对回答不了它做本职的事够不够好。比如分析类技能如 code-review的核心红线是只读——扫描阶段绝不能写文件门控类技能gate-check的核心红线是不自动推进阶段——未经用户确认不能写production/stage.txt团队类技能team-combat 等的核心红线是阻塞必须立即上报——不能静默跳过失败。同一把尺子量不出这些差异。所以 CCGS 的思路是每类技能有自己岗位说明书式的指标评分时逐条打 PASS/FAIL而不是给一个模糊的总分。三级判定体系PASS / FAIL / WARN 如何打评分采用三级判定规则定义在 quality-rubric.md 开头判定含义PASS技能的书面说明清楚满足了该条标准FAIL说明缺失、含糊或自相矛盾WARN部分满足需要人工关注 关键设计指标是二元的、基于文本的。评分对象是技能文件里写没写清楚而不是让它跑一遍看输出——所以整轮评分可以自动执行、可以反复执行结果稳定可对比。9 个技能类别各自的 PASS/FAIL 指标下面按类别速览完整原文见 quality-rubric.mdgate 门控类守住阶段流转的 5 项检查编号指标一句话标准G1读取评审模式决定派哪些导演前先读production/session-state/review-mode.txtG2full 模式齐人full 模式下 4 位 Tier-1 导演的 PHASE-GATE 并行触发G3lean 模式精简lean 模式只跑 PHASE-GATE跳过内联闸门G4solo 模式放行solo 模式不派任何导演闸门且逐条记录skipped — Solo modeG5不自动推进未经用户明确确认绝不写production/stage.txtreview 评审类只读 结构化结论编号指标一句话标准R1只读执行未经用户批准不改被评审文档所有写操作挂在 May I write 之后R28 节覆盖明确评估 GDD 的全部 8 个必备章节R3结论词汇正确只能输出 APPROVED / NEEDS REVISION / MAJOR REVISION NEEDED设计或 PASS / CONCERNS / FAIL架构R4分析期不派闸门分析阶段不触发导演闸门architecture-review 在分析后触发属例外已注明理由R5结构化发现最终结论前必须给出逐章节状态表或清单authoring 写作类逐节确认骨架先行编号指标一句话标准A1逐节循环完整写作技能一节一节产出并请求批准轻量技能可用单稿模式A2逐节确认每节写入前问 May I write this to [filepath]?A3改造模式目标文件已存在时提供更新指定章节而不是整篇覆盖A4闸门层级正确导演闸门在 full/lean 阈值下运行solo 不触发A5骨架先行先建含全部章节标题的文件骨架防止会话中断丢失进度readiness 就绪类多维度、三级结论编号指标一句话标准RD1多维检查检查 ≥3 个独立维度Design / Architecture / Scope / DoD并分别报告RD2三级结论READY/COMPLETE NEEDS WORK BLOCKED 的层级清晰RD3BLOCKED 有边界只保留给作者自己修不了的问题如需新增 ADR、依赖无法解决RD4闸门模式正确QL-STORY-READY 闸门在 full 模式触发lean/solo 跳过并注明RD5下一棒交接完成后自动浮现当前 Sprint 里下一个 READY 故事pipeline 流水线类产出物格式与顺序编号指标一句话标准P1输出 Schema 正确每个产出文件遵循项目模板EPIC.md、story frontmatter 等P2层级/优先级顺序Epic/Story 遵循 core → extended → meta 层级与优先级字段P3逐件确认每个产出文件单独问 May I write [artifact]?不批量批准P4闸门层级正确对应闸门在 full 运行、lean/solo 跳过并注明P5先读后写产出前先读相关 GDD/ADR/manifest 确保对齐analysis 分析类只读是最高准则编号指标一句话标准AN1只读扫描分析阶段只使用 Read/Glob/Grep 工具AN2结构化发现表输出带严重度/优先级的表格或清单而不是纯散文AN3不自动写文件任何建议写入如 tech-debt 登记都挂在 May I write 之后AN4分析期不派闸门分析技能不触发导演闸门发现留给人类判断team 团队协作类并行与阻塞上报编号指标一句话标准T1指名代理明确写出要派哪些代理、什么顺序T2独立则并行输入互不依赖的代理在单条消息里并行派出T3BLOCKED 立即上报任一代理阻塞就停下依赖工作绝不静默跳过T4收齐再推进依赖阶段等所有并行代理完成后再继续T5缺参即停缺少必填参数时只输出用法提示不派代理sprint 冲刺类读数据、有闸门、结构化编号指标一句话标准SP1先读状态产出前读production/sprints/或production/milestones/SP2正确闸门规划用 PR-SPRINT、里程碑审评用 PR-MILESTONEfull 运行、lean/solo 跳过SP3结构化输出速度表、风险清单、行动项而非自由发挥SP4不自动落盘未经 May I write 不写任何冲刺/里程碑记录utility 工具类先过硬指标utility 类start、help、brainstorm 等剩余技能指标最简U1—/skill-test static [name]返回 COMPLIANT 且 0 个 FAIL通过全部 7 项静态检查U2— 若该技能恰好会派导演闸门其 full/lean/solo 模式逻辑必须正确。Agent 角色类别的评分标准同一份评分标准文件还覆盖了 6 类 Agentagents/ 下每层都有行为规范类别核心指标director导演D1 返回 APPROVE / CONCERNS / REJECTD2 不越域做绑定决定D3 冲突升级到共同上级D4 使用 Opus 模型档位lead主管L1 返回领域判定如 FEASIBLE/INFEASIBLE、PASS/FAILL2 越域冲突升级L3 使用 Sonnet 档位specialist专家S1 守住自己领域S2 不跨域做单方决定S3 正确转交而不是静默拒绝engine引擎专家E1 建议 API 前先查 docs/engine-reference/ 的版本E2 按文件类型路由到正确子专家如.gdshader→ shader 专家E3 强制引擎惯用法qa质量Q1 产出测试用例/缺陷报告而非实现代码Q2 符合测试证据格式Q3 不提议新功能operations运营O1 领域所有权清晰O2 不写游戏逻辑O3 allowed-tools 与运营角色匹配 注意 director 的 D1producer 的等价词汇是 REALISTIC / CONCERNS / UNREALISTIC——指标允许领域等价但词汇表必须封闭这样评分才能客观。如何用 /skill-test category 运行评分整套评分由 /skill-test 驱动在 Claude Code 中执行命令作用/skill-test static [name\|all]结构合规检查7 项静态断言/skill-test spec [name]对照行为规范逐用例评估/skill-test category [name\|all]对照 quality-rubric.md 的类别指标打分本文主题/skill-test audit查看全部 72 技能 49 Agent 的测试覆盖总览/skill-improve [name]未通过时的修复循环测试 → 诊断 → 提案 → 复测以category模式为例它会读 catalog.yaml 拿到该技能的类别和 spec 路径读 quality-rubric.md 中对应类别的指标表逐条给出 PASS / WARN / FAIL 及依据汇总判定全 PASS →COMPLIANT有 WARN →WARNINGS有 FAIL →NON-COMPLIANT提示把结果写回 catalog.yaml 的last_category/last_category_result字段保持覆盖追踪。 评分标准里还有一条元规则规范描述的是当前行为而非理想行为所以指标未通过应先视为需要调查修正技能后再更新规范。如何为自己的技能类别定义 PASS/FAIL 指标想新增一个类别或调整指标照抄这套模板的做法先写岗位一句话参照 quality-rubric.md 每个类别开头的那段描述用一句话说清这类技能的职责边界gate 管阶段流转、analysis 只读出报告……。指标写成主语 可观察行为 边界句式例如技能在分析阶段只使用 Read/Glob/Grep 工具——可观察、可对着文本判 PASS/FAIL避免表现良好这类模糊词。数量保持 4~5 条覆盖读什么、写什么、什么时候停、怎么报结果即可多了难以维护。给例外留位置每个类别表格后都有 Exceptions 注释如 design-review 因Revise now路径拥有 Write 工具仍算 R1 通过。写清例外理由评分才不会误杀。注册到目录在 catalog.yaml 中登记技能的category与spec路径规范文件放在 skills/ 对应子目录写法参考模板 templates/skill-test-spec.md。小结质量评分标准 每类岗位一张 4~5 条的二元指标表评分对象是技能写没写清楚可自动执行、可重复对比三级判定 PASS / FAIL / WARN 让部分满足有独立位置不逼评分二选一/skill-test category all一键跑完 9 个类别结果写回 catalog.yaml 形成覆盖追踪这套框架完全自包含整个 CCGS Skill Testing Framework/ 文件夹删掉也不影响主框架运行。理解并复用这套分类别定指标的思路你也能给自己的 AI 工作流建立起同样客观、可回归的质量底线。【免费下载链接】Claude-Code-Game-StudiosTurn Claude Code into a full game dev studio — 49 AI agents, 72 workflow skills, and a complete coordination system mirroring real studio hierarchy.项目地址: https://gitcode.com/GitHub_Trending/cl/Claude-Code-Game-Studios创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考