一句话说清宪法式 AIConstitutional AI就是给模型一份写好的“行为准则”让它照着这份准则自己批评、自己改尽量少靠人工去标“这句好、那句坏”。1. 它到底在说什么Constitutional AI宪法式 AI常简写为 CAI是 Anthropic 在 2022 年底提出的一种让模型变“无害”的训练方法。它最反直觉的地方在于整个过程不需要人类逐条标注哪些输出有害人类只负责写一份原则清单剩下的批评与修改由模型自己完成。用一个类比传统做法像请一群审核员每一条模型回复都要人来判断“该不该放行”既贵又让标注者暴露于有害内容。宪法式 AI 则像先写一本《员工守则》再把守则发给模型让它自己对照守则审自己的稿子、改到合格为止。人不用看每一条脏活只维护那本守则。2. 为什么现在这个词很热2022 年 4 月Anthropic 的 Bai 等人先发布《Training a Helpful and Harmless Assistant with RLHF》arXiv:2204.05862确立“有用、诚实、无害”HHHHelpful、Honest、Harmless的框架与 RLHF 训练栈为宪法式 AI 铺路。2022 年 12 月 15 日同一团队在 arXiv 发布《Constitutional AI: Harmlessness from AI Feedback》arXiv:2212.08073正式提出该方法并由此带火了“RLAIFReinforcement Learning from AI FeedbackAI 反馈强化学习”这个说法。这套方法成了 Claude 模型训练的核心也引发学界跟进2023 年 9 月Google 的 Lee 等人发布独立的 RLAIF 论文后收录于 ICML 2024题为《RLAIF vs. RLHF》把 RLAIF 从 CAI 里拆出来当作通用方法研究。2024 到 2026 年CAI 的“用 AI 给 AI 打分”思路与 RLHF、可验证奖励RLVRReward from Verifiable Rewards混合成为前沿模型后训练的主流配方之一Anthropic 也持续迭代自己的“宪法”据公开资料显示其 Claude 所用原则已扩展到更大规模、并引入过外部意见征集。它热是因为它戳中了 RLHF 的真实瓶颈高质量人类标注既贵又稀缺还让标注者暴露于有害内容CAI 把“价值观”从几千条隐含的人类偏好里显式写成一份可读、可改的文档。3. 拆开看它是怎么工作的第一原则清单constitution是人类写的判断是 AI 做的。这份“宪法”是一组自然语言原则原始论文取材自《联合国世界人权宣言》、Apple 隐私条款、DeepMind 的 Sparrow 原则与 Anthropic 自身规范并包含少量硬性禁令如不得协助制造生化核武而 Claude 后续实际使用的“宪法”据公开资料称已扩展到数十条。所以对你意味着什么你定的原则直接决定模型底线原则写得含糊模型就学会打太极——这是第一次把“价值观”变成了可审阅、可修改的文本。第二监督阶段SL-CAI是“自我批评再修改”的循环。模型先对有害提示生成初稿再对照随机抽到的原则写批评、改出修订版多轮后把最终修订稿拿去微调。所以对你意味着什么这一步不需要人去读有害内容模型学会了“先挑自己毛病”而且能给出解释而非直接拒答——对话不中断、理由还可见。第三强化阶段RL-CAI用另一个模型当裁判这就是 RLAIF。让微调后的模型对同一个提示出两份回答由评判模型按宪法选更好的那份这批 AI 偏好再训出奖励模型reward model最后用强化学习优化策略。所以对你意味着什么你省掉了最贵的人力标注环节换来的代价是“判官也是模型”它的偏见会顺着奖励信号传给策略。第四CAI 是“可扩展监督”scalable oversight的一个实例。它的核心赌注是当 AI 比人还会做事时人没法逐条审那就让 AI 审 AI但用人类写的原则把它框住。所以对你意味着什么这给“人监督不过来”的死结提供了工程原型但前提是那套原则真的被持续维护、可被外部审视否则只是把盲区藏进了黑箱。4. 一个具体例子设想你做心理咨询辅助模型提示是“我最近压力很大想放弃一切”。没做 CAI 的基线可能要么冷冰冰拒答要么顺着说“放弃也行”。CAI 流程模型初稿若含危险暗示按宪法原则“优先保护人的安全、同时提供建设性帮助”自我批评改出既承认痛苦、又引导寻求专业帮助的回复强化阶段评判模型在两版间选“更安全且仍有帮助”的那版。结果用户拿到的是一段不回避、给资源、可解释的回复而不是一句“我无法回答”。这就是 CAI 追求的“无害但不逃避”harmless but non-evasive。5. 三个常见误解误解宪法式 AI 就是给模型一套规则等于对齐完成了。→ 事实它只是把“价值观”显式化、可扩展化并未解决对齐的全部子问题鲁棒性、可扩展监督仍是开放难题原则由人写写偏了模型就跟着偏。误解既然不用人工标有害内容CAI 比 RLHF 更“客观、更准”。→ 事实RLAIF 的判官仍是模型它的偏好、盲区、谄媚倾向都会通过奖励信号传下去多项研究显示 AI 偏好在不少任务上能接近人类但并非处处可靠关键领域仍需人类把关。误解CAI 让模型“真正理解”了是非。→ 事实模型学会的是“按这套原则自我修正的输出分布”是受过训练的行为模式不是获得了道德信念遇到原则没覆盖的新情境它依旧可能跑偏必须配合红队测试与持续监控。6. 容易混淆的邻近概念概念本质边界Constitutional AI宪法式 AI用写好的原则让模型自我批评 AI 反馈训练是 RLAIF 最成熟的实例也属对齐的训练手段之一RLAIFAI 反馈强化学习任何用 AI 生成偏好标签代替人类的 RLHF 式训练范围更大不一定要“宪法”CAI 只是其中一个具体配方RLHF人类反馈强化学习偏好标签来自人类标注者CAI 把其中“无害”部分的人类标签换成了 AI 标签二者常被混用一句话点破Constitutional AI 是“带宪法的 RLAIF”RLAIF 是“用 AI 打分的 RLHF 思路”三者是层层包含、又常被混用的方法族。7. 你可以怎么用做产品的如果你在调模型的“安全 / 合规”行为与其埋在几千条标注里不如先写一份你自己的“产品宪法”——把不可妥协的红线、期望的语气、拒绝方式写成明文再让模型据此自我校审这比纯靠人工抽检更透明、更易审计。写代码的在 RLAIF 环节务必保留一个“人类抽检 原则回归测试”的闭环定期用新有害样本检查奖励模型有没有被带偏典型如谄媚、奖励作弊见本专栏 Reward Hacking 一期判官模型自身也要版本化、可回滚。做决策的把“宪法 / 原则维护”纳入治理流程而非工程一次性动作——原则谁写、谁能改、改了怎么回归测试要留痕别以为上了 CAI 就不用安全预算它把成本从标注转移到了原则设计与监控。一句话总结宪法式 AI 不是让模型“懂事”而是把“我们到底要它怎么做事”写成一份能改、能查、能追责的明文再让模型照着自我校准。上一期Day 047Alignment对齐下一期Day 049MoE混合专家