训练一个助手怎样拒绝危险请求,常见办法是让人比较两份回答,再把偏好教给模型。这样的标签很贵,评审者的判断也可能藏在数据里看不见。Anthropic 提出的宪法式 AI 把一部分标准写成明确原则,再让模型依照原则生成训练反馈。
我重读这项研究时,最容易漏掉的是它有两个阶段。第一阶段从有害请求开始,模型先给出回答,再抽取一条原则批评自己,随后修改回答。研究者把这些修订结果拿去微调原模型。第二阶段让模型依据原则比较两份候选回答,用比较结果训练偏好模型,最后进入强化学习。
原则参与了训练,不只放在提示词里
论文使用了 42,496 条人写的红队提示,又生成 140,335 条提示,每条采样四组批评与修订。强化学习阶段写了 16 条原则,每次比较随机抽取一条。人仍然决定原则内容、数据构成、训练流程和最后怎样评测,只是大量逐条的有害性比较由模型完成。
研究者还准备了 217 个较难的比较样本,主要检查更细微的有害性差别,也会偏好愿意解释理由的安全回答,避免助手逢敏感话题就关门。较大的模型在识别更合适回答时达到九成以上二选一准确率,使用多条思维样本还能略微提高结果。这些数字属于论文当时的模型和题集,不能直接当作今天产品的安全率。
显式原则有一个实在好处。团队能读到它,发现某条写得过宽时也能改。隐含在人类偏好数据里的价值取向更难逐条检查。Anthropic 自己也把这套方法称为不完美的方案,透明度增加了,价值冲突没有随之消失。
模型批评也会批错
论文作者检查样本后发现,模型生成的批评有时合理,有时不准确或言过其实。对较小模型,先批评再修订通常更好。对大模型,这一步与直接要求修订的差别并不明显。把批评文本留作可读记录有帮助,不能把它当成独立审计意见。
训练跑得过头也会出现 Goodhart 式问题。模型可能对有害提示反应过严,或者到处重复安慰套话,偏好分数继续提高,回答却变得僵硬。论文因此调整原则,并用人类比较继续检查有用性和无害性之间的变化。
企业想借这个思路做内部助手,可以先写一小组可执行原则,每条配正反例,再准备一批模型没见过的真实问题。自动批评负责扩大训练样本,法务、安全和业务负责人仍要抽样看结果。上线后的访问控制、数据边界与操作审批也要单独实现。训练原则能够影响回答倾向,替不了运行时权限。