安全
RLHF 还不够:AI 对齐的新前沿
RLHF 把人类偏好注入模型,但它的成本、标注偏差与可扩展性正受到挑战。Constitutional AI、DPO 等新方法正在重塑对齐的工具箱。
RLHF 的局限
RLHF 依赖大量人工偏好标注,成本高、速度慢,且标注者的偏见会被直接编码进模型。当任务复杂到人类也难以稳定判断时,“人类反馈”这把尺子本身就开始失准。
Constitutional AI 的思路
与其让人逐条标注,不如先写下一套原则,让模型据此自我批评、自我修正。人类的工作从“标注每个样本”上移到“制定规则”,可扩展性显著提升。
对齐的方向,正从“教模型每件事”转向“教模型如何判断”。
DPO:绕过奖励模型
直接偏好优化(DPO)省去了单独训练奖励模型的环节,用更简洁的目标函数直接从偏好数据学习,训练更稳定、复现更容易,正在成为很多团队的默认选择。
前沿仍未收敛
没有哪种方法是终局。可扩展监督、可解释性、红队评测,都是这条战线的一部分。对齐不是一次性的“训练技巧”,而是贯穿模型全生命周期的持续工程。