训练
硬核
🗓 2025-05-02
⏱ 阅读需约 30 分钟
对齐方法比较:RLHF vs DPO
两种主流对齐方法的原理差异、训练成本与适用场景对比,帮你判断手上的项目该用哪一种。
原理差异
RLHF 分三步:训奖励模型、再用强化学习(通常 PPO)优化策略。DPO 则跳过显式奖励模型,把偏好数据直接转化为一个可微的优化目标。
成本与稳定性
RLHF 流程长、超参敏感、复现难;DPO 训练更简单稳定,对工程团队更友好。这也是近年 DPO 快速流行的主因。
能用更简单的方法达到同样效果时,简单本身就是一种优势。
怎么选
多数中小团队从 DPO 起步即可;当你需要对奖励信号做精细控制、或要引入在线探索时,RLHF 仍有不可替代之处。两者并非互斥,实践中常常组合使用。