训练 硬核 🗓 2025-05-02 ⏱ 阅读需约 30 分钟

对齐方法比较:RLHF vs DPO

两种主流对齐方法的原理差异、训练成本与适用场景对比,帮你判断手上的项目该用哪一种。

原理差异

RLHF 分三步:训奖励模型、再用强化学习(通常 PPO)优化策略。DPO 则跳过显式奖励模型,把偏好数据直接转化为一个可微的优化目标。

成本与稳定性

RLHF 流程长、超参敏感、复现难;DPO 训练更简单稳定,对工程团队更友好。这也是近年 DPO 快速流行的主因。

能用更简单的方法达到同样效果时,简单本身就是一种优势。

怎么选

多数中小团队从 DPO 起步即可;当你需要对奖励信号做精细控制、或要引入在线探索时,RLHF 仍有不可替代之处。两者并非互斥,实践中常常组合使用。

← 返回科普笔记