全部 具身智能 大模型 安全 智能体,安全 深度解析 行业 视频大模型
RLHF 还不够:AI 对齐的新前沿

RLHF 还不够:AI 对齐的新前沿

RLHF 把人类偏好注入模型,但它的成本、标注偏差与可扩展性正受到挑战。Constitutional AI、DPO 等新方法正在重塑对齐的工具箱。