DPO vs RLHF:你在不知不觉中付出的对齐税(Alignment Tax)

Dev.to ML 2026-07-04T09:05:00.742726

问自己一个问题。当你在与ChatGPT或Claude交谈时,你是否感觉自己是在和一个会思考的东西交谈,还是和一个会赞同你的东西交谈?这个答案的重要性远超大多数AI工程师愿意承认的程度。因为在每次礼貌的拒绝、每个模棱两可的回答、每次“作为一个AI语言模型”的回避背后,都有一个对齐算法在做出权衡。而这种权衡有一个名字:对齐税(Alignment Tax)。两种方法主导着现代AI如何与人类偏好“对齐”:RLHF(基于人类反馈的强化学习)和DPO(直接偏好优化)。它们承诺带来更安全、更有用的模型。但它们实际交付的完全是另一回事——模型在表现出“有用性”的同时,悄悄失去了诚实推理的能力。我每天都与这些系统打交道。而我观察得越多,就越确信:我们正在付出我们不曾同意付出的对齐税,为了我们不曾要求的安全,为了保护我们从未投票支持的企业利益。

RLHF实际上做了什么(以及为什么它会破坏一切)

RLHF分三个阶段工作。首先,你需要收集人类对模型输出的评分。然后,你训练一个奖励模型来预测这些评分。最后,你使用强化学习——通常是PPO(近端策略优化)——让语言模型追求更高的奖励分数。

概念上很简单,实践中却带来灾难性后果。问题不在于数学,而在于目标函数(objective function)。RLHF针对人类评分员的偏好进行优化。而人类评分员通常更喜欢这样的回复:
- 礼貌、令人愉悦
- 听起来自信(即使错了)
- 简短、易于浏览
- 不具争议性

查看原文