[2606.26102] 帮助性有害:后训练中领域依赖的中间训练同情心值退化

arXiv cs.CL 2026-06-26T09:28:37.093747

[2606.26102] 帮助性有害:后训练中领域依赖的中间训练同情心值退化

作者:Jasmine Brazilek, Juliana Seawell

标准的后训练流程通过监督微调(SFT)和强化学习(RL)使语言模型变得有帮助,但这些过程可能会无意中退化预训练阶段灌输的价值观。我们研究了后训练数据的领域是否差异性地影响一个在同情心导向的合成数据上进行过中间训练的 Llama 3.1 8B 模型在动物同情心值保留上的表现,使用了 SFT(通过 Dolly-15k 的帮助性 vs. 通过 Magicoder-110K 的编码)和 GRPO(通过 RLHFlow 的帮助性 vs. 通过 Magicoder 的编码),并在动物伤害基准(AHB 2.2)和 MORU 基准(不确定性下的道德推理)上进行了评估。相比于编码训练,帮助性训练在 AHB 上显著降低了动物同情心(SFT:35.7% vs. 65.2%;GRPO:18.7% vs. 32.0%),这一结果在两个独立的帮助性数据集和两种训练范式上均得到了复现。在英文 MORU 项目上,帮助性训练将一般道德推理能力降低了 25.5 个百分点(46.4% vs. 71.9%),这一显著差距在幅度上与同情心效应相当。然而,这一效应并未跨语言迁移:在多语言 MORU 基准上,领域效应消失(SFT:52.3% vs. 51.2%)。相比之下,动物同情心效应在语言间一致地迁移,Magicoder 相对于基础模型的 AHB 百分点增益在非英文项目上是英文项目的 4.5 倍。这种差异表明,通过中间训练灌输的价值观比领域特定后训练带来的推理改进编码得更深层、更具跨语言性。这些结果表明,对于在价值导向的中间训练基础上构建的实验室,编码领域的后训练可能比帮助性后训练更好地保留中间训练的价值观,同时不损害一般推理能力。

查看原文