联系我 ↗

EXPERIMENT III · POST-TRAINING

偏好,还是长度

DPO 学到的是“更好的回答”,还是只是“更长的回答”?

待开始DPO偏好数据长度偏置
  1. Q提出可证伪的问题当前阶段
  2. R做最小运行路径未开始
  3. E连接真实验证未开始
  4. P公开证据与限制未开始

为什么值得做

偏好数据里,被选中的回答往往更长。模型可能只学会了写得更多,而评测也常常偏爱长回答,两者叠加会让提升看起来比实际更大。

Q

假设

HYPOTHESIS

控制 chosen / rejected 长度差之后,DPO 在固定评估集上的提升会明显缩小,但事实类维度的提升会保留下来。

R

最小装置

MINIMAL SETUP
  1. 01统计一份公开偏好数据集中 chosen 与 rejected 的长度差
  2. 02构造长度匹配子集,与原始数据分别做 LoRA + DPO
  3. 03在长度归一化后的评测上比较,并检查回答长度的变化
E

什么会证明我错了

FALSIFIED IF

长度匹配后提升与原始数据相当,说明长度不是主要来源。

P

将会公开

WILL PUBLISH

长度分布、两组训练配置、长度归一化前后的评测对照。

前期线索相关的已有工作,不是这个实验的结论

  • SFT / DPO 对比实验在 Qwen、LLaMA 上做过 SFT 与 DPO 的练习与对比。

实验日志RUN LOG

还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。

去实验室 ↗