EXPERIMENT III · POST-TRAINING
偏好,还是长度
DPO 学到的是“更好的回答”,还是只是“更长的回答”?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
偏好数据里,被选中的回答往往更长。模型可能只学会了写得更多,而评测也常常偏爱长回答,两者叠加会让提升看起来比实际更大。
假设
HYPOTHESIS控制 chosen / rejected 长度差之后,DPO 在固定评估集上的提升会明显缩小,但事实类维度的提升会保留下来。
最小装置
MINIMAL SETUP- 01统计一份公开偏好数据集中 chosen 与 rejected 的长度差
- 02构造长度匹配子集,与原始数据分别做 LoRA + DPO
- 03在长度归一化后的评测上比较,并检查回答长度的变化
什么会证明我错了
FALSIFIED IF长度匹配后提升与原始数据相当,说明长度不是主要来源。
将会公开
WILL PUBLISH长度分布、两组训练配置、长度归一化前后的评测对照。
前期线索相关的已有工作,不是这个实验的结论
- SFT / DPO 对比实验在 Qwen、LLaMA 上做过 SFT 与 DPO 的练习与对比。
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗