EXPERIMENT VIII · POST-TRAINING
评分即对齐
按 Rubric 逐维评分构造的偏好对,能让模型学到评测真正在乎的东西吗?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
偏好对齐常用一个总体好坏来构造 chosen / rejected,但评测往往分维度看事实、推理和格式。训练信号和评测标准应当对得上。
假设
HYPOTHESIS按维度加权构造的偏好对,在固定评估集上能提升对应维度,且整体能力退化更小。
最小装置
MINIMAL SETUP- 01同一批 Prompt 生成多模型候选回答
- 02分别用整体评分与 Rubric 逐维评分构造偏好对
- 03在 Qwen 上用 LoRA + DPO 训练,固定评估集分维度回归
什么会证明我错了
FALSIFIED IF逐维构造的模型在目标维度上没有优于整体构造,或出现明显能力退化。
将会公开
WILL PUBLISHRubric、偏好数据构造脚本、训练参数和分维度结果。
前期线索相关的已有工作,不是这个实验的结论
- 后训练与偏好对齐实验2025 年起在 Qwen、LLaMA 上做过 SFT / DPO 练习。
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗