联系我 ↗

EXPERIMENT VIII · POST-TRAINING

评分即对齐

按 Rubric 逐维评分构造的偏好对,能让模型学到评测真正在乎的东西吗?

待开始DPORubricLoRA
  1. Q提出可证伪的问题当前阶段
  2. R做最小运行路径未开始
  3. E连接真实验证未开始
  4. P公开证据与限制未开始

为什么值得做

偏好对齐常用一个总体好坏来构造 chosen / rejected,但评测往往分维度看事实、推理和格式。训练信号和评测标准应当对得上。

Q

假设

HYPOTHESIS

按维度加权构造的偏好对,在固定评估集上能提升对应维度,且整体能力退化更小。

R

最小装置

MINIMAL SETUP
  1. 01同一批 Prompt 生成多模型候选回答
  2. 02分别用整体评分与 Rubric 逐维评分构造偏好对
  3. 03在 Qwen 上用 LoRA + DPO 训练,固定评估集分维度回归
E

什么会证明我错了

FALSIFIED IF

逐维构造的模型在目标维度上没有优于整体构造,或出现明显能力退化。

P

将会公开

WILL PUBLISH

Rubric、偏好数据构造脚本、训练参数和分维度结果。

前期线索相关的已有工作,不是这个实验的结论

  • 后训练与偏好对齐实验2025 年起在 Qwen、LLaMA 上做过 SFT / DPO 练习。

实验日志RUN LOG

还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。

去实验室 ↗