联系我 ↗
← 返回首页
// RESEARCH / 02 / POST-TRAINING

后训练

SFT、偏好对齐与强化学习:训练信号从哪里来,评测标准怎样和训练目标对上。

实践过
当前状态
III · VIII
造物之书里的实验
// CURRENT THESIS
奖励信号和评测本身就是数据问题。训练在优化什么、评测在奖励什么,两者一旦对不上,提升就可能只是表面的。

2025 年起在 Qwen、LLaMA 上做过 SFT 与 DPO 的练习与对比;在混元 HY4 评测中写 Rubric、处理资料冲突和异常结果,对“评测标准怎样变成训练信号”有第一手感受。

// OPEN QUESTIONS

我正在追的问题

  1. 01

    按 Rubric 逐维构造的偏好对,能否让模型学到评测真正在乎的维度?

  2. 02

    DPO 的提升里,有多少其实来自“回答更长”?

  3. 03

    可验证奖励(RLVR)能否教会小模型多步调用工具,而不只是做对数学题?

  4. 04

    在 Agent 轨迹上做强化学习时,过程奖励应该落在哪一步?

// EXPERIMENTS

造物之书里的实验

每个实验都从一个可以被证伪的问题开始
// LIMITS

现在还不能证明什么