联系我 ↗

EXPERIMENT I · DATA

洗掉一半

同样的训练预算,洗掉一半低质量数据,模型会更好还是更差?

待开始数据质量数据过滤SFT
  1. Q提出可证伪的问题当前阶段
  2. R做最小运行路径未开始
  3. E连接真实验证未开始
  4. P公开证据与限制未开始

为什么值得做

我相信数据决定模型的上限,但“质量”常常只是一句口号。要让它成立,就得说清楚按什么标准洗、洗掉多少,以及模型到底在哪些能力上变好。

Q

假设

HYPOTHESIS

按事实、推理和格式三类错误打分过滤后的一半数据,微调效果不低于全量数据,且在事实类题目上更好。

R

最小装置

MINIMAL SETUP
  1. 01取一份公开指令数据集,用规则 + 模型评审给每条打质量分
  2. 02对照三组:全量 / 随机一半 / 高分一半,训练步数与 token 数对齐
  3. 03在固定评估集上分维度比较,并人工抽检被过滤掉的样本
E

什么会证明我错了

FALSIFIED IF

高分一半在所有维度上都不优于随机一半,说明打分并没有抓住“质量”。

P

将会公开

WILL PUBLISH

打分规则、过滤前后的数据分布、三组训练配置和分维度结果。

前期线索相关的已有工作,不是这个实验的结论

  • 标注与质检实践做过金融长文本、金法医等标注,在供应商侧参与混元 HY4 评测与质量管理。

实验日志RUN LOG

还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。

去实验室 ↗