EXPERIMENT I · DATA
洗掉一半
同样的训练预算,洗掉一半低质量数据,模型会更好还是更差?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
我相信数据决定模型的上限,但“质量”常常只是一句口号。要让它成立,就得说清楚按什么标准洗、洗掉多少,以及模型到底在哪些能力上变好。
假设
HYPOTHESIS按事实、推理和格式三类错误打分过滤后的一半数据,微调效果不低于全量数据,且在事实类题目上更好。
最小装置
MINIMAL SETUP- 01取一份公开指令数据集,用规则 + 模型评审给每条打质量分
- 02对照三组:全量 / 随机一半 / 高分一半,训练步数与 token 数对齐
- 03在固定评估集上分维度比较,并人工抽检被过滤掉的样本
什么会证明我错了
FALSIFIED IF高分一半在所有维度上都不优于随机一半,说明打分并没有抓住“质量”。
将会公开
WILL PUBLISH打分规则、过滤前后的数据分布、三组训练配置和分维度结果。
前期线索相关的已有工作,不是这个实验的结论
- 标注与质检实践做过金融长文本、金法医等标注,在供应商侧参与混元 HY4 评测与质量管理。
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗