EXPERIMENT IV · DATA
第几代开始退化
用模型生成的数据训练模型,第几代开始退化?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
好数据越来越难拿,合成数据是绕不开的路。但模型学模型,分布会一代代变窄。什么时候开始变窄、混入多少真实数据能止住,决定了合成数据能走多远。
假设
HYPOTHESIS纯合成数据训练在两到三代后出现可测的多样性下降;每代混入一定比例的真实数据能显著延缓退化。
最小装置
MINIMAL SETUP- 01用小模型在一个窄领域上自我蒸馏,迭代五代
- 02对照:纯合成 / 每代混入 10% 与 30% 真实数据
- 03每代测量准确率、输出多样性(n-gram 熵、语义去重率)与长尾题表现
什么会证明我错了
FALSIFIED IF五代内各组多样性与准确率都没有可测差异。
将会公开
WILL PUBLISH每代的数据样本、多样性曲线和各组训练配置。
前期线索相关的已有工作,不是这个实验的结论
- 合成数据质检做过化学合成数据的质量检查与错误归因。
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗