联系我 ↗

EXPERIMENT IV · DATA

第几代开始退化

用模型生成的数据训练模型,第几代开始退化?

待开始合成数据模型坍缩蒸馏
  1. Q提出可证伪的问题当前阶段
  2. R做最小运行路径未开始
  3. E连接真实验证未开始
  4. P公开证据与限制未开始

为什么值得做

好数据越来越难拿,合成数据是绕不开的路。但模型学模型,分布会一代代变窄。什么时候开始变窄、混入多少真实数据能止住,决定了合成数据能走多远。

Q

假设

HYPOTHESIS

纯合成数据训练在两到三代后出现可测的多样性下降;每代混入一定比例的真实数据能显著延缓退化。

R

最小装置

MINIMAL SETUP
  1. 01用小模型在一个窄领域上自我蒸馏,迭代五代
  2. 02对照:纯合成 / 每代混入 10% 与 30% 真实数据
  3. 03每代测量准确率、输出多样性(n-gram 熵、语义去重率)与长尾题表现
E

什么会证明我错了

FALSIFIED IF

五代内各组多样性与准确率都没有可测差异。

P

将会公开

WILL PUBLISH

每代的数据样本、多样性曲线和各组训练配置。

前期线索相关的已有工作,不是这个实验的结论

  • 合成数据质检做过化学合成数据的质量检查与错误归因。

实验日志RUN LOG

还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。

去实验室 ↗