联系我 ↗
← 返回首页
// RESEARCH / 01 / DATA

数据

数据质量怎样被定义、被测量,又怎样变成模型能力。包括数据过滤、合成数据,以及那些很难拿到的数据。

实践过
当前状态
I · IV
造物之书里的实验
// CURRENT THESIS
数据决定模型的上限。质量差的数据一定训练不出好模型,但“质量”必须能被拆开、被测量,才不只是一句口号。

做过金融长文本、金法医等标注与质检,在供应商侧参与腾讯混元 HY4 的评测与质量管理:制定 Rubric、复核事实与计算、构造高难样本。这些经验是这个方向的起点,但还没有形成公开的数据实验。

// OPEN QUESTIONS

我正在追的问题

  1. 01

    同样的训练预算,按什么标准洗掉哪一半数据,模型会变得更好?

  2. 02

    合成数据能补多少数量,又从第几代开始让模型的分布变窄?

  3. 03

    事实、推理和格式三类错误,哪一类对最终能力的伤害最大?

  4. 04

    具身智能、科学实验这类难以获取的数据,最小可用的采集与质检流程是什么样的?

// EXPERIMENTS

造物之书里的实验

每个实验都从一个可以被证伪的问题开始
// LIMITS

现在还不能证明什么