// RESEARCH / 01 / DATA
数据
数据质量怎样被定义、被测量,又怎样变成模型能力。包括数据过滤、合成数据,以及那些很难拿到的数据。
- 实践过
- 当前状态
- I · IV
- 造物之书里的实验
数据决定模型的上限。质量差的数据一定训练不出好模型,但“质量”必须能被拆开、被测量,才不只是一句口号。
做过金融长文本、金法医等标注与质检,在供应商侧参与腾讯混元 HY4 的评测与质量管理:制定 Rubric、复核事实与计算、构造高难样本。这些经验是这个方向的起点,但还没有形成公开的数据实验。
- 01
同样的训练预算,按什么标准洗掉哪一半数据,模型会变得更好?
- 02
合成数据能补多少数量,又从第几代开始让模型的分布变窄?
- 03
事实、推理和格式三类错误,哪一类对最终能力的伤害最大?
- 04
具身智能、科学实验这类难以获取的数据,最小可用的采集与质检流程是什么样的?
// LIMITS
现在还不能证明什么
- 标注与评测经验来自供应商侧工作,细节无法公开
- 尚未公开任何自己跑出的数据过滤实验结果