联系我 ↗

EXPERIMENT V · AI FOR SCIENCE

化学数据里的错

化学合成数据里,模型最常犯的是哪一类错?

待开始化学数据数据质检RDKit
  1. Q提出可证伪的问题当前阶段
  2. R做最小运行路径未开始
  3. E连接真实验证未开始
  4. P公开证据与限制未开始

为什么值得做

科学数据昂贵又稀缺,是“数据决定上限”最极端的场景。合成数据能补数量,但一个配平错误或不存在的反应条件,会让训练出来的模型带着同样的错。

Q

假设

HYPOTHESIS

化学合成数据中的错误集中在少数几类(配平、单位、反应条件、不存在的物质),用规则 + 工具校验能拦下其中大部分。

R

最小装置

MINIMAL SETUP
  1. 01从公开化学问答与合成数据中抽样,人工标注错误类型
  2. 02为每类错误写校验:RDKit 结构检查、配平、单位换算
  3. 03比较只用模型评审 / 只用工具校验 / 两者结合的检出率
E

什么会证明我错了

FALSIFIED IF

错误类型高度分散,工具校验的检出率不高于模型评审。

P

将会公开

WILL PUBLISH

错误分类表、标注样本、校验脚本和检出率对照。

前期线索相关的已有工作,不是这个实验的结论

  • 化学数据质检与资料寻源做过化学合成数据质检,以及化学与学科资料的证据寻源。

实验日志RUN LOG

还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。

去实验室 ↗