EXPERIMENT V · AI FOR SCIENCE
化学数据里的错
化学合成数据里,模型最常犯的是哪一类错?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
科学数据昂贵又稀缺,是“数据决定上限”最极端的场景。合成数据能补数量,但一个配平错误或不存在的反应条件,会让训练出来的模型带着同样的错。
假设
HYPOTHESIS化学合成数据中的错误集中在少数几类(配平、单位、反应条件、不存在的物质),用规则 + 工具校验能拦下其中大部分。
最小装置
MINIMAL SETUP- 01从公开化学问答与合成数据中抽样,人工标注错误类型
- 02为每类错误写校验:RDKit 结构检查、配平、单位换算
- 03比较只用模型评审 / 只用工具校验 / 两者结合的检出率
什么会证明我错了
FALSIFIED IF错误类型高度分散,工具校验的检出率不高于模型评审。
将会公开
WILL PUBLISH错误分类表、标注样本、校验脚本和检出率对照。
前期线索相关的已有工作,不是这个实验的结论
- 化学数据质检与资料寻源做过化学合成数据质检,以及化学与学科资料的证据寻源。
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗