联系我 ↗
← 返回首页
// RESEARCH / 05 / AI FOR SCIENCE

AI for Science

科学数据昂贵又稀缺,是“数据决定上限”最极端的场景。关注化学、材料与蛋白质,以及模型怎样在很少的实验数据上被训练和验证。

在关注
当前状态
V
造物之书里的实验
// CURRENT THESIS
在科学里,一个配平错误或一个不存在的反应条件,都会让模型带着同样的错。科学 AI 首先是数据质检问题。

做过化学合成数据的质检与错误归因,以及化学与学科资料的证据寻源。这是从数据角度进入科学 AI,还没有做过模型层面的科学实验。

// OPEN QUESTIONS

我正在追的问题

  1. 01

    化学合成数据里,模型最常犯的是哪一类错?规则与工具能拦下多少?

  2. 02

    只有几百条实验数据时,预训练模型 + 少量微调能走多远?

  3. 03

    科学问答的“正确”怎样被验证:文献、计算,还是实验?

  4. 04

    蛋白质与分子生成模型的评测,和语言模型的评测有什么根本不同?

// EXPERIMENTS

造物之书里的实验

每个实验都从一个可以被证伪的问题开始
// LIMITS

现在还不能证明什么