全球大厂开始押注的 AI 科研,终于有了统一标准
今年 8 月,谷歌首席科学家 Jeff Dean 宣布离职,创办 AI4S 公司 Discovery Loop。
同样是在今年,OpenAI、Anthropic、英伟达等科技巨头相继宣布入局 AI4S 方向。
这批“跨界”大厂玩家的目标高度一致:不只做科研辅助工具,而是打造能够自主完成“假设→设计实验→执行验证→迭代优化”完整科研循环的“AI 科学家”。
不只是这些科技巨头,许多公司也已经更早入场。成立于 2024 年的中国企业深度原理,是全球最早押注 AI 自主科研方向的公司之一。
这一赛道背后是一片广阔的“金矿”。一旦 AI 能够实现自主闭环科研,AI 就能从“卖软件”升级为新材料、新药物等万亿级实体产业的生产力基座。

国家战略层面也高度重视这一赛道。AI 驱动科学发现已被纳入我国新一轮科技强国战略。
行业越热,一个问题就越绕不开:如何评价这些“AI 科学家”究竟做得好不好?
旧的衡量标尺,已经不够用了
长期以来,行业衡量 AI 科研水平的通用标尺,是 HLE 这类闭卷知识考试。
这类考试本质上是只看最终答案的考卷,只看结果,不关注答案生成的过程。
获得高分的 AI 科研工具,通常只要让它们执行一次实际实验,问题就会暴露出来:它们可能能够流畅地引用文献,却无法停下来审视和反思异常数据;也可能给出看似头头是道、实际上无法执行的实验方案。
8 月 19 日,一篇名为《Measuring AI Scientists: From Exams to Discovery》的论文发布,首次为“AI 进行真实科研的水平”提出了系统、完整的评价范式,正式填补了这一衡量标准的缺口。
论文由中国 AI4S 企业深度原理(Deep Principle)联合微软研究院、斯坦福大学、FutureHouse、Edison Scientific、艾伦人工智能研究所、加州大学伯克利分校等全球顶尖产学研机构共同完成。

全球最大材料开源数据项目 Materials Genome 和数据库 Materials Project 的创始人 Kristin Persson,FutureHouse 和 Edison Scientific 的创始人、近期《Nature》期刊 Co-Scientist 论文的核心作者 Andrew White,科研智能体评测标杆 ScienceWorld 的核心开发者 Peter Jansen,2023 年发表于《Nature》的 AI4S 综述第一作者 Yuanqi Du,以及 Terminal Bench 的最后通讯作者 Ludwig Schmidt 等 AI4S 领域的权威学者,共同奠定了这一框架的学术权威性。
深度原理作为唯一的中国产业代表,凭借真实研发管线积累的一线经验,让这套框架具备了落地的可操作性。

文章中甚至出现了诺贝尔化学奖得主 Frances Arnold 的署名。这位并不以 AI 见长、也几乎不在 AI4S 领域公开出现的科学家的参与,表明科学界权威对这一方向日益重视。
2026 年,从科技大厂到创业公司,各类玩家纷纷入场 AI 科研赛道,行业竞争加剧。这一评测体系在此时出现,有其必然性。
如何系统、完整地评价 AI 的科研水平
论文的核心创新,是提出了**发现回合(discovery episode)**评估体系。
这一体系的核心逻辑,是以“综合考核”的形式,全程记录 AI 在整个科研周期中的每一步决策,最终对完整轨迹的科学性、严谨性和有效性进行综合评分。
这种考核方式与此前的“应试”逻辑迥然不同。
围绕科研闭环的三个阶段——科研假说、方案执行、实验结果解读——这一评估体系分别建立了相应的评判维度,最终还要进行“全流程闭环测试”,衡量 AI 产出真实科研发现的综合能力。

△论文指出知识评测和发现评测的差别,并定义“发现回合”包含的评估要点
这套体系还重新定义了失败数据的价值:失败的实验数据,恰恰是训练和评估 AI 科研能力的核心资产。
人类科学家能够从失败中总结经验、规避弯路,AI 做科研也应该学会从失败中汲取经验。
此外,这一考核还对 AI 科研结果的真实性和独立性提出了较高要求,确保实验结果是“货真价实”的新发现,而不是无法实证的“自宣称成果”。
深度原理的 MIRA,就是这套体系的现实样本
在这篇标准论文发布之前,头部玩家已经在产品中跑通了闭环逻辑,深度原理的 MIRA 平台就是其中最典型的产业样本。
普通科研 AI 的定位是“答题工具”:科研人员提出明确问题,AI 返回对应答案。
MIRA 的设计逻辑与普通科研 AI 截然不同。它搭建了覆盖“假设生成→模拟计算→实验验证→知识沉淀”的完整闭环系统,通过三层架构实现真实科研团队的完整协作逻辑。
- 上层是分工协作的多智能体小队,可以统一规划和调度科研进程;
- 中层是打通高性能计算与自动化实验室的双执行引擎,实现干湿实验室联动;
- 底层是可沉淀、可复用的科研记忆体系,让每个项目的数据和试错结论都能够留存,成为后续研究的基础。

△AI Scientist MIRA 实际操作页面
这套设计的产业价值,已经得到公开基准测试的验证。
在化学、能源、材料综合评测 Research Claw Benchmark 和药物发现评测 Science Agent Arena 中,MIRA 均位列第一;其单项任务平均完成成本也处于行业最低水平,在性能和成本两个维度均形成优势。

△MIRA 在 Research Claw Benchmark 等评测中的结果

△Science Agent Arena 药物发现榜单:MIRA 以 81.1% 的综合分位列第一
深度原理此前推出的 React-OT 模型,可在 0.4 秒内计算化学反应过渡态,奠定了平台底层的高精度计算能力。
MIRA 正是在这类专业模型的基础上,进一步串联起科研全流程。这一演进路径,恰是整个 AI4S 行业从工具到平台、从单点到闭环的缩影。
作为这套评测体系的核心产业共创方,深度原理已依托 MIRA 与自建高通量实验平台的干湿闭环,在锂电、工业冷却液、新能源材料等赛道布局多条自研管线,由 AI 主导全周期科研,真实沉淀闭环数据,让平台与评测框架形成持续的相互验证与迭代。
跨越干湿实验室的完整科研实践数据,是帮助 AI 快速掌握假设边界、规避重复试错的核心资产,预计未来也将成为下一阶段 AI for Science 发展的关键基础设施。
结语
这一标准范式的发布,是 AI for Science 赛道的一个里程碑节点,为所有奔跑中的玩家划出了清晰的评判标尺。
但检验这一新标尺的数据并不容易。只有像深度原理和 Edison Scientific 这样拥有化学、材料、生物全流程研发能力,并且属于 AI native 的公司,才有可能做到。
过去的上半场,行业比拼的是“谁懂得更多”——大厂拼基座、拼参数、拼考试分数,用越来越难的题库证明模型的知识厚度。
这些努力奠定了 AI 科研的基础,但也逐渐触碰到了天花板。
接下来的下半场,比拼的将是“谁能真正做出东西”。
今年以来,从海外大厂陆续入局,到 Jeff Dean 创立 Discovery Loop,再到国内深度原理等企业的科研闭环实践,整个行业都在朝着“让 AI 真正走完从假说到发现的完整闭环”这一方向前进。
如今,AI 科研的评价标准越来越接近科学本身的逻辑。AI 离真正成为可信科研生产力的那一天,已经越来越近了。
想要完整了解“发现回合”评测体系的设计细节、测试场景与量化标准,可查阅论文原文:
《Measuring AI Scientists: From Exams to Discovery》