跳转至

FrontierScience: Evaluating AI’s Ability to Perform Expert-Level Scientific Tasks

  • arXiv: 2601.21165
  • 版本: v1
  • 提交日期: 2026-01-29
  • 最后更新: —
  • 作者: Miles Wang et al.
  • 主要机构: OpenAI
  • 主方向: Data Synthesis
  • 辅助标签: scientific-research, expert-authored, rubric, benchmark
  • 阅读状态: Seed 精读

一句话结论

FrontierScience 用专家原创、可验证且未公开的科学任务,区分 Olympiad 式封闭推理与 PhD-level Research 子任务,后者用 10 分 rubric 评估过程能力。

要解决的问题

传统科学 benchmark 多为选择题或已发表知识,能力接近饱和,无法测量模型面对新颖、开放式、需要数小时研究工作的任务时是否仍然可靠。

先用大白话说

模型会做选择题,不等于它会帮科学家做研究。真正的研究问题往往没有一句标准答案,需要拆解子问题、解释中间步骤、判断证据是否足够。FrontierScience 把这种任务交给物理、化学、生物领域专家编写,再用细粒度 rubric 检查答案的不同组成部分。

这个问题的特点是新颖、专业、开放式,而且不能只用 exact match 判断。任务还要防止训练数据污染,否则测到的是记忆,不是研究能力。

一个具体例子

一道 Research 题可能要求分析一个量子系统的研究子问题。答案即使没有复现专家的完整表述,只要正确完成“关键假设、方程、推理步骤、结论”这些 rubric 项,也能得到部分分数;如果只给一个漂亮但无依据的结论,就会暴露具体缺口。

方法拆解

  • Olympiad track:由国际竞赛奖牌得主/教练设计,答案可用数值、代数表达式或 fuzzy match 验证。
  • Research track:由 PhD scientists 编写并验证,模拟物理、化学、生物研究中的子问题,每题附专家设计的 10-point rubric。
  • 数据经过 creation、review、resolution、revision,多轮专家审查后开放 100 Olympiad + 60 Research gold set。

实验与证据

初始评测中 GPT-5.2 在 Olympiad 得分 77%、Research 得分 25%;结果显示模型在自包含题上进步快,但研究型开放任务仍远未饱和。Research rubric 同时评估最终答案和中间推理组件。

实验结果总结

  • 训练/评测模型:GPT-4o、o4-mini、o3、GPT-5.1、GPT-5、GPT-5.2、Claude Opus 4.5、Gemini 3 Pro、Grok 4 等;高推理档位按论文设置,非浏览评测。
  • Benchmark / 数据:Olympiad track 与 Research track;开放 gold set 包含 100 道 Olympiad、60 道 Research 题,实验分别进行 20/30 次试验。
  • 对比基线:不同前沿模型之间的横向比较;Research 以 10 分专家 rubric 判分(达到 7/10 才算通过)。
  • 指标:Olympiad 正确率;Research rubric 得分/通过率。
  • 主要结果:GPT-5.2 在 Olympiad 达 77%、Research 达 25%;Gemini 3 Pro Olympiad 约 76%,GPT-5 在 Research 约 25%。

与 Seed 的关系

它是 Data Synthesis 的科学研究任务 Seed,也连接 Rubric RL:专家 rubric 提供 criterion-level reward 的天然实验床。但它不是多模态 benchmark,不能替代 TVIR/MMDR-Bench。

可迁移启示

高质量合成数据需要原创性、专家复核、可验证 rubric 和 held-out 防污染集;对 Deep Research 应把研究子任务拆成可检查的中间目标,而不是只生成参考答案。

局限与待核对

  • 当前任务 text-only,不覆盖附件、图表或图文交错输出。
  • Research rubric 仍比表达式等价检查更主观,且未提供完整 human baseline。

相关链接