FrontierScience: Evaluating AI’s Ability to Perform Expert-Level Scientific Tasks¶
- arXiv: 2601.21165
- 版本: v1
- 提交日期: 2026-01-29
- 最后更新: —
- 作者: Miles Wang et al.
- 主要机构: OpenAI
- 主方向:
Data Synthesis - 辅助标签:
scientific-research,expert-authored,rubric,benchmark - 阅读状态: Seed 精读
一句话结论¶
FrontierScience 用专家原创、可验证且未公开的科学任务,区分 Olympiad 式封闭推理与 PhD-level Research 子任务,后者用 10 分 rubric 评估过程能力。
要解决的问题¶
传统科学 benchmark 多为选择题或已发表知识,能力接近饱和,无法测量模型面对新颖、开放式、需要数小时研究工作的任务时是否仍然可靠。
先用大白话说¶
模型会做选择题,不等于它会帮科学家做研究。真正的研究问题往往没有一句标准答案,需要拆解子问题、解释中间步骤、判断证据是否足够。FrontierScience 把这种任务交给物理、化学、生物领域专家编写,再用细粒度 rubric 检查答案的不同组成部分。
这个问题的特点是新颖、专业、开放式,而且不能只用 exact match 判断。任务还要防止训练数据污染,否则测到的是记忆,不是研究能力。
一个具体例子¶
一道 Research 题可能要求分析一个量子系统的研究子问题。答案即使没有复现专家的完整表述,只要正确完成“关键假设、方程、推理步骤、结论”这些 rubric 项,也能得到部分分数;如果只给一个漂亮但无依据的结论,就会暴露具体缺口。
方法拆解¶
- Olympiad track:由国际竞赛奖牌得主/教练设计,答案可用数值、代数表达式或 fuzzy match 验证。
- Research track:由 PhD scientists 编写并验证,模拟物理、化学、生物研究中的子问题,每题附专家设计的 10-point rubric。
- 数据经过 creation、review、resolution、revision,多轮专家审查后开放 100 Olympiad + 60 Research gold set。
实验与证据¶
初始评测中 GPT-5.2 在 Olympiad 得分 77%、Research 得分 25%;结果显示模型在自包含题上进步快,但研究型开放任务仍远未饱和。Research rubric 同时评估最终答案和中间推理组件。
实验结果总结¶
- 训练/评测模型:GPT-4o、o4-mini、o3、GPT-5.1、GPT-5、GPT-5.2、Claude Opus 4.5、Gemini 3 Pro、Grok 4 等;高推理档位按论文设置,非浏览评测。
- Benchmark / 数据:Olympiad track 与 Research track;开放 gold set 包含 100 道 Olympiad、60 道 Research 题,实验分别进行 20/30 次试验。
- 对比基线:不同前沿模型之间的横向比较;Research 以 10 分专家 rubric 判分(达到 7/10 才算通过)。
- 指标:Olympiad 正确率;Research rubric 得分/通过率。
- 主要结果:GPT-5.2 在 Olympiad 达 77%、Research 达 25%;Gemini 3 Pro Olympiad 约 76%,GPT-5 在 Research 约 25%。
与 Seed 的关系¶
它是 Data Synthesis 的科学研究任务 Seed,也连接 Rubric RL:专家 rubric 提供 criterion-level reward 的天然实验床。但它不是多模态 benchmark,不能替代 TVIR/MMDR-Bench。
可迁移启示¶
高质量合成数据需要原创性、专家复核、可验证 rubric 和 held-out 防污染集;对 Deep Research 应把研究子任务拆成可检查的中间目标,而不是只生成参考答案。
局限与待核对¶
- 当前任务 text-only,不覆盖附件、图表或图文交错输出。
- Research rubric 仍比表达式等价检查更主观,且未提供完整 human baseline。
相关链接¶
- Paper HTML: arXiv HTML
- Code/Dataset: Hugging Face dataset