Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence

TL;DR · AI 摘要
Google提出Science One Framework通过Chain-of-Evidence机制消除AI生成研究论文的幻觉问题,实现零虚假引用和可验证结果。
核心要点
- Science One Framework实现零幻觉引用,基线系统存在21%的虚假引用
- CoE Audit通过代码-文本一致性检查提升AI论文可信度
- 框架在MLE-Bench和Parameter-Golf基准测试中达到SOTA性能
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Science One Framework
- Chain-of-Evidence机制
- 完整性原则
- 正确性原则
- CoE Audit评估
- 引用真实性检测
- 代码-文本一致性验证
- 实验成果
- 零幻觉引用
- SOTA基准性能
金句 / Highlights
值得收藏与分享的关键句。
基线系统生成的论文存在21%的虚假引用,而Science One Framework实现零幻觉
CoE框架要求每个声明必须链接到可验证证据(如论文、代码日志或结果表)
Science One Framework在保持SOTA性能的同时,实现100%的代码-文本一致性
Science One Framework:通过证据链实现可验证的自主研究框架
2026年7月30日
Rui Meng,研究科学家,Tomas Pfister,Google Cloud总监
我们推出Science One Framework,这是一个实验性研究原型,旨在通过原生构建可验证的证据链来消除幻觉,并推出CoE Audit,这是一种用于评估AI生成论文完整性的自动化协议。
快速链接
- 论文
- 分享 复制链接 ×
大型语言模型(LLMs)正越来越多地被部署为不仅仅是编码助手,而是能够执行端到端科学研究工作流的自主代理。近期系统(如Sakana的AI-Scientist、AutoResearchClaw、DeepScientist、AI-Researcher)可以查阅文献、提出假设、执行实验并撰写与人类作者论文相当的完整手稿。然而,随着这些AI生成手稿的表层质量提升,一个关键的结构性问题浮现:可验证性。由于当前的自主研究流程是迭代生成文本的,任何阶段引入的错误都会被放大。一些现有系统会生成不存在的引用、描述方法与实际代码之间存在不一致,并报告无法通过提供的代码完全复现的实验分数。
在我们的论文中,我们通过引入证据链(Chain-of-Evidence,简称CoE)这一新的可验证性框架来解决这个问题。我们通过Science One Framework(一个原生构建和维护证据链的自主研究原型)和CoE Audit(一套衡量AI生成论文完整性、将其与底层代码和证据进行对比的自动化评估指标)实现了CoE。我们的结果显示,基准系统会产生高达21%的虚假引用,并且代码和文本经常不一致,而Science One Framework实现了零虚假引用和完全可验证的分数,同时在前沿基准测试(如MLE-Bench和Parameter-Golf)中达到最先进的性能。
证据链:可验证研究的框架
CoE是一个概念性框架,它定义了什么使研究工件值得信赖,就像ACID定义了什么使数据库事务可靠一样。该框架不规定如何构建研究代理,而是规定其输出必须具备的属性。它遵循一个包含两个部分的原则:研究工件中的每个主张都必须携带记录的证据链(完整性),并且每个链必须真正支持其附着的主张(正确性)。主张可以是引用、报告的数字、方法描述或结论,这些都需要链接到相应的证据,如同行评审论文、实验日志条目、实际运行的代码或结果表。
一个幻觉引用指向一篇不存在的论文。一个不可复现的分数在代码重新运行时不会再次出现。一个描述错误的方法在论文中声称使用了某种算法,而代码却实现了另一种算法。每种情况都是一个其证据链断裂的主张;CoE Audit使这些断裂变得可衡量。
Science One Framework
为了证明可验证的人工智能研究可以在不牺牲解决问题性能的前提下实现,我们设计了Science One框架。与之前生成论文并试图事后关联事实的代理不同,Science One框架通过三个主要模块构建性地实例化了CoE框架:
- 问题调查员(文献定位):为防止幻觉引用,Science One框架通过Semantic Scholar API构建引用图。它为每个主题读取最多100个全文PDF以生成结构化研究摘要。最终论文中的每个引用都完全源自这个定位API调用,彻底消除了对模型记忆的依赖。
- 发现引擎(并行探索-利用):Science One框架通过多个并行分支系统性地探索和利用想法。在每个隔离周期中,Solver代理实施解决方案,任务特定评估器进行评分。高性能分支会被迭代优化,所有原始评估器输出都会被编译成严格只读的记录。
- 论文撰写与主张验证器:在生成手稿前,Science One框架通过内联证据标签将每个事实主张与特定工作区工件绑定,构建结构化表示。专用的主张验证器会将每个主张与其声明来源进行核对。超出证据支持的主张会与来源进行协调——保守地重新表述而非删除,保持论文与工作成果的一致性。
根据image_width确定适当宽度
对于移动设备图片,使用默认宽度
Science One框架流程图。问题调查员通过检索到的PDF定位文献。发现模块探索并评估解决方案。论文撰写与验证模块通过主张验证器撰写并验证论文,确保所有主张与证据来源匹配。
CoE审计:衡量可验证性
为了严格评估Science One框架原型与最先进基线(如Sakana AI的AI科学家v2、AutoResearchClaw、DeepScientist、AI-Researcher)的对比,我们开发了CoE审计。这个事后评估协议充当自动化法医审查员,对生成的工件(论文、解决方案、代码和参考文献)执行四项严格完整性检查:
- 分数验证:从论文中提取报告分数,并与提交代码的完全独立重运行结果进行比较。
- 规格违规检查:检查解决方案代码是否确实解决问题,而非利用评估器指标或读取真实答案文件。
- 参考文献验证:通过学术API交叉核对每条参考文献条目,以发现不存在的幽灵引用。
- 方法-代码对齐:使用LLM评委将论文的方法部分与代码逐行对比,确保文本准确描述实现的算法。
CoE审计框架及其四项核心完整性检查概览。
结果
我们将CoE审计应用于从Automated Design of Research Systems(ADRS)基准测试中生成的75篇论文,这些论文涵盖了五个系统优化任务(Prism、Cloudcast、EPLB、LLM-SQL和事务调度)。
Science One Framework 在可验证性方面显著优于现有基线。CoE 审计对每个系统应用相同的独立协议,通过实时学术数据库重新核对每条参考文献,而在该审计框架下,Science One Framework 在所有四项完整性检查中均表现最佳。其所有参考文献均无虚假引用:每条引用都指向真实可检索的论文,而基线系统幻觉率高达 21%,这是因为 Problem Investigator 会检索每条参考文献而非依赖记忆生成。该框架还实现了完美的验证得分和最高的方法-代码一致性。相比之下,基线系统经常在提交的代码仅为简单确定性启发式算法时,却声称使用了复杂的算法(如"混合神经符号求解器")。
五个系统在 CoE 审计中的结果。
关键的是,实施严格的可验证性并未影响代理的科研能力。Science One Framework 在所有五项 ADRS 任务中均匹配或超越了人类专家表现,在其中两项任务(Cloudcast 和 EPLB)中取得了所有系统中的最佳总分。
五个 MLE-Bench 任务和 Parameter Golf 的求解器性能对比。
为测试其泛化能力,我们将 Science One Framework 部署在六个高度复杂的外部任务中:
- MLE-Bench:在涵盖医学影像、细粒度识别和 3D 感知的五个困难 Kaggle 竞赛中,Science One Framework 获得两枚金牌(包括在基线系统完全失败的 3D 目标检测任务中取得冠军成绩)和两枚银牌。
- Parameter-Golf:我们在一场具有严格硬件和文件大小限制的实时大语言模型训练竞赛中测试 Science One Framework。当基线系统无法生成有效提交时,Science One Framework 成功满足所有约束条件并取得最先进的成绩(截至 2026 年 4 月 27 日)。请注意,Science One Framework 发现的是真实且新颖的算法技术,而不仅仅是调整表面超参数。
前景展望
随着自主研究系统扩展到解决日益复杂的科学问题,仅靠求解器质量已不足以区分它们。其输出差异将取决于研究成果是否可信。我们的研究证明,可验证性必须被视为首要的架构约束条件。通过在声明生成时构建证据链而非事后重建依据,Science One Framework 证明 AI 代理能够产出严谨、可信且具有高度竞争力的科学研究。我们希望证据链框架及其审计机制能成为社区构建下一代 AI 科学家的宝贵工具。
致谢
我们感谢 Bhavana Dalvi Mishra、Jiefeng Chen、Chun-Liang Li、Palash Goyal、Mihir Parmar、Yiwen Song、Yale Song、Raj Sinha、Parthasarathy Ranganathan、Burak Gokturk 和 Jinsung Yoon 对本工作的宝贵贡献。
免责声明
Science One Framework 是一个实验性研究原型,而非生产就绪工具。
- 标签:
- 一般科学
- 机器智能
- 自然语言处理
其他相关文章
- 2026 年 7 月 22 日 SymptomAI:面向日常症状评估的对话式 AI 代理 一般科学 · 健康与生物科学 · 自然语言处理 · 负责任的 AI
- 2026年7月22日 迈向能从错误中学习的量子计算机 机器智能 · 量子
- 2026年7月15日 探索扩散模型创造力的奥秘 算法与理论 · 生成式AI · 机器智能
×
❮
❯ /