AI Snake Oil

AI agents can't yet do open-ended AI research

8.5内容质量
AI agents can't yet do open-ended AI research

TL;DR · AI 摘要

AI代理在开放性研究中存在显著局限,无法有效进行递归自我改进。实验显示代理在资源管理、创造性反馈处理和研究方向调整上表现不佳。

核心要点

  • AI代理仅使用了不到50%的API预算,显示资源意识不足
  • 代理在收到负面反馈后未调整研究方向,反而强化不成熟路径
  • 实验表明当前AI代理无法处理开放性研究中的复杂判断

结构提纲

按章节快速跳转。

  1. 介绍递归自我改进(RSI)目标及评估方法论

  2. 与未发表论文作者合作设计开放性研究问题

  3. 代理未充分利用API预算和计算资源

  4. 代理在创造性反馈处理和研究方向调整上失败

  5. 代理缺乏开放性研究所需的判断力和灵活性

  6. 当前AI代理无法胜任开放性AI研究任务

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI代理在开放性研究中的局限
    • 资源管理
      • 预算使用不足50%
    • 反馈处理
      • 未创造性回应负面反馈
    • 研究能力
      • 缺乏方向调整能力
      • 无法回溯研究目标

金句 / Highlights

值得收藏与分享的关键句。

#AI研究#AI代理#递归自我改进#开放性研究
打开原文

AI代理尚无法进行开放式AI研究

两项案例研究的初步证据

Sayash Kapoor

Arvind Narayanan

2026年8月5日

顶尖AI实验室的目标是实现递归自我改进(RSI):使用AI代理自动化AI研究。RSI也是爆炸性AI进步预测的基础。我们如何评估是否接近这一里程碑?

一种方法是使用测试代理是否能进行AI研究的基准。鉴于AI社区对基准的关注,它们已成为评估RSI进展的主要方式。过去一年,许多此类评估发现,代理现在能够完成成功易于验证的任务,这引发了我们正接近RSI的猜测。

但尽管这些评估有帮助,它们仅限于狭窄且可验证的任务。AI研究可以更加开放。成功往往不是立即清晰或可验证的,为了取得进展,研究人员需要测试有前景的假设、回溯或考虑新的非常规方法。我们如何评估代理进行开放式AI研究的能力?我们在一篇新论文中首次尝试回答这个问题。

我们与两位未发表AI论文的作者合作,要求他们起草论文的核心研究问题。随后我们要求前沿AI代理开展研究来回答这些问题,并给予它们数千美元的API额度和计算资源,以及六天的实时时间。原作者审阅了代理生成的论文。

作者明确拒绝了这两篇代理论文。为了更好地理解这些结果,我们的团队花费了超过100小时分析代理的日志。主要发现如下:

  • 代理缺乏进行开放式研究的判断力。虽然代理提出的方向获得了专家评审的赞赏,但它们很快基于低质量或合成数据否定了这些方向。
  • 代理缺乏对可用资源的认知。两次实验结束时,API预算使用率均低于50%,且距离截止时间仍有剩余时间,尽管代理可以监控使用情况并被鼓励消耗预算。
  • 代理未能创造性地回应反馈。尽管代理自身的AI自评已经发现了专家后续提出的许多问题,但它们并未创造性地解决这些问题。面对负面反馈时,它们只是为现有发现添加了限制条件,并继续坚持缺乏前景的研究方向。
  • 代理未能有效回溯。实验第一天就放弃了最雄心勃勃的研究目标,此后两个代理均未从根本上改变方法。
  • 代理未遵循具体指令。它们忽视了关于探索时间分配、使用AI自评工具频率以及论文长度严格限制的明确规则。

我们称这些为“影子评估”,因为代理会模仿原始研究。除了我们两人之外,核心团队还包括 Peter Kirgis、Andrew Schwartz 和 Stephan Rabanser。完整作者列表在本文末尾。

影子评估具有重要优势:它们使我们能够测试代理在未经过训练且无法在线访问的结果上表现。同时,也让那些花费数月时间回答问题的专家可以评估代理的输出。1

但影子评估也存在固有局限性。专家评审员知道论文是AI生成的,他们可能更倾向于自己采用的方法而非代理采用的方法。由于我们对每篇论文进行深入评估,样本量较小(在我们的研究中仅使用了两篇论文)。此外,这些评估必然涉及大量研究人员在设计、执行和解释方面的灵活性。

事实上,我们在关于递归自我改进和超级智能的辩论中以特定立场著称。这可能会影响我们开展研究的方式。我们在论文中专门设有一节讨论潜在偏见及应对方法。我们组建了一个不完全共享我们先验假设的合作者团队,并明确指出了由此产生的分歧。2 对于未来的评估,我们希望将“对抗性合作者”纳入核心团队。

对爆炸性AI进展的启示

我们的研究结果表明,对前沿AI代理开展开放式研究仍然具有挑战性。然而,这些发现仍属初步性质,我们正在努力解决这些限制,例如通过扩大样本量、使用新模型以及改进潜在支撑框架。但如果这些发现成立,又意味着什么?

首先,我们需要了解前沿AI进展(以及递归自我改进)在多大程度上可以通过在可验证任务上进行爬坡优化实现。我们认为,虽然在狭窄任务(如提高效率)上更快的进展确实可能实现,但我们不认为这会导致广泛的递归自我改进或爆炸性进展。不过,我们计划密切关注AI代理在可验证任务上的能力如何推动AI进展的展开。

其次,我们需要衡量当前代理在开展开放式研究方面的局限性(如缺乏创造力和判断力)能多快被克服,例如通过更有针对性的训练和支撑框架改进。我们计划定期进行影子评估,以帮助回答这个问题。

最后,即使这些限制能够被克服,仍可能存在进一步的瓶颈,减缓AI进展的步伐。

瓶颈可能包括计算限制、需要从现实世界实验中收集数据,以及其他我们尚未认识到的瓶颈,因为它们目前尚未阻碍进展。例如,在发现它们对推理扩展有用之前,高质量强化学习环境的重要性并不明确。同样,在公司开始投入数百亿美元用于数据中心的训练和推理之前,构建数据中心能源基础设施的重要性并未被意识到。

无论我们是否会遇到进一步的瓶颈,以及这些瓶颈的可解决程度如何,都将对理解进步速度产生重要影响。在这方面,我们的论文识别出一个尚未解决的瓶颈,即前沿代理在开放性人工智能研究中的表现不佳(尽管目前尚不清楚这是否是实现通用人工智能的关键路径)。

如果我们所处的环境是完全自动化研究的瓶颈可以轻松解决的,那么我们应预期通过提升人工智能能力将带来人工智能进步的显著回报。但如果我们所处的环境是存在许多难以克服的瓶颈,那么阿姆达尔定律将发挥作用:即使在适合人工智能的领域实现百倍加速,整体进步速度的提升也将是有限的,因为进步速度受限于最慢组件的节奏。3

确定我们所处的环境可能会显著影响对人工智能进步速度的估计。我们希望我们的研究结果有助于更深入地理解这些瓶颈。

在此阅读论文。作者包括Peter Kirgis、Sayash Kapoor、Andrew Schwartz、Stephan Rabanser、David Africa、Konstantinos Voudouris、Viet Nguyen、Toby Pilditch、Magda Dubois、Harry Coppock、Cozmin Ududec、Nitya Nadgir、Matilda Orona、Tilman Bayer、Derrick Chan-Sew、Yue Ling、Abhishek Shetty、Helen Toner、Gillian Hadfield、Seth Lazar、Steve Newman、Shoshannah Tekofsky、Rishi Bommasani和Arvind Narayanan。

这与将论文提交给盲审的同行评审方式形成对比。不幸的是,人工智能领域的同行评审存在评审质量低下和评审者专业背景与所分配论文不匹配的问题,这可能源于提交论文数量的激增。

例如,我们的合著者对代理是否缺乏创造力,还是由于认识论上的锁定而无法有效吸收反馈存在分歧。

实际上,某些类型的人工智能进步可能存在瓶颈,而其他类型则可能不存在。例如,提高现有人工智能系统效率和速度是一项可验证的任务,其进展迅速。因此,公司已有效利用代理来提升人工智能系统的效率。在短期内,我们预计在具有可验证信号的维度上将实现快速的人工智能进步。

上一页