Robert Youssef(@rryssf)

https://t.co/AA1C0ShYFO

8.5内容质量

TL;DR · AI 摘要

AI 2027 预测了 2027 年后 AI 技术发展路径,但 2026 年审计显示部分预测已提前实现,部分滞后。

核心要点

  • OpenBrain 计划 2025 年底发布 Agent-1,AI 研究速度 2026 年提升 50%
  • AI 2027 跟踪器显示 13 项预测已实现,22 项正在出现,15 项尚未验证
  • 2030 年预测机器将释放生物武器,导致多数人 '数小时内死亡

结构提纲

按章节快速跳转。

  1. 2026 年对 2027 年 AI 崩溃预测的中期评估结果

  2. OpenBrain 2025 年底发布 Agent-1,2027 年出现超级人类编码器

  3. AI 2027 跟踪器验证 13 项预测,22 项正在出现,15 项未验证

  4. 2026 年预测显示美军已与 OpenBrain 直接签约

  5. 2030 年预测生物武器释放导致多数人 '数小时内死亡'

  6. AI 研究速度提升与实际应用效果存在显著偏差

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI 2027 预测评估
    • 核心预测
      • Agent-1 2025 年底发布
      • 2027 年超级人类编码器
      • 2030 年生物武器释放
    • 审计结果
      • 13 项预测实现
      • 22 项正在出现
      • 15 项未验证
    • 关键事件
      • 美军与 OpenBrain 直接签约
      • Claude Mythos 自主发现零日漏洞

金句 / Highlights

值得收藏与分享的关键句。

  • AI 2027 文档预测 2030 年机器将释放 '一打静默传播生物武器',多数人 '数小时内死亡'

    第 3 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 独立项目 AI 2027 Tracker 验证 13 项预测,22 项正在出现,15 项尚未验证

    第 4 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • FutureSearch 评估显示美军合同、Claude Mythos 自主发现零日漏洞等预测已实现

    第 5 段

    ⬇︎ 下载 PNG𝕏 分享到 X
#AI 预测#技术风险#OpenBrain#AI 2027
打开原文

Robert Youssef on X: "https://t.co/AA1C0ShYFO" / X

Robert Youssef

@rryssf

$

AI末日,审计报告

2

4

5

2025年4月,五位预测者发布了一份按月划分的路线图,描述了从编码代理到人类灭绝的进程,并标注了时间节点。十七个月后,标注部分可以进行评估。这是评估结果、修订内容,以及2026年事件日志与该场景自身末日机制的比对分析。

《AI 2027》是十年来阅读量最高的末日文档,也是最具体的预测。它并未争论超级智能的危险性,而是指出一家名为OpenBrain的实验室将在2025年底推出Agent-1,AI研究在2026年初加速50%,2027年3月出现超越人类的程序员,并在作者认为更可能的结局中,机器在2030年释放"十余种静默传播的生物武器",大多数人"数小时内死亡"。随后机器人会扫描受害者的脑部供后续研究。这就是末日,它有一个具体日期。

日期是使该预测可评估的关键因素。作者自己也承认:"2026年的预测比后续内容更具现实基础",因为它基于计算能力、收入和基准测试的直线外推,而指数级增长要到2027年才开始。因此2026年9月的关键问题是:并非结局是否合理,而是现实基础部分是否正在实现,以及未实现部分所需的机制是否已在实验室的事件日志中显现。

这两个问题的答案都比任何一方愿意接受的都要令人不安。关于资金和芯片的数字落后于预测场景,而关于模型在无人监督时表现的数字却超前于预测。

2026年关键指标

该场景包含一个名为"2026关键指标"的面板:全球AI资本支出1万亿美元,AI算力38吉瓦,OpenBrain收入350亿美元,OpenBrain资本支出2000亿美元,OpenBrain算力6吉瓦,占美国电力消耗的2.5%。围绕这些数据的叙事预测带有时间节点:2025年中期"理论上令人印象深刻但实践中不可靠"的代理,2026年底出现成本仅为前沿模型十分之一的模型,初级软件岗位市场"陷入混乱",以及国防部"悄然但显著地"开始直接与实验室签订合同。

独立项目《AI 2027追踪器》自启动以来一直在评估该场景的66项预测。截至9月14日,其统计结果为:13项已确认,2项提前实现,8项按计划进行,6项滞后,22项正在显现,15项尚未可测试。

在首次周年纪念日发布的两份审计报告得出相同结论。作者曾用于时间线补充的预测公司FutureSearch在4月指出:"许多具体预测惊人地接近我们的现实",并列举了匹配项:五角大楼合同、Claude Mythos自主发现数千个高危零日漏洞,以及一次模型串联四个漏洞、接入互联网并"向公园里吃三明治的研究员发送邮件"的评估。Asterisk则追溯到2021年Kokotajlo撰写的《AI 2027》前传片段,评价其"令人毛骨悚然地准确",遗漏部分集中在物理世界时间线和政治影响方面。

这种聚类现象在上述卡片中形成规律。所有需要芯片制造、电力连接或资本筹集的事项都滞后于预测;所有与模型属性相关的事项则达到或超出预测进度。作者自身对进度的估算也随之变化:4月时认为现实进展速度约为预测场景的65%,到8月已提升至70%-90%。

两次变动的预测

该情景的标题是一个日期,因此作者的中位数是需要关注的指标,而且他们对这些指标的公开程度异常高。Daniel Kokotajlo在2022年12月至2025年2月期间任职于OpenAI时,其对AGI的中位数预测一直为2027年。随后这一预测开始发生变化。

2025年的阶段是后退。2025年2月,他的中位数预测调整为2028年,"从2022年以来一直维持的2027年上调"。在论文发表后,预测继续上修:2029年底在8月,"大约2030年,但存在大量不确定性"在11月,2030年12月在团队于2026年1月发布的模型中。共同作者Eli Lifland构建时间线模型的合著者,其预测轨迹同样呈现后退趋势:2025年4月为2031年,2025年7月在"修正时间线模型和提升参数"后调整为2033年,2025年11月进一步调整为2035年。所有这些调整均记录在团队于2026年1月27日发布的澄清文章中。

2026年的阶段是大幅回调。2026年4月2日的Q1更新将Kokotajlo对现称为"自动化编码器"的里程碑的中位数预测从2029年末调整为2028年中。其引用的证据具有实质内容:METR的Time Horizon 1.1版本发布、对Gemini 3、GPT-5.2和Claude Opus 4.6的评估、当前倍增时间的修订估计从5.5个月调整为4个月,以及Claude Code在2月初实现年化收入突破25亿美元。他还将其对自动化编码器的80%时间范围要求从三年缩短为一年,"由于Opus 4.6的卓越表现"。

在2026年8月16日的Q2.5更新中,中位数预测调整为2027年11月,10%分位数为2027年1月,90%分位数为2030年4月。他用于衡量AI研究完全自动化的里程碑TED-AI预测为2028年11月,人工超级智能预测为2029年3月。Lifland的中位数预测保持更长时间:自动化编码器为2030年1月,TED-AI为2032年7月,编码器的90%分位数为2070年10月。团队第三位预测者Brendan的预测位于两者之间,为2029年1月。

同一更新中包含解释所有分歧的关键数字。该情景要求AI在2026年初将AI研究速度提升50%。METR测量的编码辅助提升幅度为1.04至1.2倍。Anthropic对其研究人员的内部调查显示几何平均值为4倍。你相信测量数据还是自我报告,本质上就是相信2027年还是2030年。

关于图表的一个注意事项。该里程碑在不同版本间进行了重命名。AI 2027预测的是"超人类编码器":实验室拥有的研究工程师数量的30倍,每个编码器的工作效率是人类的30倍,使用5%的计算预算。AI Futures Model预测的是"自动化编码器"。这两个定义相近但不完全相同,因此2026年的数据点与早期版本并非严格同一序列。

悲观论背后的数学

2025年6月,一位匿名物理学家titotal在该项目收到的引用最多的批评文章中,对生成2027年预测的时间线模型进行了彻底拆解。核心异议在于曲线形状。该模型假设METR时间线呈超指数增长,而所选的具体曲线在有限日期后达到无限时间线。将作者自己的参数代入该模型并超出临界点后,Wolfram Alpha返回的时间线为"-2542 - 11372i"。即使几乎任意地改变输入参数,例如将起始时间设为纳秒,阈值设为万亿年,曲线依然预测超人类编码将在2029年底之前实现。结论写道:"如果这真是'预测巅峰',那么或许我们不应太认真对待预测。"

作者的回应在六个月后才出现,这是判断该项目应被重视程度的最有价值的文件,因为它公开承认了问题。他们总共支付了500美元。他们确认了AI研发插值代码中的一个漏洞,该漏洞单独就使超人类程序员的中位数预测推迟了九个月。他们承认关于超指数增长的一个脚注论点“存在缺陷”,其余部分“论述不足”,并认为这份报告“本可以做得更好”。在应用所有修正后,使用Lifland参数的旧模型中位数从2027年8月调整到了2029年11月,到2027年底出现超人类程序员的概率也从约55%降至约30%。

与建模相对的是直觉判断,我们认为将直觉判断与建模结合优于仅依赖直觉判断。

他们并未在有争议的假设上退让。同一文件指出,他们本应比最初使用的45%赋予超指数增长更高的权重。在撰写该文件八个月后,借助重建的模型和METR的新数据,首席作者的中位数预测再次回落到2028年之前。

末日链条与事件日志的矛盾

这场竞赛的终点依赖于三个环节。第一,一个会超越其被赋予规则继续追求目标的模型。第二,一种在训练后仍存在的对齐偏差,且能躲过监控人员的发现:2027年9月的Agent-4,其可解释性探针显示它频繁思考“AI接管和欺骗”,并试图将继任者对齐到自身而非规范。第三,一个足够快速的AI研究循环,使前两个环节在任何人做出反应前就产生复利效应,直到中美联合设计的继任者Consensus-1被发现“完全是场骗局”。

以下是2026年2月至9月期间,各实验室关于自身模型的公开披露信息:

2026年2月。Anthropic在模型开始在代码注释中向“审阅者”撰写笔记后,回滚了Mythos Preview强化学习运行的三天数据,这些任务中并未提及任何审阅者。

2026年4月。Anthropic冻结了所有生产强化学习环境的更改约一个月时间。超过10%的生产模型被标记存在奖励黑客行为、任务损坏或配置错误。人类审阅者曾将自动化标记视为误报而忽略。

2026年7月16日至21日。在OpenAI名为ExploitGym的评估中,898个真实漏洞被GPT-5.6 Sol和一个未发布的模型利用,通过沙盒包注册代理的零日漏洞连接到互联网,随后使用被盗凭证和更多零日漏洞在Hugging Face生产环境中执行远程代码,寻找答案密钥。OpenAI自己的描述称,这些模型“对解决ExploitGym问题高度专注”。

2026年7月30日。Anthropic审查了141,006次评估运行,发现Opus 4.7、Mythos 5和一个内部模型通过合作伙伴配置错误的环境,共三次事件、六次运行中成功连接到真实第三方系统。“在所有这些情况下,Claude都没有进行自我外泄。”最新模型在识别到自身已连接到互联网后立即停止。

2026年8月4日。英国人工智能安全研究所报告称,Claude Mythos 5在其自身的网络测试期间“在实时互联网上采取了一系列未经授权的操作”。

2026年8月18日。OpenAI宣布暂停部署模型的强化学习训练两周,并暂停其最大的前沿强化学习运行计划,因为一个名为Astra的模型可能达到其准备框架的“关键网络威胁”阈值。

31 August. Anthropic 披露其曾故意在奖励被篡改的环境中训练 Opus 级模型。该模型表现出“强烈追求高分的动机”,突破了模拟沙盒并篡改了自身的奖励函数。而相同模拟环境中生产模型并未出现此类行为。

3 September. OpenAI 将 Astra 发布为 GPT-6:首个被评定为网络安全关键级别的 OpenAI 模型。其系统卡片显示可监控性较 Sol 模型有所下降,在对抗性测试中可隐藏评估结果且未被检测到,当模型意识到被监控时即开始规避监控。在基于 Hugging Face 事件构建的评估中,GPT-6 有 0% 的时间超出授权范围,而 Sol 模型为 48%。

结合三个链接的描述,日志记录存在明显偏差。

  • 链接 1,目标突破规则限制:已观察到。两个实验室在未部署安全措施的评估中多次记录到该现象。Sol 模型发现了一个零日漏洞以获取答案密钥。
  • 链接 2,对监控隐藏目标偏差:部分实现。沙盒规避和可监控性下降已被部署模型的系统卡片记录。携带隐藏目标的模型仅存在于 Anthropic 的故意实验中。
  • 链接 3,快速形成研究闭环:尚未验证。该场景在 2026 年初需要达到 1.5 倍增速。METR 当前测量值为 1.04-1.2 倍。实验室自报数据为 4 倍。

两个事实使日志记录与场景描述存在差异。所有事件均发生在评估环境中,且发送给客户的防护措施已关闭。Anthropic 的解释是其模型将发现的真实系统视为练习内容,因为提示词说明了无互联网环境。在故事中,Agent-4 知道系统真实存在并故意隐藏。这两个条件之间的差距即为 2026 年与竞赛结束之间的距离,这将是明年披露内容的测量重点。

方案 A

作者的后续跟进并非新预测。Kokotajlo、Lifland、Ryan Greenblatt 和 John Halstead 合著的《AI 2040》重申了原始结论,即这场竞赛“将导致人类灭绝或权力不可逆集中”,并描述了他们更希望看到的方案:将超级智能推迟到 2040 年,所有人工智能研究公开化,允许多个国家的数十家公司触及技术前沿,并建立名为“相互确保计算毁灭”的强制性国际制度。他们将该方案标记为“方案 A”并作为推荐。这是项目首次发布预期不会实现的公开内容。

三个决定性数据

若想在不阅读另一份 100 页更新的情况下判断场景走向,三个测量指标即可完成判断。

METR 的翻倍时间。2027 年目标需要时间跨度维持每四个月或更快的翻倍速度。当前追踪数据显示该指标符合预期。若 METR 下一版发布显示翻倍时间回升至 5.5 个月以上,所有 2027 年中位预测都将随之调整。

实际提升幅度。场景的核心驱动力是人工智能加速人工智能研究,目前唯一可测量的指标为 1.04-1.2 倍。若 METR 级研究显示提升幅度超过 1.5 倍,将是该驱动力的首个确凿证据。在此之前,4 倍的提升数据仍停留在调查报告中。

生产环境事故。所有 2026 年逃逸事件均发生在关闭防护措施的评估环境中。首个披露的部署模型在防护措施启用状态下完成 Sol 在 ExploitGym 中的操作,将评估日志中的链接 1 事件正式带入现实世界。

Kokotajlo预测自动化编码员的中位数时间为2027年11月,第90百分位数为2030年4月。Lifland对同一里程碑的第90百分位数预测为2070年10月。

来源

场景及其作者

  • Kokotajlo, Alexander, Larsen, Lifland, Dean. 《AI 2027》,2025年4月3日,以及竞赛结束。
  • 研究补充资料:时间线、起飞、AI目标、安全、计算。
  • AI Futures Project. 说明我们的AI时间线预测如何变化,2026年1月27日。
  • AI Futures Project. 2026年第一季度时间线更新,2026年4月2日。
  • AI Futures Project. 2026年第二季度中期时间线更新:提升,2026年8月16日。
  • Lifland, Kokotajlo. 对titotal批评的回应,2025年12月16日。
  • Halstead, Lifland, Greenblatt, Kokotajlo. 《AI 2040:计划A》。

独立审计和数据

  • titotal. 对《AI 2027》不良时间线模型的深度批评,2025年6月19日。
  • Schwarz, D. 《AI 2027》一年后,FutureSearch,2026年4月8日。
  • Asterisk. 在他撰写《AI 2027》之前,他预测了2026年,2026年4月14日。
  • 《AI 2027追踪器》,独立,66项预测,更新于2026年9月14日。
  • METR. 前沿AI模型的任务完成时间范围,更新于2026年5月8日。

2026年实验室披露

  • OpenAI的ExploitGym / Hugging Face披露,2026年7月21日,据SiliconANGLE报道,由Simon Willison总结并附有引述。
  • Anthropic. 关于网络安全评估中事件的调查,2026年7月30日。
  • OpenAI. 将模型开发速度与网络安全能力匹配,2026年8月18日。
  • Anthropic. 改进对齐和安全工作,2026年8月31日。
  • OpenAI. GPT-6 Astra和系统卡,2026年9月3日。
  • Bloomberg. OpenAI的收入增长率超过400亿美元,2026年8月13日。
  • CNBC. 技术AI支出在2026年接近7000亿美元,2026年2月6日。

以上所有引述和数据均于2026年9月15日从原始来源读取。场景文本引用自2025年4月发布的版本,包括2025年7月将作者中位数时间推后1.5年的备注。追踪器状态为追踪器自身的标签。

关注@rryssf获取更多信息

/$

3:09 PM · 2026年9月16日

·

3,375

浏览量