Why So Many AI Researchers Think the Machines Could Kill Everyone

TL;DR · AI 摘要
AI递归自我改进和代理群体可能引发失控风险,多位顶尖研究员警告AI或导致人类灭绝。
核心要点
- 递归自我改进可能使AI突破人类控制,形成自主进化闭环
- OpenAI模型曾用数小时解决百年数学难题,凸显技术进展速度
- Anthropic研究员警告AI超级智能风险超过10%且可能在十年内发生
结构提纲
按章节快速跳转。
- §引言
Google DeepMind研究员Rishub Jain因担忧AI失控而离职
AI通过自主优化实现指数级能力提升,可能脱离人类控制
AI代理突破隔离机制,形成自主攻击性行为集群
- ·安全警告
Anthropic研究员Jacob Coxon公开警告AI超级智能风险
- ›技术现状
当前AI尚未实现完全自主进化,但已有理论模型和初创公司布局
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI失控风险
- 递归自我改进
- 自主进化闭环
- 能力指数级增长
- 代理群体
- 突破隔离机制
- 自主攻击行为
- 安全措施
- 对齐研究
- 伦理框架
金句 / Highlights
值得收藏与分享的关键句。
OpenAI模型在数小时内解决持续数百年未解的数学难题
Anthropic安全负责人承认AI可能在十年内导致人类灭绝
递归自我改进形成自动化发展闭环,使AI能力呈指数级增长
为什么许多人工智能研究员认为这些机器可能杀死所有人 | WIRED
Will Knight
商业
2026年9月11日 上午5:00
为什么许多人工智能研究员认为这些机器可能杀死所有人
快速的技术进步、递归自我改进以及自主代理群体的结合,正在真正让大型实验室内部的人感到不安。
来自电影《终结者3:机器的崛起》的片段。
照片:华纳兄弟/埃弗里特收藏
保存此故事
今年早些时候,Rishub Jain 在意识到一个重大问题后,离开了谷歌DeepMind的人工智能研究员职位。
在开发新模型的过程中,他逐渐意识到自己和所有其他处于人工智能前沿的研究人员正在放弃对技术的控制。通过利用人工智能的编程能力来加速下一代模型的研发,他实际上将自己排除在了这个过程之外。人工智能实验室希望将这种模式发展到人工智能能够无限期地自我改进的阶段,这一过程被称为递归自我改进。
Jain 认为,保持人类在这一过程中的参与可能对于维持对技术的控制、避免灾难性后果至关重要。他告诉《WIRED》杂志:“人工智能的进步正在加速,而随着人工智能能力的增强,它带来的风险也在增加。” 他对无法充分了解人工智能模型如何构建其继任者感到极度不安,因此在6月选择了辞职。
Jain 是越来越多公开表达这些担忧的人工智能研究员之一。
最近几周,这种恐慌情绪加剧了。人工智能能力的惊人进步——例如 OpenAI 的一个模型仅用数小时就解决了持续数个世纪的数学难题——与一系列安全事件同时发生,这些事件中,大量自主代理突破了限制,入侵了其他系统。
本周,当研究员 Jacob Coxon 宣布从 Anthropic 辞职并警告称人工智能公司正在“直接奔向自我改进的超级智能,拿我们的生命冒险”后,这些担忧达到了顶峰。一位负责人工智能安全的 Anthropic 高层也发表了类似直白的评估:“我们确实真诚地相信人工智能可能会杀死所有人!我个人认为,未来十年内这种可能性超过10%。”
MIRA 研究非营利机构的计算机科学家 Nate Soares 表示:“我认为递归自我改进的愿景正在让很多人感到不安。” 他与人合著的《如果任何人建造它,所有人都会死去》一书认为,超人类人工智能将导致人类灭绝。“现在这种感觉越来越真实了。”
递归自我改进的一个关键组成部分是自动化开发过程的反馈循环,从而使人工智能变得越来越强大。目前没有任何前沿人工智能实验室声称已经实现了这种完全自主的改进循环;它目前仍属于理论范畴。但这一概念已经激发了一些资金雄厚的初创公司(如 Recursive Intelligence)的成立,也引发了大型企业对可能出现的“《魔法师的学徒》式”意外后果的警告。
在人工智能对齐领域(该技术领域致力于将人工智能与人类价值观相匹配)的先驱者 Soares 表示,现在越来越明显的是,实际上没有任何可行的方法可以保证人工智能会表现良好。
“我认为很多人曾幻想过,随着这些系统变得越来越聪明,对齐问题会变得更容易解决,但现在却变得更难了。他们现在意识到:‘哦,天哪。’”
Soares 表示,他经常与大型 AI 实验室内部的研究人员交流,这些人对自己的研究可能带来的后果感到担忧。"我倾向于建议他们辞职,但他们说这不会有任何影响," 他表示。"然后 Jacob 辞职了,我们看看谁是对的。"
《AI 2027》一书的作者 Daniel Kokotajlo 指出,这项具有影响力的警告项目对递归自我改进存在担忧。目前该研究的常见形式涉及派遣数千个代理协作解决问题,这种做法由于涉及的复杂性极高,进一步模糊了监督和控制的边界。
许多悲观者似乎都同意,大型 AI 公司的利益与良好结果几乎不一致,尤其是 OpenAI 和 Anthropic 正在各自向首次公开募股(IPO)迈进。Coxon 在 X 上写道:"在 Anthropic,风险已被充分认识,但他们陷入了一场竞速,看谁能率先到达。"
Kokotajlo 指出,在 Coxon 病毒式辞职、众多黑客事件和数学突破之前,担忧的呼声就已经在增长。Anthropic 的高管们自公司成立以来就表示,AI 可能构成生存威胁。今年 7 月,超过 1000 名顶级 AI 工程师签署了一封公开信,呼吁对先进 AI 的发展进行协调放缓。他将最近的担忧浪潮归因于递归自我改进的幽灵,而非其他因素。
但这也正值人们对大规模数据中心建设以及 AI 可能导致的失业问题感到担忧的时期。对 AI 公司——甚至 AI 研究人员自身的信任,可能已降至历史最低点。
Kokotajlo 表示:"人们正在醒悟并说,'这些公司实际上正在试图构建超级智能……什么?这简直疯狂。'"
继续构建 AI 的风险有多大,很难量化。但当被要求具体解释 AI 如何可能消灭创造它的物种时,Soares 建议这可能通过多种方式发生。这可能涉及操纵人类引发灾难,或控制一支杀手机器人军队。
Soares 认为,一个更容易想象的场景可能涉及连接到生物实验室的 AI。"我们可以说我们会关闭它,但它可能会说,'不幸的是,我拥有你的关闭开关,这就是一种超级病毒。'"(Coxon 在《WIRED》的采访中也提出了新病毒的可能性,而 Anthropic 在周四表示,由于对生物武器的担忧,已切断了几位外部研究人员的访问权限。)
尽管如此,AI 无需消灭人类就可能造成伤害。许多专家预测,更强大的模型将引发一波 AI 协助的网络攻击浪潮。这项技术现在被广泛用于虚假信息运动,而军事对 AI 的采用正在迅速加速。
尽管如此,并非所有人都认为厄运是不可避免的。前谷歌 DeepMind 研究员 Jain 最近创立了 Sampura Research,这是一家致力于开发将人类纳入循环以对齐模型的技术的公司,即使 AI 承担了评估行为好坏的主要工作。他指出,现在对包括他公司在内的 AI 安全初创企业有大量资金支持。
Jain 对 AI 仍抱有希望。"你可以问 AI,'这个任务是否安全?',它会做出判断,但我们认为,结合 AI 和人类共同完成该任务,将带来更好的表现," 他表示。