Our position on open-weights models
TL;DR · AI 摘要
Anthropic明确反对禁用开放权重模型,但担忧其可能被用于军事和镇压,主张通过安全评估和国际合作应对风险。
核心要点
- 开放权重模型可能被独裁政权用于军事优势,威胁美国国家安全。
- 禁用美国企业使用中国模型无法解决AI对齐风险,因为恶意行为者多为非合规企业。
- Anthropic支持安全评估、限制高风险模型发布和加强国际合作三项措施。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 开放权重模型的立场与风险
- 核心立场
- 反对禁令,支持公共价值
- 主要风险
- 军事威胁
- 独裁政权获取优势
- 安全漏洞
- 难以监管和撤回
- 应对措施
- 安全评估
- 限制高风险模型
- 国际合作
金句 / Highlights
值得收藏与分享的关键句。
美国政府担忧独裁政权通过AI实现军事优势,中国模型可能被用于无人机和监控。
禁用美国企业使用中国模型无法解决对齐风险,因为恶意行为者多为非合规企业。
Anthropic主张通过安全评估和国际合作应对AI风险,而非简单禁令。
我们对开放权重模型的立场 \ Anthropic
公告
我们对开放权重模型的立场
2026年7月27日
Dario Amodei(Anthropic首席执行官)的帖子
过去几天,围绕开放权重模型的讨论持续升温,尤其是来自中国的模型。据报道,一些美国官员正在考虑禁止美国公司使用中国开放权重模型。对此,多家科技公司已联署公开信支持开放权重模型,甚至有人指责Anthropic试图通过禁止开放权重模型来保护自身业务。任何阅读过我过往文章的人都应清楚,我从未认为此类禁令是有效的措施,但为了消除疑虑,我将明确表态:Anthropic从未主张禁止开放权重模型。
不具有危险能力的开放权重模型是一种公共产品:除了运行所需的计算资源外,它们不会产生其他成本,同时为商业机构、开发者和研究人员创造价值。
保护主义禁令无法解决我最严重的国家安全关切。具体而言,我最担忧以下两种噩梦般的场景。我在六个月前的论文《技术的青春期》中已详细阐述过这些担忧,多年来始终持此立场:
- 我的主要担忧是威权政府(不仅是中华人民共和国共产党(CCP),尽管CCP显然是最危险的威胁)开发出比美国更强大的AI模型,并利用它们实现永久军事优势或对本国人民实施深度镇压。这一担忧在美国政府内部广泛存在:去年在巴黎,副总统Vance警告称"威权政权已盗用并使用AI强化其军事、情报和监控能力",而情报机构2026年度威胁评估报告指出"其他全球大国在AI领域的强劲进展正在挑战美国的经济竞争力和国家安全优势"。这些模型是否以开放权重形式发布无关紧要,更不用说是否被美国企业使用。事实上,最危险的模型可能是秘密训练后仅提供给人民解放军用于无人机,或提供给国家安全部用于监控和镇压的模型。
- 我的次要担忧是强大AI模型可能被滥用于实施网络攻击或生物攻击,并可能产生严重的对齐问题。开放权重模型(无论来自中国还是其他地区)相比封闭模型确实存在更高风险,因为很难为其设置防护措施或监控使用情况,且一旦公开权重就无法撤回。但禁止美国企业使用这些模型无法解决这一风险,因为恶意行为者通常不会是合法的美国企业。这虽然能保护美国AI公司免受竞争,但这从来不是我的目标。
为应对这些担忧,我支持以下三项措施,这也是我和Anthropic一直倡导的:
- 我们不应向中国出售高性能芯片或芯片制造设备,并应严厉打击猖獗的走私行为及规避手段。中国本土的芯片生产能力有限,因此由于扩展定律的限制,若没有美国芯片,就无法构建比美国更强大的模型。这是阻止威胁#1最高效直接的方式,同时通过阻碍超出美国法律监管范围的模型训练,也能间接应对威胁#2。
- 我们应严厉打击工业级蒸馏操作。与从零开始训练模型相比,蒸馏是一种计算效率更高的过程。它使中国能够构建远超其芯片数量通常所能实现的更优模型,从而部分规避芯片禁令。蒸馏无法让中国获得与美国相当或更优的人工智能能力,但可以使中国的技术前沿缩短至与美国仅相差数月。确实,许多从事这些操作的公司会发布开放权重模型——但开放权重的重要性远不如这些操作背后由寻求超越美国前沿的威权国家支持这一事实。我们应通过政策干预来遏制此类行为。对开放权重模型实施全面禁令既不是正确的解决方案,也不是我们所呼吁的措施。
- 所有足够强大的模型(无论是否开放),都应接受强制性的安全测试。应对威胁#2的最佳方式是在发布前直接对模型进行网络、生物和对齐风险测试。我认为这个想法实际上接近共识:我既对特朗普政府最近几个月在这一方向上的举措感到鼓舞,也对近期行业提出的提案感到欣慰,这些提案将对最强大的模型(无论其来源国或是否开放)实施此类测试(同时完全豁免能力较弱的模型,如初创公司和学术机构的模型)。无论开放模型是否带来更高的风险,以及这种风险是否可以缓解,都应通过测试来验证,而不是提前决定——并且可能有改进开放权重模型安全性的有效方法,包括AE Studio和Anthropic最近关于模块化训练策略的研究。请注意,要使测试有效,必须具有全球性,这意味着甚至中国共产党也需要参与其中。我认为这可能实际上可行:正如我在《技术的青春期》中所写,由于防止AI生物武器也符合中国的利益,围绕这一领域的有限合作可能是可能的。
这让我想到了那封公开信。我同意信中提出的许多观点:开放权重可以扩大对AI经济的准入,至少在某些应用场景中能增强竞争,同时赋予客户更大的控制权。关于蒸馏技术的担忧应通过有针对性的法律和商业框架来解决——这与我之前提到的措施一致。但我并不认同信中提出的观点,即开放权重模型必然更容易开发安全措施,或广泛的能力访问对防御者而言一定比攻击者更有利。在我看来,情况可能恰恰相反。例如,我担心生物学领域会出现强大的攻击者-防御者不对称性,足够强大的模型可能能够利用广泛可得的材料迅速武器化具有大流行级别危害的病毒,而对这些生物制剂的防御在最佳情况下也是一项需要数年的运营任务(正如我们在“ Warp Speed行动”中所看到的)。这类问题应通过严格的发布前测试进行实证回答,而不是提前假设。
总结我和Anthropic的立场:我们从未主张、现在也不主张对开放权重模型这一类别实施禁令。我们应将重点放在防止强大芯片落入专制政权手中、阻止工业级蒸馏,以及要求所有足够强大的模型(无论是否开放)进行安全测试。
*编辑于7月28日:更新说明,指出所引用的关于模块化训练策略的研究是Anthropic与AE Studio合作完成的。
#### 脚注
- 有关滥用权力的讨论和生物风险的讨论,分别参见该文章的第3节和第2节。
- 参见英国人工智能安全研究所的这份报告,特别是其中提到:“支撑这些优势的开放性也排除了许多封闭模型开发者可以使用的安全措施,例如检测和干扰滥用行为、随着漏洞的出现迭代安全措施、控制用户访问并撤下模型。一旦开放权重模型被发布,这些选择将永久丧失:安全措施可能被移除,模型副本可以被下载、重新分发并在私人系统上运行,超出监控范围。对于具有危险能力的模型(包括高度网络能力的模型),开放权重的发布因此会带来持续且不可逆的滥用风险。”
- 参见此处、此处和此处,了解美国司法部的更多报告。
- 在Anthropic,我们致力于通过自身实践打击工业级蒸馏,包括识别并封禁以这种方式使用我们模型的账户。这具有挑战性——例如,相关账户通常只有在大量蒸馏发生后才能被识别,而蒸馏通常涉及创建大量虚假账户,形成移动目标。任何单个公司的实践都无法完全解决这个问题,这就是我们呼吁对此问题制定政策的原因。
- 如需更详细地了解生物威胁和攻防平衡,请参见《技术的青春期》第 2 章。简而言之,我认为目前在生物学领域保障我们安全的关键因素并非“防御者”或材料的可获得性,而是智力能力与造成灾难性伤害意愿之间的负相关关系。此前的互联网搜索甚至 DNA 合成等技术远未强大到足以打破这种关联,但我担心以当前的发展速度,人工智能很快就会做到这一点。另一种说法是,足够强大的技术会消除所有障碍,暴露出攻击者或防御者是否存在固有的结构性优势,而我担心在生物学领域,这种优势属于攻击者。
相关内容
在我们的网络安全评估中调查三个真实事件
阅读更多
Cognizant 与 Anthropic 扩大合作,将 Claude 带给企业客户
介绍 Claude Opus 5
Opus 5 是 Opus 系列的一次重大改进,它在支持长期代理程序的同时,在编程和专业工作方面也带来了提升。