Anthropic News

Improving Fable 5's biology safeguards

8.5内容质量
Improving Fable 5's biology safeguards

TL;DR · AI 摘要

Anthropic通过更新Fable 5的生物学安全机制,使生物学相关误报减少85%,但专业领域仍需依赖Opus 5模型。

核心要点

  • Fable 5生物学误报减少85%,提升日常任务支持
  • 病毒学等专业领域仍需依赖Opus 5模型
  • 安全措施防止AI被用于生物武器开发

结构提纲

按章节快速跳转。

  1. 介绍Fable 5生物学安全机制更新的核心目标与成果。

  2. 测试显示生物学相关fallback减少约85%。

  3. Fable 5现可支持更多日常生物学任务。

  4. 双用途研究领域仍需依赖Opus 5模型。

  5. 需防范AI被用于生物武器开发的风险。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Fable 5生物学安全措施
    • 核心机制
      • 误报率降低85%
      • 分类器改进
    • 风险管理
      • 双用途限制
      • 恶意使用防范
    • 应用现状
      • 日常任务支持
      • 专业研究依赖Opus 5

金句 / Highlights

值得收藏与分享的关键句。

#AI安全#模型更新#生物学应用#Anthropic
打开原文

改进 Fable 5 的生物学安全措施 | Anthropic

产品

公告

改进 Fable 5 的生物学安全措施

2026 年 8 月 7 日

我们正在对 Claude Fable 5 的生物学安全措施进行更新,以大幅减少误报。Fable 5 用户现在将经历更少的“降级”(fallbacks)——当用户提出与生物学相关的问题后,系统会切换到能力较低的模型。在我们的测试中,此次更新使各产品界面上与生物学相关的降级减少了约 85%。1

因此,Fable 5 将能够协助更广泛的生物学任务。

在实际使用中,用户在日常健康和教育问题上将看到更少的降级——例如解读实验室结果、理解症状以及在教育背景下学习生物学。医疗专业人员将能够从 Fable 5 获得更多临床任务的支持。

我们认为 AI 对世界产生积极影响的最大机会在于生物学和医学,我们正在大力投资,以负责任的方式为生物学家提供前沿访问权限。目前,Fable 在涉及双重用途的请求(包括病毒学、毒理学和分子设计)时仍会降级到 Opus 5,因此尚未适用于专业生物学研究和药物开发。我们致力于通过可信的访问途径,弥合这一差距,为前沿生物学能力提供支持。

为何建立强大的生物学安全措施

我们的目标是尽快将 Fable 5 的前沿能力提供给尽可能多的用户。然而,要做到这一点,我们需要管理这些强大模型带来的日益增加的风险。其中一种风险出现在生物学领域:Fable 5 现在在某些高度复杂的生物学任务上可以超越专家,并在其他任务上提供操作支持。这意味着它能够为开发新医疗治疗的研究人员提供真正的帮助(这也是我们希望通过分类器改进和可信访问计划扩大模型访问权限的初衷)。但若落入错误之手,这些能力可能被恶意行为者利用,例如开发生物武器。我们的能力评估表明,Fable 5 可以为此类行为者带来显著提升——即提供他们其他地方无法获得的能力。

在生物学中区分 AI 的有益和有害用途往往很困难。例如,某些情况下,研究某种疾病的治疗方法需要科学家首先制造导致该疾病的危险化合物。这一点在活疫苗中最为明显,因为科学家需要培养他们试图预防的相同病原体。一些药物也是如此。为了开发治疗高血压的药物卡托普利,科学家从蛇毒中分离出了会导致人类血压骤降的有毒成分。随着 AI 前沿的生物学能力不断发展,我们需要谨慎确保这些能力带来的新风险不会在潜在科学利益之前显现。

希望利用我们的模型造成危害的复杂行为者知道如何利用这种模糊性来掩盖其意图,使危险任务看起来像普通的研究追求。美国情报界2026年年度威胁评估明确指出,这类行为者确实存在,且生物技术的进步(包括合成生物学和基因组编辑)“可能导致新型生物威胁”。该评估指出,多个国家行为者很可能维持着活跃的进攻性生物和化学武器计划——这些计划可能因获得前沿AI模型的原始能力而加速。

出于对我们关注的这些“双重用途能力”(既能用于有益目的也能用于有害目的,且两者之间的界限并不总是容易划分)的担忧,我们有意将Fable 5的生物学查询几乎全部封锁。这使我们能够将该模型提供给其他领域的用户使用。我们知道这会对合法的生物学用户造成困扰:短期内会导致大量误判,即用户提出与生物学相关的问题时,请求会被封锁并转至能力较弱的模型。尽管如此,我们仍选择做出这种权衡,因为Fable在像生物学这样的双重用途领域被滥用的代价可能是灾难性的。

我们的生物学防护机制如何运作

我们在生物学领域防范滥用的核心方法之一是通过安全分类器:小型的自动化AI系统,用于检测Fable 5是否被要求执行受保护的生物学任务或生成有害输出(我们之前曾撰文介绍过类似分类器在网络安全领域的应用)。

在Fable 5的案例中,当分类器触发时,模型会将用户的请求重新路由到Opus 5——一个能力不如Fable 5的模型,其生物学能力较弱,无法为恶意用户提供同样多的帮助。这就是用户在请求被封锁时看到的备用方案。

开发精确且稳健的分类器并非一项简单任务。为了使分类器能够快速且一致地运行,它必须学会区分我们定义的“在范围内”和“超出范围”的主题和查询(这些主题和查询可能带来潜在危害)。需要时间和多次迭代来调整分类器,以避免误报(分类器对超出范围的内容做出反应)和漏报(对在范围内的内容未能识别)。我们还要求分类器能够抵御绕过它们的尝试(称为越狱),这需要进一步的研究和测试。

从一个非常广泛的生物学分类器开始,使我们能够在继续完善分类器的研究过程中,仍然让我们的用户访问Fable 5。另一种选择——在安全措施取得更大进展之前延迟模型的通用访问——可能会使模型的通用访问及其潜在益处推迟数周甚至数月。

在过去几周里,我们对分类器的规则体系(由一系列帮助模型区分受保护内容和允许内容的规则组成)进行了细致的重写,特别注意详细地保留了良性用途的边界。我们向来自Anthropic内部和外部的多位专家征求了对这些修改的反馈意见。随后,我们基于这些规则体系开发了新的训练数据,重新训练了分类器,并验证了新分类器仍能对有害内容和双重用途研究生物学内容做出响应,但如今可以支持更广泛的安全且有益的用途。

如下面的图示所示,与Fable 5发布时相比,这些更新意味着分类器将对许多与生物学相关的良性请求不再触发。

我们的生物学分类器示意图。位于分类器边界左侧的内容被允许;位于右侧的内容将被保护(因此会被阻止并转至能力较弱的模型)。明显有害的内容(红色)和双重用途内容(橙色)会触发分类器并被阻止。我们设置了一个安全区域(浅绿色),其中包含极可能为良性但出于谨慎仍被阻止的内容。明显良性内容则显示为深绿色。Fable 5发布时,分类器范围非常宽泛(A),对大量请求都会触发——包括那些几乎可以确定是良性请求的内容(位于安全区域内的内容)。因此,分类器边界在图中位于左侧很远的位置。今天我们宣布的更新(B)意味着分类器现在能够允许更多良性请求,因为它在区分良性请求和双重用途查询的细微差别方面表现得更出色。因此,图中的分类器边界已向右侧移动。

结论

我们仍有许多工作要做以进一步完善安全机制。不可避免地,仍会出现误判——某些请求位于分类器的安全区域内,风险极低但分类器仍会触发。如上所述,出于潜在的双重用途风险,Fable仍将继续阻止与专业生物学和药物开发相关的双重用途查询。我们致力于通过可信访问途径,为研究人员开发一条安全且可扩展的路径,以使用我们最先进的模型。

我们希望您继续向我们提供反馈,帮助我们进一步完善安全机制。

#### 注释

1 因此,我们预计因生物学相关或其他原因触发的降级处理次数也将减少:在Claude.ai上减少约67%,在Cowork上减少55%,在Claude Code上减少17%,在Claude平台整体减少7%。

相关内容

Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic 担任首席全球事务官

Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic 担任其首位首席全球事务官。

阅读更多

我们在网络安全评估中调查了三起真实世界事件

我们对开放权重模型的立场