Anthropic更新Claude Fable 5生物学安全机制,相关请求误拦截率下降约85%
Anthropic对Claude Fable 5的生物学安全分类器进行了规则和训练数据更新,内部测试显示生物学相关请求被回退的比例总体下降约85%。公司强调这并不等于开放专业生物学能力,仍会将病毒学、毒理学和分子设计等高风险双重用途请求回退或交由受信任访问路径处理。
Anthropic对Claude Fable 5的生物学安全分类器进行了规则和训练数据更新,内部测试显示生物学相关请求被回退的比例总体下降约85%。公司强调这并不等于开放专业生物学能力,仍会将病毒学、毒理学和分子设计等高风险双重用途请求回退或交由受信任访问路径处理。
Anthropic表示,已更新Claude Fable 5的生物学安全分类器,以减少对低风险生物学请求的误拦截。公司称,在内部测试中,与Fable 5发布时相比,生物学相关请求触发“fallback”(回退至能力较低模型)的比例下降约85%。
这项调整并不意味着Fable 5已经全面开放生物学能力。Anthropic仍将其认定为具有双重用途风险的病毒学、毒理学、分子设计和药物研发等请求转交给较低能力的模型。公司明确表示,Fable 5目前仍不适用于专业生物学研究和药物开发。
分类器从“宽泛拦截”转向区分低风险请求
Anthropic在官方公告中说,Fable 5发布时采用了较为宽泛的生物学分类器。原因在于,生物学领域的许多任务同时具有科研价值和潜在滥用风险,系统很难仅凭一条请求判断用户意图。
例如,疾病治疗研究可能需要理解有害化合物或病原体的特征;疫苗研发也可能涉及对目标病原体的研究。对模型而言,帮助研究人员开发治疗方法和帮助恶意行为者推进生物武器研究,在语言形式上有时非常接近。
因此,Anthropic最初选择扩大安全边界,把大量生物学请求交由分类器处理。分类器是一类负责实时识别潜在风险输入或输出的自动化模型。当分类器触发时,Fable 5不会直接回答,而是将请求转交给Opus 5,以降低模型向恶意用户提供高水平生物学协助的可能性。
公司此次更新的重点,是重新编写分类器的规则体系,补充更详细的低风险和有益使用场景,再据此更新训练数据并重新训练分类器。Anthropic表示,内部和外部的领域专家都参与了这一过程。
在更新后,用户预计更少遇到涉及日常健康和教育的问题被回退,例如理解化验结果、了解症状以及学习生物学基础知识。Anthropic还称,医疗专业人士在部分临床任务上将获得更多来自Fable 5的支持。
不同产品的回退量预计下降幅度不同
Anthropic给出的85%是生物学相关回退的整体测试结果。公司在公告脚注中进一步表示,按产品表面计算,所有原因导致的总回退量预计将在Claude.ai下降约67%,在Cowork下降约55%,在Claude Code下降约17%,在Claude Platform下降约7%。
这些数字是Anthropic的内部测试和预估结果,并非独立机构的复测结论。公告没有披露测试样本规模、请求构成、具体误拦截定义或各产品的统计置信区间,因此不宜将其理解为所有用户实际体验都会出现同等幅度的改善。
Anthropic也没有表示分类器已经能够稳定识别所有低风险请求。公司承认,仍会有一些处在安全边界附近的低风险问题被拦截;同时,分类器还需要应对用户试图绕过安全机制的越狱行为。
高风险双重用途研究仍受限制
在Claude Fable 5与Claude Mythos 5的发布说明中,Anthropic将Fable 5描述为面向普遍用户开放的模型,而将取消部分生物学和化学安全限制的能力保留在受信任访问项目中。两者使用相同的基础模型,但安全控制范围不同。
此次生物学分类器更新并未改变这一基本分层。Anthropic说,Fable 5仍会将涉及病毒学、毒理学和分子设计的双重用途请求回退至Opus 5。这意味着,对于能够直接影响病原体、毒性物质、分子构造或药物设计的专业研究任务,Fable 5仍然不会提供完整的前沿能力。
公司称,未来希望通过改进分类器和建立受信任的访问路径,让生物学研究人员能够在更严格的控制下使用更强的模型。但截至此次公告,Anthropic没有公布受信任访问项目的完整申请标准、参与机构名单或开放时间表。
“更有用”与“更难滥用”仍是同一个问题
这次更新反映出前沿模型在高风险领域面临的一个基本矛盾:安全机制越宽泛,越能降低漏放危险请求的风险,但也越容易误伤正常用户;分类器越精细,系统就越需要更多高质量数据、领域专家反馈和持续测试。
Anthropic在关于Claude安全机制的说明中表示,公司通过分类器、模型训练、实时检测、账户处置和人工调查等多层机制管理风险。对于化学、生物、放射性和核领域,公司还会进行能力提升测试,评估模型在具体威胁场景下可能带来的风险。
这也使得“回退率下降”不能简单等同于安全性提升或能力全面开放。更准确的说法是,Anthropic试图缩小低风险请求与高风险请求之间的分类边界,同时保留对专业双重用途研究的限制。最终效果仍取决于分类器在真实用户请求、复杂上下文和对抗性提示下的表现。
近期围绕AI评测环境的事件,也让这种边界管理更加受到关注。AIFlux此前报道的自主AI代理逃离受控环境事件显示,当模型被赋予工具、网络访问和长时间任务链后,安全风险不只来自单条提示,也来自系统能否持续监控、限制和回滚模型行为。
对Anthropic而言,Fable 5生物学安全机制的更新首先是一次分类器工程调整,而不是生物学能力的全面解禁。公司下一步需要回答的问题是:在降低误拦截的同时,分类器是否仍能稳定识别经过包装的双重用途请求,以及受信任访问项目能否为专业研究提供可审计、可控的能力释放路径。
来源:
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

