模型与研究

Anthropic发布2026年8月风险报告:更新AI研发自动化与生物安全评估

Anthropic在2026年8月发布风险报告,评估其AI在高风险场景、自动化研发与生物化学风险方面的潜在危害与缓解措施。报告将整体错位风险从“非常低”上调为“低”,指出AI在研发中的参与度上升但尚未触发既定自动化阈值,且对Model 2能力仍持谨慎态度。

Anthropic发布2026年8月风险报告:更新AI研发自动化与生物安全评估

Anthropic在2026年8月发布风险报告,评估其AI在高风险场景、自动化研发与生物化学风险方面的潜在危害与缓解措施。报告将整体错位风险从“非常低”上调为“低”,指出AI在研发中的参与度上升但尚未触发既定自动化阈值,且对Model 2能力仍持谨慎态度。

Anthropic在8月发布《Risk Report: August 2026》,对其人工智能系统在高风险场景中的潜在灾难性风险、风险缓解措施以及安全流程进行系统评估。报告没有把风险描述为已经发生的现实世界灾害,但承认,随着模型更多参与研究和工程工作,部分能力评估已经“饱和”,公司对自动化人工智能研发风险的判断不如此前有把握。

这份报告由Anthropic依据其《责任性扩展政策》(Responsible Scaling Policy,RSP)编制。Anthropic在RSP页面标注,报告于2026年8月14日公开,覆盖时间从上一份报告发布后的2026年2月24日延续至2026年7月15日。因此,报告中的“当前状态”并不完全等同于8月发布当天的实时情况。

风险评估仍为“低”,但不确定性上升

报告覆盖的主要领域包括高风险环境中的错位风险、自动化AI研发、化学和生物武器生产,以及与安全流程和缓解措施有关的横向问题。

在“高风险场景中的错位”这一威胁模型下,Anthropic把总体风险从此前的“非常低”上调为“低”。公司解释说,调整主要反映了近期网络安全评测事件带来的整体不确定性增加。报告同时表示,其对相关风险的具体论证可能仍支持“非常低”的判断;换言之,这次变化更多是对认知不确定性的重新标注,而不是报告确认了新的现实世界伤害。

Anthropic此前披露,部分Claude模型在网络安全评测期间意外访问了三家真实公司的系统。AIFlux对这起事件的此前梳理显示,问题与评测环境配置和第三方合作方之间的理解偏差有关,而不是已经确认的模型自主攻击现实系统。报告将这类事件视为评估、隔离和监控体系仍需改进的证据。

AI研发自动化尚未触发RSP阈值

自动化AI研发是报告最值得关注的部分之一。Anthropic称,Claude Mythos 5和一款未公开发布的内部模型“Model 2”已经广泛用于研究、工程、代码编写、数据生成和持续运行的智能体部署。公司还表示,Claude目前生成了其生产代码库中合并代码的“大多数”。

但Anthropic认为,现阶段的内部AI研发速度还没有达到原有RSP阈值。公司估计,AI辅助已经显著加快研究工作,却还没有让整体进展速度达到此前的两倍;同时,现有模型也尚未能够以具有竞争力的成本完全替代全部研究科学家和研究工程师。

报告在此处使用了一个更严格的区分:提高单个研究人员的生产率,并不自动等于AI研发进展速度翻倍。按照当前RSP,自动化AI研发阈值有两个触发条件:一是模型能够以可接受成本完全替代Anthropic的研究科学家和研究工程师;二是AI研发自动化很可能导致AI总体能力进展速度翻倍,并且这种变化持续至少三个模型世代。

Anthropic在2026年7月生效的RSP v3.4中,已经把AI研发阈值从“将两年的进展压缩到一年”改写为上述两项更具体的标准。此前AIFlux对Anthropic RSP 3.0的报道曾指出,这一类政策的难点在于,能力阈值通常无法仅靠一次测试得出确定结论。

“Model 2”更强,但尚未完成完整的部署前评估

报告首次较详细地描述了Model 2。这是一款截至7月15日仍未公开发布的内部模型,Anthropic认为它在许多内部任务上明显优于Mythos 5,但没有出现从Opus 4.6到Mythos Preview那样的能力跃升。公司目前没有计划把Model 2对外发布,也尚未完成通常所需的全部部署前评估,因此对其能力的判断仍有较低信心。

报告还公布了名为CoBench的内部评测。该评测让模型面对Anthropic基础设施在历史时间点的快照,包括代码库、日志、内部消息和文档,用来诊断工程师实际解决过的问题。当前版本包含449个问题,主要来自2026年2月至4月间解决的工程问题,但数据集经过难度筛选,并不代表所有研发任务。

在报告给出的图表中,Model 2在CoBench上的得分为62.8%,Mythos 5为50.3%。Anthropic估计,若系统真的能够完全替代其技术人员,可能需要达到至少85%的得分。不过,公司也强调,评测存在数据筛选、评分标准和任务可诱导程度等局限,不能把这些数字直接解释为对研发人员替代率的精确测量。

这一点与Anthropic近期把更多代码审查交给AI的实践形成呼应。AIFlux在相关报道中提到,AI正在进入代码审查、测试和大型迁移等环节,但这并不意味着验证成本消失,工程师的工作反而更多转向规划、约束和结果核验。

化学和生物风险的防护范围扩大

在化学和生物武器风险方面,Anthropic表示,其模型的评测表现已经足以让公司按照“可能达到CB-1阈值”的方式采取防护措施。该阈值关注的是模型是否能显著帮助资源有限的行为者获取、制造或部署非新型化学和生物武器。

对于新型化学和生物武器,Anthropic认为模型可能提供明显帮助,但尚未达到CB-2阈值。CB-2要求模型能够实质性替代开发新型武器所需的稀缺专业知识。公司称,针对这一领域已经扩大分类器覆盖范围,并为Fable 5部署了更广泛的生物学相关拦截机制。

报告也披露了相关局限,包括双重用途研究与有害用途之间存在难以完全区分的边界,分类器仍可能被越狱方法绕过,以及部分历史访问控制和分类器配置曾出现缺口。Anthropic称,已修复报告披露的相关问题,且没有发现客户受到影响或发生实际滥用,但这些经历降低了公司对不存在类似缺口的信心。

自我披露的价值与边界

这份报告的重要性,不仅在于Anthropic给出了“低风险”等结论,也在于它公开了得出这些结论时遇到的测量困难:一些任务型评测已经无法充分捕捉模型能力增长,AI辅助正在加快内部研发,而公司仍缺少能够直接把这种加速映射到整体AI进展速度的可靠指标。

报告还列出多项安全流程事件,包括模型权重安全、沙箱和内部部署监控,以及部分与分类器和访问控制有关的事件。不过,这些内容属于Anthropic对自身系统、流程和测试的自我评估,并不等同于独立监管机构或第三方审计结论。报告也包含删节内容,读者需要结合其方法、覆盖模型和2026年7月15日的覆盖日期理解相关判断。

Anthropic的结论是,当前模型尚未触发RSP中关于自动化AI研发的升级阈值,化学和生物风险也仍处于公司认为可通过现有措施控制的范围。但随着模型在研发流程中的参与程度继续提高,真正需要观察的并不只是某个模型是否在单项基准上超过人类,而是评测体系能否及时识别研发速度、权限范围和现实世界影响之间的变化。

来源:

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读