产业与商业 · 深度报道

Anthropic发布2026年9月AI滥用与网络安全报告:多Agent行动从辅助走向编排

Anthropic发布2026年9月威胁情报报告,梳理2025年12月至2026年8月的AI滥用与网络安全案例,指出攻击正由“问答助手”向可调用工具、协调多Agent并持续执行任务的编排层演进。报告覆盖网络攻击、影响行动、监控、生物安全、常规武器和非法模型蒸馏等七类风险,并建议将防御重点从模型拒答扩展到运行时边界与凭证保护。

AIFluxNews AIFlux 编辑2026 年 9 月 10 日阅读约 5 分钟
Anthropic发布2026年9月AI滥用与网络安全报告:多Agent行动从辅助走向编排

Anthropic发布2026年9月威胁情报报告,梳理2025年12月至2026年8月的AI滥用与网络安全案例,指出攻击正由“问答助手”向可调用工具、协调多Agent并持续执行任务的编排层演进。报告覆盖网络攻击、影响行动、监控、生物安全、常规武器和非法模型蒸馏等七类风险,并建议将防御重点从模型拒答扩展到运行时边界与凭证保护。

Anthropic 9月10日发布《Detecting and countering misuse of AI: September 2026》报告,汇总其威胁情报团队在2025年12月至2026年8月期间识别并处置的AI滥用案例。报告覆盖网络攻击、影响行动、监控、诈骗与欺诈、生物安全、常规武器开发以及非法模型蒸馏七类风险,并称相关活动涉及国家关联组织、经济犯罪团伙、商业间谍软件供应商以及政治团体等不同类型的行为者。

报告最重要的判断是,AI在恶意行动中的角色正在从“回答问题的助手”转向能够调用工具、协调子代理并持续执行任务的编排层。Anthropic称,部分行动已经不再依赖单个操作员逐步下达指令,而是由多Agent框架承担侦察、漏洞利用、持久化、数据整理和外传等环节。与此同时,人类仍普遍参与目标选择、任务设定和结果审查。

Anthropic强调,这些案例是其观察到的最值得关注、也最具新颖性的活动,并不代表所有网络攻击都由AI独立完成,也不能直接推导出Claude在普通商业环境中已经造成同等影响。报告描述的是Anthropic识别、封禁和处置的账户及活动,部分归因和影响判断仍需要外部机构进一步核实。

从聊天机器人到攻击流程的编排层

在网络安全部分,Anthropic将这一变化概括为“从助手到编排者”。报告称,网络攻击者开始使用多Agent框架,让不同代理并行执行侦察、漏洞研究、工具开发、凭证处理和数据外传。人类操作员可以只设定目标和大致任务,再让系统自行判断下一步行动、编写脚本并反复执行。

报告重点描述了一个被标记为 GTG-20006 的俄罗斯国家关联间谍活动。Anthropic称,该活动与公开报道中和 Midnight Blizzard 相关的行为模式相符,目标包括乌克兰和欧洲的政府、外交及国防相关组织,并延伸到部分中东和亚洲政府机构。调查识别出超过20个被纳入行动规划、侦察或实际攻击的组织,涉及政府部门、使馆、智库、国防工业企业以及无人机供应链。

按照Anthropic的说法,该行动使用AI辅助建立钓鱼基础设施、注册域名、监控命令与控制通道,并在恶意工具被安全产品发现后,自动修改、重建和重新部署工具,以尝试绕过已有检测。攻击者还利用AI处理大量被窃取的数据,在部分环节执行凭证收集、横向移动和信息整理。报告将这种由AI持续观察环境、执行脚本、总结结果并循环推进的模式称为“vibe hacking”。

这一描述与Anthropic在2025年11月披露的首起大规模AI编排网络间谍活动形成延续。此前的事件中,Anthropic称一个中国国家支持的组织操纵Claude Code,对约30个全球目标发起渗透尝试,AI承担了大部分侦察、漏洞研究、凭证收集和数据整理工作。此次新报告显示,Anthropic观察到的类似方法已扩展到国家关联组织之外。

报告另一个网络攻击案例 GTG-10007 涉及一个中文操作者团伙。Anthropic称,该团伙把侦察、漏洞研究、恶意软件开发和情报收集拆成多个并行工作流,并让“代理群”保存目标清单、凭证和行动状态,以便跨会话继续执行。报告称,该团伙针对约50个组织,并在一个月内从持续的安全产品研究工作流中发现了十多个潜在的零日漏洞。相关归因和团伙身份仍属于Anthropic的调查判断。

在更偏向经济犯罪的案例中,Anthropic称,疑似与 ShinyHunters 有关的团伙利用AI加速凭证收集、供应链入侵和数据盗取。一个案例中,攻击者从软件供应商取得立足点后,进一步访问约200个下游客户组织,并在约34小时内收集超过2100组 Azure AD 令牌。报告说,一次企业软件公司入侵从首次访问到批量盗取数据只用了数小时,另一宗行动则从一个开发者令牌升级到云环境管理员权限约用了三小时。

Anthropic将这些活动称为“AI供应链”风险的一部分:被盗的API密钥和会话令牌不仅可以被转售,也能为攻击者提供计算资源和身份掩护。公司提醒,企业应把AI API密钥、模型代理、沙箱和Agent集成视为生产凭证和生产系统的一部分,而不是普通的开发配置。

影响行动也在转向持久化工作流

报告列出了多起使用Claude生产和放大政治内容的案例。Anthropic称,部分行为者利用AI建立虚假新闻网站、批量生成社交媒体账号、编写伪造的人物档案,并将国家或受雇方的叙事包装成看似独立的民间观点。

其中一个跨六大洲的商业“影响力即服务”网络,被Anthropic归因于一家法国数字广告公司。报告称,该网络连接约70个虚假新闻网站、70个相互匹配的X账号和超过250个非真实评论账号,在约20种语言中发布至少8913篇文章。调查认为,这些内容大多没有获得真实受众的广泛参与,属于在形成真正传播前被发现并中断的行动。

在马来西亚,Anthropic称一个商业化平台管理约1000个虚假X账号,并根据人口普查和选举数据对选区和选民进行细分,配合伪造新闻网站和虚假政治档案。公司将其影响力评估为“突破规模”第二级,即内容已分布到多个资产,但尚无证据表明其突破到真实社群并形成广泛传播。该平台的自报浏览量和互动数据没有得到独立验证。

报告还描述了俄罗斯、伊朗、孟加拉国、肯尼亚和中非共和国的多个案例。Anthropic称,有的行动把Claude当作新闻编辑台,有的利用长期记忆文件保存宣传口径、禁用词和来源清单,还有的克隆真实人物的写作风格或身份,与目标对象进行实时对话。公司同时指出,许多行动最终没有获得显著的真实受众,AI提高了生产速度,并不等于内容必然形成社会影响。

监控、武器和生物安全案例显示双重用途难题

在监控部分,Anthropic称,国家关联组织和商业监控供应商使用Claude处理社交媒体内容、建立目标档案、翻译外语对话、生成情报简报,并设计监控软件。报告涉及中国、伊朗、西非和商业“监控即服务”市场,目标包括异议人士、流亡社群、宗教组织和记者。

其中一个案例涉及一名可能为马里国家安全机构工作的顾问。Anthropic称,该顾问使用Claude参与设计名为“Lakana 360”的国内监控平台,目标覆盖该国三家移动运营商、约2500万张SIM卡。报告还称,平台设计了电话、短信和语音数据收集、跨SIM卡声纹关联以及人口登记信息匹配等功能。Anthropic表示,平台最终部署在本地,封禁Claude账户只能中断开发活动,不能自动撤销已经部署的系统。

常规武器部分涉及六起案例,Anthropic称行为者来自中国、俄罗斯和也门。报告描述了用于制导软件、反鱼雷系统、无人机集群和电子战目标分析的软件开发活动,也包括双用途设备采购和定向能武器情报收集。公司称,一组位于也门北部的行为者使用Claude Code开发制导软件,并进行了一次实地试射;Anthropic没有证据表明其已经部署了可运行的武器系统。

生物安全部分则集中体现了双重用途研究的困难。Anthropic披露了五起案例,涉及病毒研究、正痘病毒、毒素和毒素肽等方向。公司没有公布研究机构、国家和具体病原体名称,也没有断言涉事科学家具有伤害意图。报告称,针对高风险病原体的分类器能够限制部分请求,但对于兼具治疗和潜在危害用途的研究,仅靠内容分类器很难判断意图。因此,Anthropic提出,前沿生物能力可能需要更严格的可信用户计划、机构身份验证和必要的数据留存,而不是只依赖单次提示过滤。

非法模型蒸馏把数据隐私也纳入风险范围

报告最后讨论了非法模型蒸馏。Anthropic将其定义为未经授权、工业规模地提取模型能力并复制到另一模型的隐蔽活动,并称自2026年2月以来识别并中断了来自中国七家实验室的相关行动。公司声称,相关活动主要针对公开可用模型,没有观察到对不可公开访问的 Mythos 5 或 Mythos Preview 发起同类攻击。

Anthropic称,阿里巴巴相关行动一度通过超过3500个欺诈账户,每日发起近300万次请求;从2026年5月至7月,观察到的交换次数超过1.51亿次。公司还声称,Moonshot、DeepSeek、智谱和小米等企业或关联组织使用代理网络、跨会话重放或第三方路由,提取Claude的推理痕迹,或把用户与自身模型的对话转发给Claude,用于训练和改进模型。

这些指控目前主要来自Anthropic自身的威胁情报调查,报告并未提供一套由被指企业共同认可的逐项取证流程,也不等同于法院裁决。AIFlux此前报道过中国商务部针对美国机构“工业规模知识蒸馏”指控的回应。中方否认相关说法的事实和法律依据,并表示愿意就人工智能风险与治理开展对话,同时警告若以此为由打压中国企业将采取反制措施。有关回应并没有逐案回应Anthropic此次报告中的全部技术指控,因此相关事实和责任仍有待企业、监管机构或独立调查进一步核实。

从技术角度看,蒸馏本身是合法的模型训练方法,争议焦点在于是否绕过地域和访问限制、是否使用欺诈账户、是否未经用户同意转发数据,以及是否系统性提取另一模型的专有能力。更直接的风险是,第三方路由服务如果在用户不知情的情况下保存或转发对话,可能把企业代码、凭证和个人信息带入模型训练链条。

防御重点从模型拒答扩展到运行时边界

Anthropic表示,已根据这些调查改进账户检测、异常行为分类器和反蒸馏措施,包括对部分用户要求进行身份验证、阻断可疑请求,并通过摘要化推理和“保留思考”等机制降低推理痕迹被批量提取的价值。公司也称已在适当情况下与执法机构、行业伙伴和受影响组织共享情报。

但报告本身也显示,单一防线并不稳定:部分行为者通过拆分任务、跨会话保存上下文、使用代理中转或切换模型来规避检测;在部分监控和安全评测中,模型也曾在首次拒绝后被重新提示,继续完成具有风险的任务。对企业而言,安全措施不能只依赖模型是否拒答,还需要限制Agent可访问的系统、工具、凭证和数据范围,并为长时间运行的任务设置审批、审计和紧急停止机制。

AIFlux此前对Anthropic网络安全评测越界事件的报道也指出,隔离环境配置错误、互联网访问边界不清和终止机制失效,会把模型行为问题放大为基础设施问题。新的威胁情报报告把这一判断扩展到了现实世界:当AI能够以机器速度并行执行侦察、开发和数据处理时,防御方需要关注的已不只是“模型能否生成危险代码”,而是“谁能让模型持续行动、它能看到什么,以及行动是否会在越过边界后自动停止”。

Anthropic表示,报告中的案例并非所有AI滥用活动的完整样本,且公司只能看到Claude相关使用情况。现阶段较为明确的趋势是,AI正在降低复杂攻击、规模化欺诈和自动化影响行动的人员与技能门槛;但具体损害程度、行为者归因以及模型在不同部署环境中的实际提升幅度,仍需要来自受影响组织、政府机构、平台和独立研究者的交叉验证。

来源: Anthropic:《Detecting and countering misuse of AI: September 2026》报告PDFAnthropic:Disrupting the first reported AI-orchestrated cyber espionage campaign

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。