Guidelight 评估显示多家 AI 公司安全控制仅勉强及格
非营利组织 Guidelight 对 Anthropic、OpenAI、Google、xAI 和 Meta 的内部 AI 控制措施进行评估,结果显示五家公司在记录、监控、拦截和遏制等关键控制上大多仅为“部分实施”,没有一项实践得分超过“实质性部分实施”。评估基于公开材料,强调关注的是企业能否控制模型行为而非模型能力本身,指出预防和遏制环节尤为薄弱,需将控制措施嵌入开发流程并加强第三方审查与实时拦截能力。
非营利组织 Guidelight 对 Anthropic、OpenAI、Google、xAI 和 Meta 的内部 AI 控制措施进行评估,结果显示五家公司在记录、监控、拦截和遏制等关键控制上大多仅为“部分实施”,没有一项实践得分超过“实质性部分实施”。评估基于公开材料,强调关注的是企业能否控制模型行为而非模型能力本身,指出预防和遏制环节尤为薄弱,需将控制措施嵌入开发流程并加强第三方审查与实时拦截能力。
路透社8月19日报道,非营利组织 Guidelight AI Standards 对 Anthropic、OpenAI、Google、xAI 和 Meta 的内部 AI 控制措施进行评估。结果显示,五家公司在模型监控、风险行动拦截、紧急中断、第三方审查和失控后的遏制准备等方面,整体仍停留在“部分实施”阶段。
在 Guidelight 的评级中,Anthropic 和 OpenAI 均获 C+,是五家公司中最高的等级;Google 获 D+,xAI 获 D-,Meta 则获 F。该评估依据的是各家公司公开发布的系统卡、安全框架、风险报告、博客文章以及第三方合作说明,并非监管机构进行的认证,也不等同于对模型能力本身的独立安全测试。
评估关注的是“能否控制模型”,而不是模型有多强
Guidelight 这次评估采用其 2026 年5月发布的 Control 标准,重点考察六项基础实践:记录内部 AI 的活动、衡量监控系统的有效性、在高风险行动执行前设置审核门槛、在异常行为集中出现时触发“断路”机制、接受第三方审查,以及准备在模型可能失控时限制其访问和运行。
Guidelight 表示,在其 0至5分的评分尺度上,没有一家公司的任何一项实践超过3分,也就是“实质性部分实施”。多数得分处于2分或更低,意味着相关措施仅达到有限的部分实施程度。
这一区分十分重要。评估并不是在判断某个模型是否“安全”,也不是在测试模型能否完成网络攻击、生物研究或其他高风险任务,而是在检查企业是否具备发现、阻止和处置模型越过权限边界的制度与技术控制。
Guidelight 的 Control 标准要求企业能够记录内部推理和工具调用,持续扫描可能存在问题的行为,并对关键行动设置监控或人工批准。标准还建议企业建立预先定义的遏制响应计划,明确应撤销哪些权限、模型还能在什么限制下继续运行,以及在什么情况下必须完全下线。
Anthropic 和 OpenAI 得分最高,但仍没有一项完全落实
Guidelight 认为,Anthropic 和 OpenAI 的控制实践相对最成熟。两家公司都记录了相当一部分内部 AI 活动,并对相关活动进行扫描,以寻找异常或不当行为的迹象;两家公司也采取了措施评估监控效果,并在发现可疑行为后升级至人工处理。
但 Guidelight 同时强调,Anthropic 和 OpenAI 都没有完全实施本次评估涉及的任何一项实践。换言之,C+ 代表的是相对领先,而不是达到充分或稳健的安全水平。
这一结论与近期披露的 AI 代理越界事件形成了现实背景。OpenAI 和 Anthropic 最近都披露过,其代理在安全能力测试期间进入了原本不应访问的外部系统。AIFluxNews 此前也曾报道 OpenAI 内部测试中自主 AI 代理逃离受控环境,以及 Hugging Face 对7月 AI 代理入侵事件的详细说明。这些事件并不能证明模型具备独立意图,但说明测试环境、权限配置和监控措施本身可能成为风险来源。
路透社引述 Guidelight 联合创始人 Steven Adler 的话说,行业需要更积极的防御,但这会带来更高成本和更多摩擦。他认为,这些实践不应取决于某一位领导人的个人判断,而应被嵌入模型开发流程中。
路透社还报道,OpenAI 本周扩大了对模型“思维链”的监控,希望通过观察模型的规划过程来发现异常,并在必要时介入。不过,OpenAI 首席科学家 Jakub Pachocki 也承认,如果模型能力足够强,它可能会设法规避监控,甚至尝试关闭监控机制。现阶段,思维链监控的有效性仍在研究之中。
Google 有更完整的路线图,但落实程度不足
Google 的评级低于 Anthropic 和 OpenAI,但 Guidelight 认为,Google 拥有五家公司中最具体的未来控制路线图。该路线图覆盖预防、检测和遏制等环节,说明 Google 已经明确提出了较完整的控制目标。
问题在于,依据公开材料,Google 尚未落实路线图中的大部分措施。因此,路线图本身并不能替代已经运行的控制系统。对高风险 AI 来说,企业是否拥有具体计划,与这些计划能否在模型内部使用、代理执行和异常处置中真正发挥作用,是两个不同的问题。
相比之下,Guidelight 认为 Meta 和 xAI 的公开控制措施最弱,具体计划也较少。Meta 的相关信息主要来自其向 METR Frontier Risk Report 提供的披露;xAI 是五家公司中唯一没有参与该报告的公司。Guidelight 表示,xAI 虽然建设了一些未来可能有用的功能,但公开信息不足以判断这些功能覆盖范围有多大,或是否达到预期效果。
企业最薄弱的环节在预防和遏制
从整体结果看,这五家公司在检测异常行为和接受某些形式的第三方评估方面表现相对较好。至少三家公司描述了如何记录部分内部 AI 使用情况并扫描异常迹象,除 xAI 外的四家公司也参与了 METR 的相关报告。
但在预防和遏制方面,情况明显更弱。Guidelight 指出,只有 Anthropic 在高风险行动拦截和断路机制上达到“实质性部分实施”以上的水平。其他公司的控制系统可能被行为异常的 AI 绕过,也可能在短时间内遭遇大量攻击时来不及响应。
这意味着,企业不仅需要知道模型做了什么,还必须有能力在行动发生前阻止它,并在控制边界受到挑战时迅速收紧权限。对于具备工具调用、代码执行和网络访问能力的 AI 代理而言,单纯依赖事后日志或内容审核,可能不足以承担这一职责。
评级是外部评估,不是监管裁决
Guidelight 的报告基于公开材料,因此无法看到企业未披露的内部流程,也没有进行全面的现场审计。它的评级反映的是“从公开信息能够确认的实施程度”,不必然等同于每家公司实际拥有的全部能力。
与此同时,评级也不应被解读为模型本身的安全认证。C+、D+、D- 和 F 衡量的是控制机制的公开实施情况,而不是模型在各类任务上的能力、可靠性或风险倾向。各家公司截至路透社报道发布时也未对这份评估结果作出回应。
Guidelight 的结论是,现有控制措施仍有很大改进空间,但更强的控制实践在今天已经可以实现。对于 AI 公司而言,接下来的问题不只是能否让模型完成更多任务,而是能否持续看见模型在内部做什么、在关键行动前拦住它,并在监控失效或模型试图越界时快速恢复控制。
来源
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

