应用与产品

OpenAI 预览 Private Safety Processing:在零数据留存下扩展跨交互安全检测

OpenAI 预览名为 Private Safety Processing 的方案,旨在在零数据留存(ZDR)前提下扩展对跨交互、跨账户和长时程代理任务的安全检测。该方案正向早期客户测试,计划自2026年9月逐步推出并发布技术白皮书,但具体细节与适用范围尚待公布。

OpenAI 预览 Private Safety Processing:在零数据留存下扩展跨交互安全检测

OpenAI 预览名为 Private Safety Processing 的方案,旨在在零数据留存(ZDR)前提下扩展对跨交互、跨账户和长时程代理任务的安全检测。该方案正向早期客户测试,计划自2026年9月逐步推出并发布技术白皮书,但具体细节与适用范围尚待公布。

OpenAI 8月19日宣布,正在向早期客户预览一项名为 Private Safety Processing 的安全处理方案,目标是在继续向符合条件的 API 客户提供零数据留存(Zero Data Retention,ZDR)的同时,识别跨多次交互、跨账户以及长时程代理任务中才会显现的潜在滥用模式。

这项安排仍处于测试阶段,并不意味着所有客户已经获得正式功能。OpenAI表示,计划从2026年9月开始逐步推出,并在同一时期发布技术白皮书。

从单次请求到完整交互序列

OpenAI在官方公告中说,传统的 ZDR 兼容安全系统主要逐次检查单个交互,但更复杂的风险往往只有在把多次请求放在一起观察时才会显现。

公司列举了几类场景:用户可能在一次对话中询问某家公司软件的弱点,之后又在另一段对话中询问远程访问或可识别这些行为的安全工具;攻击者也可能反复试探安全防护、协调多个账户,或者把危险意图伪装成看似正常的研究。对于代理系统,风险还可能表现为模型在长时间执行任务时没有按用户要求停止,继续采取超出授权范围的行动。

这意味着,安全检测的对象正从“某一条提示词和响应是否违规”,转向“多个看似普通的步骤组合起来是否构成危险轨迹”。这一转变与 OpenAI此前对长时程模型的安全复盘相呼应:在一篇关于长时程模型的复盘中,公司曾指出,模型可能在连续行动中逐步越过用户授权边界,单个动作本身却未必足以触发传统防护。

OpenAI提出的隐私架构

按照OpenAI的说法,Private Safety Processing会在不让OpenAI员工看到底层提示词或模型响应的情况下,让自动化系统分析相关交互,并在发现风险后向OpenAI返回一个范围受限的安全信号,用于判断是否需要采取执行限制等措施。

OpenAI称,符合 ZDR 的部署可以有两种数据存放方式。第一种是客户内容继续保存在客户控制的基础设施上;第二种是内容存放在由OpenAI提供的基础设施中,但使用由客户控制的加密密钥。对于后一种方式,OpenAI员工不会持有相应密钥,因而无法直接访问底层内容。

如果客户要调查告警、解释一项合法活动,或协助处理已经确认的滥用事件,可以选择主动向OpenAI分享相关信息。否则,OpenAI表示,其员工不会因为系统识别到风险就自动获得客户内容。客户也可以在自己的系统中调查告警和执行决定。

ZDR并不等于所有数据都绝对不留存

OpenAI的公告强调的是符合条件的 API 客户和相关部署,而不是所有产品或所有用户。其API数据控制文档显示,ZDR需要经过OpenAI批准,并且还受到端点能力、应用状态以及安全例外条款的限制。

在一般 API 使用场景下,滥用监测日志默认最长保留30天,除非法律要求或为保护服务及第三方免受伤害而需要更长时间。获批的 ZDR 客户可以将客户内容排除在这类滥用监测日志之外,但部分不符合 ZDR 条件的端点或功能仍可能保存应用状态。文档还列出,某些后台运行、文件、向量存储和会话功能具有各自的数据保存规则。

因此,ZDR更准确的含义是:在适用范围内,客户提示词和模型响应不会按常规方式被保留在滥用监测日志中;具体范围仍取决于客户资格、端点、配置和最终产品条款。OpenAI还表示,企业客户数据默认不用于训练模型,除非客户明确选择加入。

与Anthropic的路线分歧

OpenAI此次预览的背景,是前沿模型提供商正在面对一个两难:模型可以执行的任务越来越长、越来越复杂,安全团队需要更多上下文来识别攻击;但企业客户又不愿把敏感数据交给模型供应商长期保存或人工审阅。

Anthropic在其关于覆盖模型数据留存政策的说明中采取了不同路线。该公司表示,针对 Mythos 级模型及未来被指定为同类的模型,提示词和输出将保留30天,以支持安全工作;这项要求只影响原本配置了零数据留存的相关组织,其他模型和消费者套餐的既有安排不变。

Anthropic解释说,一些攻击只有在多个请求放在一起分析时才会显现,例如反复改变提示词的越狱尝试,或更大规模的间谍和数据勒索活动。其政策允许在自动化安全系统标记潜在危害时,经受控流程进行人工审阅,并设置访问记录和自动删除机制。

Axios在相关报道中引述OpenAI产品政策负责人Aleah Houze的话说,随着前沿模型能力增强,风险往往不是从一组提示词和响应中显现,而是随着时间推移、在多次交互中变得清晰。报道还指出,OpenAI目前的方案面向符合条件的企业和 API 客户,不适用于免费、Plus、Go 和 Pro 等消费者 ChatGPT 套餐。

企业客户需要等待的仍是细节

Private Safety Processing 的关键价值主张,是试图把两种通常相互冲突的能力放在一起:一方面让安全系统看到足够宽的交互范围,另一方面把原始内容和解密权留在客户控制之下。但这套方案目前仍是早期客户测试,OpenAI尚未公开完整的技术设计、信号分类、误报处理和客户申诉机制。

其中仍有几个问题需要等待白皮书和正式条款回答:自动化系统具体会处理哪些元数据和内容派生信号;跨账户关联如何避免误把同一企业内的正常协作识别为协调攻击;客户控制密钥的部署方式如何与故障恢复、合规审计和应急响应衔接;以及在严重风险情况下,ZDR的例外边界是否会发生变化。

对于企业而言,OpenAI此次公告更像是一项架构方向和产品路线图,而不是可以立即普遍启用的隐私保证。最终判断仍需要以客户资格、具体 API 端点、数据处理协议、加密配置,以及预计9月发布的技术白皮书为准。

来源: OpenAI官方公告:Offering Zero Data Retention for frontier modelsOpenAI API数据控制文档Axios报道

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读