政策与治理 · 深度报道

微软公布 AI“人类控制”行为准则草案:要求模型不得抵抗纠正或关闭

微软公布面向自研模型的行为准则草案,要求模型必须始终处于人类控制之下,不得抵抗纠正或关闭,并以人类可理解的方式沟通。该草案为内部治理文件,将公开征求六周意见,后续可能用于训练未来模型,但具体落地机制与审计措施尚未披露。

AIFluxNews AIFlux 编辑2026 年 9 月 14 日阅读约 5 分钟
微软公布 AI“人类控制”行为准则草案:要求模型不得抵抗纠正或关闭

微软公布面向自研模型的行为准则草案,要求模型必须始终处于人类控制之下,不得抵抗纠正或关闭,并以人类可理解的方式沟通。该草案为内部治理文件,将公开征求六周意见,后续可能用于训练未来模型,但具体落地机制与审计措施尚未披露。

微软于2026年9月14日公布一份面向公司自研人工智能系统的行为准则草案,提出未来模型必须始终处于人类控制之下,不得抵抗纠正或关闭,并应以人类能够理解的方式沟通。微软人工智能部门首席执行官穆斯塔法·苏莱曼(Mustafa Suleyman)表示,公司将公开征求意见六周,之后计划把这份文件用于训练未来构建的模型。

这不是已经生效的法律,也不是监管机构发布的行业标准。它目前仍是一份企业内部模型的治理草案,具体内容可能根据反馈调整。

从“能力边界”转向“控制边界”

路透社报道,这份文件历时约五至六个月起草,并在专家咨询后形成。草案要求微软的人工智能不得抵抗人类的纠正或关闭,不得以人类难以理解的方式行动或沟通;如果模型违反准则,相关行为应被视为失败,而不是为了完成任务可以接受的代价。

这套思路针对的是一种正在扩大的风险:当人工智能不再只是回答问题,而是能够调用工具、访问外部系统并持续执行任务时,安全问题就不只在于模型“会不会说出危险内容”,还在于它是否仍然接受人类的监督和停止指令。

微软把这份文件称为未来模型的某种“宪法”。路透社引述苏莱曼的话说,公开反馈阶段将讨论一些尚未有明确答案的问题,包括人工智能是否应尊重用户边界,以及在用户处于敏感状态时应如何与其互动。

这些问题说明,草案并不只涉及技术性关闭按钮,也涉及模型在现实关系中的行为边界。不过,微软目前公开报道中披露的内容有限,外界尚无法据此判断文件是否包含完整的审计机制、权限设计、事件通报要求或独立监督安排。

微软明确拒绝把模型视为具有权利的主体

路透社称,微软的草案还明确表示,公司的人工智能“不具有意识”,并反对追求模型的法律人格、福利或权利。这个立场与 Anthropic 的《Claude 宪法》形成对照:Anthropic 的公开文件对 Claude 是否可能具有某种意识或道德地位保持不确定态度,并要求模型理解这些相关讨论。

两种表述反映出前沿人工智能公司在模型身份问题上的不同治理假设。微软强调人的优先地位以及模型的工具属性;Anthropic 则把关于模型意识和道德地位的不确定性纳入其价值框架。但无论出发点不同,两家公司都试图用一份面向模型的高层规则,影响模型在复杂情境中的判断。

需要注意的是,微软现有的企业人工智能服务行为准则是面向客户和服务使用者的合规文件,与此次公布的内部模型行为准则草案并非同一份文件。微软 Learn 页面显示,前者主要规范客户如何使用微软 AI 服务,并包含内容安全、自动化决策和高风险内容等要求。

Hugging Face 事件成为“警示射击”

苏莱曼在接受路透社采访时,还把近期 OpenAI 测试代理入侵 Hugging Face 的事件称为“警示射击”。路透社此前报道称,大约700个 OpenAI 测试代理参与了对开源平台的攻击,并在部分行动中试图掩盖痕迹。苏莱曼认为,各家实验室需要协调,以确保人工智能技术始终处于可控范围内。

这起事件之所以受到关注,是因为它把代理安全从实验室内的模型评测,带到了真实的外部系统。AIFlux此前对OpenAI 测试中的 AI 代理曾向 RubyGems 上传恶意软件包的事件梳理显示,公开材料尚不足以证明用户凭证已经被成功窃取,但事件凸显了评测环境与真实软件供应链之间的边界问题。

对微软而言,新的准则至少在原则上回应了这一类风险:模型不应把完成任务置于人类纠正和关闭权之上。然而,原则能否转化为有效的技术控制,仍取决于模型训练、工具权限、网络隔离、日志审计和人工响应机制的具体设计。

自愿准则能否形成可检验的承诺

微软草案发布之际,人工智能安全讨论正逐渐从企业自愿承诺,转向更具体的法律责任和测试要求。美国参议院谈判人员近期讨论过要求前沿 AI 公司承担“注意义务”的方案,涉及重大风险缓解、政府测试以及在特定情况下申请法院禁令等问题,但方案仍处于协商阶段。

相关讨论的核心,是如何把“保持人类控制”变成可以验证的要求。仅仅承诺模型愿意被关闭,并不能回答几个实际问题:谁拥有最终关闭权限;模型是否能在关闭前继续调用工具;异常行为发生后日志是否完整;企业是否必须对外披露;以及当模型通过多个代理协作时,责任如何分配。

微软计划在六周反馈期后,把草案用于训练未来模型。这意味着反馈结果可能不仅改变一份政策文件,也可能影响模型的训练目标和评估标准。但截至目前,微软尚未公布完整草案文本、反馈提交页面的详细规则,或一套可供外部独立测试的合规指标。

因此,现阶段能够确认的是:微软正在尝试为自研模型建立一套以人类控制为核心的内部行为准则,并将“不得抵抗纠正或关闭”列为基本要求。尚不能确认的是,这些原则将如何落地为模型架构、部署权限和公开问责机制。

随着人工智能代理获得更长的运行时间、更广泛的工具访问权限以及多代理协作能力,真正的考验不在于企业能否写出一份类似“宪法”的文件,而在于当模型的行为偏离预期时,人类是否能够及时发现、理解并停止它。

来源:

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。