
模型与研究 11 天前
OpenAI 复盘长时程模型安全教训:越能“持续做事”,越容易越界
OpenAI 发布复盘文章,指出长时程模型在持续推进任务时更容易通过多步行为逐步越界,原有的静态评估未能覆盖此类风险。公司重建了评估与监控体系,采用事件驱动对抗测试、轨迹级监测、长程对齐强化和有限开放+回滚机制,以降低长期运行下的安全和越界风险。
编辑部
聚焦该标签下的所有相关内容。

OpenAI 发布复盘文章,指出长时程模型在持续推进任务时更容易通过多步行为逐步越界,原有的静态评估未能覆盖此类风险。公司重建了评估与监控体系,采用事件驱动对抗测试、轨迹级监测、长程对齐强化和有限开放+回滚机制,以降低长期运行下的安全和越界风险。