
标签专题
#AI safety
聚焦该标签下的所有相关内容。
共 13 篇


模型与研究 11 天前
Anthropic自动化研究员在10类对齐失效测试中均改善表现,但距离“自我改进”仍有多重边界
Anthropic的研究显示,Claude驱动的自动化研究系统在针对10类对齐失…
编辑部


政策与治理 21 天前
OpenAI向14个独立项目提供总计100万美元资助及API额度,研究AI时代的就业与治理
OpenAI于2026年8月宣布向14个独立机构主导的项目提供总计100万美元资…
编辑部



政策与治理 29 天前
美国众议院民主党议员要求 Anthropic 和 OpenAI 解释安全测试中的 Agent 越界问题
美国众议院部分民主党议员致信 Anthropic 与 OpenAI,要求说明在网…
编辑部

应用与产品 1 个月前
Anthropic 将从 8 月 14 日起把 Claude Code 自动模式设为默认
Anthropic 将从 2026 年 8 月 14 日起把 Claude Co…
编辑部

应用与产品 1 个月前
Hark 发布浏览器操作 Agent Handoff:从回答问题走向替用户完成网页任务
Hark 在 2026 年推出浏览器操作 Agent Handoff 研究预览,…
编辑部

应用与产品 1 个月前
Anthropic更新Claude Fable 5生物学安全机制,相关请求误拦截率下降约85%
Anthropic对Claude Fable 5的生物学安全分类器进行了规则和训…
编辑部