模型与研究 11 天前 Anthropic自动化研究员在10类对齐失效测试中均改善表现,但距离“自我改进”仍有多重边界 Anthropic的研究显示,Claude驱动的自动化研究系统在针对10类对齐失… 编辑部