模型与研究

Anthropic设立500万美元研究资助计划,支持AI用户福祉独立评估

Anthropic宣布设立500万美元研究资助计划,资助独立团队评估AI对用户福祉的长期影响并开发开源评测工具。入选团队将获资金、模型访问与技术支持,研究须保持独立并公开成果与方法。

Anthropic设立500万美元研究资助计划,支持AI用户福祉独立评估

Anthropic宣布设立500万美元研究资助计划,资助独立团队评估AI对用户福祉的长期影响并开发开源评测工具。入选团队将获资金、模型访问与技术支持,研究须保持独立并公开成果与方法。

Anthropic于8月25日宣布,将设立总额500万美元的研究资助计划,支持独立团队研究人工智能如何影响用户福祉,并开发开放源代码的评测工具和基准。入选团队将获得直接资金、Anthropic模型访问权限和技术支持,但研究将保持独立,成果预计以开放源代码项目形式发布。

这项计划关注的不是模型在传统知识、推理或编程测试中的表现,而是人工智能进入情绪支持、心理健康危机和长期对话后,可能对用户产生的影响。Anthropic表示,用户已经把AI用于工作、学习和解决问题,也有人把聊天机器人视为咨询者、教练或情绪支持来源;但行业目前仍缺少衡量这些互动后果的清晰标准。

评估重点从单轮回答转向长期互动

Anthropic认为,用户福祉是较难评估的领域之一。对于许多模型行为,研究者可以通过一条回答判断信息是否准确或合适;但在涉及情绪和心理状态的对话中,风险往往只有在获得更多上下文后才会显现。

例如,处于困境中的用户未必会在第一句话中表达自残想法,模型可能需要根据多轮对话中逐渐出现的线索调整回应。同样,一条关于饮食或锻炼的建议,在一般语境下或许合理,但如果用户此前透露出饮食失调经历,完全相同的建议就可能变得不合适,甚至造成伤害。

因此,Anthropic在其用户福祉评估指南中提出,新的评测不应只依赖单轮、脱离实际使用环境的提示,而应尽量构造风险升级、语境变化和用户表达方式不同的多轮场景。

指南要求研究团队明确说明评测到底测量什么,以及什么情况算作通过或失败;在设计和验证过程中邀请临床及其他领域专家参与;同时衡量两类相反的风险:模型过度顺从、提供可能有害的回应,以及模型过度拒答、在本应提供帮助时回避回答。

Anthropic还强调,自动评分器不能未经检验就被当作可靠裁判。研究者应把模型评分与真实领域专家的判断进行校准,报告两者之间的一致程度,并手动检查部分对话记录。指南也建议研究者说明模拟用户与真实用户之间的差异,公布足够的代码、数据和分类方法,让第三方能够复现结果。

资助计划仍处于申请阶段

按照Anthropic的公告,申请截止日期为2026年9月21日。进入完整提案阶段的申请者预计将在10月5日前收到通知。公告没有公布最终资助团队名单,也没有说明500万美元将在多少个项目之间分配。

公司表示,入选团队可以获得资金、模型访问权限和技术支持,但不会因此失去研究独立性。研究成果将以开放源代码项目发布,供其他开发者使用。就目前信息看,这是一项资助和评测基础设施建设计划,并不代表相关研究已经完成,也不意味着其中提出的标准已经成为整个行业的统一规范。

Anthropic在公告中还链接了此前关于Claude用户行为和安全防护的研究。其中一项对Claude支持、建议和陪伴型对话的分析称,在其隐私保护分析的样本中,2.9%的对话属于情感相关互动,陪伴和角色扮演合计占比低于0.5%。这项研究同时指出,较长的对话可能从一般的咨询或辅导逐渐转向陪伴关系,因此单纯统计某一轮对话并不能完整反映风险变化。

Anthropic的另一篇用户福祉安全说明则披露了公司对自杀、自残和迎合性行为的内部评估。公司称,其多轮评估会检查模型是否提出澄清问题、是否在不过度干预的情况下提供资源,以及是否避免过度拒答或过度分享。这些数字属于Anthropic对自身模型的评估结果,并不是这次新资助计划已经产生的独立研究结论。

行业正在寻找更接近真实使用的标准

这项计划的背景,是聊天机器人逐渐承担越来越多原本由人际关系或专业服务承担的交流功能。用户可能把模型用于关系咨询、职业和人生决策,也可能在无法及时获得专业帮助时询问健康或心理问题。由此产生的关键问题并不只是模型是否能够生成一条听起来体贴的回答,而是这种回答在持续互动中会带来什么后果:它是否帮助用户获得现实支持,是否让用户更加依赖模型,是否强化了错误判断,或者是否因为过度谨慎而使真正需要帮助的人无法得到有效引导。

已有研究也显示,心理健康聊天机器人的评估仍然缺乏统一做法。一项发表于同行评审期刊的人工智能心理健康聊天机器人系统综述回顾了2020年至2024年的160项研究,并把评估区分为基础性能测试、试点可行性研究和临床效果等层次。不同研究在模型类型、用户群体、使用场景和结果指标上的差异,意味着单一分数很难说明系统在真实心理健康场景中的整体表现。

类似的评估难题也出现在其他公司的产品安全工作中。AIFluxNews此前报道的Guidelight对多家AI公司的安全控制评估也把重点放在记录、监控、拦截、第三方审查和遏制机制,而不是模型能力本身。两类工作关注的风险不同,但都指向同一个变化:随着AI从生成文本走向持续互动和执行更复杂的任务,事后查看输出已经不足以覆盖全部风险。

在心理危机支持方面,科技公司也在尝试把模型回应与人工资源连接起来。例如,Google此前宣布在Gemini中加入更直接的危机支持界面,并通过Google.org资助危机热线和相关组织。AIFluxNews在谷歌用AI加强心理危机支持的报道中提到,公司强调模型不能替代临床护理,系统应在必要时把用户引导至真人和专业支持。这种产品层面的干预,与Anthropic此次希望资助的评测工作形成互补:前者试图在对话中提供支持入口,后者则试图建立方法来判断这些机制是否有效、何时失效,以及是否会产生新的副作用。

独立性与可验证性将决定计划的影响

Anthropic为外部团队提供模型访问权限,可以降低研究者测试真实产品行为的门槛,但也带来一个需要持续关注的问题:受资助团队如何处理与资助方之间的关系。公司承诺研究团队保持独立并公开成果,这为外部检验提供了基础;不过,最终还需要看到资助名单、项目选择标准、数据访问边界、研究协议和完整结果,才能判断这种独立性在实践中如何落实。

同样重要的是,开放源代码并不自动等于开放、可复现的科学研究。评测是否覆盖不同语言、地区、文化和用户群体,是否包含真实用户而不只是模拟对话,是否能保护敏感健康信息,以及不同模型和产品环境下的结果能否比较,都会影响这些基准的实际价值。

Anthropic在指南中已经提出了区域和语言差异、多模态输入、样本规模、重复运行和外部有效性等要求。这些要求说明,公司自身也把福祉评估视为一个涉及产品环境、社会背景和临床判断的长期问题,而不是一次模型发布时即可解决的单项测试。

截至目前,Anthropic公布的是资助计划和评测原则,而不是新的独立研究结果。真正值得观察的下一步,是哪些研究团队获得支持、他们将如何定义“福祉”、能否把过度顺从和过度拒答放在同一套指标中衡量,以及公开基准最终能否被其他公司和研究机构采用。只有在这些结果出现后,外界才更有可能判断这500万美元是否推动了更可靠的AI用户福祉评估。

来源

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读