模型与研究

表情丰富的人形机器人出错后,用户信任与决策影响力为何明显下降

一项发表于 Science Robotics 的研究发现,具备眼神交流和手势等社会性表达的人形机器人在互动初期更易建立联系,但若出现错误,用户对其信任及采纳建议的意愿下降更快。研究通过脑成像、催产素检测、问卷与决策任务等多重指标,指出拟人化表达提高期待同时把错误解读为违反社会规范,从而放大信任损失。

表情丰富的人形机器人出错后,用户信任与决策影响力为何明显下降

一项发表于 Science Robotics 的研究发现,具备眼神交流和手势等社会性表达的人形机器人在互动初期更易建立联系,但若出现错误,用户对其信任及采纳建议的意愿下降更快。研究通过脑成像、催产素检测、问卷与决策任务等多重指标,指出拟人化表达提高期待同时把错误解读为违反社会规范,从而放大信任损失。

一项发表于《Science Robotics》的研究显示,带有眼神交流、手势和点头等社会性表达的人形机器人,虽然更容易在互动初期吸引人并建立联系,但一旦出现错误,用户对它的信任以及采纳其建议的意愿可能下降得更快。

研究团队认为,关键不只是“机器人犯错了”,而是用户如何理解这个错误:对一台保持静止的机器人来说,失误更像技术故障;而对一台表现得像社会伙伴的机器人来说,同样的失误可能被处理为对互动规范的违反。

这项研究由 Drexel University、美国空军学院、乔治·梅森大学和南加州大学相关研究人员参与完成,论文题为《Multilevel dynamics of the brain, hormones, mind, and behavior in social human-robot interaction》,发表于 2026 年 7 月的《Science Robotics》,DOI 为 10.1126/scirobotics.aec1762。Drexel University 也在官方研究介绍中公布了实验细节。

研究如何测量人与机器人的信任

实验共有 50 名成年男性参与者。他们分别与两种版本的 Pepper 人形机器人进行面对面交流:一种机器人会进行眼神交流、点头、手势和简短的倾听回应;另一种机器人保持静止,但说出完全相同的内容。

每名参与者大约花费两个半小时与机器人互动。实验先安排两轮没有明显错误的交流,用于建立基本信任,随后在第三轮中让机器人开始出现失误。错误并不是机械部件损坏,而是包括答非所问、打断对方、给出缺乏逻辑的建议,以及要求参与者重复已经说过的话等对话行为。

研究人员同时记录了四类指标:通过可穿戴功能性近红外脑成像设备,也就是 fNIRS,观察参与者的前额叶活动;通过唾液样本测量催产素水平;让参与者填写信任和互动感受问卷;以及记录参与者在后续共同决策任务中是否改变选择、采纳机器人的建议。

这种设计的意义在于,研究没有把信任简化为一次问卷评分。正如 Drexel 研究人员 Hasan Ayaz 所说,信任不是单一变量,脑活动、激素、主观评价和实际行为分别反映了互动中的不同层面。

表达能力带来更强参与,也带来更高期待

在机器人没有犯错时,表情和动作确实提高了参与者的投入程度。与静止的 Pepper 相比,具有眼神交流、手势和点头等非语言线索的版本,更容易让参与者把它当作一个正在参与谈话的互动对象。

但研究结果也显示,这种社会性表达同时抬高了用户对机器人的期待。当表达丰富的 Pepper 开始答非所问、打断谈话或坚持不合逻辑的观点时,参与者的大脑反应更接近处理一个社会伙伴违反互动规范的情形,而不是一台机器发生了孤立的技术故障。

研究重点观察了背外侧前额叶皮层和内侧前额叶皮层。前者与不确定性和预期被打破有关,后者则参与推断另一方意图的“心理化”过程。表达丰富的机器人出错时,这两个区域的活动增强,彼此之间的协同也更明显;研究人员据此推断,参与者正在投入更多认知资源去理解机器人的行为和意图。

相比之下,与静止机器人互动的参与者没有呈现同样的协调性脑活动。两种机器人都会导致信任下降,但错误在表达丰富的机器人身上更容易被赋予社会意义。

催产素上升不代表用户更亲近机器人

研究中一个出人意料的发现与催产素有关。催产素经常被称为“亲密激素”或“爱的激素”,通常与社会联结和信任建立联系。但在这项人机互动实验中,机器人犯错后,参与者的催产素水平反而上升,同时他们对机器人的信任下降,采纳机器人建议的次数也减少。

研究人员因此提出,在这种场景下,催产素上升可能更多反映警觉和对社会规范被破坏的敏感性,而不是亲密感增强。换句话说,参与者可能是在更加密切地关注一个“不可靠的互动对象”,而不是因为机器人犯错而与它建立了更深的情感联系。

这一解释仍然需要更多研究验证。研究结果显示的是脑活动、激素变化、信任评价和行为之间的关联,并不能单独证明催产素在其中发挥了直接的因果作用。

机器人对决策的影响力下降超过一半,但并非所有信任指标都如此

在后续的共同决策任务中,研究人员观察到,表达丰富的机器人出错后,对参与者选择的影响力下降超过一半。这一数字描述的是实验中“机器人影响参与者决策”的特定计算结果,并不意味着所有信任指标都下降了超过一半。

参与者先后完成了荒岛生存物品选择和绘画排序等任务,并有机会参考机器人的论证来修改自己的决定。机器人在可靠阶段给出切题、理由充分的意见;进入错误阶段后,它的建议开始变得无关、武断或缺乏逻辑。

研究显示,机器人的社会性表达无法抵消能力和可靠性下降所造成的损失。表达丰富的机器人在最初更有影响力,但出错后也付出了更高代价;静止机器人同样失去信任,只是参与者更倾向于把问题看作机器故障,而非互动伙伴的“行为缺陷”。

对社会机器人的启示:亲和力不能替代可靠性

这项研究的现实意义在于,社会机器人正在被设想用于医疗、教育、客户服务、养老照护和家庭环境。在这些场景中,眼神交流、手势和自然对话可能有助于降低陌生感,但它们也会改变用户对机器人的期待。

如果一个系统看起来、听起来并且行动得像一个社会伙伴,用户很可能也会用评价人的方式评价它。一旦机器人在高风险任务中给出错误建议,问题就不再只是“系统出现了一个 bug”,而可能被用户理解为它缺乏判断力、没有认真倾听,甚至不值得继续合作。

这一点也与近期具身智能的发展方向形成呼应。谷歌 DeepMind 发布的 Gemini Robotics 2试图让机器人在现实环境中完成更长链路的规划、全身动作和多机器人协作;而机器人创业公司 Enigma 则把重点放在让人类更直觉地控制机器人上。能力扩展和交互简化都在加速,但这项研究提醒行业,越接近自然互动,可靠性问题就越难被包装成普通的技术故障。

Drexel 研究人员也承认,实验存在明显限制:参与者全部是年轻成年男性,研究只使用了一种 Pepper 机器人,机器人由人工操作员按照脚本控制,fNIRS 主要覆盖大脑前部区域。因此,结果不能直接推及所有性别、文化、机器人形态或真实部署环境。

下一步需要回答的问题包括:女性和不同文化背景的用户是否会出现相同反应;不同类型的机器人是否会产生类似的社会规范判断;以及机器人在犯错后道歉、解释原因或表明善意,能否真正修复信任。

目前较为明确的结论是:社会性表达可以帮助机器人更快建立互动,但也会让错误的代价更高。对于设计者而言,机器人首先必须可靠;只有在可靠性得到保证后,亲和力和拟人化表达才可能成为优势,而不是放大失望的因素。

来源: Drexel University 官方研究介绍Science Robotics 论文页面论文 DOI研究作者在 The Conversation 的说明

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读