ChatGPT让学生答案更好,但批判性思维训练让想法更宽:OpenAI发布博科尼大学随机实验结果
博科尼大学与 OpenAI 进行的随机实验发现,ChatGPT 能使学生作业更完整、更接近专家答案,而批判性/因果推理训练则提升想法的多样性与原创性;两者结合呈现互补效果,但也提示学校需重构作业与评估以衡量不同学习目标。
博科尼大学与 OpenAI 进行的随机实验发现,ChatGPT 能使学生作业更完整、更接近专家答案,而批判性/因果推理训练则提升想法的多样性与原创性;两者结合呈现互补效果,但也提示学校需重构作业与评估以衡量不同学习目标。
一项由博科尼大学研究人员与 OpenAI Economic Research 合作开展、涉及1000多名一年级本科生的随机实验显示,ChatGPT 和批判性思维训练并不一定产生同一种收益:前者让学生的作业更完整、更连贯,也更接近专家答案;后者则促使学生提出更多样、更具原创性的想法。
研究结果把“学生应该使用人工智能,还是应该自己思考”这一常见的二选一争论,转化成了一个更具体的问题:学校需要培养哪些能力,又该用什么方式衡量这些能力。
一项围绕真实商业任务的实验
根据 OpenAI公布的研究说明,参与者是博科尼大学一年级本科生。他们需要围绕该校纪念品商店制定营销建议,目标包括提高商店的知名度和使用率。
学生按上课时段被随机分配到四组:
| 分组 | 获得的条件 |
|---|---|
| ChatGPT组 | 可使用 ChatGPT(GPT-4o) |
| 因果推理组 | 接受因果推理训练,但不能使用 ChatGPT |
| 组合组 | 同时获得 ChatGPT 和因果推理训练 |
| 对照组 | 不获得上述两项条件 |
这里的批判性思维训练并不是教学生如何使用人工智能,而是通过游戏、案例、提问和反馈,帮助他们理解因果关系,解释一个方案为什么可能有效、又可能在什么情况下失效。
研究人员随后采用两种方式评估作业。一方面,经过训练的人类评分员使用五分制标准评价作品;另一方面,自动化文本分析考察每份作业包含的想法数量和多样性、因果推理迹象,以及作业与三名专家建议之间的相似程度。
ChatGPT缩小了新手与专家之间的表达差距
在传统评分标准下,获得 ChatGPT 使用权限的学生得分比没有使用权限的学生高出接近一分(满分为五分)。他们提出了更多想法,论述逻辑更清晰,作业也更接近专家撰写的建议。
这并不意味着学生把任务完全交给了模型。OpenAI对实验的描述称,学生仍需要决定向 ChatGPT 提出什么问题,评估模型返回的内容,并选择哪些内容进入最终作业。换句话说,实验呈现的更像是“带有人工智能辅助的决策和编辑”,而不是简单复制模型答案。
这一结果说明,ChatGPT最直接的作用可能是提升成品质量,特别是帮助经验较少的学生更快组织材料、扩展方案并形成更连贯的表达。这样的帮助也带来一个教育上的难题:如果最终文本更像专家作品,仅凭成品本身,教师就更难判断学生究竟掌握了多少。
训练没有明显提高标准分数,却带来了另一种收益
因果推理训练组的情况不同。接受训练的学生能够更清楚地解释自己的想法为什么可能有效,以及哪些条件可能导致方案失败,但他们在只衡量“是否实现两个营销目标”的传统评分表上,并没有取得更高分数。
不过,文本分析捕捉到了评分表遗漏的变化:这些学生提出的想法范围更广,与同学作品相比也更加不同。也就是说,他们未必更擅长给出最符合标准答案的营销建议,却更可能提出不一样的路径、质疑既有假设,并考虑多种可能性。
这一区别反映了两种能力之间的张力:清晰、完整和符合要求的答案容易被传统评分标准识别;原创性、想法的多样性,以及对失败条件的分析,则可能需要额外的评价工具才能呈现出来。
两种能力叠加,而不是相互替代
同时获得 ChatGPT 和因果推理训练的学生,表现出两者的组合效果。他们的想法多样性与单独接受因果推理训练的学生相近;在评分、想法数量和逻辑连贯性方面,则总体保留了 ChatGPT 组的优势。与此同时,他们的作业显示出更强的逻辑连贯性,也更经常解释因果关系和质疑前提。
OpenAI据此将两种干预描述为“互补”:人工智能帮助学生把答案做得更好,批判性思维训练帮助学生把思路拓展得更宽。随机分组设计也使研究人员能够相对清楚地区分单独使用 ChatGPT、单独接受训练,以及两者结合的效果。
但这项实验仍有边界。它针对的是一所大学的一年级学生和一项营销案例,测量的是一次作业中的表现,不能直接推导出 ChatGPT 对所有年龄段、学科或长期学习效果的影响。研究说明也没有证明,短期内写出更接近专家的答案,就等于学生在没有人工智能时拥有同等水平的知识和能力。
学校可能需要重新设计作业与评价
这项研究最重要的影响,或许不在于给 ChatGPT 在课堂中的使用“背书”,而在于提醒学校:当人工智能降低了高质量表达的门槛,单独查看最终答案的价值就会下降。
OpenAI过去推出的 Study mode 也沿着类似方向设计:通过引导性提问、分步骤解释、知识检查和自我反思,减少“直接给答案”的使用方式。公司当时表示,这一功能旨在支持真正的学习,而不只是帮助用户完成任务。
在更近期的研究工作中,OpenAI还与塔尔图大学和斯坦福大学 Accelerator for Learning 的 SCALE Initiative 合作,开发用于长期追踪学习结果的测量框架。该框架试图同时关注考试成绩之外的指标,包括自主学习动机、持续投入、元认知、记忆和学习过程中的互动质量。OpenAI称,相关验证工作正在爱沙尼亚等教育环境展开,涉及近2万名16至18岁的学生。
博科尼大学自身的教育实践也显示出类似趋势:学校有关 人工智能促进包容性教学 的介绍提到,教师可以公开说明模型的局限,通过匿名反馈和“无法在有限时间内独立完成”的任务,让学生比较不同模型的回答并识别可能出现的错误。
这些做法并不意味着教师可以把判断交给模型。相反,它们把教师的工作从检查一份看似完整的答案,推向设计更能暴露思考过程的任务:要求学生解释选择、展示不同方案、记录修改过程,或者在没有人工智能帮助的情况下完成部分验证。
“更好”究竟指什么,仍然取决于教育目标
这项实验没有给出一个适用于所有课堂的人工智能使用规则。它显示的是,在特定任务中,ChatGPT与因果推理训练改善了不同维度的表现;如果学校只用单一分数衡量学生,部分变化就会被掩盖。
对于教育机构而言,接下来的问题不是是否允许学生使用 ChatGPT,而是要先明确希望学生学会什么:是更快形成结构清晰的答案,是提出没有标准模板的想法,还是能够解释证据、检验假设并承担判断责任。不同目标需要不同的课堂设计和评价方式。
在人工智能可以帮助学生写出更成熟文本的情况下,真正困难的部分可能不再是区分“像不像机器写的”,而是判断学生是否仍然参与了问题定义、证据评估和最终决策。OpenAI这项研究提供了一个起点,但这些能力能否长期保留,以及实验结果能否推广到其他学校和学科,仍需要更长期、更多独立研究来回答。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

