事件概述

2026 年 8 月 27 日,OpenAI News 发布了一篇由博科尼大学(Bocconi University)研究人员与 OpenAI 经济研究团队合作完成的随机实验报道。研究对象是超过 1000 名博科尼大学一年级本科生,他们在一次真实的商业案例分析作业中,被随机分为四组:仅使用 ChatGPT、仅接受因果推理训练、同时接受两者、以及既不使用也不接受训练。

实验的核心问题是:当学生使用 ChatGPT 完成真实作业时,作业质量提升是否以牺牲原创性为代价?最终结论给出了一个颇有启发的答案:ChatGPT 让答案更完善,批判性思维训练让思路更开阔,两者是互补的。

关键技术点

实验设计与评估方式

  • 参与者与任务:超过 1000 名一年级本科生参与,任务是为大学纪念品商店制定营销建议。
  • 分组方式:按课堂时段随机分配到四组,确保比较的因果关系可靠性。
  • 干预措施:
    • ChatGPT 访问(使用 GPT-4o)
    • 因果推理训练:一种与 AI 无关的批判性思维练习,通过游戏、案例、提问和反馈来训练学生建立因果链、解释方案为何有效或无效。
  • 评估手段:
    • 人工评分员使用 5 分制评分表打分。
    • 自动化文本分析:统计学生答案中的观点数量、观点多样性、因果推理迹象,并与三位专家给出的答案进行相似度对比。

核心结果

  1. ChatGPT 显著提升作业质量
    获得 ChatGPT 访问权限的学生,在 5 分制上平均高出近 1 分。他们的答案包含更多观点、逻辑更清晰,并且与专家建议的相似度更高。也就是说,AI 帮助新手产出了更专业化的内容。
    值得注意的是,学生并没有直接把作业扔给 ChatGPT,而是自行决定问什么、评估回答、选择最终提交的内容。这说明了人机协作中的主动性依然关键。

  2. 批判性思维训练促进原创性
    接受因果推理训练的学生,在 5 分制评分上并没有明显提升——因为评分表只考察“提高知名度”和“提高使用率”这两个标准营销目标。但文本分析显示,这些学生产出的观点范围更广、彼此之间差异更大,与同龄人的答案重合度更低。
    这说明传统评分表可能奖励清晰、结构化的答案,却忽略了“提出别人没想到的点”这一重要能力。

  3. 两者结合效果互补
    同时接受 ChatGPT 和批判性思维训练的学生,同时获得了两种优势:观点多样性与仅训练组相当,评分和观点数量与仅 ChatGPT 组相似,并且在逻辑一致性和因果推理等方面表现更全面。

对数据科学或 AI Agent 落地的意义

这一研究为 AI 在教育及更多垂直领域的落地提供了难得的方法论参考。

  • 更科学的 AI 效果评估:实验采用随机对照设计,并人工评分与自动化文本分析双轨并行,分离了工具使用和技能训练的影响。这种多维评估框架对数据科学团队衡量 AI 产品真实价值有直接借鉴意义——不能只盯着最终产出质量,还要关注用户的思维变化。
  • AI Agent 的定位逐渐清晰:本实验中的 ChatGPT 更像一个“辅助推理者”,而不是完全替代学生的 Agent。它提升了下限,而训练拉高了上限。未来 AI Agent 在办公、科研、教育等场景落地时,最佳实践可能是“AI 增强 + 人类培训”并行,而不是简单地追求自动化。
  • 评估体系需要更新:如果 AI 能轻松写出结构完美、专家级答案,那么评估一个人的真实理解和综合能力,就需要引入“原创性”“多角度思考”等新维度。对数据科学领域的 Agent 应用而言,也需要重新定义何为“好结果”。

我的技术点评

这个实验的巧妙之处在于,它把“质量”和“原创性”拆开来看。5 分制评分表捕捉的是写作质量与逻辑,而文本分析捕捉的是观点发散度。由于 AI 擅长优化表达,传统评分会掩盖学生创造性思考的退化;而文本相似度与多样性分析则能揭示训练带来的隐性收益。这个思路完全可以迁移到算法评估中:例如评估大模型生成内容的优劣,同样不能只看单次得分,还要看生成分布的多样性、对 prompt 的敏感度和是否“套路化”。

从实验设计看,样本量超过 1000 人且是随机分配,因果关系可信度较高。但原文未说明学生的具体专业、GPT-4o 使用频率、训练时长等细节,因此效果是否有长期持续性还不得而知。另外,该实验中的批判性思维训练与 AI 完全无关,如果未来将两者深度融合,或针对 AI 使用场景定制训练,效果可能会更突出。

教育领域正在经历一个微妙时刻:AI 让“专家级表达”变得廉价,也让“独特思考”变得稀缺。这项研究提醒我们,真正重要的问题不是“该不该用 AI”,而是如何使用 AI、如何评估人类在 AI 辅助下仍然不可替代的能力。对 AI Agent 的工程化落地而言,同样要思考:我们是否在追求极限性能的同时,无意间抹平了模型的多样性?这或许是后续研究者需要继续探索的方向。

原文链接

https://openai.com/index/what-students-gain-from-chatgpt-critical-thinking-training