事件概述

一篇即将发表在 Psychological Science 上的重复性研究,未能复现 Ariely 和 Wertenbroch(2002)那篇极具影响力的拖延症论文中的 Study 2。这篇原始研究声称:当任务各自设有外部设定的截止日期时,人们的表现优于自己设定截止日期或统一在最后一天截止的情况。该论文被经济学和心理学课程广泛引用,谷歌学术引用量超过 2100 次。

但更严重的问题在于:Data Colada 的博主在分析原始数据后,得出结论——这篇论文的 Study 1 和 Study 2 数据均被篡改过。目前作者已联系 Psychological Science 要求撤稿,撤稿流程仍在进行中。

原始研究回顾

Ariely 与 Wertenbroch 的 Study 2 设计如下:

  • 60 名参与者随机分入三组,每组 20 人;
  • 任务是对三份各 10 页、含 100 个语法/拼写错误的文档进行校对;
  • 条件 1:均匀截止日期(第 7、14、21 天各交一份);
  • 条件 2:自己设定截止日期(21 天内任意安排);
  • 条件 3:最后一天截止(第 21 天统一提交)。

原始报告显示:均匀截止日期组在校对绩效、延迟时间和收入上全面优于其他两组,效应量 Cohen’s d = 2.5,条件与绩效的相关 r = .79——一个完美且强得离谱的结果。

关键技术点:四个红旗

Data Colada 的分析揭示了四个主要疑点:

1. 效应量大到不合理

d = 2.5 意味着均匀截止组平均纠正 136.1 个错误,而最后截止组仅 71.1 个。作为对比:性别对身高的效应 d ≈ 1.8,性别对鞋子拥有量的效应 d ≈ 1.2,甚至让参与者数出“论证数量”这种必然成立的操纵检验,其效应量也只有 d = 1.49。一个校对这种噪声很大的任务,不可能产生比“看到几个论点就报几个”还强的效应。

2. 重复观测值

从数据分布图看,大量参与者在三个任务上的纠正数完全相同——不仅是总人数,连每个任务的独立计数都一模一样。这在真实数据中几乎不可能自然出现。

3. 文件来源与元数据疑点

博主收到的 Excel 文件来自 2006 年发给 Kyle Hyndman 的邮件,文件属性显示“上次保存者”为 Dan Ariely。但 Ariely 在 2024 年拒绝了作者分析数据的请求,并声称“收到的文件可能不是实际数据”,且没有提供额外数据。

4. 作者拒绝配合

当重复性研究的作者要求分享数据摘要时,Ariely 拒绝许可。相比之下,另一位作者 Klaus Wertenbroch 在 2006 年回复邮件时主动提供了数据文件——博主认为他们能拿到数据正是多亏了 Wertenbroch。

对数据科学和 AI Agent 落地的意义

这件事对数据驱动领域有极强的警示意义:

  • 重复性是科学的基础:单篇高影响力论文的结果再漂亮,如果无法被独立复现,就可能是在误导整个领域。数据科学边实践边验证的风格,恰恰要求我们保持对“完美结果”的警惕。
  • 数据治理与溯源:文件元数据(如“Last saved by”)、邮件记录、数据接收时间线,都是数据审计的关键证据。AI Agent 在自动采集和处理数据时,同样需要记录完整的 provenance(数据来源与操作历史)。
  • 审稿流程中数据共享权利:如果原作者拒绝提供数据,重复性研究如何继续?这是学术出版和开源数据运动共同要面对的制度问题。

我的技术点评

Data Colada 的这篇分析本身就是一份极佳的“统计取证”教学案例。它没有依赖复杂的机器学习方法,而是通过分布重叠程度、效应量基准对比、重复值检测这些基础统计手段,让造假痕迹无所遁形。

值得注意的细节是:该文明确表示“数据被篡改”的结论完全基于公开可复现的分析,读者可以自行核验。这种透明度值得所有数据科学家学习——不仅报告结果,更要公开数据与代码。

当然,原文也有未说明之处:例如,具体哪些记录被篡改、篡改方式是什么,以及是否还有其他未公布的分析细节。Data Colada 表示后续还有关于 Study 1 的专门分析,本文未提供。另外,Ariely 拒绝请求的完整理由只在其声明中提及“文件可能不是实际数据”,原文未提供更多解释。

无论如何,这提醒我们:当效应量完美到不真实时,最合理的解释也许就是“不真实”。 对 AI Agent 时代大规模自动分析而言,建立对抗数据伪造的统计审计流程,应该成为标准实践。

原文链接