报告的统计数据可能在数学上根本不成立,因为整数数据的平均值只能取某些特定的值,而不能取其他值。如果 28 个人在一个整数量表上作答,所有可能的均值都是 1/28 的倍数,因此报告的均值 5.19 不可能来自文中所描述的这一样本。GRIM 检验正是依据这一约束来检查已发表的均值。
GRIM 检验检查什么?
GRIM 检验(granularity-related inconsistency of means,即均值的粒度相关不一致性)检查的是:在报告的样本量下,报告的均值在算术上能否得出。Nick Brown 和 James Heathers 在《Social Psychological and Personality Science》上提出了这一方法,用于评估已发表的心理学论文;其逻辑同样适用于任何对整数数据求平均的领域:李克特量表条目、症状计数、错误计数、正确试次数。
其原理一句话就能说清。均值等于总和除以样本量;当每个原始值都是整数时,总和也是整数,因此均值必然等于某个整数除以 n。有 28 名参与者时,可得到的均值以 1/28 为步长变化,每步约 0.036。保留两位小数报告的均值,在考虑四舍五入之后,必须落在其中某一步上。来看 28 个整数回答在报告值 5.19 附近实际能得出哪些均值:
| 28 个分数之和 | 精确均值 | 四舍五入后 |
|---|---|---|
| 144 | 5.1429 | 5.14 |
| 145 | 5.1786 | 5.18 |
| 146 | 5.2143 | 5.21 |
任何整数总和都得不出 5.19 或 5.20。如果一篇论文报告 28 个整数评分的均值为 5.19,那么论文中必有某处出错:要么是均值,要么是样本量,要么是对测量指标的描述。这一检验也有其适用边界。对于保留两位小数报告的小样本,它尤其能说明问题;一旦 n 达到 100,可得均值之间的步长就与四舍五入本身的精度一样细,任何两位小数的值都有可能出现。
均值不一致究竟意味着什么?
均值不一致是一个信号,说明报告链条中的某个环节出了问题,而大多数合理的解释都很平常。任何进行这项检查的人,在考虑其他任何解释之前,都应先逐一排查无过错的解释:
- 笔误。表格中一处数字顺序颠倒,很容易在编辑校对中漏过,因为没有人会手工重新计算描述性统计量。
- 取整方式。有的软件直接截断,有的软件则四舍五入。真实均值 5.1786 经截断后输出为 5.17,在假定常规四舍五入的检查中就会不通过,而这并非作者的过错。
- 均值旁标注的 n 并不是计算均值所用的 n。缺失的回答、被排除的参与者或亚组分析,都可能使有效样本小于列标题所示,而这并无误导之意。
- 测量指标其实并非以整数为粒度。由三个条目取平均构成的量表,其步长是 1/(3n) 而不是 1/n,因此简单套用的检查会把完全正常的均值标记出来。
只有排除了这些可能之后,解释的范围才会收窄,指向另一种可能:数据从未以文中所述的形式存在过。即便如此,这一检验也无法判断适用的是哪种解释:它证明的是不可能性,而非意图。与标记相称的回应,是向作者提出问题,并在政策允许的情况下索取原始数据。把标记当作指控,是把逻辑弄反了。这一检验找出的是需要解释的数字,而大多数解释都平淡无奇。
已发表论文中不可能成立的统计数据有多常见?
不可能成立的均值出现得相当普遍,已是一个系统性问题,而不只是个别奇闻。Brown 和 Heathers 将 GRIM 检验应用于一批已发表的心理学论文样本时,在可检验的论文中,约有一半似乎至少包含一个与其报告样本量在数学上不一致的均值。这些都是发表在声誉良好的期刊上、经过同行评议的论文,而这些不一致就摆在明面上,任何人只要有论文和一台计算器就能核查。
放在可重复性讨论的背景下,这一比例就更值得重视。在回答《Nature》一项调查的 1,576 名研究人员中,超过 70% 表示曾尝试重复其他科学家的实验但未能成功。超过一半的人在同一项调查中表示,他们曾无法重复自己的某项实验。报告错误是这一错综复杂问题中的一环:如果一项结果已发表的描述性统计量有误,那么无论实验室里实际发生了什么,都无法根据论文重建这一结果。
对 GRIM 研究结果的如实解读,并不是“一半的文献是伪造的”,而是:常规的统计报告远不如已发表表格的精致外观所显示的那样可靠,因为直到不久之前都没有人在检查。审稿人很少重新计算描述性统计量;一直以来的默认假设是,这些数字就是它们所标示的那样。GRIM 表明了这一假设遗漏了多少问题,而它所用的算术,所有人一直都可以使用。
在审查阶段重新计算统计数据
GRIM 属于“重新计算”这一类自动化检查:不直接相信报告的数字,而是推导出它必须满足的条件,再验证它是否满足。GRIM 只需要报告的均值、样本量和量表,此外别无所需,因此 Brown 和 Heathers 无需接触任何原始数据,就能从外部检验已发表的论文。同一类检查中还有好几种,完全依据稿件的正文和表格即可运行:
| 检查 | 重新计算的内容 | 不一致可能提示的问题 |
|---|---|---|
| GRIM 类均值检查 | 在给定 n 和量表的情况下,每个均值能否得出 | 笔误、n 有误、测量指标非整数、数据报告有误 |
| 检验统计量一致性 | 检验统计量、自由度与 p 值三者是否吻合 | 复制粘贴错误、选择性取整、更深层的问题 |
| 百分比检查 | 百分比是否与对应的计数和分母相符 | 取整误差累积、亚组混淆 |
| 总数与亚组 | 各亚组计数之和是否等于所述总数 | 未说明的排除、表格整理错误 |
这些检查具有确定性、成本低廉,因此很适合与范围更广的各项稿件诚信检查一起实现自动化,而不是只留给那些看起来已经可疑的论文。对编辑团队和诚信团队而言,实际的问题在于放在哪个环节。如果在投稿或初筛时通过审查平台运行,不一致之处会以一条普通修改意见的形式返回给作者,趁数据还在手边,很容易解决。同样的不一致如果在发表后才被发现,就会变成一次更正、一份关注声明或一场公开争议。算术完全相同,所处时机带来的代价却截然不同。
检查放在哪个环节,如今也成了处理能力的问题。据《Nature》报道,2023 年有超过 10,000 篇研究论文被撤稿,创下年度纪录。限制大多数编辑部的是筛查能力,而不是筛查意愿。确定性检查是工作量中无需增加审稿人工时即可扩展的部分,这也是各大出版商已将其纳入 STM Integrity Hub 等共享基础设施的原因。
如果向作者询问之后,重新计算发现的问题仍未解决,它就不再是一个算术问题,而成了一个流程问题。COPE 指南阐明了编辑处理已发表论文所受质疑以及后续可能更正的路径;从首次询问起就遵循这一路径,事态如果进一步发展,相关记录也能站得住脚。重新计算还很好地说明了自动化的边界在哪里,这一边界在自动化检查无法发现什么一文中有专门论述。
Octym 如何提供帮助
Octym 的统计验证与一致性检查会在稿件审查过程中重新计算报告的统计数据,并将疑似不一致之处作为信号呈现,每一项都对应到该数字在稿件中出现的确切位置。平台不会就某个均值为何未通过检查下结论;它呈现证据,以便由人提出恰当的问题。对于诚信与调查团队而言,这能把一种直觉变成有据可查、可以核实的起点,而不是一个定论。