跳到主要内容
OctymPowered By Proofig AI
可重复性

为什么这么多实验无法重复

超过 70% 的受访研究人员曾无法重复其他实验室的研究。不可重复性从何而来,以及完整性这一有助于改善的抓手。

2026年5月19日 · Octym · 7 分钟阅读

实验之所以无法重复,主要是因为发表的记述不完整,而不是因为背后的科学有误。方法部分遗漏了步骤,试剂和分析选择没有写明,样本量太小,无法给出稳定的结果,分析决策是在数据到手之后才做出的。于是另一个实验室只能靠猜测重建实验方案,并得到不同的结果。

可重复性问题有多普遍?

可重复性问题普遍到大多数在职科学家都亲身遇到过。《Nature》于 2016 年发表的一项调查显示,在 1,576 名受访研究人员中,超过 70% 表示曾尝试重复其他科学家的实验但未能成功,超过一半表示曾无法重复自己的某项实验。正是第二项结果改变了讨论的框架:它描述的是研究人员无法重复自己设计、亲手开展且了如指掌的工作。

这一细节排除了那些简单的解释。如果一个领域中有很大比例的人无法重复自己的实验,原因就不在于重复方能力不足,也很少是不端行为。在从实验台到纸面的过程中,有些东西丢失了。到达读者手中的记述,是实际情况的压缩版本:方法部分往往放到收尾才写,按字数限制删减,描述的是作者已经做过无数次的实验方案,以至于那些已经习惯成自然的步骤,作者不再觉得值得写下来。

对科研管理部门而言,整体情况比任何单一案例都更重要。无法复现的研究会消耗基金经费,拖延后续项目,还会占用每一个试图在其基础上开展工作的实验室的时间。这类问题暴露得也晚,通常是在发表之后,在另一个团队花了一年时间仍未能重复出结果之后。到那时,可选的做法有限,而且都是公开的。把可重复性视为稿件的属性、而非整个领域的属性的机构,就能在研究成果仍可由自己修正时进行干预。

不可重复性究竟从何而来?

不可重复性主要源于论文遗漏的内容,以及在数据到手后做出的选择。四个原因在复现失败的案例中占了很大一部分,而其中没有一个需要有人存在不当行为。

首先是方法描述不够具体。以概要形式描述的实验方案,审稿人读来没有问题,在实验台上却无法重复:孵育时间、温度、传代次数和步骤顺序都没有写明,因为对亲手做实验的人来说,这些都是不言自明的。试剂细节的缺失让问题雪上加霜。抗体、细胞系、质粒或软件包如果只写名称,没有货号、标识符或版本号,下一个实验室就只能猜测用的是几种相似产品中的哪一种,而这些产品的表现并不完全相同。

另外两个原因在于分析环节。灵活的分析,即在看到数据之后才确定检验方法、排除规则或亚组,所得出的结果看似确凿,换一个数据集却站不住脚。统计功效不足的设计所得出的估计值太不稳定,难以复现:一项达到显著性的小型研究,往往是因为高估了效应量才达到显著,因此一次如实的复现会更接近真实情况,读起来却像是失败。作者和课题负责人(PI)很少把这些当作报告问题来看待,这正是它会贯穿整个起草过程、一直延续到投稿的原因。

失败来源在稿件中的表现如何弥补缺口
方法描述不够具体步骤只有概述而无具体说明;缺少初次接触者重复实验所需的条件提供实验方案级别的细节,或指向论文所引用的已存档方案
资源细节缺失试剂、细胞系、菌株和软件只有名称,没有标识符或版本号为使用的每一项关键资源提供标识符
灵活的分析分析选择被呈现得仿佛事先就已确定,却未说明哪些是计划内的明确区分预先计划的分析与探索性分析
统计功效不足的设计报告样本量而不说明依据;效应值徘徊在阈值附近在数据收集前确定并写明样本量的依据
选择性报告结果中只出现有效的条件和结局指标报告所有测量的条件和结局指标,包括阴性结果

为什么报告规范是切实可行的抓手

报告规范把“这项研究严谨吗?”这个问题,转化为“这份记述完整吗?”,而后一个问题在投稿前就能回答。EQUATOR Network 维护着一个可检索的报告规范库,涵盖主要的研究类型:随机试验适用 CONSORT,动物研究适用 ARRIVE,观察性研究适用 STROBE,系统综述适用 PRISMA,此外还有很多。每一项规范都是一份核查清单,列出该类研究的记述必须包含的条目,从参与者如何分组到缺失数据如何处理。

完整性在某些地方还可以通过算术来检查,这一点很容易被忽略。报告的均值可以对照其样本量进行检验,Brown 和 Heathers 发现,在他们考察的可检验心理学论文中,约有一半至少包含一个在数学上不一致的均值。一个无法根据论文自身表格重新算出的结果,读者也就无从重复。

这一区别之所以重要,是因为设计与完整性出问题的时间点不同。数据收集一旦结束,设计就已固定:统计功效不足的实验,无法在修改阶段变得功效充足。完整性则不同。只要稿件还是草稿,报告核查清单上的每一个条目都仍然可以补充、澄清或说明理由,而 EQUATOR 报告规范库的存在,就是为了让作者不必去猜测本领域期望看到哪些条目。

资助机构也在朝同一方向推动。NIH 要求申请书明确阐述严谨性和可重复性,ERC 和 Horizon Europe 等欧洲资助计划也对报告和数据可用性附加了各自的条件。其实际影响是,方法部分如今要同时服务三类读者:评判论点的审稿人、核查所述承诺是否兑现的资助机构,以及将尝试重复这项工作的科学家。三者需要的都是完整性,而完整性正是严谨性中投稿前检查仍能改变的那个维度。

科研机构在稿件阶段能做些什么?

机构可以在稿件离开本单位时采取行动;过了这一关,这项工作就不再由他们自行修正了。这些步骤并不起眼,大多属于程序性工作:

  • 将稿件与相应的报告规范对应起来。确定哪份报告核查清单适用于该研究设计,然后在投稿前对照它通读方法部分,而不是等审稿人来做。
  • 要求为关键资源提供标识符。货号、资源标识符、菌株编号和软件版本,添加起来只需几分钟,几年之后却几乎不可能再还原。
  • 要求书面说明样本量的依据。如果没有人能说清这个数字是怎么确定的,那么这一点值得在论文公开之前就弄清楚。
  • 区分预先计划的分析与探索性分析。把探索性结果标注为探索性,不需要任何代价,还能保护真正重要的论点。
  • 检查内部一致性。正文中与图表不符的数字,或描述了图中并不存在的图片的图注,会和稿件检查所审查的其他所有内容一样,随同一份稿件一起流转。

提前行动还有一个下游原因。期刊的筛查环节日益严格:通过 STM Integrity Hub,各大出版商合作建设共享基础设施,对投稿进行筛查,以发现论文工厂信号及其他科研诚信疑点。过去在同行评议中才浮现的问题(如果能浮现的话),如今在投稿入口处就会被自动化检查提出,而这些检查的发现会交给编辑,而不是作者。在投稿前自行开展审查的机构,能在问题还可以由完成这项工作的人在草稿中低调处理时,就看到同一类问题。同样的要求如今开始得更早,在申请阶段就已提出:资助机构要求申请人明确阐述严谨性。

Octym 如何提供帮助

Octym 在稿件投稿前审查方法与可重复性相关的报告,这是对论文进行的一次性审查的一部分。如果所描述的方法遗漏了其他实验室需要的细节,或者某项分析没有写明其选择,这一缺口就会作为附有支撑证据的信号呈现,定位到稿件中的具体位置,并可追溯至原文。Octym 不下定论:由作者、课题负责人或科研管理部门决定哪些内容需要补充、澄清或保持原样。这让科研管理部门能在研究成果仍可修改时,清楚地了解这项工作。

用任意一份稿件体验 Octym。

联系我们,或登录。