跳到主要内容
OctymPowered By Proofig AI
科研诚信

自动化诚信检查能发现什么,又不能发现什么

自动化诚信检查能很好地发现特定类别的模式,但无法判断意图或学术价值。如实说明其局限,以及这些局限对工具意味着什么。

2026年5月26日 · Octym · 6 分钟阅读

自动化诚信检查在识别特定类别的模式时是可靠的:重复或被篡改的图像、在统计上不可能成立的结果、已撤稿或虚构的参考文献,以及缺失的披露声明。它们无法判断意图、创新性或学术价值,也无法取代审稿人。正因为存在这一边界,设计良好的工具会把发现作为信号交由人来权衡,而绝不作为定论。

自动化诚信检查真正擅长什么?

只要诚信问题留下稳定、机器可识别的模式,自动化检查就能发挥良好作用。如今编辑部筛查中以四类模式为主,每一类都有实实在在的成效记录。

模式类别机器比对的内容典型信号
图像重复与图像篡改图表内部及图表之间像素层面和特征层面的相似性被重复使用的 Western blot 图片、拼接的泳道、经旋转或缩放的重复图像
不可能成立的统计数据报告数值之间的算术一致性在所述样本量下,任何整数数据都无法得出的均值
参考文献完整性将参考文献列表与外部记录进行比对解析引用了已撤稿论文、DOI 无法解析到任何内容
披露缺漏对照既定要求检查相关内容是否存在缺少伦理声明、数据可用性部分或利益冲突声明

这些模式出现得足够普遍,足以支持对每一份投稿进行筛查。图像完整性分析师 Jana Christopher 在接受 UKRIO 的专家访谈时介绍,在录用阶段(同行评议之后、发表之前)接受筛查的稿件中,约 20% 至 35% 因图像相关问题被标记。在统计方面,Brown 和 Heathers 提出的 GRIM 检验检查报告的均值在给定样本量下是否在数学上成立;在他们考察的可检验心理学论文中,约有一半至少包含一个不一致的均值。这一领域还在不断扩展:据《Nature》报道,生成式人工智能如今已能生成看似科学的图表,专家难以将其与真实的数据图像区分开来,而出版商之所以在构建自动化筛查,正是因为人工审查无法可靠地发现它们。在所有这些情况下,机器的优势都出于同一个原因:其底层任务是大规模比对,比对所涉及的图像、参考文献和计算之多,远超任何人脑中所能容纳的范围。一份公开的平台检查内容清单,应当能与这类模式类别清晰对应,因为自动化真正能够兑现的,正是这些方面的承诺。

自动化看不到的:意图、学术价值与背景

没有任何自动化检查能告诉您异常为何存在、这项科学研究是否重要,或者一项发现在研究的逻辑中意味着什么。意图、学术价值和背景这三个盲区,决定了任何筛查系统的上限。

先看意图,这一点再清楚不过。软件可以确定两张图片完全相同,却无法确定研究人员是在组装图表时疏忽大意,还是有意改动了图表。这一区别在实践中很重要:Christopher 在同一次 UKRIO 访谈中表示,无意错误与蓄意篡改之间的比例很难确切知道,这正是标记必须交由人来处理、而不能由工具自行定论的原因。如果一套流程把每一个图像重复标记都当作指控,就是误读了基础比率,并会侵蚀编辑与作者之间的信任。

学术价值则完全超出了自动化的能力范围。算法可以核实参考文献能否解析、统计数据是否内部一致,却无法告诉您这个问题是否值得研究、研究设计是否适合回答这个问题,或者结论是否推动了该领域的发展。做出这些判断正是同行评议存在的意义,任何筛查环节都无法取而代之。

背景介于两者之间。一张重复的图像,可能是已正确注明出处的再次发表。一个不一致的统计数据,可能源于有据可查的取整惯例。一项看似缺失的披露,可能放在补充材料中。对于阅读稿件的人来说,这些解释都显而易见,而模式匹配程序却完全看不到,这正是为什么一个标记应当开启一次对话,而不是终结对话。

为什么局限决定了设计

自动化检查的局限是设计要求,而不是埋在文档里的免责说明。一个无法判断意图的系统就不能以下定论的口吻说话,仅这一条约束就决定了后续的一切。

由此可得出三点:

  1. 发现即信号。模式匹配程序如实的输出是“这两个区域相匹配”或“这个均值在算术上不一致”:这是一项有待审视的观察,并明确说明匹配的强度。
  2. 每个信号都附有证据,并可追溯至原文。匹配的区域、计算过程、撤稿声明。有了证据,人就能在几分钟内核实或排除一项发现,而不必从头重新分析。
  3. 由人做决定。流程的终点是一位编辑、科研诚信负责人或审稿人,由其结合机器看不到的背景来权衡信号,并对结果负责。

整个行业也正在按这种方式组织起来。各大出版商通过 STM Integrity Hub 合作建设共享基础设施,对投稿进行筛查,以发现论文工厂信号及其他科研诚信疑点;筛查为编辑决策提供依据,而不是代替编辑做决定。您评估的任何诚信平台都应呈现同样的结构:输入信号,附上证据,由人作出判断。一个了解自身局限的工具,会把每一项发现都交给那位能够权衡意图与背景的参与者:人。

应当如何评估诚信工具?

实事求是的评估,要从询问自动化在哪里止步开始。无法清楚回答这个问题的供应商,并没有认真思考过自己的系统;而声称其系统能够认定不端行为的供应商,所声称的是任何模式匹配程序都无法做到的事。值得向任何供应商提出的问题:

  • 覆盖了哪些模式类别,清单是否公开?关于覆盖范围的说法应当具体、可核查,对应到明确的检查类型,而不是笼统的承诺。
  • 一项发现是什么样子?请索取样例。它应当展示证据及其出处,读起来应当是一项观察,而绝不是一项裁定。
  • 如何呈现不确定性?真实的筛查会产生模棱两可的情况。把每个案例都硬性归入“有标记”或“无问题”的工具,是在隐藏自己的误差范围。
  • 人能否推翻任何一项发现?每个信号都应当可以被排除,并记录理由,因为审阅者掌握着系统所不具备的背景信息。
  • 自动化无法评估的问题如何处理?学术价值、创新性和意图仍然需要审稿人来判断;对于涉嫌不端行为的情况,还需要一个审慎对待相关当事人的正式程序。

对于诚信与调查团队,标准还要更高:一项发现可能需要经得起机构或出版商处理程序的检验,因此可追溯的证据是必备条件,而不是锦上添花。当诚信与调查团队为已在处理中的案例评估筛查支持时,同样的问题也适用。一个坦诚说明自身局限的工具更好用,而不是更难用,因为正是这种坦诚,让人能够以站得住脚的方式为决定负责。如需一个在算术上明确果断、对意图不置一词的检查实例,请参阅 GRIM 检验。

Octym 如何提供帮助

Octym 正是围绕本文所述的边界构建的:每一项疑似发现都作为附有支撑证据的信号呈现,每一项都可追溯至原文,并始终由人来决定它意味着什么、下一步怎么做。各项检查都限定在自动化能够胜任的模式类别之内;意图、学术价值和背景则交由编辑、科研诚信负责人和审稿人判断。这一设计背后的理由,详见 Octym 为何这样设计。

用任意一份稿件体验 Octym。

联系我们,或登录。