要发现图表在不同论文之间的重复使用,需要将投稿中的图像与已发表的学术记录进行大规模比对:软件从稿件中提取图表、曲线图和统计图,并将其与已发表资料的数据库进行匹配。人工审查无法做到这一点,因为没有哪位编辑或审稿人能记住数以百万计的已发表图表。
为什么跨论文的图表重复使用能逃过人工审查?
人工图像筛查局限于单篇稿件的范围之内。编辑或图像完整性分析师可以把两幅图表并排放置,发现重复的印迹泳道或重复的显微视野,并在发表前向作者询问。这类检查切实有效:图像完整性分析师 Jana Christopher 在接受 UKRIO 的专家访谈时介绍,据她估计,她在发表前筛查的已录用稿件中,约有 20% 到 35% 因图像相关问题被标记。
局限在于比对范围。稿件内部筛查是让一篇论文与自身比对:几十张图像,都摆在同一张桌面上。而跨论文的重复使用,需要将一份投稿与文献中已发表的全部内容进行比对,这是任何人都做不到的。一位审稿人一年只审阅寥寥几份稿件,至多能认出自己恰好熟悉的论文中的图表。一张从其他课题组文章中照搬而来、多年前发表在审稿人从不翻阅的期刊上的统计图,看起来会完全像是原创。
这就是为什么跨论文的重复使用往往是偶然被发现的:一位视觉记忆力过人的读者、一位在论文发表后进行核查的人士,或是一条举报线索。依赖巧合的筛查算不上筛查。规模上的不匹配是结构性的,而不是努力程度的问题:人的注意力随阅读时间的增加而增长,而已发表的学术记录早已多达数百万篇文章。弥合这一差距是一个数据库问题,也必须作为数据库问题来解决。
图像抄袭剽窃在实践中有哪些表现?
在实践中,图像抄袭剽窃涉及的远不止照片。显而易见的情形是摄影类数据图像:显微视野、蛋白质印迹图、凝胶图和流式细胞图,从已发表论文中取来,作为新的结果呈现,过程中往往经过旋转、裁剪、镜像或对比度调整。容易被忽视的情形是曲线图和统计图。柱状图或折线图与其他图像并无二致,一张照搬来、重新标注了坐标轴并更改了数据系列颜色的图,能毫无阻碍地通过文本相似度筛查,因为文本工具比对的是文字,看不到图表内部的任何内容。
| 被重复使用的内容 | 常见的改动 | 读者为何会漏看 |
|---|---|---|
| 显微、印迹和凝胶图像 | 旋转、镜像、裁剪、对比度或颜色变化 | 以正常阅读速度浏览时,改动过的副本看起来并不完全相同 |
| 曲线图和统计图 | 重新标注坐标轴、更改数据系列颜色、重绘图例 | 被当作结果而非图像看待,因此没有人从视觉上比对 |
| 组合图中的单张图片 | 抽出其中一张图片并配上新的图注 | 来源是隐藏在另一篇论文另一幅图表中的一张子图 |
如今,这一问题是双向的:据《Nature》2024 年的报道,生成式人工智能能够生成看起来很“科学”的图表,连专家都难以将其与真实的数据图像区分开来。因此,针对重复使用或伪造图表的筛查,必须把稿件中的每一个视觉元素都当作可比对的数据:照片、曲线图、统计图,以及组合图中的每一张图片,一视同仁。
与已发表记录的比对是如何进行的?
将投稿与已发表记录进行比对,是一个由三部分组成的数据库问题。第一是语料库:从已发表文章中提取并建立索引的图表集合,每一份新投稿都要与之比对。第二是分割:将组合图拆分为单张图片,因为重复使用通常涉及的是其中一张图片,而非整幅图表。第三是能够抵御常见改动的匹配:每张图像都会被转化为一个视觉指纹,这个指纹在旋转、镜像、缩放、裁剪和对比度变化下保持稳定,因此即便是改了颜色的统计图或翻转过的显微图像,仍能找到其来源。
语料库决定了上限。比对只能在已建立索引的资料中发现匹配,因此数据库的覆盖广度决定了筛查能看到什么。
对于相近的问题,出版商已经接受了这一逻辑:主要出版商通过 STM Integrity Hub 合作建设共享基础设施,对投稿进行论文工厂信号及其他科研诚信问题的筛查,因为没有哪一家期刊能看到全部的投稿流。同样的压力正在波及图表:据《Nature》新闻报道,由于人工审查无法可靠地发现 AI 生成的图像,出版商和诚信专家正在开发自动化筛查。
数据库比对的输出是一份供人工审查的候选匹配短名单,每一项都将投稿图像与外观相似的已发表图像配对呈现。在这一层面运行的各项检查,从稿件内部的重复,到对照已发表来源的图像与曲线图抄袭剽窃检查,都遵循同一种分工:软件负责大规模比对,人负责判断软件发现的内容。
被标记的匹配意味着什么,不意味着什么
被标记的匹配意味着两张图像在视觉上相似,并不意味着存在学术不端。视觉相似有一些正当的解释,编辑需要在采取任何其他行动之前,逐一确认或排除这些解释:
- 同一作者在自己的多篇论文中重复使用方法或仪器装置图像,并注明了引用
- 经许可或授权的再次发表,例如在综述文章中注明原图出处
- 同一研究的早期版本:预印本、会议论文集、学位论文
- 共用的仪器、校准标准品或对照材料,确实会产生相似的图像
筛查经验也指向同样的结论。Jana Christopher 在接受 UKRIO 的专家访谈中表示,无意错误与蓄意篡改之间的比例难以确切知晓;同样,在作者作出答复之前,跨论文匹配也应先被推定为存在寻常的解释。
被标记的匹配所改变的,是编辑能够提出的问题。没有它,根本无从问起。有了它,就有了一个具体、可回答的询问:这张图片与这篇早期论文中的这幅图表相似,请说明两者之间的关系并提供原始数据。呈现方式在这里很重要:筛查平台如果把每个匹配与其候选来源并排展示,并标明来源,编辑就能在几分钟内处理大多数标记,并将少数需要关注的标记上报。每一步的决定都由人做出。数据库可以指出两张统计图看起来相似;而这种相似意味着什么,要由掌握了作者答复的人来判断。心中有了基础比率,这一判断会更容易,因为大多数被标记的图像都是无心的制图错误。
Octym 如何提供帮助
Octym 将投稿中的图表、曲线图和统计图与已发表资料进行比对筛查,并将疑似匹配以信号的形式呈现,每一项都与其候选来源并排展示,使证据可追溯。这项比对由业内规模领先的图像抄袭剽窃数据库 Proofig 提供支持,从一开始就把曲线图和统计图当作图像来处理。Octym 从不给出定论:编辑会结合上下文审查每一个匹配,并决定其含义。您可以在面向出版商的解决方案中了解这如何融入编辑部筛查流程。