生成式工具如今已能制作出看起来像科研图表的图像,专家很难将其与真实的数据图像区分开来;正如《Nature》所报道,这正是出版商转而构建自动化检测、不再依赖肉眼的原因。检测是可行的,但它给出的是概率而非证明,仍需由人来决定。
为什么 AI 生成的图表能骗过训练有素的审稿人?
科研图表对生成模型而言是格外容易下手的目标,原因在于结构而非技术。蛋白质印迹(Western blot)不过是噪声背景上的几条灰色条带;显微图像则是一片形状大致相似的视野。两者都不包含那种会让一张伪造的街景照片在仔细检查下露出破绽的语义细节:没有长着六根手指的手,没有拼错的招牌,也没有不可能出现的倒影。
审稿人一开始带着的预设也不对。同行评议的发展初衷,是评估实验设计是否合理、结论是否由数据得出,而不是追问数据图像究竟是否拍下了任何真实存在的东西。审稿人看一张印迹图时,评估的是条带意味着什么,而不是追究这些条带是否真的在膜上出现过。
《Nature》报道称,专业人士之所以开发自动化检测,正是因为人工审查无法可靠地发现 AI 生成的图表。对于一个图像筛查历来依赖专家肉眼的领域,这是一个分量很重的承认,也标志着威胁模型发生了真正的变化:过去的问题是作者篡改真实图像,而新的问题是图像背后根本没有任何实验。
对编辑部而言,实际后果是“看起来合理”已不再能说明任何问题。一张经受住肉眼检查的图表,通过的恰恰是生成式工具专门为之优化过的那种检验。
检测能如实承诺什么?
对 AI 生成图像的检测依据的是统计痕迹,而非图像含义。生成模型会在噪声分布、纹理和频率成分上留下特征性规律,这些规律不同于真实显微镜、相机和成像传感器所产生的伪影。检测器学习这些差异,并报告一张图像与合成生成特征的吻合程度。
这一机制为任何诚实的系统所能宣称的内容划定了硬性界限,值得直白地说明:
- 输出是概率性的。检测器报告的是可能性,而非事实。不存在一种出现在每张生成图像中、却从不出现在真实图像中的特征标记。
- 压缩和处理会削弱信号。高强度的 JPEG 压缩、尺寸调整和图表拼合,都会去除检测器所依赖的细粒度痕迹,因此一张经过正当处理的图像可能显得更可疑,而一张经过精心清洗的合成图像反而可能显得更干净。
- 模型在不断演进。针对某一代工具训练的检测,面对下一代工具时效果会减弱,因此这是一项需要持续维护的能力,而不是一个已经解决的问题。
- 高分并不等于认定存在学术不端行为。它是向作者索取原始采集文件和仪器元数据的理由。
这些都不意味着检测毫无用处,而是说明它是一种筛查信号,与抄袭相似度评分属于同一类:对引导关注很有价值,但单凭它永远不足以对任何人下结论。在几乎所有真实案例中,决定性的一步都不是检测器的输出,而是随之而来的索取请求,因为真实的实验背后有原始文件、仪器设置和带日期的采集记录,而生成的图表没有。
出版商实际上在采取哪些措施?
出版商的应对是集体行动而非各自为战,这本身就说明了业界如何看待这个问题。各大出版商通过 STM Integrity Hub 合作建设共享的投稿筛查基础设施,涵盖论文工厂信号和其他科研诚信问题。
共享基础设施对合成图表尤为重要,因为其经济逻辑有利于以量取胜。一家大规模炮制伪造稿件的论文工厂,生成图表的速度远远快于任何一家期刊的审查速度,而同一张伪造图像可能被先后投往多家期刊。只检查自身投稿流的出版商看到的只是孤立的一例;共享系统看到的则是规律。
在单个编辑部层面,应对措施是把图像筛查提前并常态化。图像完整性分析师 Jana Christopher 在接受 UKRIO 采访时表示,在录用阶段接受检查的稿件中,已有 20% 至 35% 在编辑部筛查中引发与图像相关的质询;而在她筛查过的稿件中,录用最终被撤销的仅占 1% 至 8%,因此绝大多数被标记的论文仍保留录用。合成图表进入的是一个现成的工作流程,这是一个实实在在的优势:期刊无需另起炉灶,只需扩展现有流程。
让这一切更加紧迫的背景是论文数量。据《Nature》报道,2023 年有超过 10,000 篇研究论文被撤稿,创下年度纪录。如今在多数编辑部,真正的制约因素是筛查能力,而不是筛查意愿。
编辑拿到被标记的图表后该怎么做?
编辑手中若有一张疑似 AI 生成的图表,应将其视为一个有据可查的流程的开端,而不是结论。COPE 指南为编辑提供了成文的处理途径,用于处理针对已发表文章提出的疑虑以及可能随之而来的更正;是否遵循这一途径,正是站得住脚的决定与临时决定之间的区别。
实际操作的步骤很简短。向作者索取原始采集文件、生成这些文件的仪器或软件,以及采集日期。真实的实验能很快回应这一请求,因为这些文件就存放在某个文件夹里。伪造的图表则会导致拖延、替换文件,或是一番经不起追问的解释。
记录检查了什么、收到了什么。编辑部往往跳过、事后又往往后悔的,正是这一步:两年后有人对论文提出质疑时,需要的是当时留下的记录;而一个只凭对某个疑点的记忆来重启案件的诚信团队,只能从零开始。处理这类工作的团队需要可以提交给委员会的证据,而这份记录必须在提出质询的当下就建立起来。
自始至终保持中立的措辞。从统计上看,被标记图表的作者出错的可能性远大于伪造数据,因此在证据表明并非如此之前,往来函件都应以此为前提来写。这一默认立场有充分依据:就图像标记总体而言,多数被标记的论文仍保留录用。
Octym 如何提供帮助
Octym 会审查图表是否存在 AI 生成的迹象,同时检查篡改、重复与复用,并将每项发现作为信号返回,附上证据和位置。发现会按优先级排序,让有限的编辑精力用在关键之处。任何内容都不会作为对作者的定论呈现,也没有任何一项发现能单独了结一个问题:始终由人来决定一张被标记的图表意味着什么,以及下一步应索取什么。完整的检查项列表见检查内容页面。