AI 稿件审查是指在人对一篇研究论文做出任何决定之前,使用软件检查其中的诚信与质量问题。它涵盖三大类:对稿件本身的内部检查、对照已发表记录的检查,以及对科研质量的评估。发现以证据的形式交由人来判断,而绝不是作为定论。
同样的审查可以在科研生命周期的许多环节进行。基金申请人在申请书提交给资助机构之前进行检查,作者在投稿之前检查稿件,编辑部筛查新投稿,诚信团队审查已受到质疑的论文。在每一种情况下,方法都是一样的:系统性检查,附上证据,由人做出决定。
AI 稿件审查检查哪些内容?
AI 稿件审查从三大类检查论文:稿件内部完整性、对照已发表记录的外部检查,以及科研质量。内部完整性一类只关注稿件内部的内容。外部检查一类将稿件与所有已发表的内容进行比对。科研质量一类关注科学研究本身的构建是否经得起检验。
| 检查类别 | 涵盖内容 | 回答的问题 |
|---|---|---|
| 稿件内部完整性 | 图像篡改与图像重复、AI 生成图像、曲线图与统计图表重复、统计验证与一致性、图表与图注一致性、论点与引用一致性 | 稿件自身是否前后一致? |
| 对照已发表记录的外部检查 | 图像与曲线图抄袭剽窃、已撤稿参考文献、虚构或不存在的参考文献、DOI 与元数据准确性、引用模式 | 对照现有文献,稿件是否站得住脚? |
| 科研质量 | 方法与严谨性、可重复性、可复现性、科研伦理、同行评议级分析 | 这项科学研究在发表后能否经得起检验? |
自从语言模型进入写作流程,外部检查这一类的重要性急剧上升。在《Scientific Reports》发表的一项经同行评议的测试中,GPT-3.5 生成的文献引用大多是虚构的,GPT-4 仍会产生相当比例的虚构或错误引用,即使是引用真实存在的文献,也常常包含实质性错误。如今,一份参考文献列表可能看起来无可挑剔,却仍然引用了根本不存在的论文。关于每一类具体检查哪些内容的更完整说明,展示了各项检查如何相互配合。
为什么仅靠人工审查已经跟不上
仅靠人工审查已经跟不上,是因为问题论文的数量和伪造内容的复杂程度,都已超出了人的注意力所能筛查的范围。据《Nature》报道,2023 年有超过 10,000 篇研究论文被撤稿,创下年度纪录;而撤稿是在发表很久之后才发生的,这意味着这些论文都通过了审查,并在此期间一直留在文献中。
伪造内容也变得更难识别。《Nature》在 2024 年报道,生成式人工智能能够生成看似科学的图表,专家难以将其与真实的数据图像区分开来;出版商和诚信专家之所以在构建自动化筛查,正是因为人工检查无法可靠地发现它们。审阅单篇稿件的审稿人,也无从察觉其中的图表与不相关论文中的图像相似,或者其结构与其他几十份投稿雷同:这些模式只有在成千上万份文档中才会显现出来。
同行评议从来就不是为此设计的。审稿人的任务是评判科学内容;图像取证分析、参考文献核实和统计审核是各自独立的技能,却要在无偿且时间紧迫的情况下,一次一份地应用于稿件。出版商得出的结论是,答案在于共享基础设施:通过 STM Integrity Hub,各大出版商合作对投稿进行筛查,以发现论文工厂信号及其他科研诚信疑点。AI 稿件审查把同样的逻辑应用到单篇稿件上:让软件完成系统性扫描,让人把注意力放在判断上。
信号,而非定论:发现应如何交到人的手中
设计良好的 AI 稿件审查提供的是信号,而非定论:它将每个疑似问题连同其证据一并呈现,并把判断留给人。这一区别并非表面文章。许多标记都有无过错的解释。一张重复的图像,可能是已正确披露的对照图像复用;重叠的文本,可能是标准的方法描述;一种不寻常的引用模式,可能反映的是一个小众子领域,而不是任何有组织的行为。下达裁定的软件,会把每一种情况都变成错误的指控。呈现证据的软件,则能让人在几分钟内把这些问题弄清楚。
一个完整的信号包含审阅者独立核实所需的一切:
- 标记了什么:具体的图表、图片、参考文献、统计数据或段落。
- 位于何处:在稿件中的确切位置。
- 证据:匹配的图像区域、撤稿声明、解析后的 DOI 记录,或并列呈现的不一致数字。
- 原文追溯:指向原始材料的链接,任何人都不必单凭软件的一面之词。
以这种方式呈现的发现是可审计的。编辑可以向作者准确展示是什么引出了某个问题,科研诚信负责人可以把证据直接放入案卷,而无需重新推导。一次审查如何运行,从上传到得出发现的整套机制,都直接源于这一原则。
谁在使用 AI 稿件审查?
AI 稿件审查贯穿科研生命周期,从基金申请一直到正式发表,由四类对同一份稿件利害关系各不相同的群体使用。
- 研究人员和基金申请人在任何其他人之前先检查自己的工作。NIH(针对 R01 和 R21 申请)、ERC、Horizon Europe 和 Wellcome 等资助机构已将严谨性和可重复性列为明确要求,而背后的问题真实存在:在《Nature》一项调查的 1,576 名研究人员中,超过 70% 曾尝试重复其他科学家的实验但未能成功,超过一半曾无法重复自己的实验。在投稿前发现薄弱的方法部分或有问题的参考文献,代价远低于投稿后才发现。
- 科研机构通过科研管理部门和实验室开展审查,在研究成果离开机构之前进行筛查。一篇有问题的论文就可能危及基金资助资格和机构声誉,因此投稿这一节点,正是机构掌控力达到顶峰之时。
- 出版商在投稿阶段进行筛查,对每一份稿件施以同样的审查,而不是只审查那些恰好引起怀疑的稿件。这种一致性对公平性和工作量都很重要:编辑人员只需对被标记的条目进行分流处理,而不必对所有内容都做取证式检查。
- 诚信与调查团队(包括科研诚信办公室负责人和伦理委员会)在疑点已被提出、需要整理出有条理、可核实的证据而非零散截图时使用这一审查。
在每一种场景中,平台都按机构的要求进行配置,而上一节的工作原则始终适用:软件汇集证据,每一项决定都由人做出。接下来有两个延伸问题值得一读:通用聊天机器人能否胜任这项工作,以及自动化检查真正无法发现的是什么。
Octym 如何提供帮助
Octym 是由 Proofig 团队打造的科研诚信与质量 AI 平台。它是一个平台,以定制化解决方案服务出版商、科研机构、研究人员以及诚信与调查团队,从基金申请一直到正式发表。它将疑似发现作为附有证据的信号呈现,每一项都可追溯至原文,并始终由人做出决定。这一立场背后的理由,详见各团队为何选择 Octym。