您可以用 ChatGPT 改进稿件的语言、结构和清晰度,它在这方面做得很好。但您不能把它当作诚信审查工具:聊天机器人会编造引用,会在没有证据的情况下自信作答,无法检查图像,而且把未发表的稿件粘贴到面向消费者的服务中会引发保密问题。诚信审查需要基于证据、经过验证的检查,并由人来做决定。
ChatGPT 在稿件准备中擅长什么
通用聊天机器人对稿件准备确实有用,否认这一点是不诚实的。只要谨慎使用,ChatGPT 可以精炼行文、重组冗长散乱的引言、建议更清晰的主题句,并指出论证中跳步的地方。对于用第二语言写作的研究人员,这种帮助可以让长期以来偏向英语母语者的竞争环境变得公平。
聊天机器人也可以充当模拟听众。让它用两句话概括您的摘要,您就能知道摘要传达的是否是您以为的意思。让它反驳您的讨论部分,它就可能赶在审稿人之前暴露出薄弱的论证。这些都是写作辅助:研究人员仍是作者,并核查每一条建议。
即使在这个阶段,也有两条边界。一是披露:ICMJE 推荐规范要求作者披露在稿件准备过程中使用 AI 辅助技术的情况,并明确聊天机器人不能被列为作者。借助它润色是正当的;未披露的润色帮助才是问题。二是责任:无论聊天机器人写了什么,作者都要为之负责。一段行文流畅却含有细微错误论点的段落,比一段措辞笨拙但论点正确的段落更糟,因为审稿人会原谅笨拙,却不会原谅错误。
这些都不是稿件审查,而是写作支持,这一区别对下文的所有内容都至关重要。
为什么 ChatGPT 无法核实引用?
“把聊天机器人当审稿人”的想法,正是在引用核查上站不住脚,因为语言模型生成参考文献的方式与生成其他一切内容的方式相同:产出看似合理的文本。发表于《Scientific Reports》的一项经同行评议的研究发现,GPT-3.5 生成的文献引用中大多数是虚构的,而 GPT-4 仍会产生相当比例的虚构或错误引用。《Scientific Reports》的同一项分析还发现,即便是指向真实文献的引用,也经常包含实质性错误。
出错的方式比出错的比例更重要。虚构的参考文献不会带着“不确定”的标记出现;它的格式与每一条真实文献一模一样,有看似合理的作者列表、听起来真实的期刊名,以及一个无法解析到任何地方的标识符。而被要求审查您参考文献的聊天机器人,根本没有查证的机制:它不会检索文献数据库,不会解析 DOI,也不知道某篇论文是否在上个月被撤稿。当您问它参考文献是否正确时,它作答所依据的,正是当初编造参考文献的那套统计过程。
幻觉问题不止于参考文献。问聊天机器人您的统计是否可靠,它会给出一份自信、条理清晰、却与任何重新计算都毫无关联的评估。问它您的图表中是否存在重复,它不检查一个像素就会作答。这一切背后都没有证据链:没有可以打开的记录,也没有可以核查的来源。输出的只是形似审查的回答,并不是审查。
ChatGPT 能检查图像和图表吗?
图像完整性超出了聊天机器人的审查能力,与此同时,生成式人工智能正在让这一问题变得更加棘手。《Nature》新闻报道称,生成模型能够制作出看起来像科研图表的图像,专家很难将其与真实的数据图像区分开来。《Nature》新闻的同一篇报道还指出,出版商和诚信领域的专业人士正在开发自动化检测工具,正是因为人工审查无法可靠地发现这些图像。
筛查图表是一项取证工作:比对图表内部和图表之间的区域,将图像与已发表的文献进行匹配,并检查暴露出篡改或生成来源的伪影。在聊天窗口里作答的文本模型,这些都不做。它可以描述什么是图像篡改,却无法检查您的图像。这两种能力之间的差距很容易被忽视,因为聊天机器人的描述听起来很专业。
编辑们在大规模场景下面临同样的不对称,而出版业的应对是建设专门的共享基础设施,而非依靠通用聊天工具。各大出版商通过 STM Integrity Hub 合作,筛查投稿中的论文工厂信号和其他科研诚信问题。整个行业的发展方向是:专门构建、经过验证、输出明确的检测,并在所有投稿中一致地应用。一个对同一问题在不同日子给出不同答案的对话模型,无法支撑这类流程。
把稿件粘贴进聊天机器人的保密问题
把稿件粘贴进聊天机器人时,研究人员尤其容易忽视的风险是保密性。未发表的稿件属于保密材料:其中有未发表的数据、尚未受到保护的想法,有时还有受合作者、资助机构或患者隐私规定限制的信息。面向消费者的聊天机器人是第三方服务,粘贴进去的文本如何处理,取决于该服务的条款,而条款因服务商、套餐和设置而异。视配置不同,提交的内容可能会被保留,或被用于改进模型。对于尚未发表的研究而言,这意味着实实在在地失去控制。
对编辑和同行评议专家来说,这个问题更加突出。正在评审的稿件是托付给您的,您无权将其外传。把他人未发表的研究上传到外部 AI 服务,有违反审稿保密义务的风险,许多出版商现在已明确要求审稿人不得这样做。同样的逻辑也适用于筛查投稿的编辑部人员:稿件作者从未同意让面向消费者的服务处理他们的研究。
因此,任何 AI 审查工具面临的实际问题同时也是基础设施问题:稿件在哪里处理?谁可以访问?保留多长时间?是否会被用于训练?在采用任何服务之前,请先了解它如何处理数据安全与保密。在私有、受访问控制、保留条款明确的基础设施上进行分析,与使用一个免费的聊天窗口完全是两回事,即使两者表面上看起来相似。
什么是基于证据的稿件审查
基于证据的审查意味着每一项发现都与可核查的证据挂钩,而这恰恰是聊天机器人无法提供的。基于证据的引用标记会展示一条参考文献解析到了(或未能解析到)哪条文献记录。基于证据的图像发现会并排展示匹配的区域。基于证据的统计标记会展示报告的数值以及它们之间的不一致之处。审查者可以打开证据、对其提出异议,并推翻它。
| 维度 | 面向消费者的聊天机器人 | 基于证据的诚信审查 |
|---|---|---|
| 语言与结构反馈 | 强项,这是它的核心能力 | 不是目标 |
| 引用核查 | 生成看似合理的参考文献;虚构风险有文献记载 | 对照文献记录解析参考文献 |
| 图像筛查 | 无法检查图像 | 在各图表之间及与既往发表文献之间进行经过验证的检测 |
| 证据链 | 没有;只有流畅的断言 | 每项发现都链接到其来源 |
| 保密性 | 消费者条款因服务商和套餐而异 | 私有、受访问控制的处理 |
| 定论 | 无论对错,听起来都同样自信 | 由人权衡证据并做出决定 |
经过验证与基于证据同样重要:用已知案例测试过的检测方法,其表现特征是已知的;而提示词每次都会即兴产生新的表现。基于证据的审查还有明确的范围,即一套成文的检查项,涵盖图像、参考文献、统计学和方法,而不是一场什么都愿意尝试、却什么都不核实的开放式对话。这正是专用审查平台的设计前提:每项检查只为一项任务而构建,产出可供人审核的证据,并始终以人的决定为中心。参考文献就是一个再清楚不过的案例:虚构的引用之所以能进入已发表论文,恰恰是因为它们看起来是正确的。
Octym 如何提供帮助
Octym 走的是基于证据的路线。它的检查运行在私有基础设施上,并把疑似问题作为信号呈现,每个信号都可追溯至其来源:匹配的图像区域、解析得到的参考文献记录、文本中具体的不一致之处。它从不给出定论;由人审阅证据并决定其含义。这一设计背后的考量详见为什么选择 Octym。