AI原稿レビューとは、人が研究論文について何かを判断する前に、ソフトウェアを使って信頼性と研究の質に関する問題を調べることです。対象は3つの領域にわたります。原稿そのものの内部のチェック、既発表の学術記録との照合、そして研究の質の評価です。検出結果は判定としてではなく、人が判断するための根拠として届けられます。
同じレビューが、研究のライフサイクルのさまざまな時点で行われます。研究費の申請者は助成機関に届く前に申請書を確認し、著者は投稿前に原稿を確認します。編集部は新たな投稿をスクリーニングし、研究公正チームは疑問が呈された論文を調べます。いずれの場合も方法は同じです。体系的なチェックを行い、根拠を添え、人が判断します。
AI原稿レビューでは何を調べるのか?
AI原稿レビューでは、3つのチェック領域にわたって論文を調べます。原稿内部の信頼性、既発表の学術記録との外部照合、そして研究の質です。1つ目の領域は、原稿の内部にあるものだけを見ます。2つ目は、原稿をすでに出版されたあらゆるものと比較します。3つ目は、その研究が検証に耐えうる形で組み立てられているかを問います。
| チェック領域 | 対象 | 答える問い |
|---|---|---|
| 原稿内部の信頼性 | 画像の改変と重複、AI生成画像、グラフ・チャートの重複、統計の検証と整合性、図と説明文の整合性、主張と引用の整合性 | 原稿はそれ自体の中で整合しているか? |
| 既発表の学術記録との外部照合 | 画像・グラフの盗用、撤回論文の引用、架空・実在しない参考文献、DOI・メタデータの正確性、引用パターン | 原稿は既存の文献に照らして妥当か? |
| 研究の質 | 研究方法と厳密性、再現性、追試可能性、研究倫理、査読水準の分析 | 研究は出版後も通用するか? |
言語モデルが執筆の作業に入り込んで以来、外部照合の領域の重要性は急速に高まっています。Scientific Reports誌に掲載された査読付きの検証では、GPT-3.5が生成した文献引用の過半数が架空のもので、GPT-4でも架空または誤った引用がかなりの割合を占めました。実在する文献への引用でさえ、内容に関わる誤りが頻繁に含まれていました。今では、参考文献リストが一見申し分なく見えても、実在しない論文を引用していることがありえます。各領域で調べる内容の詳しい内訳を見ると、個々のチェックがどう組み合わさっているかがわかります。
人手によるレビューだけでは追いつかなくなった理由
人手によるレビューだけでは追いつかなくなったのは、問題のある論文の量も、偽のコンテンツの巧妙さも、人の注意力でスクリーニングできる範囲を超えてしまったからです。Nature誌の報道によれば、2023年に撤回された研究論文は1万件を超え、年間の件数として過去最多となりました。撤回は出版からずっと後に行われます。つまりそれらの論文は査読を通過し、撤回されるまでの間、文献の中に残っていたことになります。
偽のコンテンツは見抜くのも難しくなっています。2024年のNature誌の報道によれば、生成AIは、専門家でも本物のデータ画像と見分けるのが難しい、科学的に見える図を作成できます。人の目による確認では確実に見つけられないからこそ、出版社や研究公正の専門家は自動スクリーニングを構築しています。また、1本の原稿を読む査読者には、その図が無関係な論文の画像に似ていることや、その構成が他の何十本もの投稿と一致していることに気づく手段がありません。こうしたパターンは、数千件の文書を横断して初めて見えてくるものです。
査読は、そもそもこうした役割を想定して設計されたものではありません。査読者に求められるのは研究内容の判断です。画像のフォレンジック分析、参考文献の検証、統計の監査はそれぞれ別のスキルであり、それらが無報酬で、時間に追われながら、一度に1本の原稿に対して行われています。出版社は、答えは共有インフラにあるという結論に至りました。大手出版社はSTM Integrity Hubを通じて、ペーパーミル(論文工場)のシグナルやその他の研究公正上の懸念について、投稿のスクリーニングで協力しています。AI原稿レビューは、同じ考え方を個々の原稿に当てはめます。体系的な調査はソフトウェアに任せ、人は判断に注意を注ぐという考え方です。
判定ではなくシグナル:検出結果を人に届けるには
よく設計されたAI原稿レビューが届けるのは、判定ではなくシグナルです。疑いのある問題をそれぞれ根拠とともに提示し、判断は人に委ねます。この区別は見かけだけのものではありません。指摘の多くには、悪意のない説明がつきます。重複した画像は、適切に開示された対照の再利用かもしれません。重なり合う文章は、定型的な研究方法の記述かもしれません。通常と異なる引用パターンは、組織的な何かではなく、小さな専門分野であることを反映しているだけかもしれません。裁定を下すソフトウェアは、これらすべてを誤った非難に変えてしまいます。根拠を提示するソフトウェアなら、人が数分で解決できます。
完全なシグナルには、レビュー担当者が独自に検証するために必要なものがすべて含まれています。
- 指摘された対象:具体的な図、パネル、参考文献、統計値、または文章の箇所。
- 位置:原稿内の正確な場所。
- 根拠:一致した画像領域、撤回告知、照合したDOIの記録、または不整合な数値を並べたもの。
- 出典の追跡:元の資料へのリンク。これがあるため、誰もソフトウェアの言い分をうのみにする必要がありません。
このような形で届く検出結果は、監査が可能です。編集者は、何が疑問のきっかけになったのかを著者に正確に示せますし、研究公正担当者は、根拠を導き直すことなく案件ファイルに収められます。アップロードから検出結果までのレビューの仕組みは、この原則から直接導かれています。
AI原稿レビューは誰が使うのか?
AI原稿レビューは、研究費申請から最終的な出版まで、研究のライフサイクル全体を通じて使われています。使うのは、同じ原稿に対してそれぞれ異なる利害を持つ4つのグループです。
- 研究者と研究費の申請者は、他の誰よりも先に自身の研究を確認します。NIH(R01およびR21の申請)、ERC、Horizon Europe、Wellcomeなどの助成機関は、厳密性と再現性を明確な要件として掲げており、その背景にある問題は現実のものです。Nature誌の調査では、1,576人の研究者のうち70%以上が、他の研究者の実験を再現しようとして失敗した経験があり、半数以上が自身の実験の再現にも失敗していました。不十分な研究方法の記載や誤った参考文献は、投稿後に見つかるよりも投稿前に見つかるほうが、はるかに少ないコストで済みます。
- 研究機関は、研究支援部門や研究室を通じてレビューを実施し、研究成果が機関の外に出る前にスクリーニングします。問題のある論文が1本あるだけで、研究費の受給状況や機関の評判が危うくなることがあります。そのため、投稿の時点こそが、機関が何より管理しやすい時点です。
- 出版社は投稿時にスクリーニングを行い、たまたま疑いを招いた原稿だけでなく、すべての原稿に同じ精査を適用します。この一貫性は、公平性と業務量の両面で重要です。編集スタッフは、すべてをフォレンジックの観点で調べる代わりに、指摘された項目をトリアージできます。
- 研究公正・調査チーム(研究公正担当者や倫理委員会を含む)は、すでに懸念が提起されており、散在するスクリーンショットではなく、整理された検証可能な根拠をまとめる必要がある場面でレビューを利用します。
どの場面でも、プラットフォームは組織の要件に合わせて設定され、前のセクションで述べた原則が一貫して適用されます。ソフトウェアが根拠をまとめ、すべての判断は人が下すという原則です。次に読む価値のある関連テーマが2つあります。汎用のチャットボットでこの役割を果たせるか、そして自動チェックでは本当に見えないものは何かです。
Octymにできること
Octymは、Proofigを手がけるチームが開発した、研究公正と研究の質のためのAIプラットフォームです。1つのプラットフォームを、出版社、研究機関、研究者、研究公正・調査チームそれぞれに合わせたソリューションとして、研究費申請から最終的な出版まで提供しています。疑いのある検出結果を根拠付きのシグナルとして提示し、根拠はそれぞれ出典まで確認できます。判断を下すのは常に人です。この姿勢の背景にある考え方は、チームがOctymを選ぶ理由で説明しています。