Natureの報道によれば、生成ツールは今や、専門家でも本物のデータ画像と見分けにくい、科学的に見える図を作り出せるようになっています。だからこそ出版社は、目視に頼るのではなく、自動検出の仕組みを構築しています。検出は可能ですが、得られるのは証明ではなく確率であり、最終的に判断するのは人です。
AI生成の図が熟練した査読者の目をすり抜けるのはなぜか?
科学の図は、生成モデルにとって際立って狙いやすい対象です。その理由は技術的というより構造的なものです。ウェスタンブロットは、ノイズのある背景に灰色のバンドがいくつか並んだものです。顕微鏡画像は、似たような形が一面に広がったものです。どちらにも、街の風景を写した偽の写真なら詳しく見るとほころびが出るような意味のある細部がありません。6本指の手も、綴りの間違った看板も、ありえない映り込みもないからです。
さらに、査読者ははじめから誤った前提で図に向き合っています。査読は、実験が適切に設計されているか、結論がデータから導かれるかを評価するために発展してきました。データ画像がそもそも何かを撮影したものなのかを問うために発展してきたわけではありません。ブロットを見る査読者が評価しているのはバンドが何を意味するかであり、そのバンドが本当にメンブレン上に存在したのかを問いただしているわけではありません。
Natureは、人手によるレビューではAI生成の図を確実には見つけられないからこそ、専門家が自動検出の開発を進めていると報じました。画像スクリーニングを長らく専門家の目に頼ってきた分野がこれを認めたことは重大であり、脅威モデルが実際に変わったことを示しています。かつての問題は著者が実際の画像に手を加えることでしたが、新たな問題は、裏づけとなる実験がまったく存在しない画像です。
編集部にとっての実務上の帰結は、「もっともらしく見える」ことが、もはや何の根拠にもならなくなったということです。目視による確認をすり抜けた図とは、生成ツールがまさに通過できるよう最適化されたテストに合格した図なのです。
検出が誠実に約束できることは何か?
AI生成画像の検出は、意味ではなく統計的な痕跡に基づいて機能します。生成モデルは、ノイズ分布、テクスチャ、周波数成分に特有の規則性を残し、それは実際の顕微鏡、カメラ、撮像センサーが生むアーティファクトとは異なります。検出器はその違いを学習し、画像が合成による生成とどの程度一致するかを報告します。
この仕組みがある以上、誠実なシステムが主張できることには越えられない限界があります。はっきり述べておきます。
- 出力は確率的です。検出器が報告するのは可能性であり、事実ではありません。あらゆる生成画像に現れ、実際の画像には決して現れない、という特徴は存在しません。
- 圧縮や処理はシグナルを弱めます。強いJPEG圧縮、リサイズ、図の組み立てはいずれも、検出器が頼りにする細かな痕跡を消してしまいます。そのため、正当に処理された画像のほうが疑わしく見え、念入りに痕跡を消した合成画像のほうがきれいに見えることがあります。
- モデルは進化し続けます。ある世代のツールで学習した検出は次の世代には弱くなるため、これは解決済みの問題ではなく、維持し続ける必要がある能力です。
- 高いスコアは研究不正の認定ではありません。著者に取得時の元ファイルと装置のメタデータを求める理由となるものです。
だからといって、検出が無意味になるわけではありません。検出はスクリーニングのシグナルであり、盗用の類似度スコアと同じ部類に入ります。注意を向ける先を決めるには有用ですが、それだけで人について何かを結論づけるには決して十分ではありません。実際のほぼすべてのケースで決め手になるのは、検出器の出力ではなく、その後に行う依頼です。本物の実験には元ファイル、装置の設定、日付の入った取得記録が存在しますが、生成された図にはそれがないからです。
出版社は実際にどう対応しているのか?
出版社は個別にではなく共同で対応しており、この問題がどう捉えられているかがうかがえます。大手出版社はSTM Integrity Hubを通じて、ペーパーミル(論文工場)のシグナルやその他の研究公正上の懸念を含め、投稿をスクリーニングするための共有基盤で協力しています。
合成された図に関して共有基盤が特に重要なのは、量を稼ぐほど有利になる経済構造があるからです。捏造された原稿を大量に生産するペーパーミルは、どの学術誌が単独で調べられるよりもはるかに速く図を生成でき、同じ捏造画像が複数の学術誌に次々と投稿されることもあります。自社への投稿だけを確認している出版社には1件しか見えませんが、共有システムにはパターンが見えます。
個々の編集部では、画像スクリーニングを早い段階に移し、日常的な業務にすることで対応してきました。画像の信頼性を専門とするアナリストのJana Christopher氏がUKRIOに語ったところによると、採択時に確認された原稿の20〜35%では、編集部のスクリーニングの段階ですでに画像に関する照会が生じています。一方、同氏がスクリーニングした原稿のうち最終的に採択が取り消されたのは1〜8%にとどまり、指摘を受けた論文の大多数は採択が維持されています。合成された図は既存の業務フローに入ってくることになり、これは実際に有利な点です。学術誌は新たなプロセスを考案する必要はなく、既存のプロセスを拡張すればよいのです。
こうした動きを一層切実にしているのが件数の多さです。Natureによれば、2023年に撤回された研究論文は10,000件を超え、年間として過去最多となりました。いまや多くの編集部にとって制約となっているのは、スクリーニングへの意欲ではなく、スクリーニングを行う能力です。
指摘を受けた図に編集者はどう対応すべきか?
AI生成の疑いがある図を前にした編集者は、それを結論ではなく、記録に残す手続きの始まりとして扱うべきです。COPEのガイダンスは、出版済み論文に対して提起された懸念と、それに続く可能性のある訂正に対処するための文書化された手順を編集者に示しています。その手順に従うことが、説明のつく判断と場当たり的な判断を分けます。
実際の手順は短いものです。著者に、元の取得ファイル、それを生成した装置またはソフトウェア、取得日を求めます。本物の実験であれば、ファイルがどこかのフォルダーに存在するため、すぐに応じられます。捏造された図の場合は、回答の遅れ、別のファイルへの差し替え、あるいは追加の質問に耐えられない説明が返ってきます。
何を確認し、何が返ってきたかを記録します。編集部が特に省きがちで、後になって特に悔やむことが多いのがこの部分です。2年後にその論文について疑問が提起されたときには当時の記録が必要になり、懸念があったという記憶しか手がかりのない研究公正チームは、白紙の状態から案件を再開することになるからです。こうした業務を担うチームには委員会に提出できる根拠が必要であり、その記録は照会を行ったその時点で作成しておかなければなりません。
やり取りは終始、中立的な言葉で行います。統計的に見れば、指摘を受けた図の著者は、データを捏造した可能性よりも、単に誤りを犯した可能性のほうがはるかに高く、根拠が別のことを示すまでは、それを前提とした文面にすべきです。この前提には十分な裏づけがあります。画像に関する指摘全般で見ると、指摘を受けた論文の多くは採択が維持されているからです。
Octymにできること
Octymは、画像の改変、重複、再利用とあわせてAI生成の兆候についても図をレビューし、各検出結果を根拠と位置を添えたシグナルとして返します。検出結果には優先順位が付けられ、編集部の限られた注意が特に重要な箇所に向かうようになっています。著者についての判定として提示されるものはなく、検出結果だけで問題が決着することもありません。指摘された図が何を意味し、次に何を求めるかは、常に人が判断します。チェック項目の全一覧はチェック項目のページにあります。