メインコンテンツへスキップ
OctymPowered By Proofig AI
画像の信頼性

画像の盗用:論文をまたいだ図の再利用はどのように見つかるのか

文献をすべて頭に入れている人はいないため、異なる論文間での図の再利用は人手による確認では発見できません。画像盗用のスクリーニングの仕組みを解説します。

2026年6月23日 · Octym · 6分で読めます

異なる論文間での図の再利用は、投稿された画像を既発表の学術記録と大規模に比較することで見つかります。ソフトウェアが原稿から図、グラフ、チャートを抽出し、既発表の資料のデータベースと照合するのです。人手によるレビューではこれはできません。何百万もの既発表の図を記憶している編集者や査読者はいないからです。

論文をまたいだ図の再利用は、なぜ人手によるレビューをすり抜けるのか?

人手による画像スクリーニングは、1本の原稿の範囲内で機能します。編集者や画像の信頼性アナリストは、2つの図を並べて、繰り返し使われているブロットのレーンや重複した顕微鏡の視野に気づき、出版前に著者へ問い合わせることができます。こうした確認は実際に成果を上げています。画像の信頼性アナリストであるJana Christopher氏は、UKRIOによる専門家インタビューの中で、出版前にスクリーニングした採択済み原稿のおよそ20〜35%で画像関連の問題が指摘されたと推計しています。

限界となるのは比較の対象です。原稿内のスクリーニングは、論文をそれ自体と比較します。対象は数十枚の画像で、すべてが手元にそろっています。論文をまたいだ再利用を見つけるには、投稿を既発表の文献すべてと比較する必要があり、それは人間にはできません。査読者が1年に読む原稿は数本程度で、気づけるのはせいぜい、たまたまよく知っている論文の図だけです。何年も前に、査読者が開くこともない学術誌に掲載された別のグループの論文から流用されたチャートは、まったくのオリジナルに見えます。

そのため、論文をまたいだ再利用は偶然によって発覚することが多くなります。並外れた視覚的記憶を持つ読者、出版後に論文を精査する調査者、情報提供などです。偶然に頼るスクリーニングは、スクリーニングとはいえません。この規模の差は、努力の問題ではなく構造的なものです。人が注意を向けられる範囲は読むことに費やした時間に応じて広がるだけですが、既発表の学術記録はすでに数百万本の論文に及んでいます。この差を埋めるのはデータベースの問題であり、データベースの問題として解決しなければなりません。

画像の盗用は、実際にはどのようなものか?

実際の画像の盗用は、写真にとどまりません。分かりやすいのは写真のデータ画像です。顕微鏡の視野、ウェスタンブロット、ゲル、フローサイトメトリーのプロットなどが既発表の論文から流用され、新しい結果として提示されます。その過程で、回転、トリミング、反転、コントラスト調整が加えられていることもよくあります。見落とされがちなのがグラフやチャートです。棒グラフや折れ線グラフもほかと同じ画像であり、軸のラベルを付け替え、系列の色を変えて流用したプロットは、テキストの類似度スクリーニングを素通りします。テキスト用のツールは単語を比較するもので、図の中身は何も見ていないからです。

再利用されるもの典型的な改変読者が見逃す理由
顕微鏡、ブロット、ゲルの画像回転、反転、トリミング、コントラストや色の変更改変されたコピーは、読む速さで見ると同一には見えない
グラフとチャート軸ラベルの付け替え、系列の色の変更、凡例の描き直し画像ではなく結果として扱われるため、誰も見た目で比較しない
複合図の中のパネル1枚のパネルを抜き出し、新しい説明文を付ける出典が、別の論文の別の図に埋もれた一部の画像である

問題は今や両方向に広がっています。Nature誌が2024年に報じたように、生成AIは、専門家でも本物のデータ画像と見分けるのが難しい、科学的に見える図を作成できます。そのため、再利用された図や人工的に作られた図を見つけるスクリーニングでは、写真、プロット、チャート、そして複合図の中の個々のパネルに至るまで、原稿中のあらゆる視覚要素を比較可能なデータとして扱う必要があります。

既発表の学術記録との比較はどのように行うのか?

投稿を既発表の学術記録と比較することは、3つの要素からなるデータベースの問題です。1つ目はコーパスです。既発表の論文から抽出した図をインデックス化したコレクションで、新しい投稿はすべてこれと比較されます。2つ目はセグメンテーションです。再利用は図全体ではなく1枚のパネルで起こることが多いため、複合図をパネルに分割します。3つ目は、よくある改変に左右されない照合です。各画像を、回転、反転、拡大縮小、トリミング、コントラストの変更があっても変わらない視覚的なフィンガープリントに変換するため、色を変えたチャートや反転させた顕微鏡画像でも出典を見つけられます。

上限を決めるのはコーパスです。比較で一致を提示できるのはインデックス化された資料の中だけであり、データベースの幅広さが、スクリーニングで見えるものを決めます。

出版社は、隣接する問題についてはすでにこの考え方を受け入れています。主要な出版社はSTM Integrity Hubを通じて、ペーパーミル(論文工場)のシグナルやその他の研究公正上の懸念について投稿をスクリーニングする共有インフラで協力しています。投稿の流れ全体を見渡せる学術誌は1つもないからです。同じ圧力が図にも及んでいます。Nature誌のニュース記事によると、人手によるレビューではAI生成画像を確実に見つけられないため、出版社や研究公正の専門家は自動スクリーニングの開発を進めています。

データベース比較の出力は、人が確認するための一致候補の絞り込みリストであり、各候補では、投稿された画像と、それに似た既発表の画像が対になっています。原稿内の重複から既発表の出典に対する画像・グラフの盗用まで、このレベルで機能するチェックには共通の役割分担があります。ソフトウェアが大規模に比較し、その提示内容を人が判断するという分担です。

指摘された一致が意味すること、意味しないこと

一致が指摘されたということは、2つの画像が視覚的に似ているということです。不正行為を意味するわけではありません。視覚的な類似には正当な説明がありうるため、編集者は何らかの対応をとる前に、次のいずれかに該当するかどうかを見極めます。

  • 同じ著者が、自身の複数の論文で研究方法や装置の画像を、引用を付けて再利用している
  • 元の図の出典を明記したレビュー論文など、ライセンスや許諾を得た再掲載
  • 同じ研究の以前のバージョン(プレプリント、会議録、学位論文)
  • 実際に似た画像を生み出す、共通の装置、校正用標準、対照試料

スクリーニングの経験も同じことを示しています。Jana Christopher氏はUKRIOの専門家インタビューの中で、意図しない誤りと意図的な改変の比率は確実に知ることが難しいと述べています。論文をまたいだ一致についても、著者が回答するまでは、同じようにごく普通の事情で説明がつくものと推定すべきです。

指摘された一致によって変わるのは、編集者が投げかけられる問いです。一致の指摘がなければ、問うべきことは何もありません。指摘があれば、具体的で答えられる問い合わせができます。「このパネルは、以前に発表されたこの論文のこの図に似ています。両者の関係を説明し、元データを提出してください」というものです。ここでは見せ方が重要です。各一致を候補となる出典と並べ、その出典を特定して示すスクリーニングプラットフォームがあれば、編集者は大半の指摘を数分で解決し、注意が必要な少数の指摘をエスカレーションできます。どの段階でも、判断は人が行います。データベースが言えるのは2つのチャートが似ているということまでであり、その類似が何を意味するかは、著者の回答を手にした人が判断します。指摘された画像の大半は、悪意のない作成ミスであるというベースレートを念頭に置けば、その判断はしやすくなります。

Octymにできること

Octymは、投稿に含まれる図、グラフ、チャートを既発表の資料と照らし合わせてスクリーニングし、一致が疑われるものをシグナルとして提示します。それぞれ候補となる出典と並べて表示されるため、根拠を確認できます。業界屈指の規模を誇る画像盗用データベースであるProofigの技術を搭載したこの比較では、グラフやチャートも最初から画像として扱います。Octymが判定を下すことはありません。編集者が文脈の中で各一致を確認し、その意味を判断します。編集部のスクリーニングにどのように組み込まれるかは、出版社向けソリューションでご覧いただけます。

お好きな原稿で、Octymをご覧ください。

お問い合わせ、またはログインしてください。