自動の信頼性チェックが確実に機能するのは、パターンとして捉えられる問題です。重複・改変された画像、統計的にありえない結果、撤回論文や架空の参考文献、開示の欠落などがこれに当たります。一方で、意図、新規性、科学的な価値を判断することはできず、査読者に代わることもできません。よく設計されたツールが、検出結果を判定としてではなく、人が検討するためのシグナルとして提示するのは、この境界があるからです。
自動の信頼性チェックが本当に得意なことは何か?
自動チェックが力を発揮するのは、信頼性の問題が、機械で認識できる安定したパターンを残す場合です。現在の編集部のスクリーニングでは4つの類型が中心となっており、いずれにも具体的な実績があります。
| パターンの類型 | 機械が照合する対象 | 典型的なシグナル |
|---|---|---|
| 画像の重複と改変 | 図の内部および図同士の、ピクセルレベルと特徴レベルの類似性 | 再利用されたウェスタンブロットのパネル、切り貼りされたレーン、回転や拡大縮小をした重複画像 |
| ありえない統計値 | 報告値の間の算術的な整合性 | 記載されたサンプルサイズでは、どのような整数データからも得られない平均値 |
| 参考文献の信頼性 | 外部の記録と照合した参考文献リスト | 撤回論文の引用、どの記録にも該当しないDOI |
| 開示の欠落 | 記載された要件に照らした有無の確認 | 倫理に関する記載、データの公開・共有のセクション、利益相反の申告の欠落 |
これらのパターンは、すべての投稿をスクリーニングする正当な理由になるほど頻繁に見られます。画像の信頼性を専門とするアナリストのJana Christopher氏は、UKRIOの専門家インタビューで、査読後・出版前の採択段階でスクリーニングした原稿のおよそ20〜35%が、画像関連の問題で指摘を受けると述べています。統計の面では、BrownとHeathersが提唱したGRIMテストが、サンプルサイズに照らして報告された平均値が数学的にありうるかを確認します。2人が調べたテスト可能な心理学論文のおよそ半数に、整合しない平均値が少なくとも1つ含まれていました。対象となる領域は広がり続けています。Nature誌の報道によれば、生成AIは今や、専門家でも本物のデータ画像と見分けるのが難しい、科学的に見える図を作成できるようになっており、人手による確認では確実に見つけられないからこそ、出版社は自動スクリーニングを構築しています。これらすべてのケースで機械が強みを発揮する理由は共通しています。根底にある作業が大規模な比較であり、人が把握できる量をはるかに超える画像、参考文献、計算を対象にするからです。プラットフォームがチェックする項目として公開されたリストは、こうしたパターンの類型にきちんと対応しているべきです。自動化が実際に裏付けられる主張は、それらだからです。
自動化では見えないもの:意図、価値、文脈
なぜ異常が存在するのか、その研究に意義があるのか、検出結果が研究の論理の中で何を意味するのか。どの自動チェックも、これらを教えてはくれません。意図、価値、文脈という3つの死角が、あらゆるスクリーニングシステムの限界を決めています。
中でも明確なのが意図です。ソフトウェアは、2つの画像パネルが同一であることは確かめられますが、研究者が不注意で図を組み立てたのか、意図的に改変したのかまでは確かめられません。この区別は実務上重要です。Christopher氏は同じUKRIOのインタビューで、意図しない誤りと意図的な改変の比率を確実に知ることは難しいと述べています。だからこそ、指摘はツールで決着させるのではなく、人に回す必要があります。重複の指摘をすべて非難として扱うワークフローは、発生率の実態を読み違え、編集者と著者の間の信頼を損ないます。
価値の判断は、まったく手の届かない領域です。アルゴリズムは、参考文献が外部の記録と照合できることや、統計が内部で整合していることは検証できますが、その問いが立てる価値のあるものだったのか、研究デザインが問いに適していたのか、結論がその分野を前進させるのかは判断できません。こうした判断を下すために査読があり、どのようなスクリーニングの仕組みもそれに代わることはできません。
文脈はその中間に位置します。重複した画像は、出典を適切に示した再掲載かもしれません。整合しない統計値は、明記された丸めの慣行に由来するかもしれません。欠落しているように見える開示は、補足資料に記載されているかもしれません。いずれの説明も、原稿を読む人には明らかですが、パターン照合では見えません。だからこそ、指摘は議論を終わらせるのではなく、始めるきっかけであるべきです。
限界が設計を決める理由
自動チェックの限界は、ドキュメントの片隅に埋もれさせておく注意書きではなく、設計上の要件です。意図を判断できないシステムは、判定を下すような表現をしてはなりません。この一つの制約が、その後のすべてを形づくります。
そこから3つの帰結が導かれます。
- 検出結果はシグナル。パターン照合が誠実に出力できるのは、「この2つの領域は一致している」「この平均値は算術的に整合しない」といった内容です。つまり、一致の度合いを明示したうえで、検討を促す観察結果です。
- すべてのシグナルに、出典まで確認できる根拠を添付。一致した領域、計算内容、撤回告知などです。根拠があれば、解析を一からやり直さなくても、人が数分で検出結果を検証したり退けたりできます。
- 判断するのは人。ワークフローの最後には、編集者、研究公正担当者、査読者がいます。機械には見えない文脈に照らしてシグナルを検討し、その結果に責任を負うのはこうした人たちです。
業界もこの考え方に沿って体制を整えつつあります。大手出版社はSTM Integrity Hubを通じて、ペーパーミル(論文工場)のシグナルやその他の研究公正上の懸念について投稿をスクリーニングする共有インフラで協力しています。このスクリーニングは編集上の判断を下すものではなく、判断の材料を提供するものです。検討中の信頼性チェックプラットフォームがどれであっても、同じ形が見られるはずです。シグナルを受け取り、根拠を添え、人が判断を下す形です。意図と文脈を検討できるのは人だけです。自らの限界を理解しているツールは、すべての検出結果を人のもとに回します。
信頼性チェックツールはどう評価すべきか?
誠実な評価は、自動化がどこで止まるのかを問うことから始まります。この問いに明確に答えられないベンダーは、自社のシステムについて十分に考え抜いていません。また、自社のシステムが研究不正を判定できると主張するベンダーは、どのパターン照合にもできないことを主張しています。ベンダーに尋ねる価値のある質問は次のとおりです。
- どのパターンの類型に対応しているか、そのリストは公開されているか。対応範囲の主張は、漠然とした約束ではなく、名前のついたチェックの種類に結びついた、具体的で確認可能なものであるべきです。
- 検出結果はどのような形で示されるか。サンプルを求めましょう。根拠とその出どころが示され、裁定ではなく観察として読めるものであるべきです。
- 不確実性をどのように表しているか。実際のスクリーニングでは、判断の分かれるケースが生じます。すべてのケースを「指摘あり」か「問題なし」かに無理に振り分けるツールは、自らの誤差範囲を隠しています。
- どの検出結果でも人が覆せるか。レビュー担当者はシステムが持たない文脈を把握しているため、すべてのシグナルは、理由を記録したうえで却下できるべきです。
- 自動化では評価できない問いはどう扱われるか。価値、新規性、意図については引き続き査読者が必要です。研究不正が疑われる場合には、関係者に十分配慮した正式な手続きも必要です。
研究公正・調査チームにとっては、求められる水準はさらに高くなります。検出結果が、研究機関や出版社の手続きの中で通用しなければならない場合があるため、出典まで確認できる根拠は、あれば望ましいものではなく必須の要件になります。すでに検討中の案件についてスクリーニングによる支援を評価する研究公正チームにも、同じ質問が当てはまります。自らの限界を率直に示すツールは、使いにくくなるのではなく、むしろ使いやすくなります。率直さがあってこそ、人は判断に根拠をもって責任を持てるからです。算術については明確な結論を出し、意図については何も語らないチェックの具体例については、GRIMテストをご覧ください。
Octymにできること
Octymは、この記事で説明した境界を前提に設計されています。疑いのある検出結果はすべて、それを裏付ける根拠とともにシグナルとして提示され、根拠はそれぞれ出典まで確認できます。それが何を意味し、次に何をするかは、常に人が決めます。チェックの対象は自動化が得意とするパターンの類型にとどめ、意図、価値、文脈の判断は編集者、研究公正担当者、査読者に委ねています。この設計の背景にある考え方は、Octymがこのように機能する理由で説明しています。