AIに確認する側を任せたら、存在しないデータを批判し始めた
ある化学論文の査読で、査読者はNMRスペクトルの図をマススペクトルと取り違え、論文には存在しない「H2D+ピーク」への指摘を書いた。H2D+は、通常の質量分析では出てこない、宇宙環境特有の化学種である(出典)。査読者はさらに、論文に含まれていない固体NMRやX線蛍光分析のフィッティングについても批判を重ねた。
図の取り違え一つならまだしも、存在しないデータへの指摘が複数重なるのは、典型的なAIハルシネーションの症状だ。査読者はおそらく、生成AIに査読の大部分を任せていた。
著者が声を上げたから覆った
著者が取った対応は、査読コメントの不合理さを指摘する短いメールをエディターに送ることだった。「本論文と関係のない記述が見られる」という一文が、判定を覆す決め手になった。エディターは判定をメジャーリビジョンに変更し、AI使用が疑われる査読者を除外。再審査の結果、軽微な修正のうえで出版というアクセプトを勝ち取った。
Science誌やNature誌は、すでに査読への生成AI使用を禁止している。ACSはさらに厳格で、一切使用禁止としている。学術出版の世界では、この配置が事故の温床になることは、すでに規範として認識されている。
確認する側が幻覚を見ると、止める仕組みが外側にしかない
査読という仕組みは、著者が書いたものを、査読者という別の視点が確認する、という役割分担の上に成り立っている。AIが書く側に立つなら、書いたものを人間が確認すれば、少なくとも存在しないデータを主張する事故は起きない。
だが今回起きたのは逆だった。確認する側にAIが立った。確認する側が幻覚を見れば、それを止める仕組みは査読の外側にしかない。今回はたまたま著者が声を上げ、エディターが対応したから覆った。声を上げなければ、存在しないデータへの批判のまま、リジェクトが確定していたかもしれない。
書く側と確認する側を、逆にしない設計
PRレビューツールParryが「confirm, don't write」、AIが書き、人間が確認するという役割分担を掲げているのは、この配置を逆にしないためでもある。AIにコードを書かせ、人間が確認する側に立つ設計は、確認する側の幻覚が紛れ込む余地を最初から作らない。
もしPRレビューでも確認する側にAIを置き、人間がAIの確認結果をそのまま信じる運用になれば、今回の査読事件と同じ構図が生まれる。存在しない依存関係への警告、起きていない副作用への指摘。人間はそれを検証する手段を持たないまま、AIの確認を鵜呑みにすることになる。
Parry自身も、Why・Risk・Confidence・Contextという四軸の草案をAIに生成させてから、著者が確認する設計を取っている。ここでAIは書く側の延長にいる。AIが書いた草案を、そのPRを書いた本人が確認する分には、今回の査読事件とは配置が違う。危ういのは、査読者のように、AIの出力を検証する手段を持たない第三者が、確認の結果だけを鵜呑みにする配置のほうだ。誰が何を確認しているかを取り違えると、確認という言葉は同じでも、中身はまったく別のものになる。
コメント (0)
コメントを投稿するにはログインが必要です
まだコメントはありません
最初のコメントを投稿してみましょう!