結果が異なる4つの理由
スコアは長い選択プロセスの末端にあるものです。画像の内容は何も変わっていなくても、いずれかのリンクを変えれば数値は変動します。
- 学習データの違い。 検出器は自身が学習したものしか認識しません。多数のオープンな生成モデルで訓練された検出器は未知のモデルに対しても有効ですが、4つの主要な商用ツールのみで訓練された検出器はそれらには強いものの、それ以外には弱い傾向があります。
- 判定基準の違い。 あるツールは60以上を疑わしいとし、別のツールは75以上を疑わしいとします。同じ測定値でも、閾値を超えるかどうかが異なるため、1つの測定から2つの結論が出ることになります。
- 定義の違い。 一部のツールはアップスケーリングや生成塗りつぶしを含むあらゆる生成プロセスを対象とします。他のツールは完全に合成されたフレームのみを対象とします。レタッチされたポートレートは、前者にとってはAIであり、後者にとっては本物と判定されます。
- 前処理の違い。 ツールはスコアリング前にサイズ変更、トリミング、再エンコードを行います。224ピクセル四方の中心部を読む検出器と、全体の384ピクセルを読む検出器では、異なる画像を見ていることになります。
ツールDが他のツールより高感度というわけではありません。より広い範囲の疑問に答えているだけです。写真が生成器によって作られたかどうかを懸念しているなら、Dは過剰反応です。AIがファイルに一切触れたかどうかを懸念しているなら、Dだけが答えを提供します。
各ツールがどの疑問に答えているかを確認する
| 問いの内容 | 判断基準 | 一般的な用途 |
|---|---|---|
| このフレームはゼロから生成されたか? | フレーム全体の合成テクスチャ | ニュース、マーケットプレイスの出品、出会い系プロフィール |
| この画像の一部はAIで編集されたか? | 基準線を超える領域の存在 | 保険、保険金請求、証拠審査 |
| このファイルにAIが少しでも触れたか? | アップスケーリング、ノイズ除去、生成塗りつぶし | ストックフォトライブラリ、コンテスト規約 |
ツール間の不一致のほとんどは、これら3つのうちどれを尋ねたかの食い違いです。結果を比較する前に、どの疑問が重要かを決定し、それぞれのツールをその目的に照らして読んでください。
2つの結果を適切に比較する方法
-
両方のツールに同一のファイルを読み込ませる
再ダウンロード、スクリーンショット、チャットアプリを経由したコピーは避けてください。バイトデータが異なればそれは別の画像であり、スコアが異なるのは正当な理由によります。
-
数値ではなく、バンド(帯域)を比較する
基準線が50のスケールで61、基準線が65のスケールで58という結果は、判定結果は異なりますが、解析内容については一致しています。
-
公開されている閾値を探す
どこに判定基準があるかを示さないツールは、比較の対象になりません。その数値は証拠としてではなく、解釈不能なものとして扱ってください。
-
プロセスを開示しているツールを優先する
領域マップ、指定されたバンド、設定されたベンチマークがあれば、推論を確認できます。根拠のない自信に満ちたラベルは信用に値しません。
-
一致を強力なシグナルとして扱う
2つの独立したツールが同じバンドに到達することは、どちらか一方の結果よりも価値があります。一致しない場合は不確実であり、平均を取って中間を導き出すべきではありません。
不一致そのものが結果となる場合
認識しておくべきパターンがあります。あるツールが全体スコアを低く出し、別のツールが高いスコアを出す場合、その画像は局所的に編集が加えられた本物の写真である可能性が高いです。
最初のツールは全体が概ね本物であるため編集の影響を平均化してしまい、2番目のツールは最も強い反応を示す領域を重視しています。どちらも測定したものに対しては正しい結果を出しており、この不一致自体がどちらかの数値よりも多くの情報を伝えています。
冷たい色調のフレーム内で、判定線を超えるタイルが1つ存在します。単一の数値ではこれを捉えることはできません。
検出器が一致するために必要なこと
共通のベンチマーク、公開された判定基準線、そしてAI関与の定義の合意があれば、不一致のほとんどは解消されます。しかし、現状ではそのような基準は存在せず、また弱点を公開するツールがそうでないツールよりも劣って見えるという理由から、それらを作成するための商業的な圧力もほとんどありません。
状況が変わるまでは、すべてのスコアは独自のスケールから出ているものとして扱ってください。ツールが表示する証拠を読み取り、ラベルの自信よりもそちらを重く受け止めてください。
誰も言及しないバージョン問題
検出器は一度作られたら固定されるものではありません。ベンダーは予告なしに再学習、閾値の調整、モデルの交換を行っており、その出力をバージョン管理しているツールはほとんどありません。3月に取得したスコアと今日取得したスコアは、異なる調整が施された別のモデルによるものかもしれません。
これは記録を残す場合に重要です。18ヶ月前のスコアを引用する保険請求ファイル、モデレーションログ、学術ケースは、現存しない測定機器の数値に基づいています。それを再現する方法も、当時どのような意味を持っていたかを確認する方法もありません。
結果を保存する際は、その根拠となるスコア、バンド、決定境界、日付も併せて保存してください。これらはモデルが更新された後でも解釈可能ですが、単なるパーセンテージにはその信頼性がありません。