← すべてのガイド 精度

AI検出器が同じ画像で異なる結果を出す理由

1枚の画像を4つのツールでテストして、4つの異なる回答が得られることがあります。その理由は構造的なものであり、それを理解することでどちらの結果を信頼すべきかが分かります。

· 7 分で読めます · Best AI Image Detector

学習データ、判定基準、およびAIの定義がそれぞれ異なるためです。2つのツールが同じ画像を解析しても、反対の判定を下す可能性があります。

結果が異なる4つの理由

スコアは長い選択プロセスの末端にあるものです。画像の内容は何も変わっていなくても、いずれかのリンクを変えれば数値は変動します。

  1. 学習データの違い。 検出器は自身が学習したものしか認識しません。多数のオープンな生成モデルで訓練された検出器は未知のモデルに対しても有効ですが、4つの主要な商用ツールのみで訓練された検出器はそれらには強いものの、それ以外には弱い傾向があります。
  2. 判定基準の違い。 あるツールは60以上を疑わしいとし、別のツールは75以上を疑わしいとします。同じ測定値でも、閾値を超えるかどうかが異なるため、1つの測定から2つの結論が出ることになります。
  3. 定義の違い。 一部のツールはアップスケーリングや生成塗りつぶしを含むあらゆる生成プロセスを対象とします。他のツールは完全に合成されたフレームのみを対象とします。レタッチされたポートレートは、前者にとってはAIであり、後者にとっては本物と判定されます。
  4. 前処理の違い。 ツールはスコアリング前にサイズ変更、トリミング、再エンコードを行います。224ピクセル四方の中心部を読む検出器と、全体の384ピクセルを読む検出器では、異なる画像を見ていることになります。
同じ写真を4通りの方法でスコアリング
ツールA、基準線50
61
ツールB、基準線65
58
ツールC、フレーム全体のみ
34
ツールD、すべての編集をカウント
88

過剰に処理された本物の写真に見られる一般的な分布を示す図です。

1つの画像、4つのツール。これは故障ではなく、それぞれが独自の基準に基づいて結果を報告しています。

ツールDが他のツールより高感度というわけではありません。より広い範囲の疑問に答えているだけです。写真が生成器によって作られたかどうかを懸念しているなら、Dは過剰反応です。AIがファイルに一切触れたかどうかを懸念しているなら、Dだけが答えを提供します。

各ツールがどの疑問に答えているかを確認する

「これはAIか」という問いに含まれる3つの異なる意味
問いの内容判断基準一般的な用途
このフレームはゼロから生成されたか?フレーム全体の合成テクスチャニュース、マーケットプレイスの出品、出会い系プロフィール
この画像の一部はAIで編集されたか?基準線を超える領域の存在保険、保険金請求、証拠審査
このファイルにAIが少しでも触れたか?アップスケーリング、ノイズ除去、生成塗りつぶしストックフォトライブラリ、コンテスト規約

ツール間の不一致のほとんどは、これら3つのうちどれを尋ねたかの食い違いです。結果を比較する前に、どの疑問が重要かを決定し、それぞれのツールをその目的に照らして読んでください。

2つの結果を適切に比較する方法

  1. 両方のツールに同一のファイルを読み込ませる

    再ダウンロード、スクリーンショット、チャットアプリを経由したコピーは避けてください。バイトデータが異なればそれは別の画像であり、スコアが異なるのは正当な理由によります。

  2. 数値ではなく、バンド(帯域)を比較する

    基準線が50のスケールで61、基準線が65のスケールで58という結果は、判定結果は異なりますが、解析内容については一致しています。

  3. 公開されている閾値を探す

    どこに判定基準があるかを示さないツールは、比較の対象になりません。その数値は証拠としてではなく、解釈不能なものとして扱ってください。

  4. プロセスを開示しているツールを優先する

    領域マップ、指定されたバンド、設定されたベンチマークがあれば、推論を確認できます。根拠のない自信に満ちたラベルは信用に値しません。

  5. 一致を強力なシグナルとして扱う

    2つの独立したツールが同じバンドに到達することは、どちらか一方の結果よりも価値があります。一致しない場合は不確実であり、平均を取って中間を導き出すべきではありません。

不一致そのものが結果となる場合

認識しておくべきパターンがあります。あるツールが全体スコアを低く出し、別のツールが高いスコアを出す場合、その画像は局所的に編集が加えられた本物の写真である可能性が高いです。

最初のツールは全体が概ね本物であるため編集の影響を平均化してしまい、2番目のツールは最も強い反応を示す領域を重視しています。どちらも測定したものに対しては正しい結果を出しており、この不一致自体がどちらかの数値よりも多くの情報を伝えています。

11 14 9 13 89 12 10 8 15

冷たい色調のフレーム内で、判定線を超えるタイルが1つ存在します。単一の数値ではこれを捉えることはできません。

領域表示機能がこの議論を解決します。これらのタイルを全体で平均すると24となり、クリーンと読み取れますが、マップを見ればなぜそれが誤解を招くかが分かります。

検出器が一致するために必要なこと

共通のベンチマーク、公開された判定基準線、そしてAI関与の定義の合意があれば、不一致のほとんどは解消されます。しかし、現状ではそのような基準は存在せず、また弱点を公開するツールがそうでないツールよりも劣って見えるという理由から、それらを作成するための商業的な圧力もほとんどありません。

状況が変わるまでは、すべてのスコアは独自のスケールから出ているものとして扱ってください。ツールが表示する証拠を読み取り、ラベルの自信よりもそちらを重く受け止めてください。

誰も言及しないバージョン問題

検出器は一度作られたら固定されるものではありません。ベンダーは予告なしに再学習、閾値の調整、モデルの交換を行っており、その出力をバージョン管理しているツールはほとんどありません。3月に取得したスコアと今日取得したスコアは、異なる調整が施された別のモデルによるものかもしれません。

これは記録を残す場合に重要です。18ヶ月前のスコアを引用する保険請求ファイル、モデレーションログ、学術ケースは、現存しない測定機器の数値に基づいています。それを再現する方法も、当時どのような意味を持っていたかを確認する方法もありません。

結果を保存する際は、その根拠となるスコア、バンド、決定境界、日付も併せて保存してください。これらはモデルが更新された後でも解釈可能ですが、単なるパーセンテージにはその信頼性がありません。

よくある質問

2つの検出器の結果が異なる場合、どちらを信じるべきですか?
その判断根拠を示している方を信頼してください。公開された決定境界、明示されたバンド、領域マップがあれば、その測定結果が自身の画像に対して妥当かどうかを確認できます。説明のない単なるパーセンテージは、どれほど自信ありげに聞こえても証拠にはなりません。
検出器を多く実行すれば、より良い答えが得られますか?
事前にそれらの重み付けを決定している場合に限ります。3つのツールが一致することは確かに強力な証拠となり得ます。しかし、6つのツールを使って2つが自分の意見と一致したというだけでは、人間は単に自分がすでに持っていた結論を正当化しているに過ぎません。
なぜあるツールは私の編集済み写真をAIと判定し、別のツールは本物と判定するのですか?
それらは異なる問いに答えているからです。生成に関与したあらゆる要素をカウントするツールは、ジェネレーティブ塗りつぶしやアップスケールをフラグ付けします。一方、完全に合成されたフレームのみを探すツールは、それらを無視します。どちらも間違いではありません。それぞれのツールがどの定義を使用しているかを確認してください。
2つの検出器が両方とも正しいことはあり得ますか?
はい、よくあることです。閾値が異なれば同じ測定でも異なる判定が下されますし、学習データセットが異なれば、珍しい画像に対して全く異なる読み取り結果が出ることもあります。重要なのはデジタル上の数値の一致ではなく、バンド内での合意です。