バランス精度が測定するもの
単純な精度は水増しが容易です。生成された画像が90%を占めるテストセットに対し、すべて「生成」と判定するモデルを使えば、精度90%という無用なモデルができあがります。
バランス精度は、実写画像と生成画像を同等に重み付けすることでこれを修正します。つまり、真正な写真をどれだけ正しくクリアし、生成画像をどれだけ正しく検出できたかの平均値です。テストの構成を明示せずに単純な精度を謳うツールは、あまり参考になりません。
検出器が誤る2つの方法
1つの数値は、性質の異なる2つの失敗を隠しており、それぞれコストが異なります。
誤検知(False positive)
- 真正な写真が境界線を超えてしまった
- 原因:アップスケーリング、レタッチ、ナイトモード、スクリーンショット
- コスト:実在の人物に対する誤った疑い
- 現実に害を及ぼす失敗
見逃し(False negative)
- 生成画像が境界線の下に留まった
- 原因:新しい生成モデル、小さな編集、加工済みファイル
- コスト:偽造画像が見逃される
- 人々の関心が低い方の失敗
判断基準線を動かすと、一方が良くなればもう一方が悪くなります。基準を下げれば偽物を多く検知できるようになりますが、本物の写真も誤判定される確率が上がります。基準を上げれば本物の画像は保護されますが、偽物を見逃す可能性が高まります。両方を同時に改善する設定は存在しないため、当ツールでは基準線を密かに調整するのではなく、65という数値で公開しています。
ベンチマークの数値が実際の性能を過大評価する理由
| ベンチマーク画像 | あなたの画像 | スコアへの影響 |
|---|---|---|
| オリジナルファイル、再保存なし | 2〜3回圧縮済み | 精度は数ポイント低下する |
| フル解像度 | チャットアプリ用に切り抜きや解像度変更済み | 読み取るべき詳細情報が減り、不確実性が増す |
| 学習時点で既知の生成ツール | 先月リリースされたモデル | あらゆる検知ツールが抱える恒久的な弱点 |
| 綺麗な写真または綺麗なレンダリング画像 | AIで一度編集された実写 | フレーム全体のスコアでは過小評価される |
| 敵対的処理なし | すり抜けるよう意図的に加工 | 測定を回避するように設計 |
これらはどれも珍しいケースではありません。画像が実際にどのように流通するかを示しています。2つのプラットフォームを経由し、スクリーンショットを撮られた画像は、ベンチマーク測定時に使用されたシグナルの多くを既に失っています。
精度に関する主張の読み方
- テストセットは何かを尋ねる。 ベンチマーク名のない数値はマーケティングです。公開されているベンチマークに基づく数値であれば、第三者が検証できます。
- バランス型か単純型かを尋ねる。 偏ったテストセットでの単純な精度は、最も数値を水増ししやすい指標です。
- 判断基準線がどこにあるかを尋ねる。 どの閾値で測定されたかを知らなければ、精度に意味はありません。
- どの生成ツールが含まれていたかを尋ねる。 どの検知ツールも、学習済みモデルには高いスコアを出しますが、その後にリリースされたモデルには弱い傾向があります。
- 偽陽性率を個別に要求する。 この数値こそが、実在の人物に対してそのツールを使用しても安全かどうかを判断する基準となります。
精度では判断できないこと
ベンチマークは、画像の集団に対してモデルがどれくらいの頻度で正解するかを測定するものです。あなたの画像に対して正解かどうかについては何も語りません。一つの結果に信頼区間は付随せず、検知ツールは自分が犯しているエラーがどれなのかを認識できません。
そのため、見出しの数値よりも、領域マップやファイル構成の根拠の方が重要となります。独立した複数のシグナルが一致していることは一つの高い数値よりも価値があり、不一致自体が重要な発見となります。
検知ツールを自分でテストする方法
誰かの数値を鵜呑みにする必要はありません。有用なテストは半日あれば実行でき、公開されているどのベンチマークよりもツールについて多くを教えてくれます。なぜなら、実際にあなたが扱う画像に近いものを使用できるからです。
-
回答がわかっているテストセットを作成する
自分で撮影した写真20枚と、自分で生成した画像20枚を用意します。オリジナルには手を加えないでください。各20枚あれば、明らかに性能の低いツールを見抜くには十分です。
-
扱いにくい画像を含める
自分で撮影した写真のスクリーンショット、ナイトモード撮影、アップスケーリングされた切り抜き、大幅にレタッチされたポートレートなどを加えます。これこそが検知ツールが失敗する領域であり、あらゆるベンダーのベンチマークが省く部分です。
-
判定ではなくスコアとバンドを記録する
各ツールが返した結果を書き留めます。ツールによって判断基準線が異なるため、数値を比較するよりもバンドを比較する方が有益です。
-
2種類のエラーを個別に数える
あなたの本物の写真が何枚フラグ立てされ、生成画像が何枚見逃されたかを確認します。自分の写真の3分の1を偽物扱いしてしまうツールは、人物の判定には使えません。
重要なのは最初の数値、つまり自分の作品をどのくらいの頻度で偽物と判定するかです。これこそがコストを伴う失敗であり、見出しの平均化された精度では見落とされてしまうものです。