← すべてのガイド 内部構造

DiffusionとGAN:検出器が両者を別々に扱う理由

画像の生成プロセスが2つあれば、指紋も2つあります。各プロセスが何を残すか、なぜGANは検知しやすかったのか、そしてそれが今後の展望にどうつながるかを解説します。

· 8 分で読めます · Best AI Image Detector

GANはアップサンプリング時に特有のアーティファクトを生成し、それが署名のような役割を果たします。Diffusionモデルにはそれがないため、2022年以降は検出が困難になり、アーキテクチャ固有の手法が通用しなくなりました。

GANはどのように画像を生成するか

GANは小さなベクトルから開始し、解像度がフルサイズに達するまで層を重ねるごとに解像度を倍にするアップサンプリングを繰り返します。もう一方のネットワークがその結果を判定し、2つのネットワークが互いに競い合って学習します。

繰り返されるアップサンプリングが重要です。倍増するステップごとに規則的なパターンが導入され、それが累積して周期的な構造となり、画像が周波数領域に変換された際に見えるようになります。

その構造は署名に近いものでした。初期の検出器は、周波数スペクトル上の市松模様を探すだけで、画像の内容を理解することなく高い精度に達することができました。それは特定のモデルではなく、アーキテクチャの指紋でした。

Diffusionモデルはどのように画像を生成するか

Diffusionはその逆です。完全なノイズのフィールドから開始し、モデルが学習した知識に基づいて、画像が現れるまで各ステップでノイズを少しずつ取り除いていきます。

アップサンプリングの連鎖がないため、周期的なアーチファクトは発生しません。出力結果は統計的にカメラで撮影されたものとは異なり、その差異は構造的というより拡散的です。検出可能な明確なパターンとして現れるものは何もありません。

GAN

  • 繰り返しアップサンプリングされた小さなベクトル
  • 倍加するごとに生じる周期的なアーチファクト
  • 周波数領域で検出可能
  • アーキテクチャが残す一種の署名
  • 2022年頃まで支配的だった

拡散(Diffusion)

  • フルサイズで段階的にノイズを除去
  • アップサンプリングの連鎖はなく、周期的なパターンも存在しない
  • 差異は構造的ではなく統計的である
  • 検出には学習済みモデルが必要
  • 2022年以降に支配的
2つのプロセスとそれぞれの痕跡。右列は、なぜ検出手法を再構築する必要があったのかを示しています。

なぜ古い検出器が機能しなくなったのか

周波数領域のチェッカーボード現象を探すよう構築されたツールは、拡散モデルの画像からは何も見つけられません。このツールは不確実性を報告するのではなく、アーチファクトが存在しないと報告します。これは結果として「クリーン」と判定されます。

これが、2021年から2023年の間に分野全体で検出精度が低下したように見えた理由です。ツールが劣化したわけではありません。それらが探していた対象が生成されなくなったのです。

アーキテクチャ固有の検出に取って代わったもの

広範性です。現在の検出器は単一のアーチファクトを探すのではなく、収集可能な限り多くの異なる生成器の出力で学習されています。そのためモデルは、単一のファミリーが生み出すものではなく、合成テクスチャに共通する性質を学習します。

ここで使用されているモデルが、数千の生成器から得た数百万枚の画像で学習されているのはまさにこの理由からです。アーキテクチャをまたいだ網羅性こそが次世代への汎化能力をもたらすのであり、主流の手法が変わっても生き残れる唯一のアプローチです。

その代償として、特定の既知の生成器に対する精度は、専門特化型の検出器よりも低くなります。しかし、これは正しいトレードオフです。なぜなら、新しい技術が登場した瞬間、専門特化型は役に立たなくなるからです。

このモデルの予測対象

GANから拡散モデルへの移行が教える教訓は、拡散モデルそのものについてではありません。画像生成の手法に縛られた検出器は寿命が限られており、移行は事前に告知されないということです。

検出の世代ごとの経年変化
アプローチ有効だった対象失敗した条件
周波数アーチファクト探索GAN拡散モデルの登場
顔特化型解析初期のフェイススワップシーン全体の生成の登場
メタデータ検査ツールから直接出力されたファイルプラットフォームによるメタデータの削除
誤り率解析一度保存したJPEG画像の流通開始
広範なマルチ生成器学習現在の主要な出力不明、他より後発

これはユーザーにとって重要なことか

主に、気づくであろう2つの事柄を説明しています。第一に、検出器が通常どのツールで生成されたかを特定できない理由です。これはモデルごとの指紋を読み取るのではなく、共有されている統計的特性を読み取っているからです。

第二に、無料の古いチェックツールがうまく機能しない理由です。オンラインに残っているツールの多くはGANのアーチファクトを中心に構築されており、再学習されていません。それらは現在の出力に対しても「クリーン」であると自信を持って判定しますが、インターフェース上の理由は説明されません。

ハイブリッドなパイプラインが結果に与える影響

あなたのもとに届く画像のほとんどは、単一の手法で生成されたものではありません。拡散モデルでベースが生成され、GANベースのアップスケーラーで拡大され、顔修正パスで目が整えられ、編集者がクロップして再保存します。

各段階でテクスチャが書き換えられるため、ファイルには複数のプロセスが重なり合った痕跡が残ります。最後に手を加えたプロセスが検出器の読み取る結果を支配することが多く、これがアップスケールされた拡散モデルの画像が、統計的に生成器よりもアップスケーラーに似てしまう理由です。

これが、アーキテクチャの特定が実験室の外では機能しない実務的な理由です。クリーンで単一モデルの出力であれば制御されたテストで解決できますが、実際の制作パイプラインを通った画像に対しては、そもそも問いが適切ではありません。

また、混乱を招く結果についての理由も説明がつきます。純粋に生成された画像が、大幅にアップスケールされた写真よりもスコアが低くなるケースです。両者ともソフトウェアによってテクスチャが書き換えられており、検出器は起源ではなくその書き換えの跡を読んでいるのです。

よくある質問

GANの画像は拡散モデルよりも検出しやすいのか
以前はそうでしたが、現在はGANの画像は大幅に減少しています。GANのアップサンプリングは単純な周波数解析で発見可能な周期的なアーチファクトを残しました。拡散モデルには同等の構造がないため、特定のパターンの検索ではなく、学習済みモデルで統計的なテクスチャを読み取る必要があります。
検出器で画像がGAN由来か拡散モデル由来か判別できるか
一般的にピクセルから判断することはできません。広範な検出器は生成的な要素が関与している可能性を報告するものであり、どのファミリーが生成したかを報告するものではありません。アーキテクチャの特定は別の研究課題であり、検出よりも信頼性が著しく劣ります。
GANは今でも使われているのか
はい、特定の用途で使われています。拡散モデルでは遅すぎる顔合成や一部のアップスケーリングなど、狭いタスクでは高速かつ効率的です。ツールによっては段階的に両方を使用するため、画像にその両方の痕跡が残ることもあります。
次のアーキテクチャで再び検出不能になるか
検出不能になるのではなく、精度が低下するでしょう。これこそが広範な学習によって得られた改善点です。数千の生成器に共通する合成テクスチャを学習したモデルは、新しいものに対して徐々に劣化しますが、単一のアーチファクトのみを探す検出器は完全に機能不全に陥ります。
なぜ一部のツールは非常に高い精度を主張するのか
多くの場合、学習に使用した生成器で構成されたテストセットで測定しているからです。その数値は真実ですが、先月リリースされたモデルに対する性能を表してはいません。ツール間の数値を比較する前に、どの生成器がベンチマークに含まれていたかを確認してください。
これはスコアをどう読むべきかに影響するか
一点だけあります。他に疑う理由がある画像に対して「クリーン」という結果が出た場合は、フラグが立った結果よりも弱い証拠として扱ってください。未知のアーキテクチャにおける故障モードは、不確実な結果ではなく、自信を持った低スコアとなるからです。