GANはどのように画像を生成するか
GANは小さなベクトルから開始し、解像度がフルサイズに達するまで層を重ねるごとに解像度を倍にするアップサンプリングを繰り返します。もう一方のネットワークがその結果を判定し、2つのネットワークが互いに競い合って学習します。
繰り返されるアップサンプリングが重要です。倍増するステップごとに規則的なパターンが導入され、それが累積して周期的な構造となり、画像が周波数領域に変換された際に見えるようになります。
その構造は署名に近いものでした。初期の検出器は、周波数スペクトル上の市松模様を探すだけで、画像の内容を理解することなく高い精度に達することができました。それは特定のモデルではなく、アーキテクチャの指紋でした。
Diffusionモデルはどのように画像を生成するか
Diffusionはその逆です。完全なノイズのフィールドから開始し、モデルが学習した知識に基づいて、画像が現れるまで各ステップでノイズを少しずつ取り除いていきます。
アップサンプリングの連鎖がないため、周期的なアーチファクトは発生しません。出力結果は統計的にカメラで撮影されたものとは異なり、その差異は構造的というより拡散的です。検出可能な明確なパターンとして現れるものは何もありません。
GAN
- 繰り返しアップサンプリングされた小さなベクトル
- 倍加するごとに生じる周期的なアーチファクト
- 周波数領域で検出可能
- アーキテクチャが残す一種の署名
- 2022年頃まで支配的だった
拡散(Diffusion)
- フルサイズで段階的にノイズを除去
- アップサンプリングの連鎖はなく、周期的なパターンも存在しない
- 差異は構造的ではなく統計的である
- 検出には学習済みモデルが必要
- 2022年以降に支配的
なぜ古い検出器が機能しなくなったのか
周波数領域のチェッカーボード現象を探すよう構築されたツールは、拡散モデルの画像からは何も見つけられません。このツールは不確実性を報告するのではなく、アーチファクトが存在しないと報告します。これは結果として「クリーン」と判定されます。
これが、2021年から2023年の間に分野全体で検出精度が低下したように見えた理由です。ツールが劣化したわけではありません。それらが探していた対象が生成されなくなったのです。
アーキテクチャ固有の検出に取って代わったもの
広範性です。現在の検出器は単一のアーチファクトを探すのではなく、収集可能な限り多くの異なる生成器の出力で学習されています。そのためモデルは、単一のファミリーが生み出すものではなく、合成テクスチャに共通する性質を学習します。
ここで使用されているモデルが、数千の生成器から得た数百万枚の画像で学習されているのはまさにこの理由からです。アーキテクチャをまたいだ網羅性こそが次世代への汎化能力をもたらすのであり、主流の手法が変わっても生き残れる唯一のアプローチです。
その代償として、特定の既知の生成器に対する精度は、専門特化型の検出器よりも低くなります。しかし、これは正しいトレードオフです。なぜなら、新しい技術が登場した瞬間、専門特化型は役に立たなくなるからです。
このモデルの予測対象
GANから拡散モデルへの移行が教える教訓は、拡散モデルそのものについてではありません。画像生成の手法に縛られた検出器は寿命が限られており、移行は事前に告知されないということです。
| アプローチ | 有効だった対象 | 失敗した条件 |
|---|---|---|
| 周波数アーチファクト探索 | GAN | 拡散モデルの登場 |
| 顔特化型解析 | 初期のフェイススワップ | シーン全体の生成の登場 |
| メタデータ検査 | ツールから直接出力されたファイル | プラットフォームによるメタデータの削除 |
| 誤り率解析 | 一度保存したJPEG | 画像の流通開始 |
| 広範なマルチ生成器学習 | 現在の主要な出力 | 不明、他より後発 |
これはユーザーにとって重要なことか
主に、気づくであろう2つの事柄を説明しています。第一に、検出器が通常どのツールで生成されたかを特定できない理由です。これはモデルごとの指紋を読み取るのではなく、共有されている統計的特性を読み取っているからです。
第二に、無料の古いチェックツールがうまく機能しない理由です。オンラインに残っているツールの多くはGANのアーチファクトを中心に構築されており、再学習されていません。それらは現在の出力に対しても「クリーン」であると自信を持って判定しますが、インターフェース上の理由は説明されません。
ハイブリッドなパイプラインが結果に与える影響
あなたのもとに届く画像のほとんどは、単一の手法で生成されたものではありません。拡散モデルでベースが生成され、GANベースのアップスケーラーで拡大され、顔修正パスで目が整えられ、編集者がクロップして再保存します。
各段階でテクスチャが書き換えられるため、ファイルには複数のプロセスが重なり合った痕跡が残ります。最後に手を加えたプロセスが検出器の読み取る結果を支配することが多く、これがアップスケールされた拡散モデルの画像が、統計的に生成器よりもアップスケーラーに似てしまう理由です。
これが、アーキテクチャの特定が実験室の外では機能しない実務的な理由です。クリーンで単一モデルの出力であれば制御されたテストで解決できますが、実際の制作パイプラインを通った画像に対しては、そもそも問いが適切ではありません。
また、混乱を招く結果についての理由も説明がつきます。純粋に生成された画像が、大幅にアップスケールされた写真よりもスコアが低くなるケースです。両者ともソフトウェアによってテクスチャが書き換えられており、検出器は起源ではなくその書き換えの跡を読んでいるのです。