モデルは何を見ているのか
カメラはレンズを通して光をセンサーに記録します。その過程で特定のノイズ、周辺部に向かってぼやける特定のパターン、センサーグリッドとそれに続くデモザイク処理から生じる隣接ピクセル間の特定の関係性が残ります。
diffusionモデルは、ノイズだらけのフィールドからノイズを繰り返し取り除くことで画像を生成します。その過程でも特定のシグネチャが残りますが、それは異なります。結果は見た目には完璧であっても、統計的には識別可能です。
これが、メタデータが消えても検知がスクリーンショットを追跡できる理由です。シグネチャはヘッダーではなくピクセル値自体にあるため、ピクセルをコピーすれば証拠もコピーされることになります。
4つの段階
- 1 ファイルを読み込む ブラウザ内でデコードされ、外部へのアップロードは行われません
- 2 フレームをスコア化する 384ピクセル四方でのVision Transformer
- 3 タイルをスコア化する 重複する領域に対する同一モデルによる処理
- 4 認証情報を読み込む C2PAおよびジェネレーターマーカー(存在する場合)
第1段階:デコード
ファイルはブラウザによってディスクから読み込まれ、生のピクセルへとデコードされます。HEIC、AVIF、TIFFなどはすべてブラウザ独自のデコーダーで処理されます。何も送信されませんが、これはサーバー側で適用されるポリシーではなく、処理がどこで行われるかという特性によるものです。
第2段階:フレーム全体のスコア化
画像は384ピクセル四方にリサイズされ、Vision Transformerを通過します。モデルは、フレームが合成であるという生の確率を返します。その数値は校正され、モデルの変動に左右されず、公開されている帯域に一貫してマッピングされます。
リサイズによって詳細が失われますが、これが精度の低下する最初の箇所です。しかし、モデルは入力サイズが固定されており、4000ピクセルの写真はそれに合わせるために縮小せざるを得ません。
第3段階:タイル処理
フレームは重複する領域に分割され、それぞれが同じモデルによって個別にスコア化されます。これこそが、完全に生成された画像と、実写写真に何かが追加されたものを区別する仕組みであり、単一の数値では代替できない段階です。
これらを平均すると21になります。タイルビューは、平均化によって失われる情報も保持しています。
タイルには意味のある結果を出すために十分なピクセルが必要です。そのため、短辺が約576ピクセル未満の画像はフレーム全体スコアのみが算出されます。小さなクロップでは個別にスコア化するための詳細情報が足りないためです。
第4段階:ファイル自身の記録
ピクセルとは別に、Content Credentialsおよび一部のツールが残すジェネレーターマーカーがチェックされます。この経路は統計的な推定ではなく、暗号的な検証を行います。有効な署名が信頼リストと照合されます。
結果をどのように組み合わせるか
2つの経路は重みが異なるため、単純に平均されることはありません。カメラ撮影と宣言する有効な認証情報は、中程度のピクセルスコアよりも優先されます。AI生成を宣言する認証情報は、それだけで結論を確定させます。
| 証拠 | タイプ | 重み |
|---|---|---|
| AI生成を宣言する有効な認証情報 | 暗号的 | 決定的 |
| カメラ撮影を宣言する有効な認証情報 | 暗号的 | 非常に強い |
| ファイル内のジェネレーターマーカー | 宣言的 | 強いが除去可能 |
| フレーム全体のピクセルスコア | 統計的 | 中程度 |
| 領域タイルスコア | 統計的 | 中程度、かつより詳細 |
| 認証情報なし | 情報なし | いずれの情報もなし |
最後の行は最も誤解されやすい部分です。認証情報がないことは否定的なシグナルではありません。これまで作成された画像の大多数には認証情報が含まれておらず、ほとんどのプラットフォームはアップロード時にこれらを削除します。
なぜブラウザで実行されるのか
モデルは約40MBで、訪問者のデバイス上でWebAssemblyを通じて実行されます。これは意図的なアーキテクチャの選択であり、理解しておくべき3つの結果を伴います。
- 画像は一切アップロードされません。そのため、誰の画像も保持するサーバーは存在せず、データ処理に関する関係性も発生しません。
- チェックにコストがかからないため、利用メーターを背後に置くことなくツールを無料で提供できます。
- 最初のチェックは時間がかかります。モデルを一度ダウンロードしてから実行する必要があるためです。以降のチェックではキャッシュされたコピーが再利用されます。
パイプラインが意図的に行わないこと
従来のフォレンジックツールで使われていた手法のいくつかは、現代のプラットフォームを経由した画像には通用しなくなったため、採用していません。
- 誤りレベル分析(ELA)。 人気があり誤解されがちですが、一度でも再保存された画像では信頼性がありません。
- コピー・移動検知。 フレーム内の複製領域を検出しますが、これは古いタイプのクローン作成を検知するものであり、生成には対応していません。
- メタデータに基づく判定。 EXIFはほとんどの場所でアップロード時に削除されるため、これに依存するチェックはまさに検証が必要な画像で失敗します。
- 顔特定分析。 特定の狭い操作には役立ちますが、それ以外には対応できません。