← すべてのガイド 内部構造

AI画像検知の実際の仕組み

ファイルをドロップしてからスコアを確認するまでの間には、ピクセルモデル、タイル処理、ファイル証拠の確認、そしてこれら3つを組み合わせるプロセスが行われます。

· 8 分で読めます · Best AI Image Detector

Vision Transformerがフレーム全体をスコア化し、同じモデルがタイル単位でもう一度スコア化します。別のリーダーがファイルの認証情報を確認し、これら3つの結果が組み合わされて1つの校正済み数値になります。

モデルは何を見ているのか

カメラはレンズを通して光をセンサーに記録します。その過程で特定のノイズ、周辺部に向かってぼやける特定のパターン、センサーグリッドとそれに続くデモザイク処理から生じる隣接ピクセル間の特定の関係性が残ります。

diffusionモデルは、ノイズだらけのフィールドからノイズを繰り返し取り除くことで画像を生成します。その過程でも特定のシグネチャが残りますが、それは異なります。結果は見た目には完璧であっても、統計的には識別可能です。

これが、メタデータが消えても検知がスクリーンショットを追跡できる理由です。シグネチャはヘッダーではなくピクセル値自体にあるため、ピクセルをコピーすれば証拠もコピーされることになります。

4つの段階

  1. 1 ファイルを読み込む ブラウザ内でデコードされ、外部へのアップロードは行われません
  2. 2 フレームをスコア化する 384ピクセル四方でのVision Transformer
  3. 3 タイルをスコア化する 重複する領域に対する同一モデルによる処理
  4. 4 認証情報を読み込む C2PAおよびジェネレーターマーカー(存在する場合)
独立した2つの証拠経路が収束します。どちらか一方だけで結論を出すようにはなっていません。

第1段階:デコード

ファイルはブラウザによってディスクから読み込まれ、生のピクセルへとデコードされます。HEIC、AVIF、TIFFなどはすべてブラウザ独自のデコーダーで処理されます。何も送信されませんが、これはサーバー側で適用されるポリシーではなく、処理がどこで行われるかという特性によるものです。

第2段階:フレーム全体のスコア化

画像は384ピクセル四方にリサイズされ、Vision Transformerを通過します。モデルは、フレームが合成であるという生の確率を返します。その数値は校正され、モデルの変動に左右されず、公開されている帯域に一貫してマッピングされます。

リサイズによって詳細が失われますが、これが精度の低下する最初の箇所です。しかし、モデルは入力サイズが固定されており、4000ピクセルの写真はそれに合わせるために縮小せざるを得ません。

第3段階:タイル処理

フレームは重複する領域に分割され、それぞれが同じモデルによって個別にスコア化されます。これこそが、完全に生成された画像と、実写写真に何かが追加されたものを区別する仕組みであり、単一の数値では代替できない段階です。

14 11 16 12 88 13 9 15 10

これらを平均すると21になります。タイルビューは、平均化によって失われる情報も保持しています。

同じモデルを重複するクロップに対して9回実行します。この画像のフレーム全体スコアは31でした。

タイルには意味のある結果を出すために十分なピクセルが必要です。そのため、短辺が約576ピクセル未満の画像はフレーム全体スコアのみが算出されます。小さなクロップでは個別にスコア化するための詳細情報が足りないためです。

第4段階:ファイル自身の記録

ピクセルとは別に、Content Credentialsおよび一部のツールが残すジェネレーターマーカーがチェックされます。この経路は統計的な推定ではなく、暗号的な検証を行います。有効な署名が信頼リストと照合されます。

結果をどのように組み合わせるか

2つの経路は重みが異なるため、単純に平均されることはありません。カメラ撮影と宣言する有効な認証情報は、中程度のピクセルスコアよりも優先されます。AI生成を宣言する認証情報は、それだけで結論を確定させます。

証拠の重み付け
証拠タイプ重み
AI生成を宣言する有効な認証情報暗号的決定的
カメラ撮影を宣言する有効な認証情報暗号的非常に強い
ファイル内のジェネレーターマーカー宣言的強いが除去可能
フレーム全体のピクセルスコア統計的中程度
領域タイルスコア統計的中程度、かつより詳細
認証情報なし情報なしいずれの情報もなし

最後の行は最も誤解されやすい部分です。認証情報がないことは否定的なシグナルではありません。これまで作成された画像の大多数には認証情報が含まれておらず、ほとんどのプラットフォームはアップロード時にこれらを削除します。

なぜブラウザで実行されるのか

モデルは約40MBで、訪問者のデバイス上でWebAssemblyを通じて実行されます。これは意図的なアーキテクチャの選択であり、理解しておくべき3つの結果を伴います。

  • 画像は一切アップロードされません。そのため、誰の画像も保持するサーバーは存在せず、データ処理に関する関係性も発生しません。
  • チェックにコストがかからないため、利用メーターを背後に置くことなくツールを無料で提供できます。
  • 最初のチェックは時間がかかります。モデルを一度ダウンロードしてから実行する必要があるためです。以降のチェックではキャッシュされたコピーが再利用されます。

パイプラインが意図的に行わないこと

従来のフォレンジックツールで使われていた手法のいくつかは、現代のプラットフォームを経由した画像には通用しなくなったため、採用していません。

  • 誤りレベル分析(ELA)。 人気があり誤解されがちですが、一度でも再保存された画像では信頼性がありません。
  • コピー・移動検知。 フレーム内の複製領域を検出しますが、これは古いタイプのクローン作成を検知するものであり、生成には対応していません。
  • メタデータに基づく判定。 EXIFはほとんどの場所でアップロード時に削除されるため、これに依存するチェックはまさに検証が必要な画像で失敗します。
  • 顔特定分析。 特定の狭い操作には役立ちますが、それ以外には対応できません。

よくある質問

検知ツールは画像の中身を見ているのか?
いいえ。物体、顔、場面といった概念は持っていません。隣接ピクセル間の統計的な関係性を測定しているため、ポートレート、街角の風景、レシートのいずれでも同様に機能し、画像の内容が真実かどうかを判断することはできません。
なぜ最初のチェックに時間がかかるのか?
モデルが約40MBあり、実行前に一度ダウンロードされる必要があるためです。その後はキャッシュされ、以降のチェックは即座に開始されます。これはサーバーではなくデバイス上で実行することのコストであり、何もアップロードされないという事実の代償です。
生のモデル出力をどのようにスコアに変換するのか?
校正です。モデルは生の確率を返しますが、これは固定スケールにマッピングされるため、特定の数値は常に同じ意味を持ちます。このステップがないと、モデルが変わるたびにスコアが変動し、公開された帯域の意味が失われてしまいます。
なぜ単純なグリッドではなく、重複するタイルなのか?
タイルの境界をまたぐ編集は2つの領域に分割され、両方で薄まってしまいます。クロップを重ねることで、どのような編集も少なくとも1つの領域内に完全に収まるようになり、小さな挿入物が平均化によって消えるのを防ぎます。
どのジェネレーターで作られたか判別できるか?
ファイルに記載がある場合のみです。ジェネレーターマーカーや認証情報はツール名を特定できる可能性がありますが、ピクセルモデルは特定できません。生成的な何かが関与した可能性を返すものであり、これは識別とは別の、より確実な答えが出しやすい質問です。
フレームとタイルに同じモデルが使われているのか?
はい。異なるクロップに対して同じモデルを実行することで、2つの結果を比較可能にしています。領域ごとに別々のモデルを使用すると、それぞれの校正と誤差が生じ、2つの数値が同じスケール上で比較できなくなります。