← すべてのガイド 内部構造

画像生成AIとそれが残す痕跡に関するフィールドガイド

ピクセルモデルで推定できること、ファイルから特定できること、そして画像の背後にあるツールを特定できると主張する検出器がなぜ行き過ぎているのかを解説します。

· 8 分で読めます · Best AI Image Detector

ピクセル分析は、何らかの生成プロセスが関与した可能性があることを推定します。ツール名を特定できるのは、クレデンシャルまたは埋め込まれたマーカーを通じたファイルそのものだけです。ほとんどのファイルにはそのどちらも含まれていません。

2つのレーン

検出器は2つの独立したチェックを実行し、それぞれが異なる回答を出します。それらを分離しておくことが、このページで最も有用な考え方です。

ピクセル分析

  • スクリーンショットや圧縮後も機能する
  • IDではなく可能性を返す
  • 設計上、生成ツールを選ばない
  • ツール名を挙げられない
  • 未知のアーキテクチャに対して性能が低下する

ファイルのエビデンス

  • ツールを正確に特定できる
  • 署名されている場合は暗号学的である
  • ほとんどのプラットフォームで削除される
  • ほとんどの画像には存在しない
  • 意図的に簡単に取り除かれる
左のレーンはほぼすべての画像で機能します。右のレーンは、独自の記録を保持している少数の画像でのみ機能します。

ファイルが宣言できること

画像が元の構造を保持している場合、いくつかのマーカーが存在する可能性があります。それぞれは、ピクセルから導き出されたものではなく、それを書き込んだソフトウェアによる主張です。

  • Content Credentials。 ツールとその動作を記載した署名付きマニフェスト。一部の主要な生成AIは現在、出力を署名しており、これがこの形式の中で最も強力なものです。
  • 生成パラメータ。 多くのオープンソースツールは、プロンプト、シード、サンプラー、モデル名を直接ファイルに埋め込みます。これは予想以上に多くの情報が含まれています。
  • ソフトウェア識別子。 最後に画像を保存したアプリケーション名を記載したプレーンなメタデータフィールド。
  • 宣言されたAIウォーターマーク。 不可視のウォーターマークが適用されたことを示すフラグ。これはウォーターマークそのものではなく宣言です。
  • カメラ撮影の証明。 署名機能を持つカメラによって行われる、ファイルがセンサーから直接来たという反対の主張。

これらは、画像がほとんどのプラットフォームにアップロードされた瞬間に消滅します。だからこそ、ファイルスキャンは実行する価値があっても依存する価値はないのです。何かを見つけたときは強力ですが、ほとんどの場合は何も見つけられません。

生成AIの特定が難しい理由

それは可能であるように聞こえます。ツールごとに異なる美学を生み出し、使い慣れた人はしばしば正しく推測できます。しかし、その直感は3つの理由から検出器には転用できません。

モデルはアーキテクチャとトレーニングデータを共有しているため、統計的な指紋が大きく重複しています。多くのツールは同じベースモデルを微調整したものであり、出力結果が人には異なって見えても、テクスチャレベルでは見分けがつきません。

出力は後処理もされます。アップスケーリング、顔の修復、編集などはすべて生成後に行われ、識別に使用されるテクスチャを書き換えてしまいます。画像が公開される頃には、生成モデルよりもアップスケーラーの影響を強く受けている可能性があります。

そしてターゲットは常に変化します。識別モデルは既存のもののルックアップテーブルであるため、訓練後にリリースされたものに対しては、明白ではなく密かに誤った判定を下すことになります。

優れたカバレッジの真の意味

検出器に関する有用な問いは、どの生成AIを名前で認識できるかではありません。どれほど広範に訓練されたかです。なぜなら、その広さがまだリリースされていないモデルに対する性能を予測するからです。

カバレッジを構築する2つの方法
アプローチ強み弱み
いくつかの主要商用ツールで訓練するそれらのツールに対する高い精度その他に対する汎化性能の低さ
数千の生成AI全体で訓練する未知のモデルへ汎化する単一ツールに対するピーク精度の低下
あるアーキテクチャのアーティファクトを探すそれが有効な間は非常に高い精度手法が変わると完全に機能不全に陥る
ファイルのマーカーのみを読み取る存在する場合は正確大半の画像で見当違いになる

2行目はここで使用されているアプローチであり、そのトレードオフは意図的です。4つの製品に対しては卓越しているが5番目には無力な検出器は、誰かから送られてきた画像をチェックするのにはあまり役に立ちません。

製品名について

サポートされている生成AIのリストは、技術的なものよりもマーケティングの産物です。ピクセルモデルにはリストはなく、トレーニング分布があるだけです。製品名を挙げることは、広範な検出機能には不要であり、かつ存在しないツールごとの機能を暗示してしまいます。

ここで結果に名前が表示される場合、それはピクセルからではなくファイルから読み取られたものであり、結果にもそのように記載されています。その区別は、あなたが使用するいかなるツールに対しても主張する価値があります。

カバレッジに関する主張の読み方

ベンダーは比較可能であるかのように聞こえるがそうではない方法でカバレッジを説明します。3つの言い回しが繰り返し現れ、それぞれが異なる意味を持っています。

X、Y、Zからの画像を検知する、は通常、ベンチマークにその3つが含まれていたことを意味します。これは能力ではなくテストについての声明であり、4番目の生成AIについては何も語っていません。

40以上の生成AIをサポートする、は通常、トレーニングセットがそれだけのソースから抽出されたことを意味します。これは、トレーニングの広さが汎化性能を予測するためより意味がありますが、特定のツールに対する保証ではありません。

ソースモデルの特定は、最も困難な課題です。その特定がファイルから来ているのか、ピクセルから来ているのかを問いかけてください。もしピクセルから来ているのであれば、特定自体の精度と検出自体の精度を分けて尋ねてください。これらは全く異なる数値だからです。

よくある質問

Midjourneyで生成された画像かどうかを検出ツールで判別できますか?
ファイルにその旨を示す認証情報やマーカーが残っている場合のみ可能です。画像がどこかで共有されると、それは一般的ではありません。ピクセルデータのみから判断することは不可能です。共有アーキテクチャや学習データに基づいて構築されたモデルは指紋が重複しており、後処理によってそのわずかな違いも曖昧になってしまうからです。
AI生成ツールは出力にウォーターマークを入れますか?
一部のツールは、ピクセルに埋め込まれた目に見えないパターンや、ファイル内の署名付き認証情報を使用してそれを行います。現在、主要なツールのいくつかはどちらか、あるいは両方を実施しています。ただしカバー範囲は部分的であり、オープンモデルでは一般的に行われていません。また、クロップ(切り抜き)、再エンコード、またはプラットフォームへのアップロードによって、これらは削除される可能性があります。
なぜ結果にツール名が表示されることがあるのですか?
ファイルにそう記録されているからです。一部の生成ツールは、モデル名、プロンプト、シード値を画像のメタデータに直接埋め込みます。これがある場合は強力な証拠となりますが、それは画像から推論されたものではなく、ソフトウェアによって宣言された情報です。
サポートされている生成ツールの一覧が長いほど、精度の高い検出ツールと言えますか?
必ずしもそうとは言えず、むしろ懐疑的になるべきです。ピクセルベースのモデルは、製品ごとではなく、生成ツール間で共有される統計的特性に基づいて機能します。長いリストは通常、テストセットに含まれていたものを説明しているだけであり、ツールが処理できる能力とは同義ではありません。
先週リリースされた生成ツールによる画像はどうですか?
精度が低下し、偽陰性(見逃し)が発生する傾向があります。未知の出力は「不明」というより低いスコアになることが多いため、他の理由で疑わしい画像は、チェックで問題ないと判定されても疑う余地を残すべきです。
メタデータが通常削除されているなら、ファイルを確認する意味はありますか?
あります。コストはかかりませんし、それによって問題が即座に解決することもあるからです。AI生成であることを宣言する有効な認証情報があれば、その時点で分析は完了します。ピクセルチェックと並行してスキャンが行われるため、判断を迷う必要はありません。