2つのレーン
検出器は2つの独立したチェックを実行し、それぞれが異なる回答を出します。それらを分離しておくことが、このページで最も有用な考え方です。
ピクセル分析
- スクリーンショットや圧縮後も機能する
- IDではなく可能性を返す
- 設計上、生成ツールを選ばない
- ツール名を挙げられない
- 未知のアーキテクチャに対して性能が低下する
ファイルのエビデンス
- ツールを正確に特定できる
- 署名されている場合は暗号学的である
- ほとんどのプラットフォームで削除される
- ほとんどの画像には存在しない
- 意図的に簡単に取り除かれる
ファイルが宣言できること
画像が元の構造を保持している場合、いくつかのマーカーが存在する可能性があります。それぞれは、ピクセルから導き出されたものではなく、それを書き込んだソフトウェアによる主張です。
- Content Credentials。 ツールとその動作を記載した署名付きマニフェスト。一部の主要な生成AIは現在、出力を署名しており、これがこの形式の中で最も強力なものです。
- 生成パラメータ。 多くのオープンソースツールは、プロンプト、シード、サンプラー、モデル名を直接ファイルに埋め込みます。これは予想以上に多くの情報が含まれています。
- ソフトウェア識別子。 最後に画像を保存したアプリケーション名を記載したプレーンなメタデータフィールド。
- 宣言されたAIウォーターマーク。 不可視のウォーターマークが適用されたことを示すフラグ。これはウォーターマークそのものではなく宣言です。
- カメラ撮影の証明。 署名機能を持つカメラによって行われる、ファイルがセンサーから直接来たという反対の主張。
これらは、画像がほとんどのプラットフォームにアップロードされた瞬間に消滅します。だからこそ、ファイルスキャンは実行する価値があっても依存する価値はないのです。何かを見つけたときは強力ですが、ほとんどの場合は何も見つけられません。
生成AIの特定が難しい理由
それは可能であるように聞こえます。ツールごとに異なる美学を生み出し、使い慣れた人はしばしば正しく推測できます。しかし、その直感は3つの理由から検出器には転用できません。
モデルはアーキテクチャとトレーニングデータを共有しているため、統計的な指紋が大きく重複しています。多くのツールは同じベースモデルを微調整したものであり、出力結果が人には異なって見えても、テクスチャレベルでは見分けがつきません。
出力は後処理もされます。アップスケーリング、顔の修復、編集などはすべて生成後に行われ、識別に使用されるテクスチャを書き換えてしまいます。画像が公開される頃には、生成モデルよりもアップスケーラーの影響を強く受けている可能性があります。
そしてターゲットは常に変化します。識別モデルは既存のもののルックアップテーブルであるため、訓練後にリリースされたものに対しては、明白ではなく密かに誤った判定を下すことになります。
優れたカバレッジの真の意味
検出器に関する有用な問いは、どの生成AIを名前で認識できるかではありません。どれほど広範に訓練されたかです。なぜなら、その広さがまだリリースされていないモデルに対する性能を予測するからです。
| アプローチ | 強み | 弱み |
|---|---|---|
| いくつかの主要商用ツールで訓練する | それらのツールに対する高い精度 | その他に対する汎化性能の低さ |
| 数千の生成AI全体で訓練する | 未知のモデルへ汎化する | 単一ツールに対するピーク精度の低下 |
| あるアーキテクチャのアーティファクトを探す | それが有効な間は非常に高い精度 | 手法が変わると完全に機能不全に陥る |
| ファイルのマーカーのみを読み取る | 存在する場合は正確 | 大半の画像で見当違いになる |
2行目はここで使用されているアプローチであり、そのトレードオフは意図的です。4つの製品に対しては卓越しているが5番目には無力な検出器は、誰かから送られてきた画像をチェックするのにはあまり役に立ちません。
製品名について
サポートされている生成AIのリストは、技術的なものよりもマーケティングの産物です。ピクセルモデルにはリストはなく、トレーニング分布があるだけです。製品名を挙げることは、広範な検出機能には不要であり、かつ存在しないツールごとの機能を暗示してしまいます。
ここで結果に名前が表示される場合、それはピクセルからではなくファイルから読み取られたものであり、結果にもそのように記載されています。その区別は、あなたが使用するいかなるツールに対しても主張する価値があります。
カバレッジに関する主張の読み方
ベンダーは比較可能であるかのように聞こえるがそうではない方法でカバレッジを説明します。3つの言い回しが繰り返し現れ、それぞれが異なる意味を持っています。
X、Y、Zからの画像を検知する、は通常、ベンチマークにその3つが含まれていたことを意味します。これは能力ではなくテストについての声明であり、4番目の生成AIについては何も語っていません。
40以上の生成AIをサポートする、は通常、トレーニングセットがそれだけのソースから抽出されたことを意味します。これは、トレーニングの広さが汎化性能を予測するためより意味がありますが、特定のツールに対する保証ではありません。
ソースモデルの特定は、最も困難な課題です。その特定がファイルから来ているのか、ピクセルから来ているのかを問いかけてください。もしピクセルから来ているのであれば、特定自体の精度と検出自体の精度を分けて尋ねてください。これらは全く異なる数値だからです。