簡単に混同される3つの層
これらを分類することで、この分野における矛盾したアドバイスのほとんどが説明できます。各層が異なる方法で失敗し、人々は最初に出会ったものから一般化してしまうためです。
| 層 | 場所 | 削除するもの |
|---|---|---|
| メタデータとクレデンシャル | ファイル内のピクセルの横 | メタデータを削除するアップロード |
| 不可視の透かし | ピクセル値の中 | 重いトリミング、再生成、強力な圧縮 |
| 統計的検出 | どこにもない、推論される | 削除するものはない、精度が低下するだけ |
| 可視透かし | 画像上に描画される | トリミング、またはインペイントツール |
3行目は異質であり、そもそも検出器が存在する理由です。何も追加されていないため、削除するものはありません。分析は、生成プロセスが偶発的に生成した特性を読み取ります。
そのため、これらの層は競合するのではなく、補完的です。透かしチェックは作動したときは正確ですが、そうでなければ沈黙します。ピクセルチェックは常に何かを返しますが、決して確実ではありません。
不可視の透かしがどのように機能するか
生成エンジンは、画像が作成される際、一致する検出器だけが探す方法を知っているパターンで、ピクセル値に小さく構造化された調整を加えます。その変化は、意図的に視覚的知覚の閾値以下に抑えられています。
信号はファイルラッパーではなくピクセル内にあるため、メタデータを破壊するものにも耐えます。スクリーンショット、再エンコード、サイズ変更、プラットフォームへのアップロードなどはすべてメタデータを残しますが、適切に設計された透かしは損なわれないまま残すことができます。
その耐久性がポイントですが、限界もあります。攻撃的なトリミングは破棄された領域にあったパターンの一部を削除し、重い圧縮はそれを劣化させ、画像を2番目の生成モデルに通すとピクセルが完全に上書きされます。
見落とされがちな構造的な制限もあります。透かしはそれを埋め込んだシステムに固有のものです。あるプロバイダーによって構築された検証ツールは、そのプロバイダーのマークのみを読み取り、何も埋め込まないオープンモデルを含む他のすべての出力については沈黙します。
指標的。動作は透かしスキームやプラットフォーム間で異なります。
最後の2列が興味深い部分です。スクリーンショットは検出器が読み取る統計的信号を破壊しますが、耐久性のある透かしは損なわれません。再生成はその逆です。どちらの層も完全にカバーし合っていないため、両方を持つべきであるという議論になります。
なぜすべての透かしをチェックできないのか
これが人々を失望させる現実的な制限です。検証にはエンコーダーと一致する検出器が必要であり、それらは構築した組織によって制御されています。
一部のプロバイダーは、自社の出力のために公開検証ページを提供しています。他のプロバイダーはパートナーのみに利用可能であり、オープンモデルは一般的に何も埋め込まないため、ウェブ上の生成画像の大部分には発見すべき透かしが存在しません。
そのため、透かしの結果が否定的であっても、それはほとんど意味をなしません。それは、この特定のスキームが作動しなかったことを示しており、他のシステムからの出力や、過度な再エンコードがなされたものにとっては予想される結果です。
肯定的な結果はその逆です。強力かつ具体的で、行動を起こす価値があります。透かし検証ツールが画像はある特定のシステムから来たと述べる場合、それはシステム自体による主張であり、それに関する推論ではありません。
今後どこへ向かうのか
方向性は単一の答えではなく、層状化に向かっています。ファイル内のクレデンシャル、ピクセル内の透かし、そして上層の統計的検出が、それぞれが他で見逃されるケースをカバーします。
ボトルネックは技術ではなく採用です。透かしは、生成エンジンがそれを実装し、プラットフォームがそれを保持し、検証ツールが利用可能な場合にうまく機能します。その3つのいずれかが欠けると、ピクセルの読み取りに戻ることになります。
今日意思決定を行う人にとって、実用的なスタンスは変わりません。利用可能なチェックを実行し、肯定的なマーカーは強力なものとして扱い、欠けているものは沈黙として扱い、賭け金が現実的である場合は、証拠と文脈に重きを置いてください。
なぜ削除の研究が削除そのものより重要なのか
学術的な作業は、特定の透かしスキームが剥がされる可能性があることを定期的に実証しており、それぞれの実証がアイデアが失敗したかのように報告されます。その読み方は、技術の目的を見失っています。
透かしは鍵ではありません。それは、生成された出力を写真として偽装したい人に課されるコストであり、ほとんどの人が払おうとしないコストです。誤解を招く画像の圧倒的多数を占める不用意な再投稿は、それを生き残れません。
比較すべきは、誰も試みていないのにインターネット上のすべてのプラットフォームによって誤って削除されるメタデータです。打ち負かすために意図的な努力を必要とする信号は、決定的な敵がそれを打ち負かすとしても、かなりの改善です。
批判が当てはまるのは、確実性に関する主張についてです。自社の透かしが起源を証明すると言うプロバイダーは誇張しています。自社の透かしが独自の未修正出力を識別すると言うプロバイダーは、そのものを正確に説明しています。
肯定的な結果に対してどうすべきか
この分野で利用可能な最も強力な単一の信号として扱い、それでも調査の終わりとは見なさないでください。透かしはピクセルを作成したシステムを識別しますが、それは画像が何を主張するために使用されているかを確立することとは異なります。
生成されたイラストは、生成されたという理由だけで問題になるわけではありません。何かが起こった記録として提示されるときに問題になり、その提示はファイルについてではなく、キャプションについての問いです。
この周囲にプロセスを構築する人にとって、機能する順序は、まずファイルをチェックし、次に検証ツールが存在する場合は透かしをチェックし、最後にピクセルをチェックすることです。各ステップは次のステップよりも安価で決定的な結果が得られ、ほとんどの画像は3番目のステップの前に解決します。
直感に反する部分は、最も決定力に欠ける層が、常に答えを出す唯一のものであるということです。これは検出への批判ではなく、検出が存在する理由であり、結果が評決ではなく可能性として読まれるべき理由です。