古いチェックリストが機能しなくなった理由
広く共有されている「特徴リスト」には共通の問題があります。それは書かれた当時に存在したモデルの弱点を記述していることです。それらの弱点は公で、測定可能で、恥ずかしいものです。だからこそ、次のリリースで真っ先に修正されるのです。
手は最も明確な例です。指を数えることは約18ヶ月間は非常に有効でしたが、今では両方向に自信満々で間違える方法となってしまいました。生成された手は今では正確なことが多く、モーションブラーがかかった本物の手は、数えるように言われた人には不自然に見えるからです。
同じことが目の反射、耳の非対称性、歯の形状などにも順番に起こっています。バイラル投稿で説明できるものはすべてベンチマークの対象となり、ベンチマークされたものはすべて修正されます。
-
2019
背景が溶けている 初期の顔生成モデルは、ぼやけた画像の上に鮮明な顔を合成していました。モデルがシーン全体を学習することで解消されました。
-
2022
耳とイヤリングの不整合 非対称な装飾品は強力な判定指標でしたが、学習データがそれをカバーするようになり解消されました。
-
2023
手と指 最もよく言及される特徴です。2世代のモデル更新でほぼ解決されました。
-
2024
フレーム内の文字 看板やラベルが判読可能になり、容易な判定基準は失われました。
-
2026
残されたものは統計的な情報です 残る違いはテクスチャやノイズの構造にあり、人間の目では判別不可能です。
顔以外の部分を見る
生成処理は注目される場所に集中します。人物のポートレートで訓練されたモデルはその領域に非常に長けていますが、訓練時に背景として扱われた領域は不完全なままです。
そこに確実なチェックポイントがあります。ランヤードに何が書かれているか、シャツの模様が腕の後ろで正しく続いているか、ネックレスの鎖が首の後ろを通って適切な場所に出ているか、肩の後ろの空間が現実に存在し得る場所かを確認してください。
繰り返される詳細は、もう一つの信頼できる指標です。壁紙、レンガ、植物、群衆の顔などを一貫して生成するのは難しいため、ポートレート自体が完璧に見えても、それらは繰り返されたり、歪んだり、消失点がずれたりして、人間の目に見つかってしまいます。
- 中心から離れたテキスト。 バッジ、看板、本の背表紙、パッケージ。中央のテキストは現在では概ね正確ですが、周辺部のテキストは依然として破綻しやすい箇所です。
- 遮蔽物の向こう側の連続性。 何かの後ろを通って再び現れるストラップ、チェーン、縞模様などが不自然につながっている。
- 群衆と繰り返されるオブジェクト。 群衆の2列目や3列目、あるいは並んだ椅子の4番目などは、最前列ほど詳細に描かれません。
- 高倍率で見る皮膚。 本物の皮膚には毛穴、産毛、非対称な傷があります。生成された皮膚は、照明では説明できないほど滑らかなことが多いです。
- 髪と他の境界線。 髪と背景の境界は、一貫してレンダリングするのが最も難しい領域の一つです。
検出器が見るもの
目視ではなくチェックツールを使う理由は、残された違いが人間の視覚の解像度を下回るからです。カメラセンサーは特有のノイズを生み出し、生成プロセスは異なるノイズを生み出しますが、どちらも通常の閲覧サイズでは目に見えません。
これが、検出器と人間の目の判断が一致しない理由でもあります。明らかに視覚的なエラーがある画像でも、テクスチャが写真のようであればスコアは低くなることがあり、逆に完璧に見えてもテクスチャが異なれば高いスコアが出ることもあります。どちらの読み取りも有益であり、一方が他方を無効にするものではありません。
| 目視検査 | ピクセル分析 | |
|---|---|---|
| 対応範囲 | 構成と論理エラー | テクスチャとノイズ構造 |
| 圧縮耐性 | はい | 劣化 |
| スクリーンショットでも機能する | はい | 大幅に劣化 |
| 小さな編集を検出 | 気づいた場合のみ | はい、領域マップ経由で |
| 時間とともに悪化する | 急速に | 徐々に |
最後の行が重要です。視覚的な指標はモデルのリリースごとに衰退しますが、多くの生成器で訓練された検出器は、特定の製品の特定の年のエラーではなく、合成テクスチャに共通する特性を学習しているため、より長く有効です。
最も重要なケース:本物の顔が変更されている場合
最も結果に影響する偽造は、全体が生成されたポートレートではありません。本物の人間の写真において、同じ体の上に別の顔が乗っていたり、手に物が追加されていたり、バッジが変更されていたり、二人目が削除されていたりするケースです。
フレーム全体のスコアは、画像の90%が本物の写真であればその平均値が反映されるため、このケースを判定するのには適していません。領域マップこそがそれを浮き彫りにします。数字よりもマップを読むことが、顔の判定精度を向上させる唯一の習慣です。
11個のタイルは写真として読み取られました。1個だけが写真ではないと判定され、それが顔をカバーしているタイルです。
有効な習慣
ポートレートに対して5秒間の周辺検査を行ってください:テキスト、連続性、繰り返されるパターン、髪の境界線。その後、チェックを実行してマップを読んでください。両方を合わせることで単独よりもはるかに多くの発見があり、すべて1分以内で完了します。
リスクを伴う場合、ピクセル解析では代替できないステップを追加してください:同じ人物を過去の履歴がある場所で探すこと。3年分の投稿履歴があり、他人がタグ付けした写真があり、一貫した雇用主があるプロフィールは、生成ツールでは決して作れない種類の証拠です。
変わらない指標
4年間の進歩にもかかわらず、2つの指標は依然として有効です。どちらも細部ではなく、距離を隔てた一貫性に関するものです。一つ目は照明です:フレーム内のすべての表面が、同じ光源から、同じ方向で、同じ柔らかさの影で照らされているかを確認してください。
生成されたポートレートは通常、顔は正しく描写されますが、周辺環境の照明との不整合が影に出ます。顎の下の強い影と壁の柔らかい影が隣り合っている場合、それは異なる二つの部屋の照明を記述しています。
二つ目は深度です。反射する表面、ガラス、水、鏡は、他のすべての幾何学と一致している必要がありますが、多くの場合一致しません。そこに存在するはずのない景色を映し出す被写体背後の窓などは、顔のモデルではなく世界のモデルを必要とするため、モデルのアップグレードがあっても残るエラーの典型です。
どちらも機械的に適用できるテストではなく、指の数を数えるよりも時間がかかります。これがトレードオフです。現在も有効なチェックとは、欠陥を探すスキャンではなく、写真を一つの場所として考える必要があるものです。