← すべてのガイド ガイド

AI生成された顔を見分ける方法

誰もが繰り返す「視覚的な特徴」は、最初に対策された箇所です。ここでは、写真と生成された顔を今でも隔てているものと、もはやそうではないものを説明します。

· 9 分で読めます · Best AI Image Detector

顔を見るのをやめてください。信頼できる特徴は数年前にフレームの端へと移動しました。背景、ジュエリー、歯、耳、そして髪の毛が他の要素と接する境界線です。顔そのものは、新しいモデルが登場するたびに最初に修正される部分です。

古いチェックリストが機能しなくなった理由

広く共有されている「特徴リスト」には共通の問題があります。それは書かれた当時に存在したモデルの弱点を記述していることです。それらの弱点は公で、測定可能で、恥ずかしいものです。だからこそ、次のリリースで真っ先に修正されるのです。

手は最も明確な例です。指を数えることは約18ヶ月間は非常に有効でしたが、今では両方向に自信満々で間違える方法となってしまいました。生成された手は今では正確なことが多く、モーションブラーがかかった本物の手は、数えるように言われた人には不自然に見えるからです。

同じことが目の反射、耳の非対称性、歯の形状などにも順番に起こっています。バイラル投稿で説明できるものはすべてベンチマークの対象となり、ベンチマークされたものはすべて修正されます。

  1. 2019
    背景が溶けている 初期の顔生成モデルは、ぼやけた画像の上に鮮明な顔を合成していました。モデルがシーン全体を学習することで解消されました。
  2. 2022
    耳とイヤリングの不整合 非対称な装飾品は強力な判定指標でしたが、学習データがそれをカバーするようになり解消されました。
  3. 2023
    手と指 最もよく言及される特徴です。2世代のモデル更新でほぼ解決されました。
  4. 2024
    フレーム内の文字 看板やラベルが判読可能になり、容易な判定基準は失われました。
  5. 2026
    残されたものは統計的な情報です 残る違いはテクスチャやノイズの構造にあり、人間の目では判別不可能です。
人気のある特徴が信頼できなくなった時期の概算です。重要なのは時期ではなく、そのパターンです。

顔以外の部分を見る

生成処理は注目される場所に集中します。人物のポートレートで訓練されたモデルはその領域に非常に長けていますが、訓練時に背景として扱われた領域は不完全なままです。

そこに確実なチェックポイントがあります。ランヤードに何が書かれているか、シャツの模様が腕の後ろで正しく続いているか、ネックレスの鎖が首の後ろを通って適切な場所に出ているか、肩の後ろの空間が現実に存在し得る場所かを確認してください。

繰り返される詳細は、もう一つの信頼できる指標です。壁紙、レンガ、植物、群衆の顔などを一貫して生成するのは難しいため、ポートレート自体が完璧に見えても、それらは繰り返されたり、歪んだり、消失点がずれたりして、人間の目に見つかってしまいます。

  • 中心から離れたテキスト。 バッジ、看板、本の背表紙、パッケージ。中央のテキストは現在では概ね正確ですが、周辺部のテキストは依然として破綻しやすい箇所です。
  • 遮蔽物の向こう側の連続性。 何かの後ろを通って再び現れるストラップ、チェーン、縞模様などが不自然につながっている。
  • 群衆と繰り返されるオブジェクト。 群衆の2列目や3列目、あるいは並んだ椅子の4番目などは、最前列ほど詳細に描かれません。
  • 高倍率で見る皮膚。 本物の皮膚には毛穴、産毛、非対称な傷があります。生成された皮膚は、照明では説明できないほど滑らかなことが多いです。
  • 髪と他の境界線。 髪と背景の境界は、一貫してレンダリングするのが最も難しい領域の一つです。

検出器が見るもの

目視ではなくチェックツールを使う理由は、残された違いが人間の視覚の解像度を下回るからです。カメラセンサーは特有のノイズを生み出し、生成プロセスは異なるノイズを生み出しますが、どちらも通常の閲覧サイズでは目に見えません。

これが、検出器と人間の目の判断が一致しない理由でもあります。明らかに視覚的なエラーがある画像でも、テクスチャが写真のようであればスコアは低くなることがあり、逆に完璧に見えてもテクスチャが異なれば高いスコアが出ることもあります。どちらの読み取りも有益であり、一方が他方を無効にするものではありません。

二種類の証拠
目視検査ピクセル分析
対応範囲構成と論理エラーテクスチャとノイズ構造
圧縮耐性はい劣化
スクリーンショットでも機能するはい大幅に劣化
小さな編集を検出気づいた場合のみはい、領域マップ経由で
時間とともに悪化する急速に徐々に

最後の行が重要です。視覚的な指標はモデルのリリースごとに衰退しますが、多くの生成器で訓練された検出器は、特定の製品の特定の年のエラーではなく、合成テクスチャに共通する特性を学習しているため、より長く有効です。

最も重要なケース:本物の顔が変更されている場合

最も結果に影響する偽造は、全体が生成されたポートレートではありません。本物の人間の写真において、同じ体の上に別の顔が乗っていたり、手に物が追加されていたり、バッジが変更されていたり、二人目が削除されていたりするケースです。

フレーム全体のスコアは、画像の90%が本物の写真であればその平均値が反映されるため、このケースを判定するのには適していません。領域マップこそがそれを浮き彫りにします。数字よりもマップを読むことが、顔の判定精度を向上させる唯一の習慣です。

14 18 11 16 12 15 89 13 17 10 14 19

11個のタイルは写真として読み取られました。1個だけが写真ではないと判定され、それが顔をカバーしているタイルです。

本物の集合写真で一人だけ顔が差し替えられている。フレーム全体のスコアは31でした。

有効な習慣

ポートレートに対して5秒間の周辺検査を行ってください:テキスト、連続性、繰り返されるパターン、髪の境界線。その後、チェックを実行してマップを読んでください。両方を合わせることで単独よりもはるかに多くの発見があり、すべて1分以内で完了します。

リスクを伴う場合、ピクセル解析では代替できないステップを追加してください:同じ人物を過去の履歴がある場所で探すこと。3年分の投稿履歴があり、他人がタグ付けした写真があり、一貫した雇用主があるプロフィールは、生成ツールでは決して作れない種類の証拠です。

変わらない指標

4年間の進歩にもかかわらず、2つの指標は依然として有効です。どちらも細部ではなく、距離を隔てた一貫性に関するものです。一つ目は照明です:フレーム内のすべての表面が、同じ光源から、同じ方向で、同じ柔らかさの影で照らされているかを確認してください。

生成されたポートレートは通常、顔は正しく描写されますが、周辺環境の照明との不整合が影に出ます。顎の下の強い影と壁の柔らかい影が隣り合っている場合、それは異なる二つの部屋の照明を記述しています。

二つ目は深度です。反射する表面、ガラス、水、鏡は、他のすべての幾何学と一致している必要がありますが、多くの場合一致しません。そこに存在するはずのない景色を映し出す被写体背後の窓などは、顔のモデルではなく世界のモデルを必要とするため、モデルのアップグレードがあっても残るエラーの典型です。

どちらも機械的に適用できるテストではなく、指の数を数えるよりも時間がかかります。これがトレードオフです。現在も有効なチェックとは、欠陥を探すスキャンではなく、写真を一つの場所として考える必要があるものです。

よくある質問

指の数を数えることはまだ有用か?
ほとんどありません。現在では両方向に失敗します。現在のモデルはほとんどの場合で手を正しく描写するため、正しい手は何の証明にもならず、動きの途中の本物の手が捉えられたものが、生成されたものとして誤読されることもあります。18ヶ月ほどは優れたヒントでしたが、今はそうではありません。
目はどうですか?反射が合わないと読みました。
それは初期の顔生成器では真実でしたが、当時はそれぞれの目をある程度独立して描写していました。現代のモデルは一貫したキャッチライトを生み出します。確認して損はありませんが、反射が対になっていることは、もはや何かの証拠にはなりません。
なぜ検出器は本物の人物の写真をフラグ立てするのですか?
通常は加工によるものです。ビューティーフィルター、ポートレートモード、ナイトモード、強力なノイズ除去は撮影後に皮膚のテクスチャを書き換えます。検出器はその信号を読み取っています。中程度のスコアを意味のあるものとして扱う前に、フィルタリングされていないオリジナルを確認してください。
どのツールで作られたか判別できますか?
ピクセルからは不可能です。モデルはアーキテクチャや学習データを共有しており、指紋は重なり合っています。ポストプロセスを行えば、それらを区別するわずかな要素もぼやけてしまいます。結果に名前が表示された場合、それは画像からではなくファイル内の認証情報に基づいたものであり、その旨は明記されます。
集合写真の中の顔にも有効ですか?
はい。領域マップが役立つのはまさにこの時です。写真の一部だけが差し替えられた場合、フレーム全体のスコアはほとんど変化しませんが、一つのタイルだけが反応します。複数人が写っている画像では、まずマップを読んでください。
ビデオ通話はどうですか?
それは異なる問題であり、異なるツールが必要です。静止画検出はライブビデオの改ざんには対応しておらず、個々のフレームをチェックしてもリアルタイムの顔交換に見られる時間的な不整合を見逃します。静止画チェックですべてをカバーできるとは考えず、別のものとして扱ってください。