← Tous les guides Guides

Comment repérer les visages générés par IA

Les indices visuels que tout le monde répète sont ceux qui ont été corrigés en premier. Voici ce qui distingue encore un visage généré d'un visage photographié, et ce qui ne le fait plus.

· 9 min de lecture · Best AI Image Detector

Arrêtez de regarder le visage. Les indices fiables se sont déplacés vers les bords du cadre depuis des années : arrière-plans, bijoux, dents, oreilles et la frontière où les cheveux rejoignent tout le reste. Le visage lui-même est la partie que chaque nouveau modèle corrige en premier.

Pourquoi la vieille liste de vérification a cessé de fonctionner

Toutes les listes d'indices largement partagées souffrent du même défaut : elles décrivent les faiblesses des modèles existant au moment de leur rédaction. Ces faiblesses sont publiques, mesurables et embarrassantes, ce qui en fait précisément les éléments que la mise à jour suivante s'efforce de corriger.

Les mains en constituent l'exemple le plus clair. Compter les doigts s'est avéré réellement utile pendant environ dix-huit mois, avant de devenir un moyen de se tromper avec assurance dans les deux sens : les mains générées sont généralement correctes aujourd'hui, et les vraies mains en mouvement se floutent en des formes qui paraissent fausses à quelqu'un à qui l'on a dit de compter.

Il en va de même pour les reflets dans les yeux, l'asymétrie des oreilles et la géométrie dentaire, dans cet ordre approximatif. Tout ce qui peut être décrit dans une publication virale fait l'objet de tests de référence, et tout ce qui est testé est corrigé.

  1. 2019
    Arrière-plans dissous Les premiers générateurs de visages produisaient un visage net sur un fond flou. Problème résolu une fois que les modèles ont appris des scènes entières.
  2. 2022
    Oreilles et boucles d'oreilles mal assorties Les bijoux asymétriques constituaient un signal fort jusqu'à ce que les données d'entraînement les intègrent.
  3. 2023
    Mains et doigts L'indice le plus cité de tous. Largement résolu en l'espace de deux cycles de publication.
  4. 2024
    Texte dans le cadre La signalétique et les étiquettes sont devenues lisibles, éliminant ainsi un indice facile.
  5. 2026
    Ce qui reste est statistique Les différences restantes se situent au niveau de la texture et du bruit, en deçà du seuil de résolution de l'œil.
À peu près le moment où chaque indice populaire a cessé d'être fiable. C'est le schéma qui compte, et non les dates exactes.

Ne regardez pas le visage

L'effort de génération se concentre là où se concentre l'attention. Un modèle entraîné sur des portraits devient très performant sur la zone que les gens regardent, et reste moins précis sur tout ce que le signal d'entraînement a traité comme arrière-plan.

C'est là que se trouvent les vérifications durables. Demandez-vous ce qui est écrit sur le tour de cou, si le motif de la chemise se poursuit correctement derrière le bras, si la chaîne d'un collier passe derrière le cou pour ressortir au bon endroit, et si la pièce visible derrière l'épaule est un lieu qui pourrait exister.

Les motifs répétés constituent l'autre famille d'indices fiables. Le papier peint, la maçonnerie, le feuillage et les visages dans une foule sont coûteux à générer de manière cohérente, de sorte qu'ils ont tendance à se répéter, à se décaler ou à perdre leur point de fuite d'une manière que l'œil peut repérer, même si le portrait au premier plan est parfait.

  • Texte éloigné du centre. Badges, signalétique, dos de livres, emballages. Le texte central est désormais généralement correct ; le texte périphérique reste la zone où tout s'effondre.
  • Continuité à travers une occlusion. Une lanière, une chaîne ou une bande qui passe derrière un objet et réapparaît de manière incorrecte.
  • Foules et objets répétés. La deuxième et la troisième rangée d'une foule, ou la quatrième chaise d'une rangée, reçoivent moins d'attention que la première.
  • Peau à fort grossissement. La vraie peau présente des pores, des poils rebelles et des imperfections asymétriques. La peau générée est souvent lisse d'une manière qu'aucun éclairage ne peut expliquer.
  • Là où les cheveux rencontrent le reste. La frontière entre les cheveux et l'arrière-plan demeure l'une des zones les plus difficiles à rendre de manière cohérente.

Ce qu'un détecteur perçoit et que vous ne voyez pas

La raison pour laquelle il faut effectuer une vérification plutôt que de s'en remettre à une inspection visuelle est que les différences restantes se trouvent sous la résolution de la vision humaine. Le capteur d'un appareil photo produit un type de bruit particulier ; un processus de génération en produit un autre, et aucun des deux n'est visible à une taille de visionnage normale.

C'est également la raison pour laquelle un détecteur et vos yeux peuvent être en désaccord. Une image présentant une erreur visuelle évidente peut obtenir un score bas parce que sa texture est photographique, et une image qui paraît parfaite peut obtenir un score élevé parce que sa texture ne l'est pas. Les deux lectures sont instructives, et aucune ne supplante l'autre.

Deux types de preuves différents
Inspection visuelleAnalyse des pixels
Fonctionne surErreurs de composition et de logiqueStructure de texture et de bruit
Résiste à la compressionOuiSe dégrade
Résiste à une capture d'écranOuiSe dégrade fortement
Détecte une modification mineureUniquement si vous la remarquezOui, via la carte des régions
S'aggrave avec le tempsRapidementGraduellement

La dernière ligne est la plus utile. Les indices visuels s'estompent à chaque nouvelle version de modèle ; un détecteur entraîné sur de nombreux générateurs s'estompe plus lentement, car il a appris ce que la texture synthétique a en commun plutôt que ce qu'un produit a raté une année donnée.

Le cas qui importe le plus : un vrai visage, altéré

Les faux les plus lourds de conséquences ne sont pas des portraits entièrement générés. Ce sont des photographies de vraies personnes dont un élément a été modifié : un visage différent sur le même corps, un objet ajouté dans la main, un badge modifié, une deuxième personne retirée du cadre.

Un score pour l'ensemble de l'image gère mal ce cas par conception, car quatre-vingt-dix pour cent de l'image est bel et bien une photographie et la moyenne le reflète. La carte des régions est ce qui le met en évidence, et lire la carte plutôt que le chiffre est la seule habitude qui améliore le plus la précision sur les visages.

14 18 11 16 12 15 89 13 17 10 14 19

Onze vignettes sont perçues comme photographiques. Une seule ne l'est pas, et c'est celle qui couvre un visage.

Photographie de groupe authentique avec un visage remplacé. Le score global de l'image était de 31.

Une habitude efficace

Accordez au portrait cinq secondes d'inspection périphérique : texte, continuité, motif répété, limite des cheveux. Lancez ensuite une vérification et lisez la carte. Les deux ensemble détectent bien plus de choses que l'un ou l'autre séparément, et l'ensemble prend moins d'une minute.

Lorsque les enjeux sont réels, ajoutez l'étape qu'aucune analyse de pixels ne peut remplacer : trouvez le même visage ailleurs avec un historique. Un profil comportant trois ans de publications, des photographies taguées par d'autres personnes et un employeur constant constitue un type de preuve qu'aucun générateur ne peut produire.

Les indices qui n'ont pas bougé

Deux éléments ont résisté à quatre ans d'amélioration, et tous deux concernent la cohérence à distance plutôt que les détails locaux. Le premier est l'éclairage : vérifier si chaque surface du cadre est éclairée par les mêmes sources, provenant des mêmes directions, avec des ombres de la même douceur.

Un portrait généré obtient généralement un visage correct et un environnement approximativement correct, et le décalage se voit dans les ombres. Une ombre dure sous le menton juxtaposée à une ombre douce sur le mur en arrière-plan décrit deux pièces différentes.

Le second est la profondeur. Les surfaces réfléchissantes, le verre, l'eau et les miroirs doivent s'accorder avec la géométrie du reste, ce qui n'est souvent pas le cas. Une fenêtre située derrière un sujet et montrant une scène qui ne pourrait pas s'y trouver est le genre d'erreur qui survient malgré les mises à jour du modèle, car elle nécessite un modèle du monde plutôt qu'un modèle de visages.

Aucun des deux n'est un test que l'on peut appliquer machinalement, et tous deux prennent plus de temps que ne le faisait le comptage des doigts. C'est le compromis : les vérifications qui fonctionnent encore sont celles qui exigent de penser l'image comme un lieu plutôt que de la scanner à la recherche d'un défaut.

Questions fréquentes

Est-il toujours utile de compter les doigts ?
Rarement, et cette méthode échoue désormais dans les deux sens. Les modèles actuels restituent correctement les mains la plupart du temps, de sorte qu'une main correcte ne prouve rien, et de vraies mains capturées en plein mouvement produisent des formes floues que les gens interprètent comme générées. C'était une bonne heuristique pendant environ dix-huit mois, mais ce n'est plus le cas aujourd'hui.
Qu'en est-il des yeux ? J'ai lu que les reflets ne correspondent pas.
Cela était vrai pour les premiers générateurs de visages, qui rendaient chaque œil de manière quelque peu indépendante. Les modèles modernes produisent des points lumineux cohérents. Cela vaut toujours la peine d'y jeter un coup d'œil puisque cela ne coûte rien, mais une paire de reflets correspondants ne prouve plus rien.
Pourquoi un détecteur signale-t-il la photographie d'une vraie personne ?
Il s'agit généralement du traitement plutôt que de la manipulation. Les filtres de beauté, le mode portrait, le mode nuit et la réduction agressive du bruit modifient tous la texture de la peau après la capture, et c'est précisément le signal que le modèle lit. Demandez un original non filtré avant de considérer un score moyen comme significatif.
Peut-il me dire quel outil a créé le visage ?
Pas à partir des pixels. Les modèles partagent des architectures et des données d'entraînement, de sorte que leurs empreintes se recoupent, et tout post-traitement brouille le peu qui les sépare. Si un nom apparaît dans un résultat, il provient d'une métadonnée du fichier plutôt que de l'image, et le résultat le précise.
Est-ce que cela fonctionne sur un visage au sein d'une photo de groupe ?
Oui, et c'est là que la carte des régions prend tout son sens. Un seul visage remplacé à l'intérieur d'une photographie par ailleurs authentique modifie à peine le score global de l'image, mais illumine une seule case. Lisez d'abord la carte sur toute image comportant plus d'une personne.
Qu'en est-il des appels vidéo ?
Problème différent, outils différents. La détection sur image fixe ne s'attaque pas à la manipulation vidéo en direct, et l'analyse d'images individuelles passe à côté des incohérences temporelles qui trahissent les échanges de visage en temps réel. Traitez ce point séparément au lieu de supposer qu'une vérification d'image fixe le couvre.