← Tous les guides Comparaison

ChatGPT peut-il dire si une image a été générée par IA ?

Il vous fournira une réponse affirmative sans aucun fondement. Explication sur l'incapacité des modèles de langage à faire cela, ce qu'ils font réellement et ce qu'il faut utiliser à la place.

· 7 min de lecture · Best AI Image Detector

Non. Un modèle de langage décrit l'apparence d'une image et la commente avec des mots. Il ne dispose d'aucun seuil étalonné, d'aucun étalon de référence et d'aucun accès aux statistiques de pixels sur lesquelles repose la détection.

Ce qu'un chatbot fait réellement

Un modèle de langage multimodal convertit une image en description sémantique, puis raisonne à partir de cette description sous forme de texte. Il répond à la question : est-ce que cette image ressemble aux images d'IA dont j'ai lu la description pendant mon entraînement ?

C'est une question de contenu et de composition. La détection est une question de texture : comment les valeurs des pixels voisins interagissent entre elles, à une échelle bien inférieure à tout ce qu'une description sémantique préserve.

Les informations lues par un détecteur sont éliminées avant même qu'un modèle de langage ne commence à analyser. Ce n'est pas que les chatbots soient mauvais dans ce domaine. Ils travaillent à partir d'une représentation qui ne contient pas les preuves.

Ce que cela produit en pratique

  • Des réponses affirmatives sans seuil. Un chatbot affirmera qu'une image est probablement générée par IA sans qu'aucun barème ne vienne nuancer le mot "probablement". Il n'y a pas de chiffre, pas de fourchette et aucun élément de comparaison avec une autre image.
  • Un raisonnement basé sur des indices obsolètes. Les modèles citent les doigts, les dents, la peau cireuse et le texte déformé, car c'est ce que les textes d'entraînement leur disent de chercher. Ces problèmes ont été résolus il y a des années.
  • Une confirmation de vos attentes. Si vous demandez si une image est fausse, vous aurez plus de chances d'entendre un oui que si vous aviez posé la question de manière neutre. C'est une propriété de l'interface, pas de l'image.
  • Aucune reproductibilité. Posez la question deux fois et vous obtiendrez deux réponses différentes pour le même fichier, avec des explications tout aussi assurées dans les deux cas.
  • Aucune information sur les régions. Il ne peut pas vous indiquer si un coin d'une photographie se comporte différemment du reste, ce qui est pourtant l'indice qui compte généralement.
Capacité Chatbot Détecteur de pixels
Analyse la texture au niveau des pixels No Yes
Score étalonné avec des fourchettes publiées No Yes
Même réponse à chaque fois No Yes
Ventilation par région No Yes
Mesuré par rapport à un étalon de référence No Yes
Explique son raisonnement en prose Yes avec fluidité Partly en tant que signaux
Décrit ce qu'il y a sur l'image Yes No
Ce que chaque approche peut réellement produire. La colonne du milieu est celle que l'on confond à tort avec la colonne de droite.

Les deux dernières lignes sont les seules qui valent la peine d'être conservées. Un modèle de langage est réellement doué pour décrire une image et pour déterminer si une scène a du sens. Ce sont des fonctionnalités utiles, mais il ne s'agit pas de détection.

Là où un chatbot est réellement utile

Écarter complètement l'outil serait une erreur. Utilisé pour ce qu'il sait faire, il complète un détecteur plutôt de ne le remplacer.

  1. Demander de décrire la scène en détail

    Une description minutieuse met souvent en évidence des éléments que vous n'aviez pas remarqués consciemment, y compris des objets qui ne vont pas ensemble ou de la signalétique que vous n'aviez pas lue.

  2. Demander si la scène est physiquement cohérente

    Les ombres, les reflets, l'échelle et la perspective relèvent de problèmes de raisonnement, et le raisonnement est précisément la fonction du modèle. Cela permet d'identifier des montages que l'analyse des pixels peut rater.

  3. Demander ce qui pourrait confirmer ou infirmer

    Transformer un soupçon en une liste de vérifications est un bon usage d'un modèle de langage, et cette liste est souvent meilleure que celle que vous auriez rédigée.

  4. Puis exécuter un véritable détecteur

    Pour la question des pixels, utilisez un outil conçu spécifiquement pour cela et lisez le score par rapport à une échelle publiée.

Pourquoi la fluidité est le danger

Un détecteur incertain renvoie un score moyen, et ce chiffre traduit l'incertitude. Un modèle de langage incertain renvoie un paragraphe, et les paragraphes ne comportent pas de barres d'erreur.

La même explication bien structurée apparaît que le modèle ait identifié quelque chose de réel ou qu'il ait produit un compte rendu plausible de néant. Les lecteurs évaluent leur confiance en fonction de la qualité de la rédaction, qui est précisément le signal qui ne contient ici aucune information.

C'est pourquoi interroger un chatbot constitue un point de départ pire que d'examiner l'image vous-même. Votre propre incertitude vous est au moins visible.

Le même problème dans d'autres outils

Il ne s'agit pas vraiment d'un produit en particulier. Tout système qui analyse une image sur un plan sémantique présente la même lacune, et plusieurs outils présentés aujourd'hui comme des détecteurs font exactement cela en arrière-plan.

Un test utile : demandez ce que l'outil rapporterait sur la photographie d'une photographie, ou sur une image dépourvue de tout sujet reconnaissable. Un détecteur de pixels renvoie un score dans les deux cas, car la texture existe indépendamment du contenu. Un système sémantique n'a rien à analyser et va soit refuser, soit inventer quelque chose.

Un second test : exécutez le même fichier deux fois. Un modèle basé sur les pixels est déterministe et renvoie le même score. Un modèle de langage procède par échantillonnage, et deux exécutions peuvent diverger. Si un outil vous donne des réponses différentes pour les mêmes octets, il ne mesure rien.

Aucun de ces tests ne nécessite de comprendre le fonctionnement de l'outil. Ils prennent tous deux une minute, et ils permettent de distinguer la mesure de la description de manière bien plus fiable que la lecture d'une page marketing.

Questions fréquentes

Est-ce que ChatGPT peut détecter les images générées par IA ?
Non, pas d'une manière mesurable. Il produit une évaluation à l'air sûr d'elle en se basant sur ce que l'image représente plutôt sur la façon dont les pixels ont été créés. Il n'y a aucun seuil calibré derrière la réponse, aucun point de référence, et poser la question deux fois peut aboutir à deux verdicts différents.
Mais il a vu juste sur une image que j'ai testée.
Il aura souvent raison, en particulier sur les cas évidents où vous auriez également eu raison. Le problème est qu'il s'exprime de la même manière lorsqu'il se trompe, de sorte qu'une bonne réponse ne vous donne aucun moyen de savoir à quel type de cas vous avez affaire sur l'image suivante.
Et si je lui demande d'analyser les pixels ?
Il ne le peut pas. L'image est convertie en une représentation sémantique avant que le modèle ne l'analyse, et la texture fine sur laquelle repose la détection est perdue lors de cette conversion. Demander une analyse des pixels produit une description de ce à quoi ressemblerait une analyse des pixels.
Existe-t-il des modèles multimodaux conçus pour la détection ?
Il existe des recherches dans ce domaine et cela ne correspond pas à ce que fait un assistant généraliste. Un détecteur spécialisé est entraîné sur des paires d'images réelles et générées avec un résultat calibré ; un modèle généraliste est entraîné pour être utile dans tous les domaines. Les deux ne sont pas interchangeables.
Dois-je utiliser un chatbot lors de la vérification d'une image ?
Oui, pour la description et le raisonnement. Demandez-lui ce que contient le cadre, si l'éclairage est cohérent et ce qui pourrait confirmer ou infirmer votre suspicion. Utilisez ensuite un détecteur pour la question des pixels, et gardez ces deux réponses bien séparées dans votre esprit.
Pourquoi tant de gens consultent-ils d'abord un chatbot ?
Parce qu'il est ouvert dans un autre onglet et qu'il répond toujours. La commodité l'emporte sur l'exactitude lorsque le coût d'une erreur est invisible, et en matière de vérification d'image, ce coût est généralement invisible jusqu'à ce que quelqu'un ait déjà agi en fonction de la réponse.