Ce qu'un chatbot fait réellement
Un modèle de langage multimodal convertit une image en description sémantique, puis raisonne à partir de cette description sous forme de texte. Il répond à la question : est-ce que cette image ressemble aux images d'IA dont j'ai lu la description pendant mon entraînement ?
C'est une question de contenu et de composition. La détection est une question de texture : comment les valeurs des pixels voisins interagissent entre elles, à une échelle bien inférieure à tout ce qu'une description sémantique préserve.
Les informations lues par un détecteur sont éliminées avant même qu'un modèle de langage ne commence à analyser. Ce n'est pas que les chatbots soient mauvais dans ce domaine. Ils travaillent à partir d'une représentation qui ne contient pas les preuves.
Ce que cela produit en pratique
- Des réponses affirmatives sans seuil. Un chatbot affirmera qu'une image est probablement générée par IA sans qu'aucun barème ne vienne nuancer le mot "probablement". Il n'y a pas de chiffre, pas de fourchette et aucun élément de comparaison avec une autre image.
- Un raisonnement basé sur des indices obsolètes. Les modèles citent les doigts, les dents, la peau cireuse et le texte déformé, car c'est ce que les textes d'entraînement leur disent de chercher. Ces problèmes ont été résolus il y a des années.
- Une confirmation de vos attentes. Si vous demandez si une image est fausse, vous aurez plus de chances d'entendre un oui que si vous aviez posé la question de manière neutre. C'est une propriété de l'interface, pas de l'image.
- Aucune reproductibilité. Posez la question deux fois et vous obtiendrez deux réponses différentes pour le même fichier, avec des explications tout aussi assurées dans les deux cas.
- Aucune information sur les régions. Il ne peut pas vous indiquer si un coin d'une photographie se comporte différemment du reste, ce qui est pourtant l'indice qui compte généralement.
| Capacité | Chatbot | Détecteur de pixels |
|---|---|---|
| Analyse la texture au niveau des pixels | No | Yes |
| Score étalonné avec des fourchettes publiées | No | Yes |
| Même réponse à chaque fois | No | Yes |
| Ventilation par région | No | Yes |
| Mesuré par rapport à un étalon de référence | No | Yes |
| Explique son raisonnement en prose | Yes avec fluidité | Partly en tant que signaux |
| Décrit ce qu'il y a sur l'image | Yes | No |
Les deux dernières lignes sont les seules qui valent la peine d'être conservées. Un modèle de langage est réellement doué pour décrire une image et pour déterminer si une scène a du sens. Ce sont des fonctionnalités utiles, mais il ne s'agit pas de détection.
Là où un chatbot est réellement utile
Écarter complètement l'outil serait une erreur. Utilisé pour ce qu'il sait faire, il complète un détecteur plutôt de ne le remplacer.
-
Demander de décrire la scène en détail
Une description minutieuse met souvent en évidence des éléments que vous n'aviez pas remarqués consciemment, y compris des objets qui ne vont pas ensemble ou de la signalétique que vous n'aviez pas lue.
-
Demander si la scène est physiquement cohérente
Les ombres, les reflets, l'échelle et la perspective relèvent de problèmes de raisonnement, et le raisonnement est précisément la fonction du modèle. Cela permet d'identifier des montages que l'analyse des pixels peut rater.
-
Demander ce qui pourrait confirmer ou infirmer
Transformer un soupçon en une liste de vérifications est un bon usage d'un modèle de langage, et cette liste est souvent meilleure que celle que vous auriez rédigée.
-
Puis exécuter un véritable détecteur
Pour la question des pixels, utilisez un outil conçu spécifiquement pour cela et lisez le score par rapport à une échelle publiée.
Pourquoi la fluidité est le danger
Un détecteur incertain renvoie un score moyen, et ce chiffre traduit l'incertitude. Un modèle de langage incertain renvoie un paragraphe, et les paragraphes ne comportent pas de barres d'erreur.
La même explication bien structurée apparaît que le modèle ait identifié quelque chose de réel ou qu'il ait produit un compte rendu plausible de néant. Les lecteurs évaluent leur confiance en fonction de la qualité de la rédaction, qui est précisément le signal qui ne contient ici aucune information.
C'est pourquoi interroger un chatbot constitue un point de départ pire que d'examiner l'image vous-même. Votre propre incertitude vous est au moins visible.
Le même problème dans d'autres outils
Il ne s'agit pas vraiment d'un produit en particulier. Tout système qui analyse une image sur un plan sémantique présente la même lacune, et plusieurs outils présentés aujourd'hui comme des détecteurs font exactement cela en arrière-plan.
Un test utile : demandez ce que l'outil rapporterait sur la photographie d'une photographie, ou sur une image dépourvue de tout sujet reconnaissable. Un détecteur de pixels renvoie un score dans les deux cas, car la texture existe indépendamment du contenu. Un système sémantique n'a rien à analyser et va soit refuser, soit inventer quelque chose.
Un second test : exécutez le même fichier deux fois. Un modèle basé sur les pixels est déterministe et renvoie le même score. Un modèle de langage procède par échantillonnage, et deux exécutions peuvent diverger. Si un outil vous donne des réponses différentes pour les mêmes octets, il ne mesure rien.
Aucun de ces tests ne nécessite de comprendre le fonctionnement de l'outil. Ils prennent tous deux une minute, et ils permettent de distinguer la mesure de la description de manière bien plus fiable que la lecture d'une page marketing.