← Tous les guides Confiance et sécurité

Modérer des images générées par l'IA à grande échelle

Seuils de triage, flux de travail par lots et raisons pour lesquelles un bannissement automatique basé sur un score est une mauvaise politique. Un guide pratique pour les équipes de confiance et de sécurité.

· 7 min de lecture · Best AI Image Detector

Utilisez un score pour ordonner une file d'attente de révision, jamais pour sanctionner un compte. La détection présente un taux d'erreur qui rend l'application automatique injuste, et les recours coûtent plus cher que ce que le triage permet d'économiser.

Pourquoi l'application automatique échoue ici

Avec une précision équilibrée de 91 pour cent dans des conditions de laboratoire, environ une décision sur onze est erronée. Sur le contenu généré par les utilisateurs, qui arrive sous forme de captures d'écran, recomprimé et recadré, le taux réel est pire.

Appliqué à cent mille éléments par jour, cela représente des milliers d'actions erronées. Chacune d'elles génère un recours, et les recours coûtent plus cher par cas que la révision remplacée par l'automatisation. Les mathématiques ne fonctionnent pas, avant même de considérer le coût en réputation lié à la suppression de publications authentiques.

Il y a un deuxième problème spécifique à la modération. Les décisions d'application des règles font l'objet d'audits. Un régulateur ou un tribunal demandant pourquoi un compte a été supprimé n'acceptera pas la sortie d'un modèle avec un seuil non publié comme justification.

Le score sert à trier, pas à agir

L'approche utile consiste à ordonner la file d'attente. Vous avez plus d'éléments que de réviseurs. Un score décide de ceux qu'une personne voit en premier, et c'est une tâche qu'il peut accomplir efficacement même avec 85 pour cent de précision, car se tromper signifie simplement que quelqu'un regarde quelque chose inutilement.

  1. 1 Au-dessus de 90 En tête de la file d'attente de révision
  2. 2 De 65 à 90 Examiné dans la fenêtre normale
  3. 3 De 45 à 65 Uniquement si signalé par un utilisateur
  4. 4 En dessous de 45 Aucune action, échantillonné pour les contrôles de qualité
Les tranches correspondent à des itinéraires de file d'attente plutôt qu'à des résultats. Rien dans ce diagramme ne supprime du contenu de manière autonome.

Échantillonner la tranche inférieure importe plus qu'il n'y paraît. C'est le seul moyen de mesurer votre taux de faux négatifs, et sans ce chiffre, vous ne pouvez pas savoir si le système fonctionne ou s'il a cessé discrètement de tout détecter.

Ce que votre politique doit stipuler

La plupart des plateformes disposent désormais d'une règle concernant les médias synthétiques, et la plupart sont mal rédigées. L'échec courant consiste à interdire globalement le contenu IA, ce qui est inapplicable et piège des éléments que personne ne souhaitait cibler.

Règles applicables par rapport aux règles qui ne le sont pas
ApplicableNon applicablePourquoi
Médias synthétiques non divulgués d'une personne réelleToutes les images générées par l'IALe second interdit le travail d'illustration et de conception
Images générées présentées comme des preuves documentairesTout ce qui obtient un score supérieur à 65Un seuil n'est pas une politique
Médias synthétiques utilisés pour tromper à des fins financièresImages qui ont l'air générées par l'IARegarder n'est pas une norme
Défaut d'étiquetage sur demandeIA non divulguée sous quelque forme que ce soitIndémontrable, et les utilisateurs ne peuvent pas s'y conformer

Rédigez la règle autour du préjudice et de la divulgation plutôt qu'autour de la technique. Une illustration générée sur une publication de fiction ne nuit à personne. Une photographie générée d'un produit, d'une personne ou d'un événement, présentée comme réelle, est ce que vous voulez réellement stopper.

Les trois cas que distingue une carte des régions

Les scores d'image entière regroupent trois situations qui nécessitent un traitement différent. L'affichage en mosaïque permet de les différencier, et cette distinction détermine généralement l'issue.

  • Toutes les vignettes sont élevées. Une image entièrement générée. Si elle est présentée comme la photographie de quelque chose de réel, c'est votre cas le plus évident.
  • Une seule vignette est élevée. Une véritable photographie avec un élément ajouté ou supprimé. Dans un contexte de place de marché ou d'actualités, c'est souvent plus grave qu'une génération complète, car c'est conçu pour être cru.
  • Uniformément tiède, aucune vignette élevée. Traitement lourd. Généralement une photo authentique passée par un filtre ou un outil de mise à l'échelle. Ne vaut presque jamais une action.
13 17 11 15 91 14 12 16 10

Une véritable photographie avec un élément inséré. Le tri de la file d'attente basé uniquement sur le score principal ne permettrait jamais de la surface.

Le cas intermédiaire. Un score global de 33 aurait blanchi cet élément.

Mesurer l'efficacité de l'outil

  1. Suivre la précision sur la tranche supérieure

    Parmi les éléments notés au-dessus de 90 qu'un modérateur a ouverts, combien ont fait l'objet d'une action ? Si ce chiffre est bas, l'outil génère du travail au lieu d'en épargner.

  2. Échantillonner la tranche inférieure chaque semaine

    Sélectionnez au hasard une centaine d'éléments sous la barre des 45 et examinez-les. C'est la seule mesure de ce qui vous échappe, et c'est celle que les équipes omettent.

  3. Surveiller le taux de recours

    Une augmentation des recours réussis concernant les décisions sur les médias synthétiques signifie que le seuil a dérivé ou qu'un nouveau générateur produisant des scores faibles est apparu.

  4. Mettre à jour la référence après chaque modification du modèle

    Les mises à jour du détecteur modifient les scores. Un seuil réglé il y a six mois par rapport à une version de modèle différente n'est plus le seuil que vous pensez qu'il est.

Doter en personnel la file d'attente créée par l'outil

L'ajout d'un détecteur à un processus de modération ne réduit pas les effectifs, et les équipes qui le prévoient s'en trouvent pénalisées. Ce qu'il modifie, c'est l'ordre d'arrivée du travail, ce qui augmente la valeur de chaque heure de révision sans réduire le nombre de personnes nécessaires.

Prévoyez dans votre budget que la file d'attente signalée sera plus lente par élément que la file d'attente générale. Un réviseur qui examine une publication signalée prend une décision plus difficile sur du matériel plus ambigu, et se précipiter mène à de mauvaises applications des règles. Deux minutes par élément est réaliste ; trente secondes ne l'est pas.

Fournissez aux réviseurs la carte des régions plutôt que le score. Un modérateur qui peut voir qu'un coin d'une image est suspect prend une meilleure décision que celui à qui l'on confie un chiffre, et il peut expliquer cette décision par la suite à une équipe de recours ou à un régulateur.

Faites tourner le personnel affecté à la révision des médias synthétiques. C'est un travail répétitif comportant une forte proportion de cas ambigus, et la précision chute de manière mesurable au cours d'un long shift. C'est la même leçon que chaque service de modération a déjà apprise pour d'autres catégories.

Questions fréquentes

Pouvons-nous supprimer automatiquement du contenu au-dessus d'un certain seuil de score ?
Vous le pouvez, et vous ne devriez pas. À un niveau de précision réaliste, cela signifie des milliers de suppressions erronées à grande échelle, chacune constituant un recours et certaines posant un problème réglementaire. Utilisez le score pour ordonner une file d'attente humaine. Le temps de révision économisé par un bon tri est supérieur à celui que l'automatisation vous épargnerait.
Quel seuil devrions-nous définir pour la révision ?
Commencez par acheminer tout ce qui se trouve au-dessus de la ligne de décision publiée et par échantillonner en dessous, puis ajustez en fonction de vos propres chiffres de précision plutôt que sur une recommandation de fournisseur. Votre mix de contenus détermine le bon seuil, et une plateforme pleine d'illustrations nécessite une ligne différente de celle d'une plateforme remplie de photos d'actualités.
Comment gérons-nous les recours ?
Demandez le fichier d'origine. La plupart des recours aboutissent grâce à des utilisateurs dont la vraie photo a été recomprimée lors de la mise en ligne, et la revérification de la source résout généralement le problème en une seule étape. Enregistrez le résultat, car les données de recours constituent le signal le plus rapide indiquant qu'un seuil a dérivé.
Faut-il indiquer aux utilisateurs qu'une image a été signalée par un détecteur ?
Leur faire savoir qu'une vérification a eu lieu est équitable et de plus en plus attendu. Publier le seuil exact ne l'est pas, car cela fournit une cible d'évasion à quiconque souhaite tester l'outil. Indiquez que des signaux automatisés guident la révision et qu'une personne prend chaque décision.
Est-ce que cela fonctionne pour la vidéo ?
Pas avec un détecteur d'images fixes. La vérification image par image d'une vidéo génère un volume énorme et passe à côté des artefacts temporels, qui constituent le signal le plus fort dans une vidéo manipulée. Traitez la vidéo comme un problème distinct nécessitant des outils distincts.
Qu'en est-il des images que nos propres utilisateurs génèrent légitimement ?
Préférez l'étiquetage à la suppression. Un champ de divulgation lors du téléchargement, soutenu par une vérification qui signale les cas non divulgués pour révision, vous offre une règle viable. Les utilisateurs qui respectent l'obligation d'étiquetage ne doivent jamais faire l'objet de sanctions, ce qui rend la politique défendable.