Pourquoi l'application automatique échoue ici
Avec une précision équilibrée de 91 pour cent dans des conditions de laboratoire, environ une décision sur onze est erronée. Sur le contenu généré par les utilisateurs, qui arrive sous forme de captures d'écran, recomprimé et recadré, le taux réel est pire.
Appliqué à cent mille éléments par jour, cela représente des milliers d'actions erronées. Chacune d'elles génère un recours, et les recours coûtent plus cher par cas que la révision remplacée par l'automatisation. Les mathématiques ne fonctionnent pas, avant même de considérer le coût en réputation lié à la suppression de publications authentiques.
Il y a un deuxième problème spécifique à la modération. Les décisions d'application des règles font l'objet d'audits. Un régulateur ou un tribunal demandant pourquoi un compte a été supprimé n'acceptera pas la sortie d'un modèle avec un seuil non publié comme justification.
Le score sert à trier, pas à agir
L'approche utile consiste à ordonner la file d'attente. Vous avez plus d'éléments que de réviseurs. Un score décide de ceux qu'une personne voit en premier, et c'est une tâche qu'il peut accomplir efficacement même avec 85 pour cent de précision, car se tromper signifie simplement que quelqu'un regarde quelque chose inutilement.
- 1 Au-dessus de 90 En tête de la file d'attente de révision
- 2 De 65 à 90 Examiné dans la fenêtre normale
- 3 De 45 à 65 Uniquement si signalé par un utilisateur
- 4 En dessous de 45 Aucune action, échantillonné pour les contrôles de qualité
Échantillonner la tranche inférieure importe plus qu'il n'y paraît. C'est le seul moyen de mesurer votre taux de faux négatifs, et sans ce chiffre, vous ne pouvez pas savoir si le système fonctionne ou s'il a cessé discrètement de tout détecter.
Ce que votre politique doit stipuler
La plupart des plateformes disposent désormais d'une règle concernant les médias synthétiques, et la plupart sont mal rédigées. L'échec courant consiste à interdire globalement le contenu IA, ce qui est inapplicable et piège des éléments que personne ne souhaitait cibler.
| Applicable | Non applicable | Pourquoi |
|---|---|---|
| Médias synthétiques non divulgués d'une personne réelle | Toutes les images générées par l'IA | Le second interdit le travail d'illustration et de conception |
| Images générées présentées comme des preuves documentaires | Tout ce qui obtient un score supérieur à 65 | Un seuil n'est pas une politique |
| Médias synthétiques utilisés pour tromper à des fins financières | Images qui ont l'air générées par l'IA | Regarder n'est pas une norme |
| Défaut d'étiquetage sur demande | IA non divulguée sous quelque forme que ce soit | Indémontrable, et les utilisateurs ne peuvent pas s'y conformer |
Rédigez la règle autour du préjudice et de la divulgation plutôt qu'autour de la technique. Une illustration générée sur une publication de fiction ne nuit à personne. Une photographie générée d'un produit, d'une personne ou d'un événement, présentée comme réelle, est ce que vous voulez réellement stopper.
Les trois cas que distingue une carte des régions
Les scores d'image entière regroupent trois situations qui nécessitent un traitement différent. L'affichage en mosaïque permet de les différencier, et cette distinction détermine généralement l'issue.
- Toutes les vignettes sont élevées. Une image entièrement générée. Si elle est présentée comme la photographie de quelque chose de réel, c'est votre cas le plus évident.
- Une seule vignette est élevée. Une véritable photographie avec un élément ajouté ou supprimé. Dans un contexte de place de marché ou d'actualités, c'est souvent plus grave qu'une génération complète, car c'est conçu pour être cru.
- Uniformément tiède, aucune vignette élevée. Traitement lourd. Généralement une photo authentique passée par un filtre ou un outil de mise à l'échelle. Ne vaut presque jamais une action.
Une véritable photographie avec un élément inséré. Le tri de la file d'attente basé uniquement sur le score principal ne permettrait jamais de la surface.
Mesurer l'efficacité de l'outil
-
Suivre la précision sur la tranche supérieure
Parmi les éléments notés au-dessus de 90 qu'un modérateur a ouverts, combien ont fait l'objet d'une action ? Si ce chiffre est bas, l'outil génère du travail au lieu d'en épargner.
-
Échantillonner la tranche inférieure chaque semaine
Sélectionnez au hasard une centaine d'éléments sous la barre des 45 et examinez-les. C'est la seule mesure de ce qui vous échappe, et c'est celle que les équipes omettent.
-
Surveiller le taux de recours
Une augmentation des recours réussis concernant les décisions sur les médias synthétiques signifie que le seuil a dérivé ou qu'un nouveau générateur produisant des scores faibles est apparu.
-
Mettre à jour la référence après chaque modification du modèle
Les mises à jour du détecteur modifient les scores. Un seuil réglé il y a six mois par rapport à une version de modèle différente n'est plus le seuil que vous pensez qu'il est.
Doter en personnel la file d'attente créée par l'outil
L'ajout d'un détecteur à un processus de modération ne réduit pas les effectifs, et les équipes qui le prévoient s'en trouvent pénalisées. Ce qu'il modifie, c'est l'ordre d'arrivée du travail, ce qui augmente la valeur de chaque heure de révision sans réduire le nombre de personnes nécessaires.
Prévoyez dans votre budget que la file d'attente signalée sera plus lente par élément que la file d'attente générale. Un réviseur qui examine une publication signalée prend une décision plus difficile sur du matériel plus ambigu, et se précipiter mène à de mauvaises applications des règles. Deux minutes par élément est réaliste ; trente secondes ne l'est pas.
Fournissez aux réviseurs la carte des régions plutôt que le score. Un modérateur qui peut voir qu'un coin d'une image est suspect prend une meilleure décision que celui à qui l'on confie un chiffre, et il peut expliquer cette décision par la suite à une équipe de recours ou à un régulateur.
Faites tourner le personnel affecté à la révision des médias synthétiques. C'est un travail répétitif comportant une forte proportion de cas ambigus, et la précision chute de manière mesurable au cours d'un long shift. C'est la même leçon que chaque service de modération a déjà apprise pour d'autres catégories.