← Tutte le guide Fiducia e sicurezza

Moderare le immagini generate dall'IA su scala

Soglie di triage, flussi di lavoro in batch e perché un blocco automatico basato su un punteggio è la politica sbagliata. Una guida pratica per i team di trust and safety.

· 7 min di lettura · Best AI Image Detector

Usa un punteggio per ordinare una coda di revisione, mai per prendere provvedimenti su un account. Il rilevamento ha un tasso di errore che rende ingiusta l'applicazione automatica, e i costi dei ricorsi superano i risparmi del triage.

Perché l'applicazione automatica fallisce in questo caso

Con una precisione bilanciata del 91 percento in condizioni di laboratorio, circa una valutazione su undici è errata. Sui contenuti generati dagli utenti, che arrivano salvati come screenshot, ricompressi e ritagliati, il tasso reale è peggiore.

Applicato a centomila elementi al giorno, si tratta di migliaia di azioni errate. Ciascuna di esse genera un ricorso, e i ricorsi costano di più per caso rispetto alla revisione che l'automazione ha sostituito. La matematica non torna, ancor prima di considerare il costo reputazionale della rimozione di post autentici.

C'è un secondo problema specifico della moderazione. Le decisioni di applicazione delle regole vengono verificate. Un'autorità di regolamentazione o un tribunale che chiede perché un account sia stato rimosso non accetterà come motivazione l'output di un modello con una soglia non pubblicata.

Punteggio per smistare, non per agire

Il modo utile di inquadrare la questione è l'ordinamento della coda. Hai più elementi rispetto ai revisori. Un punteggio decide quali di essi una persona vede per prima, ed è un compito che può svolgere bene anche all'85 percento di precisione, perché sbagliare significa semplicemente che qualcuno guarda qualcosa inutilmente.

  1. 1 Sopra 90 Inizio della coda di revisione
  2. 2 Da 65 a 90 Revisionato entro la finestra temporale normale
  3. 3 Da 45 a 65 Solo se segnalato da un utente
  4. 4 Sotto 45 Nessuna azione, campionato per i controlli di qualità
Le fasce corrispondono a percorsi della coda anziché a esiti. Nulla in questo schema rimuove i contenuti autonomamente.

Campionare la fascia inferiore è più importante di quanto sembri. È l'unico modo per misurare il tasso di falsi negativi e, senza quel numero, non puoi dire se il sistema stia funzionando o abbia smesso silenziosamente di intercettare qualsiasi cosa.

Cosa deve dichiarare la tua policy

La maggior parte delle piattaforme ha ormai una regola sui media sintetici, e la maggior parte di esse è scritta male. Il difetto comune è vietare i contenuti IA in generale, il che è inapplicabile e intercetta cose che nessuno intendeva bloccare.

Regole applicabili rispetto a regole non applicabili
ApplicabileNon applicabileMotivo
Media sintetici non dichiarati di una persona realeTutte le immagini generate dall'IALa seconda vieta il lavoro di illustrazione e design
Immagini generate presentate come prove documentaliQualsiasi elemento che superi 65Una soglia non è una policy
Media sintetici usati per ingannare a fini di lucroImmagini che sembrano generate dall'IAGuardare non è uno standard
Mancata etichettatura su richiestaIA non dichiarata in qualsiasi formaIndimostrabile, e gli utenti non possono adeguarsi

Scrivi la regola incentrandola sul danno e sulla divulgazione piuttosto che sulla tecnica. Un'illustrazione generata in un post di finzione non danneggia nessuno. Una fotografia generata di un prodotto, una persona o un evento, presentata come reale, è ciò che vuoi effettivamente fermare.

I tre casi separati da una mappa delle regioni

I punteggi sull'intero fotogramma comprimono tre situazioni che richiedono trattamenti differenti. La visualizzazione a riquadri le distingue, e di solito questa distinzione decide l'esito.

  • Tutti i riquadri alti. Un'immagine interamente generata. Se viene presentata come la fotografia di qualcosa di reale, questo è il tuo caso più evidente.
  • Un riquadro alto. Una fotografia reale con qualcosa aggiunto o rimosso. Nel contesto di un marketplace o di notizie, questo è spesso più grave di una generazione completa, poiché è progettato per essere creduto.
  • Uniformemente calda, nessuno alto. Elaborazione pesante. Solitamente una foto autentica passata attraverso un filtro o un upscaler. Quasi mai meritevole di provvedimenti.
13 17 11 15 91 14 12 16 10

Una fotografia reale con un elemento inserito. L'ordinamento della coda basato un po' sul punteggio del titolo non lo farebbe mai emergere.

Il caso intermedio. Un punteggio sull'intero fotogramma pari a 33 avrebbe fatto passare questo elemento.

Misurare se funziona

  1. Traccia la precisione nella fascia superiore

    Tra gli elementi con punteggio superiore a 90 aperti da un moderatore, quanti hanno portato a un'azione? Se quel numero è basso, lo strumento sta creando lavoro anziché risparmiarlo.

  2. Campiona la fascia inferiore settimanalmente

    Estrai un centinaio di elementi casuali al di sotto di 45 ed esaminali. Questa è l'unica misurazione di ciò che ti sta sfuggendo, ed è quella che i team saltano.

  3. Osserva il tasso di ricorso

    Un aumento dei ricorsi accolti sulle decisioni relative a media sintetici significa che la soglia si è spostata o è arrivato un nuovo generatore che ottiene punteggi bassi.

  4. Ricalibra dopo ogni modifica del modello

    Gli aggiornamenti del rilevatore modificano i punteggi. Una soglia tarata sei mesi fa rispetto a una versione diversa del modello non è più la soglia che pensi che sia.

Gestire la coda creata dallo strumento

Aggiungere un rilevatore a un flusso di lavoro di moderazione non riduce l'organico, e i team che pianificano di farlo ne escono penalizzati. Ciò che cambia è l'ordine di arrivo del lavoro, il che aumenta il valore di ogni ora del revisore senza ridurre la quantità necessaria.

Metti in preventivo che la coda segnalata sia più lenta per singolo elemento rispetto alla coda generale. Un revisore che esamina un post segnalato sta prendendo una decisione più difficile su materiale più ambiguo, e avere fretta è il modo in cui si verificano interventi errati. Due minuti a elemento sono realistici; trenta secondi no.

Fornisci ai revisori la mappa delle regioni anziché il punteggio. Un moderatore che può vedere che un angolo di un'immagine è caldo prende una decisione migliore rispetto a uno a cui viene consegnato un numero, e può spiegare quella decisione in seguito a un team di ricorsi o a un'autorità di regolamentazione.

Fai ruotare il personale dalla revisione dei media sintetici. È un lavoro ripetitivo con un'alta percentuale di casi ambigui, e la precisione cala notevolmente nel corso di un turno lungo. Questa è la stessa lezione che ogni funzione di moderazione ha già imparato riguardo ad altre categorie.

Domande frequenti

Possiamo rimuovere automaticamente i contenuti sopra una soglia di punteggio?
Puoi farlo, e non dovresti. A un'accuratezza realistica, ciò significa migliaia di rimozioni errate su scala, ciascuna delle quali genera un ricorso e alcune delle quali rappresentano un problema normativo. Usa il punteggio per ordinare una coda umana. Il tempo risparmiato dai revisori grazie a un buon ordinamento è superiore al tempo che l'automazione ti farebbe risparmiare.
Quale soglia dovremmo impostare per la revisione?
Inizia instradando tutto ciò che si trova al di sopra della linea di decisione pubblicata e campionando al di sotto di essa, quindi effettua la calibrazione sui tuoi dati di precisione piuttosto che su una raccomandazione del fornitore. Il tuo mix di contenuti determina la soglia corretta, e una piattaforma piena di illustrazioni richiede una linea diversa rispetto a una piena di foto giornalistiche.
Come gestiamo i ricorsi?
Richiedi il file originale. La maggior parte dei ricorsi accolti proviene da utenti la cui foto autentica è stata ricompressa al momento del caricamento, e ricontrollare la fonte di solito risolve la questione in un solo passaggio. Registra l'esito, poiché i dati dei ricorsi sono il segnale più rapido del fatto che una soglia si sia spostata.
Agli utenti dovrebbe essere comunicato che un'immagine è stata segnalata da un rilevatore?
Informarli che è stato effettuato un controllo è corretto ed è sempre più previsto. Pubblicare la soglia esatta non lo è, perché fornisce un bersaglio per l'evasione a chiunque sia disposto a fare test contro di essa. Dichiara che i segnali automatizzati informano la revisione e che ogni decisione viene presa da una persona.
Questo funziona per i video?
Non con un rilevatore di immagini fisse. Il controllo fotogramma per fotogramma di un video produce un volume enorme e non coglie gli artefatti temporali, che sono il segnale più forte nei video manipolati. Tratta i video come un problema separato che richiede strumenti dedicati.
Che dire delle immagini che i nostri stessi utenti generano legittimamente?
Etichettale anziché rimuoverle. Un campo di divulgazione al momento del caricamento, supportato da un controllo che segnala i casi non dichiarati per la revisione, ti offre una regola applicabile. Gli utenti che seguono il requisito di etichettatura non dovrebbero mai subire provvedimenti, ed è questo che rende la policy difendibile.