Perché l'applicazione automatica fallisce in questo caso
Con una precisione bilanciata del 91 percento in condizioni di laboratorio, circa una valutazione su undici è errata. Sui contenuti generati dagli utenti, che arrivano salvati come screenshot, ricompressi e ritagliati, il tasso reale è peggiore.
Applicato a centomila elementi al giorno, si tratta di migliaia di azioni errate. Ciascuna di esse genera un ricorso, e i ricorsi costano di più per caso rispetto alla revisione che l'automazione ha sostituito. La matematica non torna, ancor prima di considerare il costo reputazionale della rimozione di post autentici.
C'è un secondo problema specifico della moderazione. Le decisioni di applicazione delle regole vengono verificate. Un'autorità di regolamentazione o un tribunale che chiede perché un account sia stato rimosso non accetterà come motivazione l'output di un modello con una soglia non pubblicata.
Punteggio per smistare, non per agire
Il modo utile di inquadrare la questione è l'ordinamento della coda. Hai più elementi rispetto ai revisori. Un punteggio decide quali di essi una persona vede per prima, ed è un compito che può svolgere bene anche all'85 percento di precisione, perché sbagliare significa semplicemente che qualcuno guarda qualcosa inutilmente.
- 1 Sopra 90 Inizio della coda di revisione
- 2 Da 65 a 90 Revisionato entro la finestra temporale normale
- 3 Da 45 a 65 Solo se segnalato da un utente
- 4 Sotto 45 Nessuna azione, campionato per i controlli di qualità
Campionare la fascia inferiore è più importante di quanto sembri. È l'unico modo per misurare il tasso di falsi negativi e, senza quel numero, non puoi dire se il sistema stia funzionando o abbia smesso silenziosamente di intercettare qualsiasi cosa.
Cosa deve dichiarare la tua policy
La maggior parte delle piattaforme ha ormai una regola sui media sintetici, e la maggior parte di esse è scritta male. Il difetto comune è vietare i contenuti IA in generale, il che è inapplicabile e intercetta cose che nessuno intendeva bloccare.
| Applicabile | Non applicabile | Motivo |
|---|---|---|
| Media sintetici non dichiarati di una persona reale | Tutte le immagini generate dall'IA | La seconda vieta il lavoro di illustrazione e design |
| Immagini generate presentate come prove documentali | Qualsiasi elemento che superi 65 | Una soglia non è una policy |
| Media sintetici usati per ingannare a fini di lucro | Immagini che sembrano generate dall'IA | Guardare non è uno standard |
| Mancata etichettatura su richiesta | IA non dichiarata in qualsiasi forma | Indimostrabile, e gli utenti non possono adeguarsi |
Scrivi la regola incentrandola sul danno e sulla divulgazione piuttosto che sulla tecnica. Un'illustrazione generata in un post di finzione non danneggia nessuno. Una fotografia generata di un prodotto, una persona o un evento, presentata come reale, è ciò che vuoi effettivamente fermare.
I tre casi separati da una mappa delle regioni
I punteggi sull'intero fotogramma comprimono tre situazioni che richiedono trattamenti differenti. La visualizzazione a riquadri le distingue, e di solito questa distinzione decide l'esito.
- Tutti i riquadri alti. Un'immagine interamente generata. Se viene presentata come la fotografia di qualcosa di reale, questo è il tuo caso più evidente.
- Un riquadro alto. Una fotografia reale con qualcosa aggiunto o rimosso. Nel contesto di un marketplace o di notizie, questo è spesso più grave di una generazione completa, poiché è progettato per essere creduto.
- Uniformemente calda, nessuno alto. Elaborazione pesante. Solitamente una foto autentica passata attraverso un filtro o un upscaler. Quasi mai meritevole di provvedimenti.
Una fotografia reale con un elemento inserito. L'ordinamento della coda basato un po' sul punteggio del titolo non lo farebbe mai emergere.
Misurare se funziona
-
Traccia la precisione nella fascia superiore
Tra gli elementi con punteggio superiore a 90 aperti da un moderatore, quanti hanno portato a un'azione? Se quel numero è basso, lo strumento sta creando lavoro anziché risparmiarlo.
-
Campiona la fascia inferiore settimanalmente
Estrai un centinaio di elementi casuali al di sotto di 45 ed esaminali. Questa è l'unica misurazione di ciò che ti sta sfuggendo, ed è quella che i team saltano.
-
Osserva il tasso di ricorso
Un aumento dei ricorsi accolti sulle decisioni relative a media sintetici significa che la soglia si è spostata o è arrivato un nuovo generatore che ottiene punteggi bassi.
-
Ricalibra dopo ogni modifica del modello
Gli aggiornamenti del rilevatore modificano i punteggi. Una soglia tarata sei mesi fa rispetto a una versione diversa del modello non è più la soglia che pensi che sia.
Gestire la coda creata dallo strumento
Aggiungere un rilevatore a un flusso di lavoro di moderazione non riduce l'organico, e i team che pianificano di farlo ne escono penalizzati. Ciò che cambia è l'ordine di arrivo del lavoro, il che aumenta il valore di ogni ora del revisore senza ridurre la quantità necessaria.
Metti in preventivo che la coda segnalata sia più lenta per singolo elemento rispetto alla coda generale. Un revisore che esamina un post segnalato sta prendendo una decisione più difficile su materiale più ambiguo, e avere fretta è il modo in cui si verificano interventi errati. Due minuti a elemento sono realistici; trenta secondi no.
Fornisci ai revisori la mappa delle regioni anziché il punteggio. Un moderatore che può vedere che un angolo di un'immagine è caldo prende una decisione migliore rispetto a uno a cui viene consegnato un numero, e può spiegare quella decisione in seguito a un team di ricorsi o a un'autorità di regolamentazione.
Fai ruotare il personale dalla revisione dei media sintetici. È un lavoro ripetitivo con un'alta percentuale di casi ambigui, e la precisione cala notevolmente nel corso di un turno lungo. Questa è la stessa lezione che ogni funzione di moderazione ha già imparato riguardo ad altre categorie.