← Alla guider Förtroende och säkerhet

Moderering av AI-genererade bilder i stor skala

Tröskelvärden för prioritering, batchflöden och varför automatiska avstängningar baserade på poäng är fel strategi. En praktisk guide för Trust and Safety-team.

· 7 min läsning · Best AI Image Detector

Använd poängen för att prioritera granskningskön, aldrig för att vidta åtgärder mot ett konto. Detektering har en felmarginal som gör automatiserade sanktioner orättvisa, och överklagandena kostar mer än vad prioriteringen sparar in.

Varför automatiserade åtgärder inte fungerar här

Med 91 procents balanserad träffsäkerhet under laboratorieförhållanden är ungefär vart elfte beslut felaktigt. För användargenererat innehåll, som ofta är skärmdumpat, omkomprimerat och beskuret, är den verkliga felmarginalen ännu sämre.

Tillämpat på hundratusen objekt om dagen innebär det tusentals felaktiga åtgärder. Varje sådan leder till en överklagan, och överklaganden kostar mer per ärende än den granskning som automatiseringen ersatte. Kalkylen går inte ihop, redan innan man väger in förtroendeförlusten av att ta bort äkta inlägg.

Det finns ett andra problem som är specifikt för moderering. Åtgärdsbeslut granskas i efterhand. En tillsynsmyndighet eller en domstol som frågar varför ett konto togs bort kommer inte att acceptera en modellbedömning med ett opublicerat tröskelvärde som motivering.

Sätt poäng för att sortera, inte för att agera

Det mest användbara perspektivet är köprioritering. Ni har fler ärenden än granskare. En poäng avgör vilka ärenden en människa ser först, och det är en uppgift verktyget klarar väl även vid 85 procents träffsäkerhet, eftersom ett misstag bara innebär att någon tittar på ett ärende i onödan.

  1. 1 Över 90 Högst upp i granskningskön
  2. 2 65 till 90 Granskas inom normal tidsram
  3. 3 45 till 65 Endast vid användaranmälan
  4. 4 Under 45 Ingen åtgärd, stickprov för kvalitetskontroll
Nivåerna styr granskningsflödet snarare än slutresultatet. Ingenting i detta diagram tar bort innehåll på egen hand.

Att ta stickprov i den lägsta nivån är viktigare än det verkar. Det är det enda sättet att mäta andelen falska negativ, och utan den siffran kan ni inte avgöra om systemet fungerar eller om det i det tysta har slutat fånga upp fall.

Vad era riktlinjer behöver innehålla

De flesta plattformar har numera en regel för syntetiska medier, och de flesta är dåligt formulerade. Det vanligaste misstaget är att förbjuda AI-innehåll generellt, vilket är omöjligt att upprätthålla och träffar sådant som ingen hade för avsikt att stoppa.

Regler som går att upprätthålla kontra regler som inte gör det
Möjliga att upprätthållaInte möjliga att upprätthållaVarför
Icke-deklarerade syntetiska medier föreställande en verklig personAlla AI-genererade bilderDet senare förbjuder illustrationer och designarbete
Genererade bilder som presenteras som dokumentära bevisAllt som får över 65 poängEtt tröskelvärde är inte en policy
Syntetiska medier som används för ekonomiskt bedrägeriBilder som ser AI-genererade utSubjektiva bedömningar är ingen standard
Underlåtenhet att märka upp innehåll på begäranIcke-deklarerad AI i alla formerGår inte att bevisa, och användare kan inte följa det

Formulera regeln kring skada och transparens snarare än kring teknik. En genererad illustration i ett fiktivt inlägg skadar ingen. Ett genererat fotografi av en produkt, en person eller en händelse som presenteras som äkta är det ni faktiskt vill stoppa.

De tre fall som områdeskartan särskiljer

En samlad poäng för hela bilden slår ihop tre situationer som kräver olika hantering. Kartvyn särskiljer dem, och skillnaden avgör oftast utfallet.

  • Högt utslag på alla rutor. En helt genererad bild. Om den presenteras som ett fotografi av något verkligt är detta ert tydligaste fall.
  • Högt utslag på en ruta. Ett äkta fotografi där något har lagts till eller tagits bort. På en marknadsplats eller i ett nyhetssammanhang är detta ofta allvarligare än en helgenererad bild, eftersom den är utformad för att framstå som trovärdig.
  • Jämnt förhöjt, inget högt utslag. Kraftig efterbehandling. Oftast ett äkta foto som passerat genom ett filter eller en uppskalare. Nästan aldrig värt att vidta åtgärder mot.
13 17 11 15 91 14 12 16 10

Ett äkta fotografi med ett infogat element. En kösortering baserad enbart på totalpoängen hade aldrig fångat upp det.

Mellanfallet. En totalpoäng på 33 för hela bilden hade godkänt detta objekt.

Att mäta om det fungerar

  1. Följ precisionen i den högsta nivån

    Av de objekt med över 90 poäng som en moderator öppnade, hur många ledde till en åtgärd? Om den siffran är låg skapar verktyget merarbete i stället för att spara tid.

  2. Ta veckovisa stickprov i den lägsta nivån

    Välj ut hundra slumpmässiga objekt med under 45 poäng och granska dem. Det är den enda mätningen av vad ni missar, och det är den kontroll som team oftast hoppar över.

  3. Håll koll på andelen överklaganden

    En ökning av bifallna överklaganden gällande syntetiska medier innebär att tröskelvärdet har förskjutits eller att en ny generator har lanserats som ger låga poäng.

  4. Kalibrera om efter varje modelländring

    Uppdateringar av detektorn förändrar poängen. Ett tröskelvärde som justerades för sex månader sedan mot en annan modellversion är inte längre det tröskelvärde du tror att det är.

Resursfördela för kön som verktyget skapar

Att införa ett detekteringsverktyg i ett modereringsflöde minskar inte personalbehovet, och team som planerar för det får ofta problem. Vad det förändrar är ordningen som ärendena anländer i, vilket ökar värdet på varje granskningstimme utan att minska antalet timmar som krävs.

Räkna med att den flaggade kön tar längre tid per ärende än den allmänna kön. En granskare som tittar på ett flaggat inlägg gör en svårare bedömning av mer svårtolkat material, och att stressa igenom det är så felaktiga åtgärder uppstår. Två minuter per ärende är realistiskt; trettio sekunder är det inte.

Ge granskarna områdeskartan i stället för bara poängen. En moderator som ser att ett hörn av en bild ger utslag fattar ett bättre beslut än en som bara får en siffra, och kan motivera beslutet i efterhand för ett överklagandeteam eller en tillsynsmyndighet.

Rotera bort personal från granskning av syntetiska medier. Det är ett repetitivt arbete med en hög andel gränsfall, och träffsäkerheten sjunker märkbart under ett långt skift. Detta är samma lärdom som modereringsverksamheter redan dragit inom andra områden.

Frågor som ställs

Kan vi ta bort innehåll automatiskt över ett visst tröskelvärde?
Det är möjligt, men ni bör undvika det. Vid realistisk träffsäkerhet leder det till tusentals felaktiga borttagningar i stor skala, där varje fall innebär en överklagan och i vissa fall juridiska problem. Använd poängen för att sortera en manuell kö. Tiden granskarna sparar på en välordnad kö är större än den tid automatiseringen skulle spara.
Vilket tröskelvärde bör vi sätta för manuell granskning?
Börja med att dirigera allt över det publicerade tröskelvärdet och ta stickprov under det. Justera sedan utifrån era egna precisionssiffror snarare än leverantörens rekommendation. Er innehållsmix avgör rätt tröskelvärde; en plattform full av illustrationer kräver en annan gräns än en som domineras av nyhetsfoton.
Hur hanterar vi överklaganden?
Be om originalfilen. De flesta godkända överklaganden kommer från användare vars äkta foton har komprimerats om vid uppladdning, och en ny kontroll av källfilen löser oftast ärendet direkt. Logga resultatet, eftersom data från överklaganden är den snabbaste indikationen på att ett tröskelvärde har förskjutits.
Bör användare informeras om att en bild har flaggats av en detektor?
Att informera om att en kontroll har gjorts är rimligt och förväntas i allt högre grad. Att publicera det exakta tröskelvärdet är det inte, eftersom det ger en måltavla för alla som vill testa gränserna. Tydliggör att automatiserade signaler vägleder granskningen och att en människa fattar varje beslut.
Fungerar detta för video?
Inte med en detektor för stillbilder. Bild-för-bild-analys av video genererar enorma datavolymer och missar temporala avvikelser, vilka utgör den starkaste signalen i manipulerad video. Hantera video som ett separat problem som kräver egna verktyg.
Hur hanterar vi bilder som våra egna användare genererar legitimt?
Märk upp i stället för att ta bort. Ett fält för deklaration vid uppladdning, i kombination med en kontroll som flaggar odeklarerade fall för granskning, ger en fungerande regel. Användare som följer märkningskravet ska aldrig drabbas av åtgärder, vilket gör policyn försvarbar.