← Wszystkie poradniki Zaufanie i bezpieczeństwo

Moderowanie obrazów generowanych przez AI na dużą skalę

Próg klasyfikacji, wsadowe przepływy pracy i dlaczego automatyczny zakaz na podstawie wyniku to błędna polityka. Praktyczny przewodnik dla zespołów ds. zaufania i bezpieczeństwa.

· 7 min czytania · Best AI Image Detector

Użyj wyniku do uporządkowania kolejki przeglądu, nigdy do podejmowania działań wobec konta. Wykrywanie ma wskaźnik błędów, który czyni automatyczne egzekwowanie niesprawiedliwym, a koszty odwołań przewyższają oszczędności z klasyfikacji.

Dlaczego automatyczne egzekwowanie zawodzi w tym przypadku

Przy 91-procentowej zrównoważonej dokładności w warunkach laboratoryjnych mniej więcej jedna ocena na jedenaście jest błędna. W przypadku treści generowanych przez użytkowników, które docierają jako zrzuty ekranu, po ponownej kompresji i przycięciu, rzeczywisty wskaźnik jest gorszy.

W odniesieniu do stu tysięcy elementów dziennie to tysiące błędnych działań. Każde z nich to odwołanie, a odwołania kosztują w przeliczeniu na sprawę więcej niż przegląd, który zastąpiła automatyzacja. Matematyka się nie zgadza, zanim jeszcze weźmie się pod uwagę koszt reputacji związany z usuwaniem autentycznych postów.

Istnieje drugi problem specyficzny dla moderacji. Decyzje o egzekwowaniu zasad podlegają audytom. Regulator lub sąd pytający, dlaczego konto zostało usunięte, nie zaakceptuje wyniku modelu z nieopublikowanym progiem jako uzasadnienia.

Wynik służy do sortowania, a nie do podejmowania działań

Użytecznymi ramami jest porządkowanie kolejki. Masz więcej elementów niż recenzentów. Wynik decyduje, które z nich człowiek zobaczy jako pierwsze, i jest to zadanie, z którym system radzi sobie dobrze nawet przy 85-procentowej dokładności, ponieważ pomyłka oznacza po prostu, że ktoś patrzy na coś niepotrzebnie.

  1. 1 Powyżej 90 Początek kolejki przeglądu
  2. 2 Od 65 do 90 Przegląd w normalnym okienku czasowym
  3. 3 Od 45 do 65 Tylko jeśli zgłoszone przez użytkownika
  4. 4 Poniżej 45 Brak działania, próbkowanie pod kątem kontroli jakości
Przedziały odpowiadają ścieżkom w kolejce, a nie wynikom końcowym. Żaden element na tym schemacie nie usuwa treści sam z siebie.

Próbkowanie dolnego przedziału ma większe znaczenie, niż się wydaje. To jedyny sposób na zmierzenie wskaźnika fałszywie ujemnych wyników, a bez tej liczby nie da się stwierdzić, czy system działa, czy też po cichu przestał cokolwiek wykrywać.

Co musi zawierać Twoja polityka

Większość platform ma obecnie zasady dotyczące mediów syntetycznych, a większość z nich jest napisana słabo. Powszechnym błędem jest ogólny zakaz treści AI, który jest niemożliwy do wyegzekwowania i łapie rzeczy, których nikt nie chciał łapać.

Zasady, które można egzekwować, w porównaniu do zasad, których nie można
Możliwe do wyegzekwowaniaNiemożliwe do wyegzekwowaniaDlaczego
Niejawne media syntetyczne przedstawiające prawdziwą osobęWszystkie obrazy generowane przez sztuczną inteligencjęDrugi zakazuje ilustracji i prac projektowych
Wygenerowane obrazy przedstawiane jako dowód w materiale dokumentalnymWszystko, co uzyskuje wynik powyżej 65Próg to nie polityka
Media syntetyczne używane do oszukiwania dla zyskuObrazy, które wyglądają jak wygenerowane przez AIPatrzenie to nie standard
Brak oznaczenia na żądanieNiejawna sztuczna inteligencja w jakiejkolwiek formieNiedowodliwe, a użytkownicy nie są w stanie się do tego zastosować

Sformułuj zasady wokół szkody i ujawnienia informacji, a nie wokół techniki. Wygenerowana ilustracja w poście z fikcją nikomu nie szkodzila. Wygenerowane zdjęcie produktu, osoby lub wydarzenia przedstawione jako prawdziwe to coś, co naprawdę chcesz zatrzymać.

Trzy przypadki, które rozróżnia mapa regionów

Wyniki dla całego kadru spłaszczają trzy sytuacje wymagające odmiennego podejścia. Widok kafelków pozwala je odróżnić, a to rozróżnienie zazwyczaj decyduje o wyniku.

  • Wszystkie kafelki wysokie. Obraz w całości wygenerowany. Jeśli jest prezentowany jako zdjęcie czegoś prawdziwego, to Twój najoczywistszy przypadek.
  • Jeden kafelek wysoki. Prawdziwa fotografia z czymś dodanym lub usuniętym. W kontekście rynkowym lub informacyjnym jest to często poważniejsze niż pełna generacja, ponieważ ma na celu uwiarygodnienie.
  • Równomiernie ciepłe, brak wysokich. Silne przetwarzanie. Zazwyczaj autentyczne zdjęcie poddane działaniu filtra lub skalera. Prawie nigdy nie warta podejmowania działań.
13 17 11 15 91 14 12 16 10

Prawdziwa fotografia z wstawionym elementem. Porządkowanie kolejki wyłącznie na podstawie głównego wyniku nigdy by tego nie ujawniło.

Środkowy przypadek. Wynik dla całego kadru wynoszący 33 pozwoliłby temu elementowi przejść pomyślnie.

Mierzenie skuteczności działania

  1. Śledź precyzję w górnym przedziale

    Spośród elementów z wynikiem powyżej 90, które moderator otworzył, wobec ilu podjęto działania? Jeśli ta liczba jest niska, narzędzie generuje pracę, zamiast ją oszczędzać.

  2. Co tydzień pobieraj próbkę z dolnego przedziału

    Wylosuj sto elementów z poniżej 45 i przejrzyj je. To jedyny pomiar tego, co przeoczono, i jest to rzecz, którą zespoły pomijają.

  3. Obserwuj wskaźnik odwołań

    Wzrost liczby udanych odwołań od decyzji dotyczących mediów syntetycznych oznacza, że próg uległ przesunięciu lub pojawił się nowy generator, który daje niskie wyniki.

  4. Uaktualniaj punkty odniesienia po każdej zmianie modelu

    Aktualizacje detektora zmieniają wyniki. Próg dostrojony sześć miesięcy temu do innej wersji modelu nie jest już progiem, którym myślisz, że jest.

Obsadzenie kadrowe kolejki tworzonej przez narzędzie

Dodanie detektora do potoku moderacji nie zmniejsza zatrudnienia, a zespoły, które planują, że tak się stanie, kończą w gorszej sytuacji. Zmienia to kolejność, w jakiej napływa praca, co zwiększa wartość każdej godziny pracy recenzenta bez zmniejszania liczby potrzebnych osób.

Zaplanuj budżet tak, aby oznaczona kolejka była wolniejsza w przeliczeniu na element niż kolejka ogólna. Recenzent patrzący na oznaczony post podejmuje trudniejszą decyzję w sprawie bardziej niejednoznacznego materiału, a pośpiech w tym przypadku prowadzi do błędnego egzekwowania zasad. Dwie minuty na element są realistyczne; trzydzieści sekund nie.

Daj recenzentom mapę regionów zamiast wyniku. Moderator, który widzi, że jeden róg obrazu jest podejrzany, podejmuje lepszą decyzję niż ten, któremu wręczono liczbę, i może później wyjaśnić tę decyzję zespołowi ds. odwołań lub organowi regulacyjnemu.

Rotuj pracowników zajmujących się przeglądem mediów syntetycznych. Jest to praca powtarzalna z dużym odsetkiem niejednoznacznych przypadków, a dokładność zauważalnie spada w trakcie długiej zmiany. To ta sama lekcja, którą każda funkcja moderacji przyswoiła już w odniesieniu do innych kategorii.

Często zadawane pytania

Czy możemy automatycznie usuwać treści powyżej progu punktowego?
Możesz, ale nie powinieneś. Przy realistycznej dokładności oznacza to tysiące błędnych usunięć na dużą skalę, z których każde stanowi odwołanie, a niektóre są problemem regulacyjnym. Użyj wyniku, aby uporządkować kolejkę dla człowieka. Czas recenzentów zaoszczędzony dzięki dobremu uporządkowaniu jest większy niż czas, jaki zaoszczędziłaby automatyzacja.
Jaki próg powinniśmy ustawić dla przeglądu?
Rozpocznij od przekierowania wszystkiego powyżej opublikowanej linii decyzyjnej i pobierania próbek poniżej niej, a następnie dostosuj na podstawie własnych wskaźników precyzji, a nie zaleceń dostawcy. Twój zestaw treści decyduje o właściwym progu, a platforma pełna ilustracji potrzebuje innej linii niż taka pełna zdjęć prasowych.
Jak obsługujemy odwołania?
Poproś o oryginalny plik. Większość udanych odwołań pochodzi od użytkowników, których prawdziwe zdjęcie zostało ponownie skompresowane podczas przesyłania, a ponowne sprawdzenie źródła zazwyczaj rozwiązuje problem w jednym kroku. Zarejestruj wynik, ponieważ dane dotyczące odwołań są najszybszym sygnałem, że próg uległ przesunięciu.
Czy użytkownicy powinni być informowani, że obraz został oznaczony przez detektor?
Informowanie ich o przeprowadzeniu sprawdzenia jest uczciwe i coraz bardziej oczekiwane. Publikowanie dokładnego progu już nie, ponieważ daje to cel do obejścia każdemu, kto chce go przetestować. Oświadcz, że sygnały zautomatyzowane stanowią podstawę przeglądu, a każdą decyzję podejmuje człowiek.
Czy to działa w przypadku wideo?
Nie za pomocą detektora pojedynczych obrazów. Sprawdzanie wideo klatka po klatce generuje ogromną objętość i pomija artefakty czasowe, które są najsilniejszym sygnałem w manipulowanym wideo. Traktuj wideo jako osobny problem wymagający osobnych narzędzi.
A co z obrazami, które nasi własni użytkownicy generują w sposób legalny?
Oznaczaj, a nie usuwaj. Pole ujawniania informacji podczas przesyłania, wspierane przez sprawdzanie, które flaguje niezgłoszone przypadki do przeglądu, zapewnia działające zasady. Użytkownicy, którzy przestrzegają wymogu oznaczania, nigdy nie powinni spotkać się z egzekucją zasad, co czyni tę politykę obronną.