Dlaczego automatyczne egzekwowanie zawodzi w tym przypadku
Przy 91-procentowej zrównoważonej dokładności w warunkach laboratoryjnych mniej więcej jedna ocena na jedenaście jest błędna. W przypadku treści generowanych przez użytkowników, które docierają jako zrzuty ekranu, po ponownej kompresji i przycięciu, rzeczywisty wskaźnik jest gorszy.
W odniesieniu do stu tysięcy elementów dziennie to tysiące błędnych działań. Każde z nich to odwołanie, a odwołania kosztują w przeliczeniu na sprawę więcej niż przegląd, który zastąpiła automatyzacja. Matematyka się nie zgadza, zanim jeszcze weźmie się pod uwagę koszt reputacji związany z usuwaniem autentycznych postów.
Istnieje drugi problem specyficzny dla moderacji. Decyzje o egzekwowaniu zasad podlegają audytom. Regulator lub sąd pytający, dlaczego konto zostało usunięte, nie zaakceptuje wyniku modelu z nieopublikowanym progiem jako uzasadnienia.
Wynik służy do sortowania, a nie do podejmowania działań
Użytecznymi ramami jest porządkowanie kolejki. Masz więcej elementów niż recenzentów. Wynik decyduje, które z nich człowiek zobaczy jako pierwsze, i jest to zadanie, z którym system radzi sobie dobrze nawet przy 85-procentowej dokładności, ponieważ pomyłka oznacza po prostu, że ktoś patrzy na coś niepotrzebnie.
- 1 Powyżej 90 Początek kolejki przeglądu
- 2 Od 65 do 90 Przegląd w normalnym okienku czasowym
- 3 Od 45 do 65 Tylko jeśli zgłoszone przez użytkownika
- 4 Poniżej 45 Brak działania, próbkowanie pod kątem kontroli jakości
Próbkowanie dolnego przedziału ma większe znaczenie, niż się wydaje. To jedyny sposób na zmierzenie wskaźnika fałszywie ujemnych wyników, a bez tej liczby nie da się stwierdzić, czy system działa, czy też po cichu przestał cokolwiek wykrywać.
Co musi zawierać Twoja polityka
Większość platform ma obecnie zasady dotyczące mediów syntetycznych, a większość z nich jest napisana słabo. Powszechnym błędem jest ogólny zakaz treści AI, który jest niemożliwy do wyegzekwowania i łapie rzeczy, których nikt nie chciał łapać.
| Możliwe do wyegzekwowania | Niemożliwe do wyegzekwowania | Dlaczego |
|---|---|---|
| Niejawne media syntetyczne przedstawiające prawdziwą osobę | Wszystkie obrazy generowane przez sztuczną inteligencję | Drugi zakazuje ilustracji i prac projektowych |
| Wygenerowane obrazy przedstawiane jako dowód w materiale dokumentalnym | Wszystko, co uzyskuje wynik powyżej 65 | Próg to nie polityka |
| Media syntetyczne używane do oszukiwania dla zysku | Obrazy, które wyglądają jak wygenerowane przez AI | Patrzenie to nie standard |
| Brak oznaczenia na żądanie | Niejawna sztuczna inteligencja w jakiejkolwiek formie | Niedowodliwe, a użytkownicy nie są w stanie się do tego zastosować |
Sformułuj zasady wokół szkody i ujawnienia informacji, a nie wokół techniki. Wygenerowana ilustracja w poście z fikcją nikomu nie szkodzila. Wygenerowane zdjęcie produktu, osoby lub wydarzenia przedstawione jako prawdziwe to coś, co naprawdę chcesz zatrzymać.
Trzy przypadki, które rozróżnia mapa regionów
Wyniki dla całego kadru spłaszczają trzy sytuacje wymagające odmiennego podejścia. Widok kafelków pozwala je odróżnić, a to rozróżnienie zazwyczaj decyduje o wyniku.
- Wszystkie kafelki wysokie. Obraz w całości wygenerowany. Jeśli jest prezentowany jako zdjęcie czegoś prawdziwego, to Twój najoczywistszy przypadek.
- Jeden kafelek wysoki. Prawdziwa fotografia z czymś dodanym lub usuniętym. W kontekście rynkowym lub informacyjnym jest to często poważniejsze niż pełna generacja, ponieważ ma na celu uwiarygodnienie.
- Równomiernie ciepłe, brak wysokich. Silne przetwarzanie. Zazwyczaj autentyczne zdjęcie poddane działaniu filtra lub skalera. Prawie nigdy nie warta podejmowania działań.
Prawdziwa fotografia z wstawionym elementem. Porządkowanie kolejki wyłącznie na podstawie głównego wyniku nigdy by tego nie ujawniło.
Mierzenie skuteczności działania
-
Śledź precyzję w górnym przedziale
Spośród elementów z wynikiem powyżej 90, które moderator otworzył, wobec ilu podjęto działania? Jeśli ta liczba jest niska, narzędzie generuje pracę, zamiast ją oszczędzać.
-
Co tydzień pobieraj próbkę z dolnego przedziału
Wylosuj sto elementów z poniżej 45 i przejrzyj je. To jedyny pomiar tego, co przeoczono, i jest to rzecz, którą zespoły pomijają.
-
Obserwuj wskaźnik odwołań
Wzrost liczby udanych odwołań od decyzji dotyczących mediów syntetycznych oznacza, że próg uległ przesunięciu lub pojawił się nowy generator, który daje niskie wyniki.
-
Uaktualniaj punkty odniesienia po każdej zmianie modelu
Aktualizacje detektora zmieniają wyniki. Próg dostrojony sześć miesięcy temu do innej wersji modelu nie jest już progiem, którym myślisz, że jest.
Obsadzenie kadrowe kolejki tworzonej przez narzędzie
Dodanie detektora do potoku moderacji nie zmniejsza zatrudnienia, a zespoły, które planują, że tak się stanie, kończą w gorszej sytuacji. Zmienia to kolejność, w jakiej napływa praca, co zwiększa wartość każdej godziny pracy recenzenta bez zmniejszania liczby potrzebnych osób.
Zaplanuj budżet tak, aby oznaczona kolejka była wolniejsza w przeliczeniu na element niż kolejka ogólna. Recenzent patrzący na oznaczony post podejmuje trudniejszą decyzję w sprawie bardziej niejednoznacznego materiału, a pośpiech w tym przypadku prowadzi do błędnego egzekwowania zasad. Dwie minuty na element są realistyczne; trzydzieści sekund nie.
Daj recenzentom mapę regionów zamiast wyniku. Moderator, który widzi, że jeden róg obrazu jest podejrzany, podejmuje lepszą decyzję niż ten, któremu wręczono liczbę, i może później wyjaśnić tę decyzję zespołowi ds. odwołań lub organowi regulacyjnemu.
Rotuj pracowników zajmujących się przeglądem mediów syntetycznych. Jest to praca powtarzalna z dużym odsetkiem niejednoznacznych przypadków, a dokładność zauważalnie spada w trakcie długiej zmiany. To ta sama lekcja, którą każda funkcja moderacji przyswoiła już w odniesieniu do innych kategorii.