Co mierzy zbalansowana dokładność
Zwykłą dokładność łatwo sztucznie podbić. Jeśli podasz detektorowi zestaw testowy składający się w 90 procentach z wygenerowanych obrazów, model, który na wszystko odpowiada twierdząco, uzyska 90 procent dokładności, pozostając bezużytecznym.
Zbalansowana dokładność naprawia ten problem, traktując prawdziwe i wygenerowane obrazy z równą wagą, dzięki czemu podawana wartość jest średnią dwóch wskaźników: jak często autentyczne fotografie są poprawnie uznawane za czyste oraz jak często wygenerowane obrazy są poprawnie oznaczane. Narzędzie podające zwykłą dokładność bez podania składu swojego zestawu testowego nie mówi Ci zbyt wiele.
Dwa sposoby, w które detektor może się pomylić
Jedna liczba ukrywa dwa zupełnie różne błędy, które wiążą się z całkowicie odmiennymi kosztami.
Fałszywy alarm
- Autentyczna fotografia uzyskała wynik powyżej linii
- Spowodowane skalowaniem, retuszem, trybem nocnym, zrzutami ekranu
- Koszt: oskarżenie skierowane wobec prawdziwej osoby
- Błąd, który wyrządza rzeczywistą szkodę
Fałszywie ujemny
- Wygenerowany obraz uzyskał wynik poniżej linii
- Spowodowane przez nowe generatory, drobne edycje, pliki poddane praniu
- Koszt: fałszywka przechodzi bez przeszkód
- Błąd, który ludzie rzadziej zauważają
Przesunięcie progu decyzyjnego to zawsze wymiana jednego za drugie. Obniżenie go wykrywa więcej fałszywek, ale oznacza też więcej prawdziwych zdjęć. Podniesienie go chroni autentyczne obrazy, lecz przepuszcza więcej fałszywek. Nie ma ustawienia, które poprawia oba parametry naraz – dlatego ustaliliśmy próg na poziomie 65 jawnie, zamiast dostrajać go po cichu.
Dlaczego wyniki testów zawyżają rzeczywistą skuteczność
| Obraz z testu porównawczego | Twój obraz | Wpływ na wynik |
|---|---|---|
| Plik oryginalny, nigdy niezapisywany ponownie | Skompresowany dwa lub trzy razy | Trafność spada o kilka punktów procentowych |
| Pełna rozdzielczość | Przycięty lub pomniejszony w komunikatorze | Mniej szczegółów do analizy, większa niepewność |
| Generatory znane na etapie trenowania | Model wydany w zeszłym miesiącu | Stała słabość każdego detektora |
| Czyste zdjęcie lub czysty render | Prawdziwe zdjęcie z jedną modyfikacją AI | Wynik dla całego kadru zaniża ocenę zmian |
| Brak manipulacji maskujących | Celowo przetworzony, aby przejść test | Zaprojektowany, aby oszukać pomiar |
To nie są odosobnione przypadki. Właśnie tak w praktyce krążą obrazy w sieci. Zdjęcie, które trafia do Ciebie przez dwie platformy i w formie zrzutu ekranu, straciło już większość sygnałów, na których opierał się benchmark.
Jak interpretować deklarowaną skuteczność
- Zapytaj o zestaw testowy. Liczba bez podania konkretnego benchmarku to tylko marketing. Wynik na publicznym zestawie danych może zweryfikować każdy.
- Zapytaj, czy trafność jest zrównoważona. Zwykła trafność liczona na niesymetrycznym zestawie testowym to najprostszy sposób na sztuczne zawyżenie wyniku.
- Zapytaj o próg decyzyjny. Trafność jest bez znaczenia bez znajomości progu odcięcia, dla którego została zmierzona.
- Zapytaj, jakie generatory uwzględniono. Każdy detektor radzi sobie dobrze z modelami, na których był trenowany, i gorzej z tymi wydanymi później.
- Poproś o odrębny odsetek fałszywie pozytywnych wyników. To ta liczba decyduje, czy narzędzie można bezpiecznie stosować w sprawach dotyczących ludzi.
Czego trafność Ci nie powie
Benchmark mierzy, jak często model ma rację w całej populacji obrazów. Nie mówi nic o tym, czy ma rację w przypadku Twojego pliku. Pojedynczy wynik nie ma przedziału ufności, a detektor nie wie, który ze swoich typowych błędów właśnie popełnia.
Dlatego mapa obszarów i dowody w samym pliku mają większe znaczenie niż ogólna liczba. Zgodność niezależnych sygnałów jest warta więcej niż wysoki wynik z jednego źródła, a rozbieżność między nimi sama w sobie stanowi istotną informację.
Jak samodzielnie przetestować detektor
Nie musisz wierzyć nikomu na słowo. Wartościowy test zajmuje jedno popołudnie i powie Ci o narzędziu więcej niż jakikolwiek opublikowany benchmark – ponieważ korzysta ze zdjęć zbliżonych do Twoich.
-
Przygotuj zestaw ze znanym wynikiem
Dwadzieścia zdjęć zrobionych samodzielnie i dwadzieścia obrazów wygenerowanych przez siebie. Zachowaj nienaruszone oryginały. Po dwadzieścia sztuk z każdego rodzaju wystarczy, by obnażyć ewidentnie słabe narzędzie.
-
Uwzględnij przypadki niejednoznaczne
Dodaj zrzuty ekranu własnych zdjęć, ujęcia w trybie nocnym, przeskalowane kadry i mocno wyretuszowany portret. Na tym detektory zawodzą najczęściej i to te przypadki są pomijane w materiałach dostawców.
-
Zapisuj wynik i przedział, a nie sam werdykt
Zanotuj, co zwróciło każde narzędzie. Porównywanie przedziałów mówi więcej niż porównywanie samych liczb, ponieważ różne narzędzia mogą mieć inaczej ustawione progi decyzyjne.
-
Licz oba typy błędów osobno
Ile Twoich prawdziwych zdjęć oznaczono jako fałszywe, a ile wygenerowanych obrazów pominięto. Narzędzie, które wykrywa każdą fałszywkę, ale oznacza przy tym jedną trzecią Twoich własnych zdjęć, nie nadaje się do weryfikacji ludzi.
Najważniejsza jest pierwsza liczba: jak często narzędzie uznaje Twoją własną pracę za fałszywkę. To błąd niosący realne konsekwencje – i ten, który ogólna trafność w materiałach promocyjnych zwykle zaciera.