Cztery powody różnic w wynikach
Wynik jest końcem długiego łańcucha wyborów. Zmień dowolne ogniwo, a liczba się zmieni, mimo że nic w obrazie się nie zmieniło.
- Różne dane treningowe. Detektor rozpoznaje to, co widział. Narzędzie przeszkolone na tysiącach otwartych generatorów radzi sobie dobrze z nietypowymi modelami. Narzędzie przeszkolone na czterech największych narzędziach komercyjnych radzi sobie lepiej z tymi czterema, a z wszystkimi innymi gorzej.
- Różne linie decyzyjne. Jedno narzędzie uznaje 60 za podejrzane, inne 75. Ten sam odczyt przekracza jeden próg, a innego nie, więc otrzymujesz dwa werdykty z jednego pomiaru.
- Różne definicje. Niektóre narzędzia uwzględniają każdy udział generatywny, w tym skalowanie w górę lub wypełnienie generatywne. Inne oznaczają tylko w całości syntetyczne klatki. Retuszowany portret to dla pierwszego AI, a dla drugiego prawda.
- Różne wstępne przetwarzanie. Narzędzia zmieniają rozmiar, kadrują i ponownie kodują przed obliczeniem wyniku. Detektor czytający kwadrat o wielkości 224 pikseli na środku widzi inny obraz niż ten czytający 384 piksele całego kadru.
Narzędzie D nie jest bardziej czułe od innych. Odpowiada na szersze pytanie. Jeśli Twoją obawą jest to, czy fotografia została zainscenizowana przez generator, narzędzie D raportuje nadmiernie. Jeśli Twoją obawą jest to, czy jakiekolwiek AI dotknęło pliku, narzędzie D jako jedyne daje Ci odpowiedź.
Zapytaj, na jakie pytanie odpowiada każde narzędzie
| Pytanie | Co je oznacza | Typowe zastosowanie |
|---|---|---|
| Czy ta klatka została wygenerowana z niczego? | Syntetyczna tekstura całego kadru | Wiadomości, ogłoszenia na giełdach, profile randkowe |
| Czy jakakolwiek część została edytowana przez AI? | Jeden region powyżej linii | Ubezpieczenia, roszczenia, przegląd dowodów |
| Czy jakiekolwiek AI w ogóle dotknęło tego pliku? | Skalowanie w górę, odszumianie, wypełnienie generatywne | Biblioteki stockowe, zasady konkursów |
Większość rozbieżności między narzędziami to w rzeczywistości nieporozumienie co do tego, na które z tych trzech pytań odpowiadałeś. Przed porównaniem wyników zdecyduj, które pytanie ma dla Ciebie znaczenie, a następnie odczytaj wynik każdego narzędzia pod tym kątem.
Jak prawidłowo porównać dwa wyniki
-
Przekaż obu narzędziom identyczny plik
Nie ponowne pobranie, nie zrzut ekranu, nie kopia, która przeszła przez aplikację czatu. Inne bajty to inny obraz i słusznie uzyskają inne wyniki.
-
Porównaj przedziały, a nie liczby
Wynik 61 w skali z linią na 50 oraz 58 w skali z linią na 65 różnią się werdyktem, ale są zgodne co do samego odczytu.
-
Szukaj opublikowanego progu
Narzędzie, które nie chce ujawnić, gdzie leży jego linia, nie może być z niczym porównane. Traktuj tę liczbę jako nieinterpretowalną, a nie jako dowód.
-
Wybieraj narzędzie, które pokazało swój proces roboczy
Mapa regionów, nazwany przedział i podany benchmark pozwalają sprawdzić logikę stojącą za wynikiem. Pewna siebie etykieta bez żadnego poparcia już nie.
-
Traktuj zgodność jako silny sygnał
Dwa niezależne narzędzia osiągające ten sam przedział są warte więcej niż jedno z nich w pojedynkę. Jeśli każde twierdzi co innego, oznacza to niepewność, a nie wyciąganie średniej.
Kiedy rozbieżność jest samym wynikiem
Warto nauczyć się rozpoznawać jeden wzorzec. Narzędzie zgłaszające niski wynik dla całego kadru w parze z narzędziem zgłaszającym wysoki wynik często oznacza, że obraz jest prawdziwą fotografią z lokalną edycją.
Pierwsze narzędzie uśrednia edycję w większości autentycznego kadru. Drugie przypisuje wagę najsilniejszemu regionowi. Oba mają rację co do tego, co zmierzyły, a sama rozbieżność powiedziała Ci więcej niż którakolwiek z tych liczb.
Jeden kafelek powyżej linii decyzyjnej wewnątrz innej zimnej ramki. Żadna pojedyncza liczba tego nie uchwyci.
Co zmusiłoby detektory do zgodności
Wspólny benchmark, opublikowane linie decyzyjne i uzgodniona definicja tego, co zalicza się do udziału AI, wyeliminowałyby większość rozbieżności. Nic z tego jeszcze nie istnieje i nie ma silnej presji komercyjnej, aby to stworzyć, ponieważ narzędzie publikujące swoje słabości wygląda gorzej niż to, które tego nie robi.
Dopóki to się nie zmieni, traktuj każdy wynik jako pochodzący z prywatnej skali. Przeczytaj dowody przedstawione przez narzędzie i przypisz im większą wagę niż pewności w jego etykiecie.
Problem z wersjonowaniem, o którym nikt nie wspomina
Detektor nie jest czymś stałym w czasie. Dostawcy retrenują modele, dostosowują progi i zmieniają modele bez zapowiedzi, a prawie żaden z nich nie wersjonuje swoich wyników. Wynik uzyskany w marcu i wynik uzyskany dzisiaj mogą pochodzić z różnych modeli z różną kalibracją w tle.
Ma to znaczenie, jeśli archiwizujesz wyniki. Dokumentacja roszczeń, dziennik moderacji lub sprawa akademicka powołująca się na wynik sprzed osiemdziesięciu miesięcy powołuje się na pomiar, którego instrument już nie istnieje. Nie ma sposobu, aby go odtworzyć, ani sprawdzić, co oznaczało w tamtym czasie.
Tam, gdzie przechowujesz wyniki, zachowaj przy nich dowody: wyniki dla regionów, pasmo, linię decyzyjną oraz datę. One pozostają czytelne także wtedy, gdy model, który za nimi stoi, zostanie zaktualizowany, czego goły procent nie zapewnia.