← Wszystkie poradniki Dokładność

Dlaczego detektory AI dają różne wyniki dla tego samego obrazu

Uruchom jedno zdjęcie przez cztery narzędzia i uzyskaj cztery odpowiedzi. Przyczyny mają charakter strukturalny, a ich znajomość podpowiada, któremu wynikowi wierzyć.

· 7 min czytania · Best AI Image Detector

Różne dane treningowe, różne linie decyzyjne i różne definicje tego, co uznaje się za AI. Dwa narzędzia mogą odczytać obraz identycznie, a mimo to zgłosić przeciwstawne werdykty.

Cztery powody różnic w wynikach

Wynik jest końcem długiego łańcucha wyborów. Zmień dowolne ogniwo, a liczba się zmieni, mimo że nic w obrazie się nie zmieniło.

  1. Różne dane treningowe. Detektor rozpoznaje to, co widział. Narzędzie przeszkolone na tysiącach otwartych generatorów radzi sobie dobrze z nietypowymi modelami. Narzędzie przeszkolone na czterech największych narzędziach komercyjnych radzi sobie lepiej z tymi czterema, a z wszystkimi innymi gorzej.
  2. Różne linie decyzyjne. Jedno narzędzie uznaje 60 za podejrzane, inne 75. Ten sam odczyt przekracza jeden próg, a innego nie, więc otrzymujesz dwa werdykty z jednego pomiaru.
  3. Różne definicje. Niektóre narzędzia uwzględniają każdy udział generatywny, w tym skalowanie w górę lub wypełnienie generatywne. Inne oznaczają tylko w całości syntetyczne klatki. Retuszowany portret to dla pierwszego AI, a dla drugiego prawda.
  4. Różne wstępne przetwarzanie. Narzędzia zmieniają rozmiar, kadrują i ponownie kodują przed obliczeniem wyniku. Detektor czytający kwadrat o wielkości 224 pikseli na środku widzi inny obraz niż ten czytający 384 piksele całego kadru.
Ta sama fotografia oceniona na cztery sposoby
Narzędzie A, linia na 50
61
Narzędzie B, linia na 65
58
Narzędzie C, tylko cały kadr
34
Narzędzie D, uwzględnia każdą edycję
88

Wskaźniki ilustracyjne pokazujące rozrzut typowy dla silnie przetworzonego, ale autentycznego zdjęcia.

Jeden obraz, cztery narzędzia. Nic tutaj nie jest awarią: każde zgłasza to, co mówi jego własna skala.

Narzędzie D nie jest bardziej czułe od innych. Odpowiada na szersze pytanie. Jeśli Twoją obawą jest to, czy fotografia została zainscenizowana przez generator, narzędzie D raportuje nadmiernie. Jeśli Twoją obawą jest to, czy jakiekolwiek AI dotknęło pliku, narzędzie D jako jedyne daje Ci odpowiedź.

Zapytaj, na jakie pytanie odpowiada każde narzędzie

Trzy pytania, które ludzie mają na myśli, pytaąc, „czy to AI”
PytanieCo je oznaczaTypowe zastosowanie
Czy ta klatka została wygenerowana z niczego?Syntetyczna tekstura całego kadruWiadomości, ogłoszenia na giełdach, profile randkowe
Czy jakakolwiek część została edytowana przez AI?Jeden region powyżej liniiUbezpieczenia, roszczenia, przegląd dowodów
Czy jakiekolwiek AI w ogóle dotknęło tego pliku?Skalowanie w górę, odszumianie, wypełnienie generatywneBiblioteki stockowe, zasady konkursów

Większość rozbieżności między narzędziami to w rzeczywistości nieporozumienie co do tego, na które z tych trzech pytań odpowiadałeś. Przed porównaniem wyników zdecyduj, które pytanie ma dla Ciebie znaczenie, a następnie odczytaj wynik każdego narzędzia pod tym kątem.

Jak prawidłowo porównać dwa wyniki

  1. Przekaż obu narzędziom identyczny plik

    Nie ponowne pobranie, nie zrzut ekranu, nie kopia, która przeszła przez aplikację czatu. Inne bajty to inny obraz i słusznie uzyskają inne wyniki.

  2. Porównaj przedziały, a nie liczby

    Wynik 61 w skali z linią na 50 oraz 58 w skali z linią na 65 różnią się werdyktem, ale są zgodne co do samego odczytu.

  3. Szukaj opublikowanego progu

    Narzędzie, które nie chce ujawnić, gdzie leży jego linia, nie może być z niczym porównane. Traktuj tę liczbę jako nieinterpretowalną, a nie jako dowód.

  4. Wybieraj narzędzie, które pokazało swój proces roboczy

    Mapa regionów, nazwany przedział i podany benchmark pozwalają sprawdzić logikę stojącą za wynikiem. Pewna siebie etykieta bez żadnego poparcia już nie.

  5. Traktuj zgodność jako silny sygnał

    Dwa niezależne narzędzia osiągające ten sam przedział są warte więcej niż jedno z nich w pojedynkę. Jeśli każde twierdzi co innego, oznacza to niepewność, a nie wyciąganie średniej.

Kiedy rozbieżność jest samym wynikiem

Warto nauczyć się rozpoznawać jeden wzorzec. Narzędzie zgłaszające niski wynik dla całego kadru w parze z narzędziem zgłaszającym wysoki wynik często oznacza, że obraz jest prawdziwą fotografią z lokalną edycją.

Pierwsze narzędzie uśrednia edycję w większości autentycznego kadru. Drugie przypisuje wagę najsilniejszemu regionowi. Oba mają rację co do tego, co zmierzyły, a sama rozbieżność powiedziała Ci więcej niż którakolwiek z tych liczb.

11 14 9 13 89 12 10 8 15

Jeden kafelek powyżej linii decyzyjnej wewnątrz innej zimnej ramki. Żadna pojedyncza liczba tego nie uchwyci.

Widok regionów rozstrzyga spór. Średnia z całego kadru dla tych kafelków wynosi 24, co jest odczytywane jako czysty obraz; mapa pokazuje, dlaczego jest to mylące.

Co zmusiłoby detektory do zgodności

Wspólny benchmark, opublikowane linie decyzyjne i uzgodniona definicja tego, co zalicza się do udziału AI, wyeliminowałyby większość rozbieżności. Nic z tego jeszcze nie istnieje i nie ma silnej presji komercyjnej, aby to stworzyć, ponieważ narzędzie publikujące swoje słabości wygląda gorzej niż to, które tego nie robi.

Dopóki to się nie zmieni, traktuj każdy wynik jako pochodzący z prywatnej skali. Przeczytaj dowody przedstawione przez narzędzie i przypisz im większą wagę niż pewności w jego etykiecie.

Problem z wersjonowaniem, o którym nikt nie wspomina

Detektor nie jest czymś stałym w czasie. Dostawcy retrenują modele, dostosowują progi i zmieniają modele bez zapowiedzi, a prawie żaden z nich nie wersjonuje swoich wyników. Wynik uzyskany w marcu i wynik uzyskany dzisiaj mogą pochodzić z różnych modeli z różną kalibracją w tle.

Ma to znaczenie, jeśli archiwizujesz wyniki. Dokumentacja roszczeń, dziennik moderacji lub sprawa akademicka powołująca się na wynik sprzed osiemdziesięciu miesięcy powołuje się na pomiar, którego instrument już nie istnieje. Nie ma sposobu, aby go odtworzyć, ani sprawdzić, co oznaczało w tamtym czasie.

Tam, gdzie przechowujesz wyniki, zachowaj przy nich dowody: wyniki dla regionów, pasmo, linię decyzyjną oraz datę. One pozostają czytelne także wtedy, gdy model, który za nimi stoi, zostanie zaktualizowany, czego goły procent nie zapewnia.

Często zadawane pytania

Jeśli dwa detektory mają odmienne zdanie, któremu należy uwierzyć?
Temu, które pokazuje swoje rozumowanie. Opublikowana linia decyzyjna, nazwane pasmo i mapa regionów pozwalają sprawdzić, czy odczyt ma sens w przypadku danego zdjęcia. Goły procent z narzędzia, które nie wyjaśnia swojego znaczenia, nie jest dowodem, niezależnie od tego, jak pewnie brzmi.
Czy uruchomienie większej liczby detektorów daje lepszą odpowiedź?
Tylko wtedy, gdy z góry zdecydujesz, jak je ważyć. Zgoda trzech narzędzi jest rzeczywiście silniejsza niż jednego. Sześć narzędzi, z których dwa zgadzają się z Tobą, to sposób, w jaki ludzie przekonują się do wniosku, do którego już wcześniej doszli.
Dlaczego jedno narzędzie uznaje moje edytowane zdjęcie za wygenerowane przez AI, a inne za prawdziwe?
Odpowiadają na różne pytania. Narzędzie, które uwzględnia każdą ingerencję generatora, wykrywa wypełnienie generatywne lub skalowanie. Narzędzie szukające wyłącznie całkowicie syntetycznych klatek tego nie robi. Żadne nie myli się; sprawdź, jakiej definicji używa każde z nich.
Czy oba detektory mogą mieć rację?
Tak, i jest to powszechne. Różne progi oznaczają, że ten sam pomiar daje odmienne werdykty, a różne zestawy treningowe oznaczają autentycznie różne odczyty nietypowego obrazu. Zgoda w paśmie jest tym, co się liczy, a nie zgoda co do cyfr.