Na co patrzy model
Aparat rejestruje światło przez obiektyw na matrycy. Proces ten pozostawia określonego rodzaju szum, specyficzny wzór spadku ostrości ku krawędziom oraz konkretną relację między sąsiadującymi pikselami, która wynika z siatki matrycy i następującego po niej demosaikowania.
Model dyfuzyjny buduje obraz poprzez wielokrotne usuwanie szumu z pola losowego, aż wyłoni się coś spójnego. Ten proces również pozostawia specyficzny podpis, który jest inny. Wynik może być wizualnie doskonały i jednocześnie możliwy do odróżnienia statystycznie.
Dlatego detekcja działa również na zrzutach ekranu, gdy metadane już zniknęły. Podpis znajduje się w samych wartościach pikseli, a nie w nagłówku, więc skopiowanie pikseli oznacza skopiowanie dowodów.
Cztery etapy
- 1 Odczytaj plik Zdekodowany w przeglądarce, nigdy nieprzesłany na serwer
- 2 Oceń klatkę Vision transformer o rozdzielczości 384 pikseli kwadratowych
- 3 Oceń kafelki Ten sam model na nakładających się obszarach
- 4 Odczytaj poświadczenia C2PA i znaczniki generatora, jeśli są obecne
Etap pierwszy: dekodowanie
Plik jest odczytywany z dysku przez stronę i dekodowany do surowych pikseli. HEIC, AVIF, TIFF i inne są obsługiwane przez natywne dekodery przeglądarki. Nic nie jest przesyłane, co wynika z miejsca wykonywania pracy, a nie z polityki stosowanej na serwerze.
Etap drugi: ocena całej klatki
Obraz jest skalowany do 384 pikseli kwadratowych i przepuszczany przez model vision transformer. Model zwraca surowe prawdopodobieństwo, że klatka jest syntetyczna. Liczba ta jest następnie kalibrowana, aby spójnie dopasować ją do opublikowanych przedziałów zamiast ulegać zniosom modelu.
Skalowanie powoduje utratę szczegółów, co jest pierwszym miejscem utraty dokładności. Jest to również nieuniknione: model ma stały rozmiar wejściowy, a fotografia o rozdzielczości 4000 pikseli musi zostać pomniejszona, aby się w nim zmieścić.
Etap trzeci: przepust kafelkowy
Klatka jest dzielona na nakładające się obszary, a każdy z nich jest oceniany osobno przez ten sam model. To właśnie odróżnia w pełni wygenerowany obraz od prawdziwej fotografii z dodanym elementem i jest to etap, którego pojedyncza liczba nie jest w stanie zastąpić.
Uśrednienie tych wartości daje 21. Widok kafelków zachowuje informacje, które uśrednianie niszczy.
Kafelki potrzebują wystarczającej liczby pikseli, aby miały znaczenie, dlatego obrazy o krótszym boku poniżej około 576 pikseli otrzymują wyłącznie ocenę całej klatki. W małym wycinku nie ma wystarczającej ilości szczegółów, aby ocenić go niezależnie.
Etap czwarty: własny rejestr pliku
Niezależnie od pikseli, plik jest sprawdzany pod kątem Content Credentials oraz znaczników generatora pozostawionych przez niektóre narzędzia. Ta ścieżka ma charakter kryptograficzny, a nie statystyczny: ważny podpis jest weryfikowany względem listy zaufanych źródeł, a nie szacowany.
Jak wyniki są łączone
Obie ścieżki nie są uśredniane, ponieważ mają różne wagi. Ważne poświadczenie potwierdzające zarejestrowanie przez aparat przeważa nad umiarkowanym wynikiem pikseli. Poświadczenie potwierdzające generowanie przez AI rozstrzyga kwestię samodzielnie.
| Dowód | Typ | Waga |
|---|---|---|
| Ważne poświadczenie deklarujące generowanie przez AI | Kryptograficzny | Rozstrzygający |
| Ważne poświadczenie deklarujące rejestrację przez aparat | Kryptograficzny | Bardzo silny |
| Znacznik generatora w pliku | Deklaratywny | Silny, ale możliwy do usunięcia |
| Wynik pikseli dla całej klatki | Statystyczny | Umiarkowany |
| Wyniki kafelków obszarów | Statystyczny | Umiarkowany i bardziej szczegółowy |
| Brak poświadczenia | Brak | Brak informacji w każdą stronę |
Ostatni wiersz jest tym, który ludzie najczęściej odczytują błędnie. Brak poświadczenia nie jest negatywnym sygnałem. Zdecydowana większość kiedykolwiek stworzonych obrazów nie ma żadnych poświadczeń, a niemal każda platforma usuwa je podczas przesyłania.
Dlaczego to działa w przeglądarce
Model ma około 40 MB i działa za pośrednictwem technologii WebAssembly na urządzeniu użytkownika. To świadomy wybór architektoniczny, który niesie ze sobą trzy konsekwencje, które warto zrozumieć.
- Nic nie jest przesyłane, więc żaden serwer nie przechowuje niczyich obrazów i nie ma tu relacji związanych z przetwarzaniem danych, które należałoby dokumentować.
- Sprawdzenie nie generuje kosztów utrzymania, dlatego narzędzie może być darmowe i pozbawione liczników wykorzystania.
- Pierwsze sprawdzenie trwa dłużej, ponieważ model pobiera się raz przed uruchomieniem. Kolejne sprawdzenia korzystają z zapisanego w pamięci podręcznej pliku.
Czego proces celowo nie robi
Kilka technik występujących w starszych narzędziach śledczych jest nieobecnych, ponieważ nie działają już na obrazach przesyłanych przez nowoczesne platformy.
- Analiza poziomu błędów (ELA). Popularna, powszechnie błędnie interpretowana i nieskuteczna w przypadku każdego obrazu, który został zapisany ponownie więcej niż raz.
- Wykrywanie kopiowania i wklejania. Znajduje zduplikowane obszary wewnątrz klatki, co pozwala wykryć klonowanie w starym stylu, a nie generowanie.
- Werdykty oparte na metadanych. Dane EXIF są usuwane podczas przesyłania niemal wszędzie, więc sprawdzenie od nich zależne zawiedzie dokładnie na tych obrazach, które użytkownicy muszą zweryfikować.
- Analiza ukierunkowana na twarze. Przydatna w jednej wąskiej kategorii manipulacji i całkowicie ślepa na wszystko inne.