← Wszystkie poradniki Pod maską

Deepfake a obraz wygenerowany przez AI: dwa różne zjawiska

Jeden kreuje postać, która nie istnieje. Drugi umieszcza prawdziwą osobę w sytuacji, w której nigdy się nie znalazła. Wymagają one odmiennych metod weryfikacji, a ich mylenie prowadzi do poważnych błędów.

· 9 min czytania · Best AI Image Detector

Obraz wygenerowany kreuje swój obiekt od podstaw. Deepfake zachowuje tożsamość prawdziwej osoby i manipuluje tym, co ta osoba rzekomo robi. To drugie zjawisko wyrządza bezpośrednią szkodę konkretnym ludziom i jest trudniejsze do wykrycia, ponieważ większość kadru pozostaje autentyczna.

Dwa różne pojęcia pod tą samą nazwą

Obraz w pełni wygenerowany powstaje od zera. Nie ma pod nim żadnej fotografii, żadnego odczytu matrycy ani zdarzenia z przeszłości. Każdy piksel stworzył model, a przedstawiona postać nie ma tożsamości, którą można by zniesławić, bo fizycznie nie istnieje.

Deepfake bazuje na materiale autentycznym. Punktem wyjścia jest zdjęcie lub nagranie wideo – faktyczny zapis realnej chwili – w którym model zastąpił określony obszar, zazwyczaj twarz, wyrenderowanym wizerunkiem kogoś innego.

Rozróżnienie to ma znaczenie prawne, redakcyjne i techniczne. Wygenerowane zdjęcie stockowe nieistniejącego lekarza to kwestia praw licencyjnych. Zdjęcie prawdziwego lekarza z twarzą wklejoną w ciało, do którego nigdy nie należała, to kwestia zniesławienia i potencjalny czyn karalny.

Wygenerowane zdjęcie stockowe Portret biznesowy AI własnej osoby Wygenerowana fałszywa postać publiczna Zdjęcie z podmienioną twarzą Zmodyfikowany dokument
Jaka część kadru jest prawdziwa → ↑ Szkoda wyrządzona konkretnej osobie
Pozycje mają charakter poglądowy. Kluczowe są osie: stopień szkody zależy od tożsamości, a nie od poziomu syntetyczności pikseli.
Rozmieszczenie poszczególnych typów. Prawy dolny kwadrant skupia najpoważniejsze szkody.

Dlaczego deepfake jest trudniejszy do wykrycia

Detektor analizuje teksturę statystyczną obrazu i określa, w jakim stopniu przypomina ona wynik działania modelu. Gdy cały kadr jest syntetyczny, sygnał ten występuje wszędzie, a wynik jest jednoznaczny.

Face swap odwraca ten problem. Dziewięćdziesiąt procent obrazu to prawdziwe zdjęcie, z autentycznym szumem matrycy i historią kompresji, co odzwierciedla średnia dla całego kadru. Przekonująca zamiana twarzy może dać wynik na poziomie około 30 na obrazie, który w rzeczywistości wprowadza w błąd.

Nie jest to wada samego modelu, lecz niewłaściwie postawione pytanie. Pytanie, czy obraz został wygenerowany, jest nieadekwatne, gdy rzetelna odpowiedź brzmi: większość nie, ale jeden istotny fragment tak.

16 12 19 14 11 91 17 13 15 18 12 16

Uśrednienie, które dało wynik 33, to dokładnie to, co ukrywa ten jeden istotny fragment.

Prawdziwe zdjęcie z podmienioną jedną twarzą. Wynik dla całego kadru wyniósł 33 i nie mówił praktycznie nic.

Odpowiedzią na ten problem jest mapa regionów. Osobna ocena nakładających się kafelków sprawia, że lokalna modyfikacja jest mierzona względem swojego bezpośredniego otoczenia, a nie rozmywana w całym kadrze, do którego nie pasuje.

Terminologia w kolejności pojawiania się

Stosowane pojęcia i to, co faktycznie oznaczają
PojęcieCo to oznaczaCzy obiekt jest prawdziwy?
DeepfakeWizerunek prawdziwej osoby przeniesiony do innego materiałuTak
Face swapPowszechna forma deepfake'a na zdjęciu lub filmieTak
Wygenerowane przez AIWygenerowany z promptu bez zdjęcia źródłowegoNie
Edytowane przez AIPrawdziwe zdjęcie z czymś dodanym lub usuniętymZazwyczaj
Media syntetycznePojęcie nadrzędne obejmujące wszystkie powyższeZależy
CheapfakePrawdziwe media wprowadzające w błąd podpisem, kadrowaniem lub starą datąTak

Warto zatrzymać się przy ostatnim wierszu, ponieważ jest to najczęstsza forma dezinformacji wizualnej i jedyna, której nie wykryje żaden detektor. Autentyczne, nieedytowane zdjęcie z innego kraju sprzed trzech lat, podpisane jako dzisiejsza wiadomość, zostanie ocenione zgodnie z prawdą jako autentyczna fotografia.

Praktyczne postępowanie w zależności od przypadku

  1. Podejrzewasz, że cały obraz został zmyślony. Wykonaj analizę całego kadru. Wysoki wynik przy jednolitej mapie daje maksymalną pewność.
  2. Podejrzewasz wklejenie lub zamianę osoby. Najpierw sprawdź mapę regionów. Ogólny wynik liczbowy będzie zaniżony.
  3. Podejrzewasz modyfikację dokumentu. Podobnie jak wyżej; oczekuj dokładnie jednego wyróżnionego kafelka nad zmienionym polem.
  4. Podejrzewasz fałszywy podpis. Detektor tu nie pomoże. Użyj odwrotnego wyszukiwania obrazem, a następnie sprawdź datę i miejsce.
  5. To jest wideo. Wymaga zupełnie innych narzędzi. Analiza klatka po klatce pomija artefakty czasowe, które zdradzają zamiany w czasie rzeczywistym.

Dlaczego to rozróżnienie chroni ludzi

Traktowanie każdego syntetycznego obrazu z jednakową powagą rodzi dwa problemy jednocześnie. Marnuje uwagę na nieszkodliwe przypadki, takie jak użycie wygenerowanego portretu z braku budżetu na fotografa, a zarazem umniejsza znaczenie sytuacji, które rzeczywiście komuś szkodzą.

Szkoda nie wynika z samej sztuczności pikseli. Wynika z przedstawienia prawdziwej, konkretnej osoby robiącej coś, czego nie zrobiła. To wymaga eskalacji i to w tym przypadku średni wynik jest najmniej wiarygodnym podsumowaniem.

Oparcie wewnętrznych zasad na tożsamości, a nie na technologii, zapewnia im dłuższą aktualność. Metody będą się zmieniać; pytanie o to, czy konkretna osoba została fałszywie przedstawiona – nie.

Jak powstaje face swap

Zrozumienie procesu produkcji ułatwia zrozumienie detekcji. Zamiana twarzy zaczyna się od zdjęcia docelowego oraz zestawu zdjęć osoby, której twarz ma zostać użyta. Model uczy się renderować tę twarz przy oświetleniu, kącie i mimice obecnych na zdjęciu docelowym.

Wyrenderowana twarz jest następnie wklejana z powrotem do oryginalnego kadru, a najtrudniejszym etapem jest łączenie krawędzi. Obie części mają inny szum, inną historię kompresji i często nieco inną charakterystykę barwną, dlatego proces wtapiania wygładza granicę, aż oko przestanie zauważać łączenie.

To wygładzenie jest dokładnie tym, co odczytuje mapa regionów. Wtapianie usuwa drobnoziarnistą teksturę generowaną przez matrycę, a powstały obszar różni się statystycznie od całego otoczenia, nawet jeśli łączenie jest niewidoczne. Szew pozostaje niedostrzegalny dla oka, lecz w pełni mierzalny.

To wyjaśnia również, dlaczego podmiana twarzy tak łatwo przechodzi test całego kadru. Zmanipulowany obszar jest mały, celowo wtopiony w otoczenie i otoczony autentycznym zdjęciem, które dominuje w każdej średniej liczonej dla całego kadru.

Błąd, który stale się powtarza

Użytkownicy sprawdzają podejrzany deepfake w detektorze, widzą wynik w granicach 30 i dochodzą do wniosku, że obraz jest autentyczny. To błędny wniosek z prawidłowej liczby: wynik jest poprawny, ale odpowiedział na inne pytanie niż to, które zadano.

Wystarczy prosty nawyk. Przy każdym obrazie, na którym istotna jest konkretna osoba, otwórz mapę regionów przed odczytaniem ogólnego wyniku i potraktuj najwyżej oceniony kafelek, a nie średnią, jako wniosek wymagający reakcji.

Często zadawane pytania

Czy każdy obraz AI to deepfake?
Nie, a różnica tkwi w obiekcie. Deepfake wykorzystuje wizerunek prawdziwej osoby bez jej zgody, co czyni go szkodliwym i często bezprawnym. Wygenerowany obraz nieistniejącej osoby nie ma ofiary, a zrównywanie obu przypadków odwraca uwagę od realnych zagrożeń.
Czy to narzędzie wykrywa deepfake?
Na zdjęciach często tak – dzięki mapie regionów, a nie ogólnemu wynikowi. Podmieniona twarz to lokalna modyfikacja wewnątrz autentycznego zdjęcia, dlatego widoczna jest jako pojedynczy wyróżniony kafelek na chłodnej siatce, podczas gdy wynik dla całego kadru pozostaje niski. Przy każdym zdjęciu osoby sprawdzaj najpierw mapę.
Co z wideo deepfake?
Wymaga to innych narzędzi. Manipulacja wideo pozostawia artefakty czasowe – niespójności między kolejnymi klatkami – których model do obrazów statycznych nie analizuje. Sprawdzanie pojedynczych klatek wykryje niektóre przypadki, ale pominie te zoptymalizowane pod kątem przejścia takiego testu.
Dlaczego znany deepfake uzyskał niski wynik?
Ponieważ większość kadru to prawdziwe zdjęcie. Wynik dla całego kadru jest średnią z całego obrazu, a twarz zajmująca jedną ósmą kadru wpływa na tę średnią w minimalnym stopniu. To najczęstszy powód błędnej interpretacji wyników przy zamianie twarzy.
Czy da się wykryć cheapfake?
Nie za pomocą detektora, ponieważ nie ma w nim elementów syntetycznych. Prawdziwe zdjęcie z fałszywym podpisem to problem weryfikacji źródła: użyj odwrotnego wyszukiwania obrazem, aby znaleźć wcześniejsze publikacje, a następnie sprawdź, czy data i miejsce zgadzają się z deklarowanymi.
Czy prawo traktuje je inaczej?
Coraz częściej tak. W wielu jurysdykcjach wprowadzono przepisy penalizujące tworzenie syntetycznych wizerunków prawdziwych osób bez ich zgody, zwłaszcza materiałów o charakterze intymnym, podczas gdy obrazy nieprzedstawiające nikogo konkretnego podlegają zwykłym przepisom. W kwestiach prawnych skonsultuj się z własnym działem prawnym zamiast polegać na tej stronie.