← Wszystkie poradniki Porównanie

Czy ChatGPT potrafi rozpoznać, czy obraz został wygenerowany przez AI?

Dostarczy pewną odpowiedź bez żadnego poparcia w faktach. Dlaczego modele językowe nie potrafią tego zrobić, czym się tak naprawdę zajmują i czego użyć w zamian.

· 7 min czytania · Best AI Image Detector

Nie. Model językowy opisuje, jak wygląda obraz, i wyciąga z tego wnioski w formie słownej. Nie ma skalibrowanego progu, punktu odniesienia ani dostępu do statystyk pikseli, od których zależy wykrywanie.

Czym tak naprawdę zajmuje się chatbot

Multimodalny model językowy przekształca obraz w opis semantyczny, a następnie wyciąga wnioski na temat tego opisu w tekście. Odpowiada na pytanie, czy to zdjęcie przypomina obrazy AI, o których czytał podczas treningu.

To pytanie dotyczące zawartości i kompozycji. Wykrywanie to kwestia tekstury: tego, jak wartości sąsiadujących pikseli odnoszą się do siebie, w skali znacznie mniejszej niż cokolwiek, co zachowuje opis semantyczny.

Informacje, które odczytuje detektor, są odrzucane, zanim model językowy zacznie myśleć. To nie tak, że chatboty są w tym złe. Pracują na reprezentacji, która nie zawiera dowodów.

Co to daje w praktyce

  • Pewne odpowiedzi bez progu. Chatbot powie, że obraz jest prawdopodobnie wygenerowany przez AI, bez żadnej skali stojącej za słowem „prawdopodobnie”. Brak tu liczby, przedziału i czegokolwiek, do czego można by porungować inny obraz.
  • Rozumowanie oparte na przestarzałych wskazówkach. Modele przywołują palce, zęby, woskowatą skórę i zniekształcony tekst, ponieważ tak nakazuje szukać tekst treningowy. Te problemy zostały rozwiązane lata temu.
  • Zgodność z Twoim sposobem sformułowania pytania. Zapytawszy o to, czy obraz jest fałszywy, z większym prawdopodobieństwem usłyszysz odpowiedź twierdzącą, niż gdybyś zapytał w sposób neutralny. To cecha interfejsu, a nie zdjęcia.
  • Brak powtarzalności. Zadaj to samo pytanie dwa razy, a możesz otrzymać dwie różne odpowiedzi dotyczące tego samego pliku wraz z równie pewnymi wyjaśnieniami dla każdej z nich.
  • Brak informacji o obszarach. Model nie potrafi stwierdzić, że jeden róg fotografii zachowuje się inaczej niż reszta, a to jest ustalenie, które zazwyczaj ma znaczenie.
Możliwość Chatbot Detektor pikseli
Odczytuje teksturę na poziomie pikseli No Yes
Skalibrowany wynik z opublikowanymi przedziałami No Yes
Ta sama odpowiedź za każdym razem No Yes
Szczegółowy podział na obszary No Yes
Zmierzony względem punktu odniesienia No Yes
Wyjaśnia swoje rozumowanie prozą Yes płynnie Partly jako sygnały
Opisuje to, co znajduje się na zdjęciu Yes No
Co każde podejście może faktycznie wygenerować. Środkowa kolumna to ta, którą ludzie biorą za prawą kolumnę.

Ostatnie dwa wiersze są tymi, które warto zachować. Model językowy jest autentycznie dobry w opisywaniu obrazu i w wyciąganiu wniosków co do tego, czy scena ma sens. Są to przydatne funkcje, ale nie jest to wykrywanie.

Gdzie chatbot jest autentycznie przydatny

Całkowite zignorowanie tego narzędzia byłoby błędem. Używane zgodnie ze swoimi możliwościami, uzupełnia detektor, zamiast go zastępować.

  1. Poproś o szczegółowy opis sceny

    Staranny opis często ujawnia rzeczy, których nie zauważyłeś świadomie, w tym obiekty, które do siebie nie pasują, lub napisy, których nie przeczytałeś.

  2. Zapytaj, czy scena jest spójna fizycznie

    Cienie, odbicia, skala i perspektywa to problemy wymagające rozumowania, a rozumowanie jest tym, do czego model został stworzony. Pozwala to wykryć kompozycje, które analiza pikseli może pominąć.

  3. Zapytaj, co mogłoby to potwierdzić lub obalić

    Przekształcenie podejrzeń w listę kontrolną to dobre zastosowanie modelu językowego, a lista ta jest często lepsza od tej, którą sam byś napisał.

  4. Następnie uruchom właściwy detektor

    W przypadku pytań dotyczących pikseli użyj narzędzia stworzonego specjalnie do tego celu i odnieś wynik do opublikowanej skali.

Dlaczego płynność wypowiedzi stanowi zagrożenie

Detektor, który nie jest pewien, zwraca średnią wartość, a sama ta liczba komunikuje niepewność. Model językowy, który nie jest pewien, zwraca akapit, a akapity nie mają słupków błędu.

Ta sama dobrze ustrukturyzowana wyjaśniająca treść pojawia się niezależnie od tego, czy model zidentyfikował coś rzeczywistego, czy stworzył brzmiący wiarygodnie opis niczego. Czytelnicy uzależniają swoje zaufanie od jakości pisma, czyli dokładnie od tego sygnału, który w tym przypadku nie niesie żadnych informacji.

Dlatego pytający chatbot jest gorszym punktem wyjścia niż samodzielne obejrzenie zdjęcia. Twoja własna niepewność jest dla Ciebie przynajmniej widoczna.

Ten sam problem w innych narzędziach

Nie dotyczy to tak naprawdę jednego produktu. Każdy system, który analizuje obraz semantycznie, ma tę samą lukę, a kilka narzędzi przedstawianych obecnie jako detektory robi pod spodem dokładnie to samo.

Przydatny test: zapytaj, co narzędzie zgłosiłoby w przypadku zdjęcia przedstawiającego zdjęcie lub obrazu bez żadnego rozpoznawalnego obiektu. Detektor pikseli zwraca wynik w obu przypadkach, ponieważ tekstura istnieje niezależnie od zawartości. System semantyczny nie ma nad czym się zastanawiać i albo odmówi odpowiedzi, albo coś zmyśli.

Drugi test: uruchom ten sam plik dwukrotnie. Model pikselowy jest deterministyczny i zwraca tę samą liczbę. Model językowy losuje, a dwa uruchomienia mogą się różnić. Jeśli narzędzie podaje różne odpowiedzi dla tych samych bajtów, oznacza to, że niczego nie mierzy.

Żaden z testów nie wymaga zrozumienia działania narzędzia. Oba zajmują minutę i skuteczniej oddzielają pomiar od opisu niż czytanie strony marketingowej.

Często zadawane pytania

Czy ChatGPT potrafi wykrywać obrazy wygenerowane przez sztuczną inteligencję?
Nie, w żadnym mierzalnym sensie. Tworzy pewnie brzmiącą ocenę opartą na tym, co przedstawia obraz, a nie na tym, w jaki sposób powstały piksele. Za odpowiedzią nie stoi żaden skalibrowany próg ani punkt odniesienia, a zadanie tego samego pytania dwa razy może dać dwa różne werdykty.
Ale miał rację co do testowanego przeze mnie obrazu.
Często będzie miał rację, zwłaszcza w oczywistych przypadkach, w których Ty również miałbyś rację. Problem polega na tym, że brzmi on identycznie, gdy się myli, więc poprawna odpowiedź nie daje Ci żadnego sposobu, aby dowiedzieć się, z jakim przypadkiem masz do czynienia przy następnym obrazie.
A co jeśli poproszę go o analizę pikseli?
To niemożliwe. Obraz zostaje przekształcony w reprezentację semantyczną, zanim model zacznie go analizować, a drobna tekstura, od której zależy wykrywanie, jest w tym przekształceniu tracona. Prośba o analizę pikseli skutkuje opisem tego, jak wyglądałaby analiza pikseli.
Czy istnieją modele multimodalne stworzone do wykrywania?
W tej dziedzinie prowadzone są badania, jednak nie jest to funkcja ogólnego asystenta. Celowo zbudowany detektor jest trenowany na parach obrazów rzeczywistych i wygenerowanych z kalibrowanym wynikiem, podczas gdy model ogólny jest trenowany tak, aby być pomocnym we wszystkim. Oba te rozwiązania nie są swoimi bliskimi zamiennikami.
Czy podczas sprawdzania obrazu powinienem w ogóle korzystać z chatbota?
Tak, w celu opisu i wnioskowania. Zapytaj go, co znajduje się w kadrze, czy oświetlenie jest spójne oraz co potwierdziłoby lub obaliło Twoje podejjrzenia. Następnie użyj detektora do oceny pikseli i zachowaj obie odpowiedzi oddzielnie w pamięci.
Dlaczego tak wiele osób najpierw pyta chatbota?
Ponieważ ma go otwartego w innej karcie i zawsze odpowiada. Wygoda wygrywa z dokładnością, gdy koszt popełnienia błędu jest niewidoczny, a w przypadku weryfikacji obrazu koszt ten zazwyczaj jest niewidoczny do momentu, w którym ktoś już podjął działania na podstawie odpowiedzi.