← Всички ръководства Сравнение

Може ли ChatGPT да разпознае дали една изображение е генерирано с AI?

Ще ви даде уверен отговор без нищо зад него. Защо езиковите модели не могат да направят това, какво всъщност правят и какво да използвате вместо това.

· 7 мин. четене · Best AI Image Detector

Не. Езиковият модел описва как изглежда едно изображение и разсъждава за него с думи. Той няма калибриран праг, няма бенчмарк и няма достъп до пикселната статистика, от която зависи детекцията.

Какво всъщност прави един чатбот

Мултимодалният езиков модел превръща изображението в семантично описание и след това разсъждава върху това описание в текст. Той отговаря на въпроса дали тази картина прилича на AI изображенията, за които съм чел по време на обучението.

Това е въпрос за съдържание и композиция. Детекцията е въпрос за текстура: как съседните пикселни стойности се свързват помежду си, в мащаб далеч под всичко, което семантичното описание запазва.

Информацията, която детектора разчита, се изхвърля преди езиковият модел да започне да мисли. Не че чатботовете са лоши в това. Те работят от представяне, което не съдържа доказателствата.

Какво произвежда това на практика

  • Уверени отговори без праг. Чатботът ще каже вероятно генерирано от AI без никакъв мащаб зад думата вероятно. Няма число, няма диапазон и няма с какво да се сравните спрямо друго изображение.
  • Разсъждения по остарели белези. Моделите цитират пръсти, зъби, восъчна кожа и изкривен текст, защото това казва тренировъчният текст да се търси. Те бяха поправени преди години.
  • Съгласие с вашата рамка. Попитайте дали едно изображение е фалшиво и е по-вероятно да чуете да, отколкото ако бяхте попитали неутрално. Това е свойство на интерфейса, а не на картината.
  • Няма възпроизводимост. Попитайте два пъти и можете да получите два различни отговора за един и същ файл с еднакво уверени обяснения за всеки от тях.
  • Няма информация за регионите. Той не може да ви каже, че единият ъгъл на фотографията се държи по различен начин от останалата част, което е констатацията, която обикновено има значение.
Възможност Чатбот Пикселен детектор
Чете текстура на пикселном ниво No Yes
Калибриран резултат с публикувани диапазони No Yes
Един и същ отговор всеки път No Yes
Разбивка на регионално ниво No Yes
Измерено спрямо бенчмарк No Yes
Обяснява своите разсъждения в проза Yes гладко Partly като сигнали
Описва какво има на снимката Yes No
Какво всъщност може да произведе всеки подход. Средната колона е тази, която хората бъркат с дясната колона.

Последните два реда са тези, които си струва да бъдат запазени. Езиковият модел е наистина добър в описването на изображение и в разсъжденията дали една сцена има смисъл. Това са полезни неща и те не са детекция.

Къде един чатбот е наистина полезен

Пълното отхвърляне на инструмента би било погрешен извод. Използван за това, което може да прави, той по-скоро допълва детектора, отколкото да го заменя.

  1. Помолете го да опише сцената в детайли

    Внимателното описание често извежда на повърхността неща, които не сте забелязали съзнателно, включително обекти, които не си пасват, или надписи, които не сте прочели.

  2. Попитайте дали сцената е физически съвместима

    Сенките, отраженията, мащабът и перспективата са проблеми на разсъждението, а разсъждението е предназначението на модела. Това улавя композитни изображения, които пикселният анализ може да пропусне.

  3. Попитайте какво би го потвърдило или опровергало

    Превръщането на съмнението в списък с проверки е добро приложение на езиковия модел и списъкът често е по-добър от този, който бихте написали вие самите.

  4. След това пуснете истински детектор

    За въпроса с пикселите използвайте нещо, създадено за това, и сравнете резултата с публикувана скара.

Защо плавността е опасна

Детектор, който не е сигурен, връща средна стойност, като самата стойност комуникира несигурността. Езиков модел, който не е сигурен, връща параграф, а параграфите нямат граници на грешката.

Едно и също добре структурирано обяснение се появява независимо дали моделът е идентифицирал нещо реално, или е създал правдоподобно звучащо описание на нищо. Читателите калибрират доверието си според качеството на писането, което е точно сигналът, който тук не носи никаква информация.

Ето защо питането на чатбот е по-лоша отправна точка от това да разгледате снимката сами. Вашата собствена несигурност поне е видима за вас.

Същият проблем при други инструменти

Това всъщност не се отнася само до един продукт. Всяка система, която разсъждава върху изображение семантично, има същия пропуск и няколко инструмента, представяни сега като детектори, правят точно това в дълбочина.

Полезен тест: попитайте какво би докладвал инструментът за снимка на снимка или за изображение без разпознаваем обект изобщо. Пикселният детектор връща резултат и в двата случая, тъй като текстурата съществува независимо от съдържанието. Семантичната система няма върху какво да разсъждава и или ще откаже, или ще измисли нещо.

Втори тест: стартирайте същия файл два пъти. Пикселният модел е детерминиран и връща същия брой. Езиковият модел прави извадки и две изпълнения могат да се разминат. Ако даден инструмент ви дава различни отговори за едни и същи байтове, той не измерва нищо.

Нито един от тестовете не изисква разбиране как работи инструментът. И двата отнемат минута и помежду си те отделят измерването от описанието много по-надеждно от четенето на маркетинг страница.

Въпроси, които хората задават

Може ли ChatGPT да разпознава изображения, генерирани от AI?
Не, не и в измерим смисъл. Той изготвя самоуверено звучаща оценка въз основа на това какво изобразява снимката, а не на това как са направени пикселите. За отговора няма калибриран праг, нито бенчмарк, а задаването на въпроса втори път може да доведе до две различни решения.
Но той беше прав за снимка, която тествах.
Той ще бъде прав често, особено в очевидни случаи, в които и вие щяли да бъдете прави. Проблемът е, че звучи по абсолютно същия начин, когато греши, така че верният отговор не ви дава начин да разберете кой вид сте получили при следващото изображение.
Ами ако го помоля да анализира пикселите?
Той не може. Изображението се преобразува в семантично представяне, преди моделът да разсъждава върху него, и фината текстура, от която зависи детекцията, се губи при това преобразуване. Искането на пикселен анализ води до описание на това как би изглеждал пикселният анализ.
Има ли мултимодални модели, създадени за детекция?
В тази област има изследвания и тя не е това, което прави един общ асистент. Специално създаденият детектор е обучен върху двойки реални и генерирани изображения с калибриран изход; общият модел е обучен да бъде полезен за всичко. Двете неща не са близък заместител.
Трябва ли изобщо да използвам чатбот, когато проверявам изображение?
Да, за описание и разсъждения. Попитайте го какво има в кадъра, дали осветлението е съгласувано и какво би потвърдило или опровергало вашето съмнение. След това използвайте детектор за въпроса с пикселите и пазете двете отговори разделени в съзнанието си.
Защо толкова много хора първо питат чатбот?
Защото той е отворен в друг раздел и винаги отговаря. Удобството побеждава точността, когато цената на грешката е невидима, а при проверката на изображения цената обикновено е невидима, докато някой вече не е действал въз основа на отговора.

Проверете изображение сега

Безплатно, без акаунт и файлът никога не напуска вашето устройство. Петдесет проверки на ден.

Отворете детектора

Продължете четенето