← Всички ръководства Под капака

Diffusion срещу GAN: защо детекторите ги третират различно

Два начина за изграждане на изображение, два различни отпечатка. Какво оставя след себе си всеки процес, защо GAN бяха по-лесни за улавяне и какво предсказва това за следващото.

· 8 мин. четене · Best AI Image Detector

GAN оставят повтарящ се артефакт от мащабирането нагоре, който е почти подписа им. Diffusion моделите не го правят, поради което детекцията стана по-трудна през 2022 г. и триковете, специфични за архитектурата, спряха да работят.

Как GAN изгражда изображение

Генеративната състезателна мрежа започва от малък вектор и го мащабира многократно нагоре, удвоявайки резолюцията на всеки слой, докато достигне пълен размер. Втора мрежа оценява резултата и двете се обучават една срещу друга.

Помраченото мащабиране нагоре е важната част. Всяка стъпка на удвояване въвежда редовен модел и тези модели се натрупват в периодична структура, която е видима, когато изображението се трансформира във честотната област.

Тази структура бе близка до подпис. Ранните детектори можеха да търсят шахов модел във честотния спектър и да постигнат висока точност, без да разбират нищо за снимката. Това беше отпечатък на архитектурата, а не на конкретен модел.

Как diffusion моделът изгражда такова

Diffusion работи по обратния начин. Започва с поле от чист шум с пълна целева резолюция и премахва малка част от него на всяка стъпка, водено от наученото от модела, докато се появи изображение.

Няма стълбица на мащабиране, затова няма и периодични артефакти. Изходните данни се различават статистически от кадър, заснет с камера, като разликата е по-скоро дифузна, отколкото структурна. Нищо в тях не се проявява като ясен шаблон, който да можете да потърсите.

GAN

  • Малък вектор, мащабиран многократно
  • Периодични артефакти от всяко удвояване
  • Откриваеми във честотната област
  • Архитектурата оставя близък до подписа отпечатък
  • Доминиращ до около 2022 г.

Дифузия

  • Шумът се премахва стъпка по стъпка в пълен размер
  • Без стълбица на мащабиране, без периодичен шаблон
  • Разликата е статистическа, а не структурна
  • Изисква се обучен модел за откриване
  • Доминиращ от 2022 г. насам
Двата процеса и какво оставя всеки от тях. Дясната колона показва защо се е наложило детекторите да бъдат създадени наново.

Защо по-старите детектори спряха да работят

Инструмент, създаден да открива карирани структури във честотната област, не открива нищо в изображение, създадено чрез дифузия. Той не отчита несигурност; той съобщава, че артефактът отсъства, което се тълкува като чист резултат.

Това е причината точността на детекцията в цялата област да изглежда сякаш се е сринала между 2021 и 2023 г. Инструментите не се бяха влошили. Това, което те търсеха, бе спряло да се произвежда.

Какво замени детекцията, специфична за дадена архитектура

Широта. Вместо да търсят един артефакт, съвременните детектори се обучават на изходни данни от възможно най-много различни генератори, така че моделът да научи какво е общото в синтетичната текстура, вместо какво произвежда едно конкретно семейство.

Използваният тук модел е обучен на милиони изображения от хиляди генератори точно поради тази причина. Покритието между различните архитектури е това, което осигурява обобщаването за следващата, и това е единственият подход, който е оцелял след промяната на доминиращия метод.

Компромисът е, че точността за всеки отделен известен генератор е по-ниска, отколкото би постигнал специализиран детектор. Това е правилният компромис, тъй като специализираният инструмент е безполезен в деня, когато се появи нещо ново.

Какво прогнозира това

Урокът от прехода от GAN към дифузия не е свързан с дифузията. Той се състои в това, че всеки детектор, обвързан с начина, по който в момента се създават изображенията, има ограничен живот и преходът няма да бъде обявен предварително.

Как остаря всяко поколение детекция
ПодходРаботи приПроваля се, когато
Търсене на честотни артефактиGAN моделиПоявява се дифузията
Специфичен анализ на лицаРанни размени на лицаПоявява се генерирането на цели сцени
Проверка на метаданниФайлове директно от инструментПлатформите премахват метаданните
Анализ на ниво грешкиJPEG файлове с едно запазванеИзображенията започнаха да пътуват
Широко обучение с много генераториПовечето съвременни изходни данниНеизвестно и по-късно от другите

Има ли значение всичко това за потребителя

Най-общо казано, то обяснява две неща, които ще забележите. Първо, защо детекторът обикновено не може да назове кой инструмент е произвел изображението: той разчита общо статистическо свойство, а не пръстов отпечатък на конкретен модел.

Второ, защо по-старите безплатни проверки се представят зле. Няколко все още активни онлайн инструмента са изградени около артефакти от GAN и не са били преобучавани. Те връщат уверени чисти резултати за актуалните изходни данни и нищо в интерфейса не обяснява защо.

Какво прави хибридният конвейер с даден резултат

Повечето изображения, които стигат до вас, не са създадени с един единствен метод. Дифузионният модел генерира основата, мащабиращ инструмент на базата на GAN я увеличава, стъпката за възстановяване на лица оправя очите, а редакторът изрязва и записва резултата наново.

Всеки етап пренаписва текстурата, така че файлът носи следи от няколко процеса, насложени един върху друг. Последният етап, който докосва изображението, обикновено доминира над това, което чете детекторът, поради което мащабираното дифузионно изображение може да изглежда статистически по-близко до мащабиращия инструмент, отколкото до генератора.

Това е практическата причина идентификацията на архитектурата да не работи извън лабораторни условия. При контролиран тест с чисти изходни данни от един модел това е разрешим проблем. При изображение, минало през реален производствен конвейер, въпросът не е поставен правилно.

Това обяснява и един резултат, който хората намират за объркващ: наистина генерирано изображение, което получава по-нисък резултат от силно мащабирана фотография. И на двете текстурата е пренаписана от софтуер и детекторът чете пренаписването, а не произхода.

Въпроси, които хората задават

Дали GAN изображенията се откриват по-лесно от дифузионните?
Те бяха такива и сега от тях има далеч по-малко. GAN мащабирането оставяше периодичен артефакт, който обикновеният честотен анализ можеше да открие. Дифузията не оставя еквивалентна структура, затова детекцията изисква обучен модел, който чете статистическа текстура, вместо целенасочено търсене на един шаблон.
Може ли детекторът да ми каже дали изображението е от GAN или от дифузионен модел?
По принцип не от пикселите. Широкият детектор отчита доколко е вероятно да е участвало нещо генеративно, а не кое семейство го е произвело. Идентификацията на архитектурата е отделен изследователски проблем и тя е значително по-ненадеждна от детекцията.
Използват ли се все още GAN моделите?
Да, на определени места. Те остават бързи и ефективни за тесни задачи като синтез на лица и някои видове мащабиране, където дифузията би била по-бавна. Някои инструменти използват и двете на различни етапи, което означава, че едно изображение може да носи следи от всяко от тях.
Ще счупи ли следващата архитектура детекцията отново?
Това ще намали точността, вместо да я счупи, което е подобрението, осигурено от широкото обучение. Модел, който е научил какво е общото между синтетичните текстури в хиляди генератори, се влошава постепенно спрямо нещо ново, докато детекторът за единични артефакти се проваля напълно.
Защо някои инструменти все още твърдят, че имат много висока точност?
Обикновено защото измерват върху тестови набор, изграден от генератори, на които са били обучени. Тази цифра е реална, но тя не описва производителността спрямо модела, пуснат миналия месец. Попитайте кои генератори са били в бенчмарка, преди да сравнявате стойности между инструментите.
Влияе ли това на начина, по който трябва да тълкувам резултата?
Само в едно отношение. Третирайте чистия резултат за изображение, което имате други причини да се съмнявате, като по-слабо доказателство в сравнение с маркирания резултат, тъй като режимът на отказ при непозната архитектура е уверен нисък резултат, а не несигурен.

Проверете изображение сега

Безплатно, без акаунт и файлът никога не напуска вашето устройство. Петдесет проверки на ден.

Отворете детектора

Продължете четенето