← Все руководства Принцип работы

Diffusion против GAN: почему детекторы работают с ними по-разному

Два способа построения изображения — два разных «отпечатка». Что оставляет после себя каждый процесс, почему GAN было проще распознать и что это говорит о будущем.

· 8 мин чтения · Best AI Image Detector

GAN оставляют повторяющийся артефакт при апсемплинге, который является почти подписью. Модели diffusion — нет, именно поэтому обнаружение стало сложнее в 2022 году, и поэтому узкоспециализированные методы перестали работать.

Как GAN строит изображение

Генеративно-состязательная сеть начинает с небольшого вектора и многократно увеличивает его (апсемплинг), удваивая разрешение на каждом слое, пока не достигнет полного размера. Вторая сеть оценивает результат, и обе обучаются в противоборстве.

Повторяющийся апсемплинг — важная часть. Каждый этап удвоения вносит регулярный паттерн, и эти паттерны накапливаются в периодическую структуру, которая видна, если преобразовать изображение в частотную область.

Эта структура была почти как подпись. Ранние детекторы могли искать «шахматный» паттерн в спектре частот и достигать высокой точности, ничего не понимая в самом изображении. Это был отпечаток архитектуры, а не конкретной модели.

Как это делает модель diffusion

Diffusion работает в обратную сторону. Она начинает с поля чистого шума в полном целевом разрешении и на каждом шаге убирает немного шума, руководствуясь тем, чему модель обучилась, пока не проявится изображение.

Здесь нет лестницы апскейлинга, поэтому нет и периодических артефактов. Вывод статистически отличается от снимка камеры, и это отличие диффузно, а не структурно. Ничто в нем не проявляется как четкий паттерн, который можно было бы выявить.

GAN

  • Малый вектор, неоднократно увеличенный (апскейлинг)
  • Периодические артефакты от каждого удвоения
  • Обнаружимы в частотной области
  • Архитектура оставляет почти явную сигнатуру
  • Доминировал примерно до 2022 года

Диффузия

  • Шум удаляется шаг за шагом в полном размере
  • Нет лестницы апскейлинга, нет периодического паттерна
  • Разница статистическая, а не структурная
  • Требуется обученная модель для обнаружения
  • Доминирует с 2022 года
Два процесса и то, что каждый из них оставляет после себя. Правый столбец показывает, почему детектирование пришлось создавать заново.

Почему старые детекторы перестали работать

Инструмент, созданный для поиска «шахматной доски» в частотной области, ничего не находит в диффузном изображении. Он не сообщает о неопределенности; он сообщает, что артефакт отсутствует, что считывается как чистый результат.

Вот почему точность детектирования в этой области, казалось бы, рухнула в период между 2021 и 2023 годами. Инструменты не стали хуже. То, что они искали, перестало производиться.

Что заменило детектирование, специфичное для архитектуры

Широта охвата. Вместо поиска одного артефакта текущие детекторы обучаются на выходных данных как можно большего числа различных генераторов, чтобы модель усвоила, что общего у синтетической текстуры, а не то, что производит одно семейство.

Используемая здесь модель была обучена на миллионах изображений из тысяч генераторов именно по этой причине. Охват различных архитектур — это то, что обеспечивает обобщение на следующую, и это единственный подход, который пережил смену доминирующего метода.

Компромисс заключается в том, что точность на любом отдельном известном генераторе ниже, чем у специализированного детектора. Это правильный компромисс, потому что специалист бесполезен в тот день, когда появляется что-то новое.

Что это предсказывает

Урок перехода от GAN к диффузии заключается не в самой диффузии. Он в том, что любой детектор, привязанный к тому, как изображения создаются в данный момент, имеет ограниченный срок жизни, и этот переход не будет анонсирован заранее.

Как менялось каждое поколение детектирования
ПодходРаботал наПерестал работать, когда
Поиск частотных артефактовGANПоявилась диффузия
Анализ лицРанние замены лицПоявилась генерация целых сцен
Проверка метаданныхФайлы напрямую из инструментаПлатформы удаляли метаданные
Анализ уровня ошибок (ELA)JPEG с одним сохранениемИзображения начали перемещаться
Широкое обучение на множестве генераторовБольшинство текущих выходных данныхНеизвестно, позже остальных

Важно ли это для пользователя

В основном это объясняет две вещи, которые вы заметите. Во-первых, почему детектор обычно не может назвать инструмент, который создал изображение: он считывает общее статистическое свойство, а не отпечаток конкретной модели.

Во-вторых, почему старые бесплатные чекеры работают плохо. Некоторые инструменты, всё ещё находящиеся онлайн, были построены вокруг артефактов GAN и не были переобучены. Они выдают уверенные чистые результаты на текущих данных, и в интерфейсе нет объяснения почему.

Что делает гибридный конвейер с результатом

Большинство изображений, которые доходят до вас, не были созданы одним методом. Диффузионная модель генерирует базу, апскейлер на базе GAN увеличивает её, проход восстановления лиц исправляет глаза, а редактор кадрирует и пересохраняет результат.

Каждый этап перезаписывает текстуру, поэтому файл несет следы нескольких процессов, наложенных друг на друга. Последний, кто коснулся изображения, обычно доминирует в том, что считывает детектор, поэтому увеличенное диффузное изображение статистически может выглядеть больше как апскейлер, чем как генератор.

Это практическая причина, по которой идентификация архитектуры не работает вне лаборатории. В контролируемом тесте с чистым выводом одной модели это решаемая проблема. Для изображения, которое прошло через реальный производственный конвейер, вопрос поставлен некорректно.

Это также объясняет результат, который сбивает людей с толку: подлинно сгенерированное изображение, которое получает оценку ниже, чем сильно увеличенная фотография. У обоих текстура была перезаписана программным обеспечением, и детектор считывает перезапись, а не происхождение.

Вопросы пользователей

Легче ли обнаружить GAN-изображения, чем диффузионные?
Было легче, и их сейчас гораздо меньше. Апскейлинг GAN оставлял периодический артефакт, который мог найти простой частотный анализ. Диффузия не оставляет эквивалентной структуры, поэтому обнаружение требует обученной модели, считывающей статистическую текстуру, а не целенаправленного поиска одного паттерна.
Может ли детектор сказать мне, пришло ли изображение из GAN или из диффузионной модели?
В общем случае, нет, не по пикселям. Детектор широкого профиля сообщает, насколько вероятно участие генеративных методов, а не какое именно семейство их произвело. Идентификация архитектуры — это отдельная исследовательская задача, и она значительно менее надежна, чем детектирование.
Используются ли до сих пор GAN?
Да, в конкретных областях. Они остаются быстрыми и эффективными для узких задач, таких как синтез лиц и некоторые виды апскейлинга, где диффузия работала бы медленнее. Некоторые инструменты используют оба метода на разных этапах, что означает, что изображение может нести следы любого из них.
Сломает ли следующая архитектура детектирование снова?
Она снизит точность, а не сломает её, что и является улучшением, полученным благодаря широкому обучению. Модель, которая усвоила, что общего у синтетической текстуры у тысяч генераторов, деградирует постепенно при появлении чего-то нового, в то время как детектор одного артефакта отказывает полностью.
Почему некоторые инструменты всё ещё заявляют об очень высокой точности?
Обычно потому, что они проводят замеры на тестовом наборе, собранном из генераторов, на которых они обучались. Эта цифра реальна, но она не описывает производительность на модели, выпущенной в прошлом месяце. Спрашивайте, какие генераторы были в бенчмарке, прежде чем сравнивать цифры между инструментами.
Влияет ли это на то, как мне следует воспринимать результат?
Только в одном случае. Относитесь к чистому результату на изображении, в котором у вас есть и другие причины сомневаться, как к более слабому доказательству, чем к помеченному результату, потому что режим отказа для неизвестной архитектуры — это уверенно низкий балл, а не неопределенный.

Проверить изображение сейчас

Бесплатно, без учетной записи, файл никогда не покидает ваше устройство. Пятьдесят проверок в день.

Открыть детектор

Читать далее