Как GAN строит изображение
Генеративно-состязательная сеть начинает с небольшого вектора и многократно увеличивает его (апсемплинг), удваивая разрешение на каждом слое, пока не достигнет полного размера. Вторая сеть оценивает результат, и обе обучаются в противоборстве.
Повторяющийся апсемплинг — важная часть. Каждый этап удвоения вносит регулярный паттерн, и эти паттерны накапливаются в периодическую структуру, которая видна, если преобразовать изображение в частотную область.
Эта структура была почти как подпись. Ранние детекторы могли искать «шахматный» паттерн в спектре частот и достигать высокой точности, ничего не понимая в самом изображении. Это был отпечаток архитектуры, а не конкретной модели.
Как это делает модель diffusion
Diffusion работает в обратную сторону. Она начинает с поля чистого шума в полном целевом разрешении и на каждом шаге убирает немного шума, руководствуясь тем, чему модель обучилась, пока не проявится изображение.
Здесь нет лестницы апскейлинга, поэтому нет и периодических артефактов. Вывод статистически отличается от снимка камеры, и это отличие диффузно, а не структурно. Ничто в нем не проявляется как четкий паттерн, который можно было бы выявить.
GAN
- Малый вектор, неоднократно увеличенный (апскейлинг)
- Периодические артефакты от каждого удвоения
- Обнаружимы в частотной области
- Архитектура оставляет почти явную сигнатуру
- Доминировал примерно до 2022 года
Диффузия
- Шум удаляется шаг за шагом в полном размере
- Нет лестницы апскейлинга, нет периодического паттерна
- Разница статистическая, а не структурная
- Требуется обученная модель для обнаружения
- Доминирует с 2022 года
Почему старые детекторы перестали работать
Инструмент, созданный для поиска «шахматной доски» в частотной области, ничего не находит в диффузном изображении. Он не сообщает о неопределенности; он сообщает, что артефакт отсутствует, что считывается как чистый результат.
Вот почему точность детектирования в этой области, казалось бы, рухнула в период между 2021 и 2023 годами. Инструменты не стали хуже. То, что они искали, перестало производиться.
Что заменило детектирование, специфичное для архитектуры
Широта охвата. Вместо поиска одного артефакта текущие детекторы обучаются на выходных данных как можно большего числа различных генераторов, чтобы модель усвоила, что общего у синтетической текстуры, а не то, что производит одно семейство.
Используемая здесь модель была обучена на миллионах изображений из тысяч генераторов именно по этой причине. Охват различных архитектур — это то, что обеспечивает обобщение на следующую, и это единственный подход, который пережил смену доминирующего метода.
Компромисс заключается в том, что точность на любом отдельном известном генераторе ниже, чем у специализированного детектора. Это правильный компромисс, потому что специалист бесполезен в тот день, когда появляется что-то новое.
Что это предсказывает
Урок перехода от GAN к диффузии заключается не в самой диффузии. Он в том, что любой детектор, привязанный к тому, как изображения создаются в данный момент, имеет ограниченный срок жизни, и этот переход не будет анонсирован заранее.
| Подход | Работал на | Перестал работать, когда |
|---|---|---|
| Поиск частотных артефактов | GAN | Появилась диффузия |
| Анализ лиц | Ранние замены лиц | Появилась генерация целых сцен |
| Проверка метаданных | Файлы напрямую из инструмента | Платформы удаляли метаданные |
| Анализ уровня ошибок (ELA) | JPEG с одним сохранением | Изображения начали перемещаться |
| Широкое обучение на множестве генераторов | Большинство текущих выходных данных | Неизвестно, позже остальных |
Важно ли это для пользователя
В основном это объясняет две вещи, которые вы заметите. Во-первых, почему детектор обычно не может назвать инструмент, который создал изображение: он считывает общее статистическое свойство, а не отпечаток конкретной модели.
Во-вторых, почему старые бесплатные чекеры работают плохо. Некоторые инструменты, всё ещё находящиеся онлайн, были построены вокруг артефактов GAN и не были переобучены. Они выдают уверенные чистые результаты на текущих данных, и в интерфейсе нет объяснения почему.
Что делает гибридный конвейер с результатом
Большинство изображений, которые доходят до вас, не были созданы одним методом. Диффузионная модель генерирует базу, апскейлер на базе GAN увеличивает её, проход восстановления лиц исправляет глаза, а редактор кадрирует и пересохраняет результат.
Каждый этап перезаписывает текстуру, поэтому файл несет следы нескольких процессов, наложенных друг на друга. Последний, кто коснулся изображения, обычно доминирует в том, что считывает детектор, поэтому увеличенное диффузное изображение статистически может выглядеть больше как апскейлер, чем как генератор.
Это практическая причина, по которой идентификация архитектуры не работает вне лаборатории. В контролируемом тесте с чистым выводом одной модели это решаемая проблема. Для изображения, которое прошло через реальный производственный конвейер, вопрос поставлен некорректно.
Это также объясняет результат, который сбивает людей с толку: подлинно сгенерированное изображение, которое получает оценку ниже, чем сильно увеличенная фотография. У обоих текстура была перезаписана программным обеспечением, и детектор считывает перезапись, а не происхождение.