Два пути
Детектор проводит две независимые проверки, и они отвечают на разные вопросы. Разделение этих проверок — самая полезная идея на этой странице.
Анализ пикселей
- Работает после скриншотов и сжатия
- Возвращает вероятность, а не идентификацию
- Агностичен к генератору по дизайну
- Не может назвать инструмент
- Снижает точность при встрече с неизвестными архитектурами
Доказательства в файле
- Может точно назвать инструмент
- Криптографически защищен при подписи
- Удаляется почти каждой платформой
- Отсутствует в большинстве изображений
- Легко удаляется преднамеренно
Что может декларировать файл
Когда изображение все еще сохраняет свою исходную структуру, могут присутствовать несколько видов маркеров. Каждый из них — это заявление программного обеспечения, которое его создало, а не что-то производное от пикселей.
- Content Credentials. Подписанный манифест с указанием инструмента и того, что он сделал. Некоторые крупные генераторы теперь подписывают свои выходные данные, что является сильнейшей формой подтверждения.
- Параметры генерации. Многие инструменты с открытым исходным кодом встраивают промпт, сид, сэмплер и имя модели прямо в файл, что дает больше информации, чем ожидают большинство пользователей.
- Идентификаторы программного обеспечения. Поле обычных метаданных с указанием приложения, которое последним сохранило изображение.
- Декларируемые водяные знаки AI. Флаг, указывающий на применение невидимого водяного знака — это декларация, а не сам водяной знак.
- Утверждения о захвате камерой. Противоположное заявление, сделанное подписывающей камерой, что файл был получен с сенсора.
Все это исчезает в тот момент, когда изображение загружается на любую платформу. Вот почему сканирование файла стоит запускать, но на него никогда не стоит полагаться: когда оно что-то находит, это сильное доказательство, но в большинстве случаев оно ничего не находит.
Почему трудно назвать генератор
Кажется, что это должно быть возможно. Разные инструменты создают разную эстетику, и человек, который много с ними работает, часто может угадать верно. Эта интуиция не переносится на детектор по трем причинам.
Модели разделяют архитектуры и данные обучения, поэтому их статистические отпечатки сильно перекрываются. Многие инструменты — это дообученные версии одной базы, что делает их почти неразличимыми на уровне текстур, даже если их результаты выглядят по-разному для человека.
Результаты также проходят постобработку. Масштабирование, восстановление лиц и редактирование происходят после генерации и полностью переписывают текстуру, от которой зависела бы идентификация. К моменту публикации изображения в нем может быть больше от апскейлера, чем от генератора.
И цель постоянно меняется. Любая модель идентификации — это таблица существующих вещей, что делает ее бесполезной для всего, что вышло после ее обучения, причем это происходит незаметно, а не очевидно.
Что на самом деле означает хорошее покрытие
Полезный вопрос о детекторе — не то, какие генераторы он распознает по имени. А то, насколько широким было обучение, потому что широта — это то, что прогнозирует производительность на моделях, которые еще не вышли.
| Подход | Сила | Слабость |
|---|---|---|
| Обучение на нескольких крупных коммерческих инструментах | Высокая точность на этих инструментах | Плохая обобщаемость на все остальное |
| Обучение на тысячах генераторов | Обобщается на неизвестные модели | Более низкая пиковая точность на каждом из них |
| Поиск артефакта одной архитектуры | Очень высокая эффективность, пока это работает | Полный провал при смене метода |
| Чтение только маркеров файла | Точно, когда присутствует | Слеп на большинстве изображений |
Второй ряд — это подход, используемый здесь, и выбор был преднамеренным. Детектор, который отлично работает на четырех продуктах и бесполезен на пятом, мало полезен для проверки изображения, которое кто-то вам прислал.
О названиях продуктов
Списки поддерживаемых генераторов — это скорее маркетинговый ход, чем технический. У пиксельной модели нет списка; у нее есть распределение при обучении. Называние продуктов подразумевает возможности для каждого конкретного инструмента, которых у широкого детектирования нет и которые ему не нужны.
Если имя и появляется здесь в результате, оно взято из файла, а не из пикселей, и результат прямо об этом говорит. На этом различии стоит настаивать при работе с любым инструментом.
Как читать заявления об охвате
Поставщики описывают охват способами, которые звучат сравнимо, но таковыми не являются. Три формулировки встречаются постоянно, и каждая означает разное.
Обнаруживает изображения из X, Y и Z обычно означает, что бенчмарк содержал эти три. Это утверждение о тестировании, а не о возможностях, и оно ничего не говорит о четвертом генераторе.
Поддерживает более сорока генераторов обычно означает, что набор для обучения был взят из такого количества источников. Это более значимо, так как широта обучения прогнозирует обобщаемость, но это все еще не гарантия для какого-либо конкретного инструмента.
Определение исходной модели — самая сложная задача. Различайте, получена ли эта информация из файла или из пикселей. Если из пикселей, уточняйте точность определения отдельно от точности обнаружения, поскольку это совершенно разные показатели.