Четыре причины различия результатов
Балл — это конец длинной цепочки решений. Измените любое звено, и цифра сдвинется, хотя с самим изображением ничего не произошло.
- Разные обучающие данные. Детектор распознает то, что видел. Тот, что обучен на тысячах открытых генераторов, хорошо справляется с необычными моделями. Тот, что обучен на четырех крупнейших коммерческих инструментах, лучше справляется с ними, а с остальным — хуже.
- Разные линии решений. Один инструмент называет подозрительным результат 60, другой — 75. Одно и то же значение пересекает один порог и не пересекает другой, поэтому вы получаете два вердикта по одному измерению.
- Разные определения. Некоторые инструменты учитывают любое участие генеративного ИИ, включая апскейл или генеративное заполнение. Другие помечают только полностью синтетические кадры. Ретушированный портрет для первого — ИИ, для второго — оригинал.
- Разная предварительная обработка. Инструменты меняют размер, обрезают и перекодируют изображение перед оценкой. Детектор, считывающий квадрат 224 пикселя в центре, видит другую картину, нежели тот, что читает 384 пикселя всего кадра.
Инструмент D не более чувствителен, чем другие. Он отвечает на более широкий вопрос. Если вас беспокоит, был ли снимок постановочным, D преувеличивает. Если вас волнует, касался ли файла какой-либо ИИ, D — единственный, кто отвечает на ваш вопрос.
Спрашивайте, на какой вопрос отвечает каждый инструмент
| Вопрос | Что его помечает | Типичное использование |
|---|---|---|
| Был ли этот кадр сгенерирован с нуля? | Синтетическая текстура всего кадра | Новости, объявления на маркетплейсах, профили знакомств |
| Была ли какая-то часть отредактирована ИИ? | Один регион выше линии | Страхование, претензии, проверка доказательств |
| Касался ли этот файл ИИ вообще? | Апскейл, шумоподавление, генеративное заполнение | Стоки, правила конкурсов |
Большинство разногласий между инструментами — это на самом деле спор о том, какой из этих трех вопросов вы задали. Перед сравнением результатов решите, какой вопрос важен для вас, затем оценивайте каждый инструмент исходя из него.
Как правильно сравнить два результата
-
Подайте в оба инструмента идентичный файл
Не повторно скачанный, не скриншот, не копия из чата. Разные байты — это разные изображения, и они законно будут оцениваться по-разному.
-
Сравнивайте диапазоны, а не цифры
61 на шкале с линией 50 и 58 на шкале с линией 65 расходятся в вердикте, но согласны в оценке.
-
Ищите опубликованный порог
Инструмент, который не говорит, где проходит его линия, нельзя ни с чем сравнивать. Воспринимайте число как неинтерпретируемое, а не как доказательство.
-
Предпочитайте инструмент, который показывает свою работу
Карта регионов, именованный диапазон и заявленный бенчмарк позволяют проверить логику. Уверенная метка без обоснования — нет.
-
Воспринимайте совпадение как сильный сигнал
Два независимых инструмента, указывающих на один диапазон, значат больше, чем любой из них по отдельности. Если они не согласны — это значит неопределенность, а не необходимость искать среднее арифметическое.
Когда разногласие — это и есть ответ
Стоит научиться узнавать один паттерн. Инструмент, который показывает низкий балл для всего кадра, в сочетании с тем, который показывает высокий, часто означает, что изображение — настоящая фотография с локальным редактированием.
Первый инструмент усредняет правку по почти подлинному кадру. Второй взвешивает самый сильный регион. Оба правы в том, что измерили, и само разногласие рассказало вам больше, чем любая цифра.
Один фрагмент над линией решения внутри «холодного» кадра. Ни одна цифра не передаст этого.
Что заставило бы детекторы согласиться
Общий бенчмарк, опубликованные линии решений и согласованное определение того, что считается ИИ, устранили бы большую часть разброса. Ничего из этого пока не существует, и нет коммерческого давления для их создания, потому что инструмент, публикующий свои слабости, выглядит хуже, чем тот, что этого не делает.
Пока это не изменится, воспринимайте каждый балл как результат личной шкалы. Читайте доказательства, которые показывает инструмент, и придавайте этому больше значения, чем уверенности в его метке.
Проблема версий, о которой никто не говорит
Детектор — это не неизменная вещь. Разработчики переобучают модели, меняют пороги и заменяют модели без уведомления, и почти никто из них не указывает версию своего вывода. Балл, полученный в марте, и балл, полученный сегодня, могут прийти из разных моделей с разной калибровкой.
Это важно, если вы фиксируете результаты. Дело о претензии, лог модерации или академический случай, ссылающийся на балл восемнадцатимесячной давности, цитирует измерение, инструмент для которого больше не существует. Его невозможно воспроизвести и нельзя проверить, что оно означало в то время.
Если вы храните результаты, сохраняйте и данные, на основе которых они получены: оценки областей, диапазон, пороговое значение и дату. Они остаются понятными даже после того, как лежащая в их основе модель устареет, чего нельзя сказать о простом процентном показателе.