← Все руководства Точность

Почему ИИ-детекторы не согласны друг с другом по одному и тому же изображению

Пропустите одну картинку через четыре инструмента и получите четыре ответа. Причины структурны, и знание их поможет понять, какому результату верить.

· 7 мин чтения · Best AI Image Detector

Разные обучающие данные, разные линии решений и разные определения того, что считается ИИ. Два инструмента могут одинаково считать изображение и при этом выдавать противоположные вердикты.

Четыре причины различия результатов

Балл — это конец длинной цепочки решений. Измените любое звено, и цифра сдвинется, хотя с самим изображением ничего не произошло.

  1. Разные обучающие данные. Детектор распознает то, что видел. Тот, что обучен на тысячах открытых генераторов, хорошо справляется с необычными моделями. Тот, что обучен на четырех крупнейших коммерческих инструментах, лучше справляется с ними, а с остальным — хуже.
  2. Разные линии решений. Один инструмент называет подозрительным результат 60, другой — 75. Одно и то же значение пересекает один порог и не пересекает другой, поэтому вы получаете два вердикта по одному измерению.
  3. Разные определения. Некоторые инструменты учитывают любое участие генеративного ИИ, включая апскейл или генеративное заполнение. Другие помечают только полностью синтетические кадры. Ретушированный портрет для первого — ИИ, для второго — оригинал.
  4. Разная предварительная обработка. Инструменты меняют размер, обрезают и перекодируют изображение перед оценкой. Детектор, считывающий квадрат 224 пикселя в центре, видит другую картину, нежели тот, что читает 384 пикселя всего кадра.
Одна и та же фотография, оцененная четырьмя способами
Инструмент А, линия на 50
61
Инструмент B, линия на 65
58
Инструмент C, только по всему кадру
34
Инструмент D, учитывает любую правку
88

Иллюстративные данные, показывающие типичный разброс для сильно обработанной, но подлинной фотографии.

Одно изображение, четыре инструмента. Здесь нет неисправности: каждый сообщает то, что показывает его собственная шкала.

Инструмент D не более чувствителен, чем другие. Он отвечает на более широкий вопрос. Если вас беспокоит, был ли снимок постановочным, D преувеличивает. Если вас волнует, касался ли файла какой-либо ИИ, D — единственный, кто отвечает на ваш вопрос.

Спрашивайте, на какой вопрос отвечает каждый инструмент

Три вопроса, которые люди подразумевают под «это ИИ?»
ВопросЧто его помечаетТипичное использование
Был ли этот кадр сгенерирован с нуля?Синтетическая текстура всего кадраНовости, объявления на маркетплейсах, профили знакомств
Была ли какая-то часть отредактирована ИИ?Один регион выше линииСтрахование, претензии, проверка доказательств
Касался ли этот файл ИИ вообще?Апскейл, шумоподавление, генеративное заполнениеСтоки, правила конкурсов

Большинство разногласий между инструментами — это на самом деле спор о том, какой из этих трех вопросов вы задали. Перед сравнением результатов решите, какой вопрос важен для вас, затем оценивайте каждый инструмент исходя из него.

Как правильно сравнить два результата

  1. Подайте в оба инструмента идентичный файл

    Не повторно скачанный, не скриншот, не копия из чата. Разные байты — это разные изображения, и они законно будут оцениваться по-разному.

  2. Сравнивайте диапазоны, а не цифры

    61 на шкале с линией 50 и 58 на шкале с линией 65 расходятся в вердикте, но согласны в оценке.

  3. Ищите опубликованный порог

    Инструмент, который не говорит, где проходит его линия, нельзя ни с чем сравнивать. Воспринимайте число как неинтерпретируемое, а не как доказательство.

  4. Предпочитайте инструмент, который показывает свою работу

    Карта регионов, именованный диапазон и заявленный бенчмарк позволяют проверить логику. Уверенная метка без обоснования — нет.

  5. Воспринимайте совпадение как сильный сигнал

    Два независимых инструмента, указывающих на один диапазон, значат больше, чем любой из них по отдельности. Если они не согласны — это значит неопределенность, а не необходимость искать среднее арифметическое.

Когда разногласие — это и есть ответ

Стоит научиться узнавать один паттерн. Инструмент, который показывает низкий балл для всего кадра, в сочетании с тем, который показывает высокий, часто означает, что изображение — настоящая фотография с локальным редактированием.

Первый инструмент усредняет правку по почти подлинному кадру. Второй взвешивает самый сильный регион. Оба правы в том, что измерили, и само разногласие рассказало вам больше, чем любая цифра.

11 14 9 13 89 12 10 8 15

Один фрагмент над линией решения внутри «холодного» кадра. Ни одна цифра не передаст этого.

Региональный вид разрешает спор. Среднее значение этих фрагментов по всему кадру — 24, что выглядит как «чистый» результат; карта показывает, почему это вводит в заблуждение.

Что заставило бы детекторы согласиться

Общий бенчмарк, опубликованные линии решений и согласованное определение того, что считается ИИ, устранили бы большую часть разброса. Ничего из этого пока не существует, и нет коммерческого давления для их создания, потому что инструмент, публикующий свои слабости, выглядит хуже, чем тот, что этого не делает.

Пока это не изменится, воспринимайте каждый балл как результат личной шкалы. Читайте доказательства, которые показывает инструмент, и придавайте этому больше значения, чем уверенности в его метке.

Проблема версий, о которой никто не говорит

Детектор — это не неизменная вещь. Разработчики переобучают модели, меняют пороги и заменяют модели без уведомления, и почти никто из них не указывает версию своего вывода. Балл, полученный в марте, и балл, полученный сегодня, могут прийти из разных моделей с разной калибровкой.

Это важно, если вы фиксируете результаты. Дело о претензии, лог модерации или академический случай, ссылающийся на балл восемнадцатимесячной давности, цитирует измерение, инструмент для которого больше не существует. Его невозможно воспроизвести и нельзя проверить, что оно означало в то время.

Если вы храните результаты, сохраняйте и данные, на основе которых они получены: оценки областей, диапазон, пороговое значение и дату. Они остаются понятными даже после того, как лежащая в их основе модель устареет, чего нельзя сказать о простом процентном показателе.

Вопросы пользователей

Если два детектора показывают разный результат, какому из них верить?
Тому, который показывает логику своих рассуждений. Опубликованная пороговая линия, указанный диапазон и карта областей позволяют проверить, имеет ли смысл полученное для вашего изображения значение. Простой процентный показатель от инструмента, который не поясняет его значение, не является доказательством, какой бы убедительной ни казалась его уверенность.
Дает ли более точный ответ использование нескольких детекторов?
Только если вы заранее решите, как их взвешивать. Согласие трех инструментов действительно весомее, чем одного. Шесть инструментов, из которых два согласны с вашим мнением, — это то, как люди убеждают себя в заранее сделанном выводе.
Почему один инструмент называет мое отредактированное фото ИИ-генерацией, а другой — реальным?
Они отвечают на разные вопросы. Инструмент, который учитывает любое использование генеративных технологий, помечает генеративное заполнение или масштабирование. Инструмент, который ищет только полностью синтетические кадры, этого не делает. Ни один из них не ошибается; проверьте, какое определение использует каждый из них.
Могут ли оба детектора быть правы?
Да, это часто случается. Разные пороги означают, что одно и то же измерение дает разные вердикты, а разные обучающие наборы означают объективно разные показатели для необычного изображения. Значение имеет согласие в диапазоне, а не совпадение цифр.