← Все руководства Сравнение

Может ли ChatGPT определить, является ли изображение сгенерированным ИИ?

Он даст вам уверенный ответ без каких-либо оснований. Почему языковые модели не могут этого сделать, что они на самом деле делают и что использовать вместо них.

· 7 мин чтения · Best AI Image Detector

Нет. Языковая модель описывает, как выглядит изображение, и рассуждает о нем словами. У нее нет откалиброванного порога, нет эталона и нет доступа к статистике пикселей, от которой зависит детекция.

Что на самом деле делает чат-бот

Мультимодальная языковая модель преобразует изображение в семантическое описание, а затем рассуждает об этом описании в тексте. Она отвечает на вопрос: похоже ли это изображение на ИИ-изображения, о которых я читала во время обучения.

Это вопрос о содержании и композиции. Детекция — это вопрос о текстуре: как соотносятся значения соседних пикселей в масштабе, гораздо меньшем, чем тот, который сохраняет семантическое описание.

Информация, которую считывает детектор, отбрасывается до того, как языковая модель начинает думать. Дело не в том, что чат-боты плохи в этом. Они работают с представлением, которое не содержит доказательств.

К чему это приводит на практике

  • Уверенные ответы без порога. Чат-бот скажет «вероятно, сгенерировано ИИ» без какой-либо шкалы, стоящей за словом «вероятно». Нет числа, нет диапазона и не с чем сравнивать другое изображение.
  • Рассуждения на основе устаревших признаков. Модели ссылаются на пальцы, зубы, восковую кожу и искаженный текст, потому что именно это написано в обучающем тексте. Эти проблемы были исправлены годы назад.
  • Согласие с вашей формулировкой. Спросите, является ли изображение поддельным, и вы скорее услышите «да», чем если бы спросили нейтрально. Это свойство интерфейса, а не картинки.
  • Нет воспроизводимости. Спросите дважды, и вы можете получить два разных ответа об одном и том же файле с одинаково уверенными объяснениями для каждого.
  • Нет информации о регионах. Он не может сказать вам, что один угол фотографии ведет себя иначе, чем остальные, а именно этот вывод обычно и имеет значение.
Возможности Чат-бот Пиксельный детектор
Считывает текстуру на уровне пикселей No Yes
Откалиброванная оценка с опубликованными диапазонами No Yes
Одинаковый ответ каждый раз No Yes
Разбивка по регионам No Yes
Измеряется по эталону No Yes
Объясняет свои рассуждения прозой Yes бегло Partly как сигналы
Описывает, что находится на снимке Yes No
Что на самом деле может выдать каждый подход. Средний столбец — это тот, который люди ошибочно принимают за правый.

Последние две строки стоят того, чтобы их запомнить. Языковая модель действительно хорошо описывает изображение и рассуждает о том, насколько логична сцена. Это полезные навыки, но не обнаружение.

В чем чат-бот действительно полезен

Полностью отказываться от этого инструмента — неправильный вывод. Если использовать его по назначению, он дополняет детектор, а не заменяет его.

  1. Попросите описать сцену в деталях

    Тщательное описание часто выявляет то, что вы не заметили осознанно, включая объекты, которые не сочетаются друг с другом, или надписи, которые вы не прочитали.

  2. Спросите, физически ли согласована сцена

    Тени, отражения, масштаб и перспектива — это задачи на логику, а именно для этого и предназначена модель. Это позволяет выявить композитные изображения, которые может пропустить попиксельный анализ.

  3. Спросите, что подтверждает или опровергает это

    Превращение подозрения в список проверок — хорошее применение языковой модели, и этот список часто лучше того, который составили бы вы.

  4. Затем запустите настоящий детектор

    Для анализа пикселей используйте инструмент, созданный именно для этого, и сопоставляйте оценку с опубликованной шкалой.

Почему беглость речи опасна

Детектор, который не уверен, возвращает среднее число, и само это число говорит о неуверенности. Языковая модель, которая не уверена, возвращает целый абзац, а у абзацев нет доверительных интервалов.

Одно и то же стройное объяснение появляется независимо от того, определила ли модель что-то реальное или придумала правдоподобно звучащее описание пустоты. Читатели калибруют свое доверие по качеству текста, хотя именно этот сигнал здесь не несет никакой информации.

Вот почему спрашивать чат-бота — худшее начало, чем посмотреть на картинку самостоятельно. Ваша собственная неуверенность по крайней мере видна вам самим.

Та же проблема в других инструментах

Это касается не одного конкретного продукта. Любая система, которая рассуждает об изображении семантически, имеет один и тот же пробел, и несколько инструментов, представленных сейчас как детекторы, делают именно это в своей основе.

Полезный тест: спросите, что инструмент выдаст на фотографии фотографии или на изображении без узнаваемого объекта. Пиксельный детектор вернет оценку в любом случае, потому что текстура существует независимо от содержания. Семантической системе не над чем рассуждать, и она либо откажется, либо что-то выдумает.

Второй тест: запустите один и тот же файл дважды. Пиксельная модель детерминирована и возвращает одно и то же число. Языковая модель делает выборку, и результаты двух запусков могут не совпадать. Если инструмент дает разные ответы для одних и тех же байтов, он ничего не измеряет.

Ни один из тестов не требует понимания того, как работает инструмент. Оба занимают минуту, и они позволяют отделить измерение от описания надежнее, чем чтение маркетинговой страницы.

Вопросы пользователей

Может ли ChatGPT обнаружить изображения, созданные ИИ?
Нет, не в измеримом смысле. Он выдает уверенную оценку, основанную на том, что изображено на картинке, а не на том, как создавались пиксели. За ответом нет откалиброванного порога, нет эталона, а повторный запрос может дать два разных вердикта.
Но он оказался прав насчет изображения, которое я проверял.
Он часто будет прав, особенно в очевидных случаях, где вы тоже оказались бы правы. Проблема в том, что он звучит идентично, когда ошибается, поэтому правильный ответ не дает вам понять, какой именно результат вы получили в следующий раз.
Что, если я попрошу его проанализировать пиксели?
Он не может. Изображение преобразуется в семантическое представление, прежде чем модель начинает рассуждать о нем, и мелкие текстуры, от которых зависит обнаружение, отбрасываются при этом преобразовании. Просьба проанализировать пиксели порождает описание того, как выглядел бы попиксельный анализ.
Существуют ли мультимодальные модели, созданные для обнаружения?
В этой области ведутся исследования, и это не то, чем занимается обычный помощник. Специализированный детектор обучается на парах реальных и сгенерированных изображений с калиброванным выходом; общая модель обучается быть полезной во всем. Они не являются полноценными заменителями.
Стоит ли вообще использовать чат-бота при проверке изображения?
Да, для описания и рассуждений. Спросите, что находится в кадре, согласовано ли освещение и что подтвердит или опровергнет ваше подозрение. Затем используйте детектор для анализа пикселей и держите эти два ответа раздельно в своем уме.
Почему так много людей сначала спрашивают чат-бота?
Потому что он открыт в другой вкладке и всегда отвечает. Удобство перевешивает точность, когда цена ошибки невидима, а при проверке изображений цена обычно не видна до тех пор, пока кто-то уже не совершил действие на основе ответа.

Проверить изображение сейчас

Бесплатно, без учетной записи, файл никогда не покидает ваше устройство. Пятьдесят проверок в день.

Открыть детектор

Читать далее