Что на самом деле делает чат-бот
Мультимодальная языковая модель преобразует изображение в семантическое описание, а затем рассуждает об этом описании в тексте. Она отвечает на вопрос: похоже ли это изображение на ИИ-изображения, о которых я читала во время обучения.
Это вопрос о содержании и композиции. Детекция — это вопрос о текстуре: как соотносятся значения соседних пикселей в масштабе, гораздо меньшем, чем тот, который сохраняет семантическое описание.
Информация, которую считывает детектор, отбрасывается до того, как языковая модель начинает думать. Дело не в том, что чат-боты плохи в этом. Они работают с представлением, которое не содержит доказательств.
К чему это приводит на практике
- Уверенные ответы без порога. Чат-бот скажет «вероятно, сгенерировано ИИ» без какой-либо шкалы, стоящей за словом «вероятно». Нет числа, нет диапазона и не с чем сравнивать другое изображение.
- Рассуждения на основе устаревших признаков. Модели ссылаются на пальцы, зубы, восковую кожу и искаженный текст, потому что именно это написано в обучающем тексте. Эти проблемы были исправлены годы назад.
- Согласие с вашей формулировкой. Спросите, является ли изображение поддельным, и вы скорее услышите «да», чем если бы спросили нейтрально. Это свойство интерфейса, а не картинки.
- Нет воспроизводимости. Спросите дважды, и вы можете получить два разных ответа об одном и том же файле с одинаково уверенными объяснениями для каждого.
- Нет информации о регионах. Он не может сказать вам, что один угол фотографии ведет себя иначе, чем остальные, а именно этот вывод обычно и имеет значение.
| Возможности | Чат-бот | Пиксельный детектор |
|---|---|---|
| Считывает текстуру на уровне пикселей | No | Yes |
| Откалиброванная оценка с опубликованными диапазонами | No | Yes |
| Одинаковый ответ каждый раз | No | Yes |
| Разбивка по регионам | No | Yes |
| Измеряется по эталону | No | Yes |
| Объясняет свои рассуждения прозой | Yes бегло | Partly как сигналы |
| Описывает, что находится на снимке | Yes | No |
Последние две строки стоят того, чтобы их запомнить. Языковая модель действительно хорошо описывает изображение и рассуждает о том, насколько логична сцена. Это полезные навыки, но не обнаружение.
В чем чат-бот действительно полезен
Полностью отказываться от этого инструмента — неправильный вывод. Если использовать его по назначению, он дополняет детектор, а не заменяет его.
-
Попросите описать сцену в деталях
Тщательное описание часто выявляет то, что вы не заметили осознанно, включая объекты, которые не сочетаются друг с другом, или надписи, которые вы не прочитали.
-
Спросите, физически ли согласована сцена
Тени, отражения, масштаб и перспектива — это задачи на логику, а именно для этого и предназначена модель. Это позволяет выявить композитные изображения, которые может пропустить попиксельный анализ.
-
Спросите, что подтверждает или опровергает это
Превращение подозрения в список проверок — хорошее применение языковой модели, и этот список часто лучше того, который составили бы вы.
-
Затем запустите настоящий детектор
Для анализа пикселей используйте инструмент, созданный именно для этого, и сопоставляйте оценку с опубликованной шкалой.
Почему беглость речи опасна
Детектор, который не уверен, возвращает среднее число, и само это число говорит о неуверенности. Языковая модель, которая не уверена, возвращает целый абзац, а у абзацев нет доверительных интервалов.
Одно и то же стройное объяснение появляется независимо от того, определила ли модель что-то реальное или придумала правдоподобно звучащее описание пустоты. Читатели калибруют свое доверие по качеству текста, хотя именно этот сигнал здесь не несет никакой информации.
Вот почему спрашивать чат-бота — худшее начало, чем посмотреть на картинку самостоятельно. Ваша собственная неуверенность по крайней мере видна вам самим.
Та же проблема в других инструментах
Это касается не одного конкретного продукта. Любая система, которая рассуждает об изображении семантически, имеет один и тот же пробел, и несколько инструментов, представленных сейчас как детекторы, делают именно это в своей основе.
Полезный тест: спросите, что инструмент выдаст на фотографии фотографии или на изображении без узнаваемого объекта. Пиксельный детектор вернет оценку в любом случае, потому что текстура существует независимо от содержания. Семантической системе не над чем рассуждать, и она либо откажется, либо что-то выдумает.
Второй тест: запустите один и тот же файл дважды. Пиксельная модель детерминирована и возвращает одно и то же число. Языковая модель делает выборку, и результаты двух запусков могут не совпадать. Если инструмент дает разные ответы для одних и тех же байтов, он ничего не измеряет.
Ни один из тестов не требует понимания того, как работает инструмент. Оба занимают минуту, и они позволяют отделить измерение от описания надежнее, чем чтение маркетинговой страницы.