← Все руководства Принцип работы

Дипфейк против сгенерированного AI: не одно и то же

Одно придумывает человека, которого не существует. Другое помещает реального человека туда, где его никогда не было. Им нужны разные проверки, и их смешение ведет к ошибкам.

· 9 мин чтения · Best AI Image Detector

Сгенерированное изображение выдумывает своего субъекта. Дипфейк сохраняет личность реального человека и меняет то, что он якобы делает. Второе наносит вред конкретному человеку, и его труднее обнаружить, так как большая часть кадра подлинная.

Две разные вещи, которые люди называют одним и тем же

Полностью сгенерированное изображение начинается с нуля. Под ним нет фотографии, нет данных сенсора, нет момента, который случился. Каждый пиксель создан моделью, и человек на нем не имеет личности, которую можно опорочить, так как этого человека нет.

Дипфейк начинается с чего-то реального. Под ним есть фотография или видео, подлинная съемка подлинного момента, и модель заменила конкретную область, обычно лицо, на изображение кого-то другого.

Это различие важно юридически, редакционно и технически. Сгенерированное стоковое фото несуществующего врача — вопрос лицензирования. Фотография реального врача с лицом, вклеенным в тело, к которому он никогда не имел отношения — вопрос клеветы, а возможно, и уголовного преступления.

Сгенерированное стоковое фото AI-портрет вас самих Сгенерированная фотография знаменитости Фото с замененным лицом Измененный документ
Насколько реален кадр → ↑ Вред конкретному человеку
Позиции иллюстративны. Важны оси: вред связан с личностью, а не с тем, насколько синтетичны пиксели.
Где что находится. В нижнем правом квадранте концентрируется серьезный вред.

Почему дипфейк сложнее распознать

Детектор считывает статистическую текстуру изображения и сообщает, какая его часть выглядит так, будто она создана моделью. Когда весь кадр синтетический, этот сигнал присутствует везде, и оценка однозначна.

Замена лица переворачивает проблему. Девяносто процентов изображения — это реальная фотография с реальным шумом сенсора и реальной историей сжатия, и среднее значение по всему кадру отражает именно это. Убедительная замена лица может дать оценку в районе 30 баллов даже для изображения, которое является откровенной подделкой.

Это не столько сбой модели, сколько некорректная постановка вопроса. Вопрос «сгенерировано ли изображение» оказывается неверным, когда честный ответ звучит так: большая часть изображения — нет, но важная его часть — да.

16 12 19 14 11 91 17 13 15 18 12 16

Усреднение, которое дало 33 балла, — это именно то, что скрывает тот самый фрагмент, который важен.

Реальная фотография, на которой заменено одно лицо. Оценка всего кадра составила 33, и это почти ничего вам не сказало.

Карта областей — это решение проблемы постановки вопроса. Раздельная оценка перекрывающихся фрагментов означает, что локализованная замена измеряется относительно ее собственного окружения, а не размывается по всему кадру, к которому она не относится.

Терминология в порядке появления

Термины, которые используют люди, и то, что каждый из них на самом деле описывает
ТерминЧто это значитРеален ли объект?
ДипфейкИзображение реального человека, перенесенное на другие кадрыДа
Замена лицаРаспространенная форма дипфейка на фото или видеоДа
Создано ИИСоздано по запросу без исходной фотографииНет
AI-отредактированоНастоящее фото с добавленным или удаленным объектомОбычно
Синтетический медиаконтентОбщий термин для всего перечисленногоЗависит от ситуации
Дешевый фейк (Cheapfake)Реальный контент, введенный в заблуждение подписью, обрезкой или старой датойДа

На последней строке стоит остановиться, потому что это наиболее распространенная форма визуальной дезинформации, с которой не работает ни один детектор. Подлинная, неотредактированная фотография из другой страны трехлетней давности с подписью как «новости дня» получит оценку как реальная фотография, которой она и является.

Что делать в разных случаях

  1. Вы подозреваете, что вся картинка вымышлена. Запустите проверку всего кадра. Высокий балл при однородной карте — это максимально ясный результат.
  2. Вы подозреваете, что лицо было вставлено или заменено. Сначала изучите карту областей. Число будет занижать результат.
  3. Вы подозреваете, что документ был изменен. То же самое, что выше; ожидайте ровно одну «горячую» область поверх измененного поля.
  4. Вы подозреваете, что подпись лжет. Детектор не поможет. Используйте поиск по изображению, затем проверьте дату и место.
  5. Это видео. Совсем другие инструменты. Анализ отдельных кадров пропускает временные артефакты, которые выдают замену в реальном времени.

Почему это различие защищает людей

Отношение к любому синтетическому изображению как к одинаково серьезной проблеме ведет к двум ошибкам. Оно растрачивает внимание на безобидные вещи, например, когда кто-то использует сгенерированный портрет, потому что у него не было денег на фотографа, и недооценивает случаи, которые действительно вредят человеку.

Вред заключается не в том, что пиксели искусственные. А в том, что реального человека показывают делающим то, чего он не делал. Именно это требует реагирования, и именно здесь средняя оценка меньше всего заслуживает доверия в качестве итога.

Построение внутренней политики вокруг идентичности, а не вокруг технологий, позволяет ей дольше оставаться актуальной. Методы будут меняться, а вопрос о том, искажается ли образ конкретного человека, — нет.

Как на самом деле делается замена лица

Понимание процесса помогает объяснить детектирование. Замена начинается с целевой фотографии и набора изображений человека, чье лицо будет использовано. Модель учится отображать это лицо с учетом освещения, ракурса и выражения, уже присутствующих в целевом кадре.

Затем отрисованное лицо накладывается обратно в исходный кадр, и самая сложная часть — это стык. У двух половин разный шум, разная история сжатия и часто слегка разная цветопередача, поэтому этап смешивания сглаживает границу до тех пор, пока глаз перестает замечать соединение.

Это сглаживание и считывает карта областей. Смешивание удаляет высокочастотную текстуру, которую создает сенсор, и полученный фрагмент статистически отличается от всего вокруг, даже если шов невидим. Стык одновременно невидим и измерим.

Это также объясняет, почему замена легко проходит проверку всего кадра. Манипулируемая область мала, намеренно вписана в окружение и окружена аутентичной фотографией, которая доминирует над любым средним значением по кадру.

Ошибка, которая постоянно повторяется

Люди проверяют подозрительный дипфейк через детектор, видят оценку в тридцать с небольшим баллов и делают вывод, что изображение подлинное. Это неверный вывод из правильного числа: оценка верна, но вопрос, на который она отвечает, был не тем, который задавали.

Привычка, которая это исправляет, проста. Для любого изображения, где речь идет о конкретном человеке, открывайте карту областей до того, как читать итоговую цифру, и считайте наиболее выделяющийся фрагмент, а не среднее значение, тем результатом, на основании которого стоит действовать.

Вопросы пользователей

Является ли каждое ИИ-изображение дипфейком?
Нет, и разница — в объекте. Дипфейк использует внешность реального человека без его участия, что делает его вредным и часто незаконным. Сгенерированное изображение кого-то, кто не существует, не имеет жертвы, и отношение к ним как к равнозначным растрачивает внимание на безобидные случаи.
Может ли этот инструмент обнаружить дипфейк?
На статичном изображении — часто да, через карту областей, а не через оценку. Замененное лицо — это локализованная замена внутри подлинной фотографии, поэтому оно отображается как одна «горячая» область в «холодной» сетке, в то время как число для всего кадра остается низким. На любом изображении человека сначала читайте карту.
А что насчет видео-дипфейков?
Для этого нужны другие инструменты. Видеоманипуляции оставляют временные артефакты, несоответствия между соседними кадрами, которые модель для статичных изображений не ищет. Проверка отдельных кадров выявит часть случаев, но пропустит те, что были созданы специально, чтобы пройти именно такую проверку.
Почему известный дипфейк получил низкую оценку?
Потому что большая его часть — это реальная фотография. Оценка всего кадра вычисляется как среднее по всему изображению, и лицо, занимающее одну восьмую часть кадра, очень слабо влияет на это среднее. Это самый распространенный способ, которым люди неверно интерпретируют результат для изображения с заменой.
Можно ли обнаружить дешевый фейк (cheapfake)?
Детектором — нет, потому что нет ничего синтетического для обнаружения. Реальная фотография с ложной подписью — это проблема происхождения: используйте поиск по изображению, чтобы найти более ранние копии, затем проверьте, соответствуют ли дата и место заявленному утверждению.
Относится ли к ним закон по-разному?
Все чаще — да. В ряде юрисдикций введены правонарушения, специально охватывающие неконсенсуальные синтетические изображения реальных людей, особенно интимного характера, в то время как сгенерированные изображения абстрактных людей рассматриваются по обычным правилам. Проконсультируйтесь с вашей юридической службой, а не полагайтесь на эту страницу.