Две разные вещи, которые люди называют одним и тем же
Полностью сгенерированное изображение начинается с нуля. Под ним нет фотографии, нет данных сенсора, нет момента, который случился. Каждый пиксель создан моделью, и человек на нем не имеет личности, которую можно опорочить, так как этого человека нет.
Дипфейк начинается с чего-то реального. Под ним есть фотография или видео, подлинная съемка подлинного момента, и модель заменила конкретную область, обычно лицо, на изображение кого-то другого.
Это различие важно юридически, редакционно и технически. Сгенерированное стоковое фото несуществующего врача — вопрос лицензирования. Фотография реального врача с лицом, вклеенным в тело, к которому он никогда не имел отношения — вопрос клеветы, а возможно, и уголовного преступления.
Почему дипфейк сложнее распознать
Детектор считывает статистическую текстуру изображения и сообщает, какая его часть выглядит так, будто она создана моделью. Когда весь кадр синтетический, этот сигнал присутствует везде, и оценка однозначна.
Замена лица переворачивает проблему. Девяносто процентов изображения — это реальная фотография с реальным шумом сенсора и реальной историей сжатия, и среднее значение по всему кадру отражает именно это. Убедительная замена лица может дать оценку в районе 30 баллов даже для изображения, которое является откровенной подделкой.
Это не столько сбой модели, сколько некорректная постановка вопроса. Вопрос «сгенерировано ли изображение» оказывается неверным, когда честный ответ звучит так: большая часть изображения — нет, но важная его часть — да.
Усреднение, которое дало 33 балла, — это именно то, что скрывает тот самый фрагмент, который важен.
Карта областей — это решение проблемы постановки вопроса. Раздельная оценка перекрывающихся фрагментов означает, что локализованная замена измеряется относительно ее собственного окружения, а не размывается по всему кадру, к которому она не относится.
Терминология в порядке появления
| Термин | Что это значит | Реален ли объект? |
|---|---|---|
| Дипфейк | Изображение реального человека, перенесенное на другие кадры | Да |
| Замена лица | Распространенная форма дипфейка на фото или видео | Да |
| Создано ИИ | Создано по запросу без исходной фотографии | Нет |
| AI-отредактировано | Настоящее фото с добавленным или удаленным объектом | Обычно |
| Синтетический медиаконтент | Общий термин для всего перечисленного | Зависит от ситуации |
| Дешевый фейк (Cheapfake) | Реальный контент, введенный в заблуждение подписью, обрезкой или старой датой | Да |
На последней строке стоит остановиться, потому что это наиболее распространенная форма визуальной дезинформации, с которой не работает ни один детектор. Подлинная, неотредактированная фотография из другой страны трехлетней давности с подписью как «новости дня» получит оценку как реальная фотография, которой она и является.
Что делать в разных случаях
- Вы подозреваете, что вся картинка вымышлена. Запустите проверку всего кадра. Высокий балл при однородной карте — это максимально ясный результат.
- Вы подозреваете, что лицо было вставлено или заменено. Сначала изучите карту областей. Число будет занижать результат.
- Вы подозреваете, что документ был изменен. То же самое, что выше; ожидайте ровно одну «горячую» область поверх измененного поля.
- Вы подозреваете, что подпись лжет. Детектор не поможет. Используйте поиск по изображению, затем проверьте дату и место.
- Это видео. Совсем другие инструменты. Анализ отдельных кадров пропускает временные артефакты, которые выдают замену в реальном времени.
Почему это различие защищает людей
Отношение к любому синтетическому изображению как к одинаково серьезной проблеме ведет к двум ошибкам. Оно растрачивает внимание на безобидные вещи, например, когда кто-то использует сгенерированный портрет, потому что у него не было денег на фотографа, и недооценивает случаи, которые действительно вредят человеку.
Вред заключается не в том, что пиксели искусственные. А в том, что реального человека показывают делающим то, чего он не делал. Именно это требует реагирования, и именно здесь средняя оценка меньше всего заслуживает доверия в качестве итога.
Построение внутренней политики вокруг идентичности, а не вокруг технологий, позволяет ей дольше оставаться актуальной. Методы будут меняться, а вопрос о том, искажается ли образ конкретного человека, — нет.
Как на самом деле делается замена лица
Понимание процесса помогает объяснить детектирование. Замена начинается с целевой фотографии и набора изображений человека, чье лицо будет использовано. Модель учится отображать это лицо с учетом освещения, ракурса и выражения, уже присутствующих в целевом кадре.
Затем отрисованное лицо накладывается обратно в исходный кадр, и самая сложная часть — это стык. У двух половин разный шум, разная история сжатия и часто слегка разная цветопередача, поэтому этап смешивания сглаживает границу до тех пор, пока глаз перестает замечать соединение.
Это сглаживание и считывает карта областей. Смешивание удаляет высокочастотную текстуру, которую создает сенсор, и полученный фрагмент статистически отличается от всего вокруг, даже если шов невидим. Стык одновременно невидим и измерим.
Это также объясняет, почему замена легко проходит проверку всего кадра. Манипулируемая область мала, намеренно вписана в окружение и окружена аутентичной фотографией, которая доминирует над любым средним значением по кадру.
Ошибка, которая постоянно повторяется
Люди проверяют подозрительный дипфейк через детектор, видят оценку в тридцать с небольшим баллов и делают вывод, что изображение подлинное. Это неверный вывод из правильного числа: оценка верна, но вопрос, на который она отвечает, был не тем, который задавали.
Привычка, которая это исправляет, проста. Для любого изображения, где речь идет о конкретном человеке, открывайте карту областей до того, как читать итоговую цифру, и считайте наиболее выделяющийся фрагмент, а не среднее значение, тем результатом, на основании которого стоит действовать.