На что смотрит модель
Камера записывает свет через объектив на сенсор. Этот процесс оставляет специфический шум, особый характер падения резкости к краям и конкретные закономерности в связях между соседними пикселями, обусловленные структурой сенсора и последующей демозаикой.
Diffusion-модель строит изображение, многократно удаляя шум из случайного поля до тех пор, пока не появится связное изображение. Этот процесс также оставляет свою сигнатуру, и она отличается. Результат может быть визуально идеальным и при этом статистически распознаваемым.
Вот почему детекция работает даже после скриншота, в отличие от метаданных. Сигнатура находится в самих значениях пикселей, а не в заголовке файла, поэтому копирование пикселей сохраняет доказательство.
Четыре этапа
- 1 Чтение файла Декодируется в браузере, никогда не загружается на сервер
- 2 Оценка кадра Vision transformer с разрешением 384 пикселя
- 3 Оценка фрагментов Та же модель на перекрывающихся участках
- 4 Чтение данных файла C2PA и маркеры генератора, если присутствуют
Этап первый: декодирование
Файл считывается с диска страницей и декодируется в «сырые» пиксели. HEIC, AVIF, TIFF и другие форматы обрабатываются собственными декодерами браузера. Ничего не передается на сервер; это свойство того, где именно выполняются вычисления, а не политика сервера.
Этап второй: оценка всего кадра
Изображение масштабируется до 384 пикселей и проходит через vision transformer. Модель возвращает «сырую» вероятность того, что кадр является синтетическим. Это число затем калибруется, чтобы оно последовательно соответствовало опубликованным диапазонам, не смещаясь вместе с моделью.
При изменении размера теряются детали — это первое место, где страдает точность. Однако этого не избежать: у модели фиксированный размер входных данных, и фотографию в 4000 пикселей приходится уменьшать, чтобы она поместилась.
Этап третий: проход по фрагментам
Кадр делится на перекрывающиеся участки, и каждый из них оценивается той же моделью отдельно. Именно это позволяет отличить полностью сгенерированное изображение от реальной фотографии, в которую что-то добавили; это этап, который не может заменить одно число.
Усреднение дает 21. Просмотр по фрагментам сохраняет информацию, которую уничтожает усреднение.
Фрагментам нужно достаточное количество пикселей, чтобы оценка была значимой, поэтому изображения размером менее 576 пикселей по меньшей стороне получают только оценку всего кадра. В маленьком фрагменте недостаточно деталей для независимой оценки.
Этап четвертый: собственные данные файла
Независимо от пикселей файл проверяется на наличие Content Credentials и маркеров генератора, оставленных некоторыми инструментами. Этот путь является криптографическим, а не статистическим: действительная подпись сверяется со списком доверенных источников, а не оценивается.
Как объединяются результаты
Два пути не усредняются, так как они имеют разный вес. Действительный сертификат (credential), подтверждающий съемку камерой, имеет приоритет над умеренной оценкой пикселей. Сертификат, указывающий на AI-генерацию, решает вопрос однозначно.
| Доказательство | Тип | Вес |
|---|---|---|
| Действительный сертификат AI-генерации | Криптографический | Решающий |
| Действительный сертификат съемки камерой | Криптографический | Очень сильный |
| Маркер генератора в файле | Декларативный | Сильный, но может быть удален |
| Оценка пикселей всего кадра | Статистический | Умеренный |
| Оценка фрагментов (тайлов) | Статистический | Умеренный, более специфичный |
| Сертификаты отсутствуют | Нет данных | Нет информации в ту или иную сторону |
Последнюю строку люди понимают неправильно чаще всего. Отсутствие сертификата не является негативным сигналом. Подавляющее большинство изображений не имеют никаких меток, а почти все платформы удаляют их при загрузке.
Почему он работает в браузере
Модель весит около 40 МБ и работает через WebAssembly на устройстве пользователя. Это осознанный архитектурный выбор, имеющий три последствия, которые стоит учитывать.
- Ничего не загружается на сервер, поэтому нет сервера, хранящего чужие изображения, и нет отношений по обработке данных, требующих документации.
- Проверка ничего не стоит в обслуживании, поэтому инструмент может быть бесплатным, без счетчиков использования.
- Первая проверка медленнее, так как модель скачивается один раз перед запуском. Последующие проверки используют кэшированную копию.
Что конвейер осознанно не делает
Некоторые методы, встречающиеся в старых криминалистических инструментах, отсутствуют, так как они больше не работают с изображениями, прошедшими через современные платформы.
- Анализ уровня ошибок (ELA). Популярен, часто понимается неверно и ненадежен для любого изображения, которое было сохранено более одного раза.
- Детекция копирования-перемещения. Находит дублированные области внутри кадра — это обнаруживает старые методы клонирования, но не генерацию.
- Вердикты на основе метаданных. EXIF удаляется при загрузке почти везде, поэтому проверка, зависящая от него, не сработает именно на тех изображениях, которые пользователям нужно проверить.
- Анализ лиц. Полезен для одного узкого класса манипуляций и «слеп» ко всему остальному.