← Все руководства Принцип работы

Как на самом деле работает детекция AI-изображений

Что происходит с момента загрузки файла до получения оценки: модель попиксельного анализа, проход по фрагментам (тайлам), анализ данных файла и то, как эти три компонента объединяются.

· 8 мин чтения · Best AI Image Detector

Vision transformer оценивает кадр целиком, та же модель повторно оценивает его по фрагментам, отдельный модуль проверяет собственные данные файла, и все три результата объединяются в одно калиброванное число.

На что смотрит модель

Камера записывает свет через объектив на сенсор. Этот процесс оставляет специфический шум, особый характер падения резкости к краям и конкретные закономерности в связях между соседними пикселями, обусловленные структурой сенсора и последующей демозаикой.

Diffusion-модель строит изображение, многократно удаляя шум из случайного поля до тех пор, пока не появится связное изображение. Этот процесс также оставляет свою сигнатуру, и она отличается. Результат может быть визуально идеальным и при этом статистически распознаваемым.

Вот почему детекция работает даже после скриншота, в отличие от метаданных. Сигнатура находится в самих значениях пикселей, а не в заголовке файла, поэтому копирование пикселей сохраняет доказательство.

Четыре этапа

  1. 1 Чтение файла Декодируется в браузере, никогда не загружается на сервер
  2. 2 Оценка кадра Vision transformer с разрешением 384 пикселя
  3. 3 Оценка фрагментов Та же модель на перекрывающихся участках
  4. 4 Чтение данных файла C2PA и маркеры генератора, если присутствуют
Два независимых пути сбора доказательств, которые сходятся воедино. Ни один из них не должен отвечать за итоговый результат в одиночку.

Этап первый: декодирование

Файл считывается с диска страницей и декодируется в «сырые» пиксели. HEIC, AVIF, TIFF и другие форматы обрабатываются собственными декодерами браузера. Ничего не передается на сервер; это свойство того, где именно выполняются вычисления, а не политика сервера.

Этап второй: оценка всего кадра

Изображение масштабируется до 384 пикселей и проходит через vision transformer. Модель возвращает «сырую» вероятность того, что кадр является синтетическим. Это число затем калибруется, чтобы оно последовательно соответствовало опубликованным диапазонам, не смещаясь вместе с моделью.

При изменении размера теряются детали — это первое место, где страдает точность. Однако этого не избежать: у модели фиксированный размер входных данных, и фотографию в 4000 пикселей приходится уменьшать, чтобы она поместилась.

Этап третий: проход по фрагментам

Кадр делится на перекрывающиеся участки, и каждый из них оценивается той же моделью отдельно. Именно это позволяет отличить полностью сгенерированное изображение от реальной фотографии, в которую что-то добавили; это этап, который не может заменить одно число.

14 11 16 12 88 13 9 15 10

Усреднение дает 21. Просмотр по фрагментам сохраняет информацию, которую уничтожает усреднение.

Та же модель, запущенная девять раз на перекрывающихся фрагментах. Общая оценка кадра для этого изображения составила 31.

Фрагментам нужно достаточное количество пикселей, чтобы оценка была значимой, поэтому изображения размером менее 576 пикселей по меньшей стороне получают только оценку всего кадра. В маленьком фрагменте недостаточно деталей для независимой оценки.

Этап четвертый: собственные данные файла

Независимо от пикселей файл проверяется на наличие Content Credentials и маркеров генератора, оставленных некоторыми инструментами. Этот путь является криптографическим, а не статистическим: действительная подпись сверяется со списком доверенных источников, а не оценивается.

Как объединяются результаты

Два пути не усредняются, так как они имеют разный вес. Действительный сертификат (credential), подтверждающий съемку камерой, имеет приоритет над умеренной оценкой пикселей. Сертификат, указывающий на AI-генерацию, решает вопрос однозначно.

Как взвешиваются доказательства
ДоказательствоТипВес
Действительный сертификат AI-генерацииКриптографическийРешающий
Действительный сертификат съемки камеройКриптографическийОчень сильный
Маркер генератора в файлеДекларативныйСильный, но может быть удален
Оценка пикселей всего кадраСтатистическийУмеренный
Оценка фрагментов (тайлов)СтатистическийУмеренный, более специфичный
Сертификаты отсутствуютНет данныхНет информации в ту или иную сторону

Последнюю строку люди понимают неправильно чаще всего. Отсутствие сертификата не является негативным сигналом. Подавляющее большинство изображений не имеют никаких меток, а почти все платформы удаляют их при загрузке.

Почему он работает в браузере

Модель весит около 40 МБ и работает через WebAssembly на устройстве пользователя. Это осознанный архитектурный выбор, имеющий три последствия, которые стоит учитывать.

  • Ничего не загружается на сервер, поэтому нет сервера, хранящего чужие изображения, и нет отношений по обработке данных, требующих документации.
  • Проверка ничего не стоит в обслуживании, поэтому инструмент может быть бесплатным, без счетчиков использования.
  • Первая проверка медленнее, так как модель скачивается один раз перед запуском. Последующие проверки используют кэшированную копию.

Что конвейер осознанно не делает

Некоторые методы, встречающиеся в старых криминалистических инструментах, отсутствуют, так как они больше не работают с изображениями, прошедшими через современные платформы.

  • Анализ уровня ошибок (ELA). Популярен, часто понимается неверно и ненадежен для любого изображения, которое было сохранено более одного раза.
  • Детекция копирования-перемещения. Находит дублированные области внутри кадра — это обнаруживает старые методы клонирования, но не генерацию.
  • Вердикты на основе метаданных. EXIF удаляется при загрузке почти везде, поэтому проверка, зависящая от него, не сработает именно на тех изображениях, которые пользователям нужно проверить.
  • Анализ лиц. Полезен для одного узкого класса манипуляций и «слеп» ко всему остальному.

Вопросы пользователей

Смотрит ли детектор на то, что изображено на картинке?
Нет. У него нет концепции объектов, лиц или сцен. Он измеряет статистические связи между соседними пикселями — поэтому он одинаково эффективно работает на портретах, городских сценах и сканах квитанций, и поэтому он не может сказать, правдиво ли содержание изображения.
Почему первая проверка занимает больше времени?
Модель скачивается один раз (около 40 МБ) перед запуском. После этого она кэшируется, и последующие проверки начинаются мгновенно. Это плата за работу на вашем устройстве, а не на сервере, зато вы получаете гарантию, что ничего не загружается в сеть.
Как «сырой» вывод модели превращается в оценку?
Калибровка. Модель возвращает «сырую» вероятность, которая отображается на фиксированной шкале, чтобы определенное число всегда означало одно и то же. Без этого шага оценки менялись бы при каждом обновлении модели, и опубликованные диапазоны потеряли бы смысл.
Почему перекрывающиеся фрагменты, а не простая сетка?
Изменение, которое попадает на границу фрагмента, было бы разделено между двумя областями и «размыто» в обеих. Перекрытие фрагментов означает, что любое изменение полностью попадает хотя бы в одну область, что не дает маленькой вставке «потеряться» при усреднении.
Может ли он сказать, какой генератор создал изображение?
Только если это указано в самом файле. Маркер генератора или сертификат могут назвать инструмент; пиксельная модель — нет. Она возвращает вероятность участия генеративных процессов, что является другим вопросом, отличным от идентификации, и на него гораздо проще ответить надежно.
Используется ли одна и та же модель для кадра и для фрагментов?
Да. Запуск одной модели на разных фрагментах делает два результата сравнимыми. У отдельной модели для фрагментов была бы своя калибровка и свои ошибки, и два числа больше не находились бы в одной шкале.