← Все руководства Точность

Точность детектора ИИ: что на самом деле означает 91%

Сбалансированная точность, линии принятия решений и разница между эталонным тестом и вашим изображением. Что покрывает заголовочная цифра и что она тихо опускает.

· 7 мин чтения · Best AI Image Detector

Сбалансированная точность 91,3% означает, что примерно одно из одиннадцати изображений попадает не на ту сторону линии решения в лабораторных условиях на чистых файлах. Ваше изображение — не лабораторное условие.

Что измеряет сбалансированная точность

Обычную точность легко завысить. Дайте детектору тестовый набор, где 90% сгенерированных изображений, и модель, которая на всё говорит «да», покажет точность 90%, будучи при этом бесполезной.

Сбалансированная точность исправляет это, взвешивая реальные и сгенерированные изображения поровну. Цифра — это среднее из двух показателей: как часто подлинные фото проходят проверку и как часто сгенерированные помечаются. Инструмент, указывающий обычную точность без состава теста, мало что вам говорит.

Сбалансированная точность по качеству JPEG
Чистые оригиналы
91.3 %
Качество JPEG 60
87.3 %
Качество JPEG 40
84.6 %

Ось начинается с 80%, чтобы наклон был читаем. Полная ось 0-100 скрыла бы эффект целиком.

Опубликованные цифры для используемой здесь модели, измеренные на ее исследовательском бенчмарке.

Два способа ошибиться для детектора

Одна цифра скрывает два очень разных сбоя, и они несут очень разную цену.

Ложноположительный результат

  • Подлинное фото оценено выше линии
  • Вызвано масштабированием, ретушью, ночным режимом, скриншотами
  • Цена: обвинение реального человека
  • Сбой, который наносит реальный вред

Ложноотрицательный результат

  • Сгенерированное изображение оценено ниже линии
  • Вызвано новыми генераторами, мелкими правками, «очищенными» файлами
  • Цена: фейк прошел без проверки
  • Сбой, который люди замечают меньше
Единая цифра точности усредняет их. Они не взаимозаменяемы, и большинство людей гораздо больше заботит один из них.

Изменение линии принятия решения всегда влечет за собой компромисс. Ее понижение позволяет выявить больше подделок, но приводит к ложным срабатываниям на реальных фотографиях. Повышение защищает подлинные снимки, но пропускает больше сгенерированных изображений. Идеальной настройки, улучшающей оба показателя сразу, не существует, поэтому линия установлена на уровне 65, а не настроена скрытно.

Почему эталонные тесты завышают реальные показатели

Разница между тестовым набором и снимком, который вам прислали
Эталонное изображениеВаше изображениеВлияние на оценку
Исходный файл, без повторного сохраненияСжат два или три разаТочность падает на несколько пунктов
Полное разрешениеОбрезан или уменьшен для мессенджераМеньше деталей для анализа, больше неопределенности
Генераторы, известные во время обученияМодель, выпущенная в прошлом месяцеПостоянная слабость любого детектора
Чистая фотография или чистый рендерРеальное фото с одним ИИ-редактированиемОценка всего кадра занижает результат
Без состязательной обработкиНамеренно обработано, чтобы пройти проверкуРазработано специально для обмана системы измерения

Ничто из этого не является редким случаем. Это описание того, как изображения распространяются на самом деле. Снимок, прошедший через две платформы и скриншот, уже утратил большую часть сигнала, на котором замерялся эталон.

Как интерпретировать заявления о точности

  • Спросите про тестовый набор. Цифра без указания эталона — это маркетинг. Результат на публичном бенчмарке можно проверить самостоятельно.
  • Спросите про сбалансированность или чистоту данных. Обычная точность на несбалансированном тестовом наборе — самый простой способ завысить показатель.
  • Спросите, где находится линия принятия решения. Точность бессмысленна без знания порога, при котором она была измерена.
  • Спросите, какие генераторы были включены. Любой детектор показывает хорошие результаты на моделях, на которых обучался, и худшие — на тех, что вышли позже.
  • Запросите отдельно уровень ложноположительных срабатываний. Это число определяет, безопасно ли использовать инструмент для проверки реальных людей.

Чего не может сказать точность

Бенчмарк измеряет, как часто модель права на совокупности изображений. Это ничего не говорит о том, будет ли она права в вашем случае. У единичного результата нет доверительного интервала, а детектор не знает, какую именно ошибку он совершает в данный момент.

Именно поэтому карта регионов и анализ файла важнее, чем итоговая цифра. Согласованность независимых сигналов ценнее, чем сильный показатель одного из них, а расхождение — это само по себе результат анализа.

Как самостоятельно протестировать детектор

Вам не нужно принимать чьи-либо цифры на веру. Полезный тест занимает вторую половину дня и говорит о инструменте больше, чем любой опубликованный бенчмарк, потому что он использует изображения, похожие на ваши.

  1. Создайте набор, ответы для которого вам известны

    Двадцать фотографий, которые вы сделали сами, и двадцать изображений, которые вы сгенерировали. Сохраните оригиналы нетронутыми. Двадцати штук каждого вида достаточно, чтобы разоблачить откровенно слабый инструмент.

  2. Включите в тест сложные случаи

    Добавьте скриншоты ваших собственных фото, снимки в ночном режиме, обрезанный вариант с увеличением и портрет с сильной ретушью. Это места, где детекторы ошибаются, и именно эту часть пропускают все бенчмарки поставщиков.

  3. Записывайте оценку и диапазон, а не вердикт

    Записывайте, что выдал каждый инструмент. Сравнение диапазонов информативнее сравнения чисел, так как разные инструменты могут устанавливать линии принятия решений в разных местах.

  4. Считайте два типа ошибок отдельно

    Сколько ваших реальных фото было помечено ошибочно и сколько сгенерированных изображений было пропущено. Инструмент, который никогда не пропускает подделку ценой пометки трети ваших собственных снимков, непригоден для работы с людьми.

Число, которое действительно важно — первое: как часто система называет ваши собственные работы подделкой. Это ошибка с ценой, и именно ее сглаживает усредненная цифра точности в заголовке.

Вопросы пользователей

Является ли точность 91% хорошим показателем для ИИ-детектора?
Это разумная цифра для пиксельного детектора на чистом бенчмарке, но она недостаточно высока, чтобы действовать только на ее основе. Девять ошибок из ста — это много, когда каждая из них может быть обвинением. Рассматривайте его как инструмент скрининга, который указывает, куда стоит посмотреть, а не как тест, решающий вопрос окончательно.
Какой ИИ-детектор самый точный?
Честный ответ в том, что опубликованные цифры несравнимы. Разные инструменты используют разные наборы тестов, разные линии решений и разные определения точности, поэтому числа измеряют разные вещи. Сравнивайте то, что показывает вам инструмент: опубликованные диапазоны, карту регионов и заявленный уровень ложноположительных срабатываний.
Улучшается ли точность по мере совершенствования моделей?
Детекция и генерация развиваются параллельно, поэтому разрыв остается примерно постоянным. Каждый новый генератор — это новые данные для любого существующего детектора, а переобучение следует за выходом модели, а не предшествует ему. Ожидайте постоянного отставания, а не окончательного решения проблемы.
Почему один и тот же инструмент выдает разные оценки для одной и той же картинки?
Этого быть не должно, и если это происходит, значит файлы различаются. Копия, которая была сохранена заново, изменена в размере или прошла через платформу — это другой файл с другими пикселями. Сравнивайте оригинал с оригиналом, а не оригинал с его скачанной версией.