Почему автоматическое применение санкций здесь не работает
При 91-процентной сбалансированной точности в лабораторных условиях, примерно один случай из одиннадцати — ошибочный. В пользовательском контенте, который приходит в виде скриншотов, пережатых и обрезанных файлов, реальный показатель еще хуже.
Если применять это к ста тысячам элементов в день, это тысячи неверных действий. Каждое из них ведет к апелляции, а стоимость обработки апелляции выше, чем стоимость проверки, которую заменила автоматизация. Математика не сходится даже без учета репутационных издержек от удаления подлинных публикаций.
Есть вторая проблема, специфичная для модерации. Решения о санкциях подлежат аудиту. Регулятор или суд, спрашивающий, почему аккаунт был заблокирован, не примет в качестве обоснования вывод модели с неопубликованным пороговым значением.
Оценка для сортировки, а не для действий
Полезный подход — упорядочивание очереди. Элементов больше, чем модераторов. Оценка решает, что именно человек увидит первым, и с этой задачей инструмент отлично справляется даже при 85-процентной точности, поскольку ошибка здесь означает лишь то, что кто-то посмотрел на что-то лишнее.
- 1 Выше 90 Начало очереди на проверку
- 2 от 65 до 90 Проверка в обычном режиме
- 3 от 45 до 65 Только при наличии жалобы от пользователя
- 4 Ниже 45 Без действий, выборка для контроля качества
Выборка из нижнего диапазона важнее, чем кажется. Это единственный способ измерить уровень ложноотрицательных результатов, и без этой цифры вы не поймете, работает система или незаметно перестала что-либо ловить.
Что должны содержать ваши правила
У большинства платформ сейчас есть правила по синтетическому медиаконтенту, и большинство из них написано плохо. Распространенная ошибка — общий запрет на контент от ИИ, который невозможно исполнить и который затрагивает то, что никто не планировал запрещать.
| Исполнимые | Неисполнимые | Почему |
|---|---|---|
| Нераскрытый синтетический контент с реальным человеком | Все изображения, созданные ИИ | Второе запрещает иллюстрации и дизайнерские работы |
| Сгенерированные изображения, представленные как документальное свидетельство | Любое изображение с оценкой выше 65 | Порог — это не правило |
| Синтетический контент, используемый для обмана ради денег | Изображения, которые выглядят как созданные ИИ | Визуальная оценка — это не стандарт |
| Отказ маркировать по требованию | Нераскрытый ИИ в любом виде | Недоказуемо, и пользователи не могут соблюдать |
Формулируйте правила вокруг вреда и раскрытия информации, а не вокруг техники создания. Сгенерированная иллюстрация к художественному посту никому не вредит. Сгенерированная фотография продукта, человека или события, выдаваемая за реальную, — это то, что вы действительно хотите пресечь.
Три случая, которые разделяет карта регионов
Оценка всего кадра объединяет три ситуации, требующие разного подхода. Просмотр по плиткам помогает их различить, и именно от этого различия обычно зависит решение.
- Все плитки с высоким баллом. Полностью сгенерированное изображение. Если оно выдается за фотографию чего-то реального, это ваш самый очевидный случай.
- Одна плитка с высоким баллом. Реальная фотография, в которую что-то добавили или из нее убрали. В контексте маркетплейсов или новостей это часто серьезнее, чем полностью сгенерированный объект, так как это намеренно сделано, чтобы в это поверили.
- Равномерно теплый, нет высоких значений. Тяжелая обработка. Обычно подлинное фото через фильтр или апскейлер. Почти никогда не требует санкций.
Реальная фотография с добавленным элементом. Сортировка очереди только по итоговой оценке никогда бы его не выявила.
Измерение эффективности
-
Отслеживайте точность в верхнем диапазоне
Сколько элементов с оценкой выше 90, открытых модератором, получили санкции? Если это число низкое, инструмент создает работу, а не экономит её.
-
Еженедельно делайте выборку из нижнего диапазона
Берите случайную сотню элементов с баллом ниже 45 и проверяйте их. Это единственный способ измерить то, что вы пропускаете, и это то, что команды упускают из виду.
-
Следите за долей апелляций
Рост числа успешных апелляций по решениям о синтетическом контенте означает, что пороговое значение «уплыло» или появился новый генератор, который получает низкие баллы.
-
Обновляйте базовые показатели после каждого изменения модели
Обновления детектора меняют оценки. Порог, настроенный полгода назад для другой версии модели, больше не является тем порогом, который вы себе представляете.
Укомплектование очереди, созданной инструментом
Добавление детектора в конвейер модерации не сокращает штат, и команды, которые планируют обратное, оказываются в худшем положении. Что он меняет, так это порядок поступления работы, что повышает ценность каждого часа работы модератора, не сокращая количество нужных сотрудников.
Заложите бюджет на то, чтобы проверка помеченных элементов занимала больше времени, чем проверка общего потока. Модератор, изучающий помеченный пост, принимает более сложное решение по неоднозначному материалу, и спешка здесь приводит к ошибкам. Две минуты на один элемент — это реалистично; тридцать секунд — нет.
Давайте модераторам карту регионов, а не просто оценку. Модератор, который видит, что один угол изображения подозрителен, принимает лучшее решение, чем тот, кому дали просто цифру, и они могут объяснить это решение апелляционной комиссии или регулятору.
Ротируйте сотрудников, работающих с синтетическим контентом. Это монотонная работа с большой долей неоднозначных случаев, и точность заметно падает к концу долгой смены. Это тот же урок, который каждая служба модерации уже усвоила по другим категориям.