← Всички ръководства Доверие и безопасност

Модериране на генерирани от AI изображения в голям мащаб

Прагове за триаж, пакетни работни процеси и защо автоматичната забрана въз основа на оценка е грешна политика. Ръководство за работа за екипи по доверие и безопасност.

· 7 мин. четене · Best AI Image Detector

Използвайте оценка, за да подредите опашка за преглед, никога за предприемане на действия срещу акаунт. Детекцията има процент на грешки, който прави автоматичното прилагане нечестно, а обжалванията струват повече, отколкото триажът спестява.

Защо автоматичното прилагане се проваля тук

При 91 процента балансирана точност при лабораторни условия, приблизително едно от единадесет обаждания е грешно. При съдържание, генерирано от потребителите, което пристига на екранни снимки, прекомпресирано и изрязано, реалният процент е по-лош.

Приложено към сто хиляди елемента на ден, това са хиляди погрешни действия. Всяко от тях е обжалване, а обжалванията струват повече на случай, отколкото прегледът, който автоматизацията е заместила. Математиката не излиза, дори преди да вземете предвид репутационните разходи за премахване на истински публикации.

Има втори проблем, специфичен за модерирането. Решенията за прилагане се одитират. Регулатор или съд, който пита защо даден акаунт е бил премахнат, няма да приеме изход от модел с непубликуван праг като основание.

Оценявайте, за да сортирате, а не за да действате

Полезното рамкиране е подреждането на опашката. Имате повече елементи, отколкото рецензенти. Една оценка определя кои от тях човек вижда първи и това е работа, която тя може да върши добре дори при 85 процента точност, защото това да грешиш просто означава, че някой гледа нещо ненужно.

  1. 1 Над 90 Началото на опашката за преглед
  2. 2 65 до 90 Прегледано в рамките на нормалния прозорец
  3. 3 45 до 65 Само ако е докладвано от потребител
  4. 4 Под 45 Без действие, взети са проби за проверки на качеството
Диапазоните съответстват на маршрути на опашката, а не на резултати. Нищо в тази диаграма не премахва съдържание само по себе си.

Вземането на проби от долния диапазон е по-важно, отколкото изглежда. Това е единственият начин да измерите процента си на фалшиво отрицателни резултати и без това число не можете да разпознаете дали системата работи или тихо е спряла да улавя каквото и да било.

Какво трябва да казва вашата политика

Повечето платформи вече имат правило за синтетични медии и повечето от тях са написани лошо. Често срещаният провал е забраната на AI съдържанието като цяло, което е невъзможно за прилагане и улавя неща, които никой не е искал да хване.

Правила, които могат да бъдат наложени, срещу правила, които не могат
ПриложимоНеприложимоЗащо
Неоповестени синтетични медии на реално лицеВсички генерирани от AI изображенияВторото забранява илюстрациите и дизайнерската работа
Генерирани изображения, представени като документални доказателстваВсичко, което има резултат над 65Прагът не е политика
Синтетични медии, използвани за измама с цел париИзображения, които изглеждат генерирани от AIГледането не е стандарт
Непосочване при поискванеНеобявен AI под каквато и да е формаНедоказуемо и потребителите не могат да го спазват

Напишете правилото около вредата и оповестяването, а не около техниката. Генерираната илюстрация в публикация с художествена литература на никого не вреди. Генерираната фотография на продукт, човек или събитие, представена като истинска, е нещото, което всъщност искате да спрете.

Трите случая, които картата на регионите разделя

Оценките за цял кадър обединяват три ситуации, които се нуждаят от различно третиране. Изгледът с плочки ги отличава и разликата обикновено определя изхода.

  • Всяка плочка е висока. Изцяло генерирано изображение. Ако то е представено като фотография на нещо реално, това е вашият най-ясен случай.
  • Една плочка е висока. Истинска фотография с нещо добавено или премахнато. В контекста на пазар или новини това често е по-сериозно от пълното генериране, защото е предназначено да му се вярва.
  • Равномерно топло, нито едно високо. Тежка обработка. Обикновено истинска снимка през филтър или мащабатор. Почти никога не си струва да се предприемат действия.
13 17 11 15 91 14 12 16 10

Истинска фотография с вметнат елемент. Подреждането на опашката само по основната оценка никога нямаше да я изведе на повърхността.

Средният случай. Резултат за цел кадър от 33 би изчистил този елемент.

Измерване дали работи

  1. Проследявайте прецизността в горния диапазон

    От елементите с оценка над 90, които модератор е отворил, колко са били подложени на действие? Ако този брой е нисък, инструментът създава работа, вместо да я спестява.

  2. Взимайте проби от долния диапазон седмично

    Издърпайте произволни сто от под 45 и ги прегледайте. Това е единственото измерване на това, което пропускате, и е това, което екипите пропущат.

  3. Наблюдавайте процента на обжалване

    Ръстът на успешните обжалвания на решения за синтетични медии означава, че прагът се е изместил или е пристигнал нов генератор с нисък резултат.

  4. Задавайте нов базов ред след всяка промяна на модела

    Актуализациите на детектора променят оценките. Праг, настроен преди шест месеца срещу различна версия на модела, вече не е прагът, който смятате, че е.

Окомплектоване на опашката, която инструментът създава

Добавянето на детектор към работен процес за модериране не намалява броя на служителите и екипите, които планират това да стане, се оказват в по-лошо положение. Това, което той променя, е редът, в който работата пристига, което повишава стойността на всеки час на рецензента, без да намалява броя на хората, от които се нуждаете.

Заложете в бюджета маркираната опашка да бъде по-бавна за артикул от общата опашка. Рецензент, който разглежда маркирана публикация, взима по-трудно решение по по-двусмислен материал и бързането с това води до грешно правоприлагане. Две минути на артикул е реалистично; тридесет секунди не са.

Дайте на рецензентите картата на регионите, а не оценката. Модератор, който вижда, че единият ъгъл на изображението е „горещ“, взима по-добро решение от този, на когото е дадено число, и те могат да обяснят това решение след това на екип по обжалванията или на регулатор.

Ротирайте хората извън прегледа на синтетични медии. Това е повтаряща се работа с висок дял на двусмислени случаи и точността спада забележимо в рамките на дълга смяна. Това е същият урок, който всяка функция за модериране вече е научила за други категории.

Въпроси, които хората задават

Можем ли автоматично да премахваме съдържание над праг на оценка?
Можете и не трябва. При реалистична точност това означава хиляди грешни премахвания в голям мащаб, всяко от които е обжалване, а някои от тях са регулаторен проблем. Използвайте оценката, за да подредите човешка опашка. Времето на рецензента, спестено от добро подреждане, е по-голямо от времето, което автоматизацията би ви спестила.
Какъв праг трябва да зададем за преглед?
Започнете с насочване на всичко над публикуваната линия на решение и вземане на проби под нея, след това настройте въз основа на собствените си показатели за прецизност, а не на препоръка на доставчик. Вашият набор от съдържание определя правилния праг и платформа, пълна с илюстрации, се нуждае от различна линия от такава, пълна с новинарски снимки.
Как се обработват обжалванията?
Поискайте оригиналния файл. Повечето успешни обжалвания идват от потребители, чиято истинска снимка е била прекомпресирана при качване, и повторната проверка на източника обикновено разрешава това в една стъпка. Запишете резултата, тъй като данните за обжалванията са най-бързият сигнал, че прагът се е изместил.
Трябва ли потребителите да бъдат информирани, че дадено изображение е било маркирано от детектор?
Да се каже, че е извършена проверка, е честно и все по-очаквано. Публикуването на точния праг не е, защото това дава цел за заобиколяне на всеки, който е готов да тества срещу нея. Заявете, че автоматизираните сигнали информират прегледа и че човек взема всяко решение.
Работи ли това за видео?
Не с детектор за неподвижни изображения. Проверката кадър по кадър на видео създава огромно количество и пропуска времеви артефакти, които са най-силният сигнал в манипулираното видео. Третирайте видеото като отделен проблем, който се нуждае от отделни инструменти.
Ами изображенията, които нашите собствени потребители генерират легитимно?
Етикетирайте, вместо да премахвате. Полето за оповестяване при качване, подкрепено от проверка, която маркира непосочените случаи за преглед, ви дава работещо правило. Потребителите, които спазват изискването за етикетиране, никога не трябва да виждат правоприлагане, което е нещото, което прави политиката защитима.