Четирите причини резултатите да се различават
Резултатът е краят на дълга верига от избори. Променете която и да е връзка и числото се измества, въпреки че нищо в изображението не се е променило.
- Различни данни за обучение. Детекторът разпознава това, което е видял. Един, обучен на хиляди отворени генератори, се справя добре с необичайни модели. Един, обучен на четирите най-големи търговски инструмента, се справя с тези четири по-добре и с всичко останало по-зле.
- Различни линии на решение. Един инструмент определя 60 като съмнително, друг определя 75 като съмнително. Същото отчитане пресича един праг, а друг – не, така че получавате две присъди от едно измерване.
- Различни определения. Някои инструменти отчитат всякаква генеративна намеса, включително мащабиране или генеративно запълване. Други отбелязват само напълно синтетични кадри. Ретушираният портрет е AI за първия и реален за втория.
- Различна предварителна обработка. Инструментите оразмеряват, изрязват и прекодират преди оценяването. Детектор, който чете квадрат с размери 224 пиксела от центъра, вижда различна картина от този, който чете 384 пиксела от целия кадър.
Инструмент Г не е по-чувствителен от останалите. Той отговаря на по-широк въпрос. Ако вашата грижа е дали една фотография е била инсценирана от генератор, Г надвишава отчетите. Ако вашата грижа е дали какъвто и да е AI е докоснал файла, Г е единственият, който ви отговаря.
Попитайте на какъв въпрос отговаря всеки инструмент
| Въпросът | Какво го отбелязва | Типична употреба |
|---|---|---|
| Генериран ли е този кадър от нищото? | Синтетична текстура на целия кадър | Новини, обяви на пазара, запознанства |
| Редактирана ли е някоя част от това от AI? | Един регион над линията | Застраховки, претенции, преглед на доказателства |
| Докоснал ли е изобщо някакъв AI този файл? | Мащабиране, премахване на шум, генеративно запълване | Библиотеки за стокови изображения, правила за състезания |
Повечето несъгласия между инструментите всъщност са несъгласие относно това за кое от тези трите сте попитали. Преди да сравнявате резултатите, решете кой въпрос има значение за вас, след това прочетете всеки инструмент спрямо него.
Как да сравните два резултата правилно
-
Подайте на двата инструмента идентичния файл
Не повторно изтегляне, не екранна снимка, не копие, което е преминало през приложение за чат. Различните байтове са различно изображение и законно ще получат различен резултат.
-
Сравнявайте ленти, а не числа
Число 61 на скала с линия на 50 и 58 на скала с линия на 65 не са съгласни относно присъдата, докато са съгласни относно отчитането.
-
Търсете публикуван праг
Инструмент, който не казва къде стои неговата линия, не може да се сравнява с нищо. Третирайте числото като неинтерпретируемо, а не като доказателство.
-
Предпочитайте инструмента, който показва работата си
Карта на регионите, назована лента и посочен бенчмарк ви позволяват да проверите обосновката. Уверен етикет без нищо зад него – не.
-
Третирайте съгласието като силен сигнал
Два независими инструмента, достигащи една и съща лента, струват повече от който и да е от тях сам по себе си. Двама несъгласни означава несигурно, а не разделяне на разликата.
Когато несъгласието е констатацията
Един модел заслужава да се научите да разпознавате. Инструмент, който отчита нисък резултат за целия кадър заедно с друг, който отчита висок резултат, често означава, че изображението е истинска снимка с локална корекция.
Първият инструмент усреднява корекцията върху предимно истински кадър. Вторият преценява най-силния регион. И двамата са прави за това, което са измерили, и самото несъгласие ви е казало повече от всяко число.
Едно поле над линията на решение вътре в иначе студен кадър. Никое единично число не улавя това.
Какво би накарало детекторите да се съгласят
Споделен бенчмарк, публикувани линии на решение и договорено определение за това какво се брои за намеса на AI биха премахнали по-голямата част от разпространението. Нито едно от тези неща все още не съществува и има малък търговски натиск да бъдат създадени, защото инструмент, който публикува слабостите си, изглежда по-зле от този, който не го прави.
Докато това не се промени, третирайте всяка оценка като идваща от частна скала. Прочетете доказателствата, които инструментът ви показва, и ги претеглете по-сериозно от увереността в неговия етикет.
Проблемът с версиите, който никой не споменава
Детекторът не е едно нещо с течение на времето. Доставчиците преобучават, коригират прагове и сменят модели без предизвестие и почти никой от тях не номерира версиите на своя изход. Резултатът, който сте получили през март, и резултатът, който получавате днес, може да идват от различни модели с различно калибриране зад тях.
Това е от значение, ако записвате резултати. Досие по иск, дневник за модерация или академичен случай, който цитира резултат от преди осемнадедесет месеца, цитира измерване, чийто инструмент вече не съществува. Няма начин да се възпроизведе и няма начин да се провери какво е означавало по това време.
Когато запазвате резултати, запазвайте доказателствата към тях: оценките на регионите, диапазона, границата на решение и датата. Те остават разбираеми, след като моделът зад тях е обновен, за разлика от едноличния процент.