Какво измерва балансираната точност
Обикновената точност се надува лесно. Ако подадете на детектора тестов набор, който е 90 процента генерирани изображения, и модел, който казва „да“ на всичко, той постига 90 процента, докато е безполезен.
Балансираната точност коригира това, като претегля истинските и генерираните изображения еднакво, така че числото е средната стойност на две съотношения: колко често истинските фотографии са правилно изчистени и колко често генерираните изображения са правилно маркирани. Инструмент, който цитира обикновена точност без да назове своя тестов микс, не ви казва много.
Двата начина, по които детекторът греши
Едно число скрива две много различни грешки и те носят много различни разходи.
Фалшиво положителен резултат
- Истинска фотография получи оценка над линията
- Причинено от мащабиране, ретуш, нощен режим, екранни снимки
- Цена: обвинение срещу реален човек
- Грешката, която нанася реална вреда
Фалшиво отрицателен резултат
- Генерирано изображение получи оценка под линията
- Причинено от нови генератори, малки редакции, изпрани файлове
- Цена: фалшификат преминава неоспорен
- Грешката, която хората забелязват по-малко
Преместването на границата на решението заменя едното с другото. Нейното понижаване улавя повече фалшификати и отбелязва повече истински снимки. Нейното повишаване защитава истинските изображения и пропуска повече фалшификати. Няма настройка, която да подобрява и двете, поради което границата е зададена на 65, а не е настроена скрито.
Защо референтните данни надценяват реалното представяне
| Тестово изображение | Вашето изображение | Влияние върху оценката |
|---|---|---|
| Оригинален файл, никога презаписван | Компресиран два или три пъти | Точността спада с няколко пункта |
| Пълна резолюция | Изрязан или с намалена резолюция за чат приложение | По-малко детайли за четене, повече несигурност |
| Генератори, познати по време на обучението | Модел, пуснат миналия месец | Постоянната слабост на всеки детектор |
| Чиста снимка или чист рендър | Истинска снимка с една AI корекция | Оценката на цялата рамка я подценява |
| Без съпротивителна обработка | Умишлено манипулиран за преминаване | Проектиран да заобиколи измерването |
Никое от тези неща не са необичайни случаи. Те описват как изображенията всъщност се пренасят. Картина, която достига до вас през две платформи и екранна снимка, вече е загубила голяма част от сигнала, на който е бил измерван бенчмаркът.
Как да тълкувате твърдение за точност
- Попитайте за тестовия набор. Данни без назован бенчмарк са маркетинг. Данни на публичен бенчмарк могат да бъдат проверени от някой друг.
- Попитайте дали е балансиран или обикновен. Обикновената точност на несиметричен тестов набор е числото, което най-лесно се напомпа.
- Попитайте къде стои границата на решението. Точността е безсмислена без знанието на прага, при който е измерена.
- Попитайте кои генератори са били включени. Всеки детектор се представя добре с моделите, на които е обучен, и по-зле с тези, пуснати след това.
- Попитайте отделно за процента фалшивоположителни резултати. Това е числото, което решава дали инструментът е безопасен за използване върху реални хора.
Какво не може да ви каже точността
Един бенчмарк измерва колко често даден модел е прав сред множество изображения. Той не казва нищо за това дали е прав за вашите. Към един единствен резултат няма прикачен доверителен интервал и детекторът не може да знае коя от грешките си прави.
Ето защо картата на регионите и файловите доказателства са по-важни от заглавната цифра. Съгласуваността между независими сигнали струва повече от силно число от един от тях, а несъгласуваността сама по себе си е констатация.
Как да тествате детектор сами
Не е нужно да приемате чиито и да било данни на доверие. Полезният тест отнема следобед и ви казва повече за даден инструмент, отколкото който и да е публикуван бенчмарк, защото използва изображения, които приличат на вашите.
-
Изградете набор, чиито резултати вече знаете
Двадесет фотографии, които сте направили сами, и двадесет изображения, които сте генерирали. Запазете оригиналите непокътнати. Двадесет от всеки вид са достатъчни, за да изложат на показ очевидно слаб инструмент.
-
Включете неудобната среда
Добавете екранни снимки на собствените си снимки, нощни кадри, мащабирано изрязване и силно ретуширан портрет. Тук детекторите се провалят и това е частта, която всеки бенчмарк на доставчик пропуска.
-
Запишете оценката и категорията, а не присъда
Запишете какво е върнал всеки инструмент. Сравняването на категории е по-информативно от сравняването на числа, тъй като два инструмента могат да поставят границите си на решения на различни места.
-
Пребройте двата вида грешки отделно
Колко от вашите истински снимки са били маркирани и колко от вашите генерирани изображения са били пропуснати. Инструмент, който никога не пропуска фалшификат, като маркира една трета от вашите собствени снимки, е неизползваем за хора.
Числото, което има значение, е първото: колко често нарича собствената ви работа фалшива. Това е провалът, който носи цена и който заглавната цифра за точност замазва със средна стойност.