← Всички ръководства Точност

Точност на AI детектор на изображения: какво всъщност означава 91%

Балансирана точност, линии на решение и разликата между лабораторен тест и вашата снимка. Какво обхваща водещото число и какво тихо пропуска.

· 7 мин. четене · Best AI Image Detector

91.3% балансирана точност означава, че приблизително едно изображение на всеки единадесет попада от грешната страна на линията на решение при лабораторни условия върху чисти файлове. Вашето изображение не е лабораторно условие.

Какво измерва балансираната точност

Обикновената точност се надува лесно. Ако подадете на детектора тестов набор, който е 90 процента генерирани изображения, и модел, който казва „да“ на всичко, той постига 90 процента, докато е безполезен.

Балансираната точност коригира това, като претегля истинските и генерираните изображения еднакво, така че числото е средната стойност на две съотношения: колко често истинските фотографии са правилно изчистени и колко често генерираните изображения са правилно маркирани. Инструмент, който цитира обикновена точност без да назове своя тестов микс, не ви казва много.

Балансирана точност по JPEG качество
Чисти оригинали
91.3 %
JPEG качество 60
87.3 %
JPEG качество 40
84.6 %

Оста започва от 80%, за да се чете наклона. Пълна ос 0-100 би скрила ефекта напълно.

Публикуваните данни за използвания тук модел, измерени върху неговия изследователски бенчмарк.

Двата начина, по които детекторът греши

Едно число скрива две много различни грешки и те носят много различни разходи.

Фалшиво положителен резултат

  • Истинска фотография получи оценка над линията
  • Причинено от мащабиране, ретуш, нощен режим, екранни снимки
  • Цена: обвинение срещу реален човек
  • Грешката, която нанася реална вреда

Фалшиво отрицателен резултат

  • Генерирано изображение получи оценка под линията
  • Причинено от нови генератори, малки редакции, изпрани файлове
  • Цена: фалшификат преминава неоспорен
  • Грешката, която хората забелязват по-малко
Единична цифра на точност изчислява средното за тези двете. Те не са взаимозаменяеми и повечето хора се интересуват много повече от едната.

Преместването на границата на решението заменя едното с другото. Нейното понижаване улавя повече фалшификати и отбелязва повече истински снимки. Нейното повишаване защитава истинските изображения и пропуска повече фалшификати. Няма настройка, която да подобрява и двете, поради което границата е зададена на 65, а не е настроена скрито.

Защо референтните данни надценяват реалното представяне

Разликата между тестови набор и изображение, което някой ви изпраща
Тестово изображениеВашето изображениеВлияние върху оценката
Оригинален файл, никога презаписванКомпресиран два или три пътиТочността спада с няколко пункта
Пълна резолюцияИзрязан или с намалена резолюция за чат приложениеПо-малко детайли за четене, повече несигурност
Генератори, познати по време на обучениетоМодел, пуснат миналия месецПостоянната слабост на всеки детектор
Чиста снимка или чист рендърИстинска снимка с една AI корекцияОценката на цялата рамка я подценява
Без съпротивителна обработкаУмишлено манипулиран за преминаванеПроектиран да заобиколи измерването

Никое от тези неща не са необичайни случаи. Те описват как изображенията всъщност се пренасят. Картина, която достига до вас през две платформи и екранна снимка, вече е загубила голяма част от сигнала, на който е бил измерван бенчмаркът.

Как да тълкувате твърдение за точност

  • Попитайте за тестовия набор. Данни без назован бенчмарк са маркетинг. Данни на публичен бенчмарк могат да бъдат проверени от някой друг.
  • Попитайте дали е балансиран или обикновен. Обикновената точност на несиметричен тестов набор е числото, което най-лесно се напомпа.
  • Попитайте къде стои границата на решението. Точността е безсмислена без знанието на прага, при който е измерена.
  • Попитайте кои генератори са били включени. Всеки детектор се представя добре с моделите, на които е обучен, и по-зле с тези, пуснати след това.
  • Попитайте отделно за процента фалшивоположителни резултати. Това е числото, което решава дали инструментът е безопасен за използване върху реални хора.

Какво не може да ви каже точността

Един бенчмарк измерва колко често даден модел е прав сред множество изображения. Той не казва нищо за това дали е прав за вашите. Към един единствен резултат няма прикачен доверителен интервал и детекторът не може да знае коя от грешките си прави.

Ето защо картата на регионите и файловите доказателства са по-важни от заглавната цифра. Съгласуваността между независими сигнали струва повече от силно число от един от тях, а несъгласуваността сама по себе си е констатация.

Как да тествате детектор сами

Не е нужно да приемате чиито и да било данни на доверие. Полезният тест отнема следобед и ви казва повече за даден инструмент, отколкото който и да е публикуван бенчмарк, защото използва изображения, които приличат на вашите.

  1. Изградете набор, чиито резултати вече знаете

    Двадесет фотографии, които сте направили сами, и двадесет изображения, които сте генерирали. Запазете оригиналите непокътнати. Двадесет от всеки вид са достатъчни, за да изложат на показ очевидно слаб инструмент.

  2. Включете неудобната среда

    Добавете екранни снимки на собствените си снимки, нощни кадри, мащабирано изрязване и силно ретуширан портрет. Тук детекторите се провалят и това е частта, която всеки бенчмарк на доставчик пропуска.

  3. Запишете оценката и категорията, а не присъда

    Запишете какво е върнал всеки инструмент. Сравняването на категории е по-информативно от сравняването на числа, тъй като два инструмента могат да поставят границите си на решения на различни места.

  4. Пребройте двата вида грешки отделно

    Колко от вашите истински снимки са били маркирани и колко от вашите генерирани изображения са били пропуснати. Инструмент, който никога не пропуска фалшификат, като маркира една трета от вашите собствени снимки, е неизползваем за хора.

Числото, което има значение, е първото: колко често нарича собствената ви работа фалшива. Това е провалът, който носи цена и който заглавната цифра за точност замазва със средна стойност.

Въпроси, които хората задават

Добра ли е 91% точност за AI детектор на изображения?
Това е разумна цифра за базиран на пиксели детектор на чист бенчмарк и тя не е достатъчно висока, за да се действа въз основа само на нея. Девет погрешни решения в сто са много, когато всяко едно от тях може да е обвинение. Третирайте го като инструмент за скрининг, който ви показва къде да гледате, а не като тест, който решава въпроса.
Кой AI детектор за изображения е най-точен?
Честният отговор е, че публикуваните данни не са сравними. Различните инструменти използват различни тестови набори, различни граници на решенията и различни определения за точност, така че числата измерват различни неща. Вместо това сравнете това, което инструментът ви показва: публикувани категории, карта на регионите и посочен процент на фалшивоположителни резултати.
Подобрява ли се точността с усъвършенстването на моделите?
Детекцията и генерирането се подобряват заедно, така че разликата остава горе-долу постоянна. Всеки нов генератор е непознати данни за всеки съществуващ детектор и преобучението следва пускането, вместо да го предхожда. Очаквайте трайно закъснение, а не решен проблем.
Защо един и същ инструмент дава различни оценки за една и съща снимка?
Това не трябва да се случва и ако става така, двата файла се различават. Копие, което е било презаписано, преоразмерено или прекарано през платформа, е различен файл с различни пиксели. Сравнете оригинала с оригинала, а не оригинала с негово изтеглено копие.