← Всички ръководства Под капака

Как всъщност работи откриването на AI изображения

Какво се случва между пускането на файл и четенето на резултат: пикселният модел, процеса на разделяне на плочки, данните във файла и как трите са комбинирани.

· 8 мин. четене · Best AI Image Detector

Vision transformer оценява цялата рамка, същият модел я оценява отново на плочки, отделен четец проверява собствените идентификационни данни на файла и трите резултата се комбинират в едно калибрирано число.

Какво разглежда моделът

Камерата записва светлина през обектив върху сензор. Този процес оставя специфичен вид шум, специфичен модел на намаляване на рязкостта към краищата и специфично отношение между съседните пиксели, което произтича от сензорната мрежа и последващата обработка.

Дифузионният модел изгражда изображение чрез многократно премахване на шум от случайно поле, докато се появи нещо кохерентно. Този процес също оставя подпис и той е различен. Резултатът може да бъде визуално перфектен и статистически отличим едновременно.

Това е причината откриването да оцелява при екранна снимка, когато метаданните не го правят. Подписът е в самите стойности на пикселите, а не в заглавната част, така че копирането на пикселите копира и доказателството.

Четирите етапа

  1. 1 Прочетете файла Декодиран в браузъра, никога не качван
  2. 2 Оценете рамката Vision transformer при 384 пиксела квадрат
  3. 3 Оценете плочките Същият модел върху припокриващи се региони
  4. 4 Прочетете идентификационните данни C2PA и маркери на генератора, ако присъстват
Две независими пътеки на доказателства, които се събират. От нито една не се изисква да носи отговора сама.

Етап първи: декодиране

Файлът се чете от диска от страницата и се декодира в сурови пиксели. HEIC, AVIF, TIFF и останалите се обработват от собствените декодери на браузъра. Нищо не се предава, което е свойство на това къде се извършва работата, а не политика, прилагана на сървър.

Етап втори: оценка на цялата рамка

Изображението се преоразмерява до 384 пиксела квадрат и се прекарва през vision transformer. Моделът връща сурова вероятност кадърът да е синтетичен. След това това число се калибрира, така че да се мапира към публикуваните ленти последователно, вместо да се отклонява с модела.

Преоразмеряването губи детайли, което е първото място, където точността се губи. То е и неизбежно: моделът има фиксиран размер на входните данни и снимка с резолюция 4000 пиксела трябва да бъде намалена, за да се побере.

Етап трети: процесът на разделяне на плочки

Рамката е разделена на припокриващи се региони и всеки от тях се оценява самостоятелно от същия модел. Това е нещото, което отделя напълно генерирано изображение от истинска снимка с добавено нещо, и това е етапът, който едно число не може да замести.

14 11 16 12 88 13 9 15 10

Усредняването на тези резултати дава 21. Изгледът с плочки запазва информацията, която усредняването унищожава.

Същият модел, пуснат девет пъти върху припокриващи се отрязъци. Резултатът за цялата рамка за това изображение беше 31.

Плочките се нуждаят от достатъчно пиксели, за да бъдат значими, поради което изображенията под приблизително 576 пиксела от по-кратната страна получават само оценка за цялата рамка. Няма достатъчно детайли в малък отрязък, за да бъде оценен независимо.

Етап четвърти: собственият запис на файла

Отделно от пикселите, файлът се проверява за Content Credentials и за маркери на генератора, оставени от някои инструменти. Този път е криптографски, а не статистически: валидният подпис се проверява спрямо списък с доверени източници, а не се оценява.

Как се комбинират резултатите

Двете пътеки не се усредняват, защото носят различни тегла. Валидно удостоверение, деклариращо заснемане с камера, превишава умерената оценка на пикселите. Удостоверение, деклариращо AI генериране, решава въпроса само по себе си.

Как се претеглят доказателствата
ДоказателствоТипТегло
Валидно удостоверение, деклариращо AI генериранеКриптографскоРешаващо
Валидно удостоверение, деклариращо заснемане с камераКриптографскоМного силно
Маркер на генератора във файлаДекларативноСилно, но подлежащо на премахване
Оценка на пикселите за цялата рамкаСтатистическоУмерено
Оценки на плочките в регионитеСтатистическоУмерено и по-специфично
Няма налично удостоверениеНямаНяма информация в нито една посока

Последният ред е този, който хората тълкуват погрешно най-често. Липсващото удостоверение не е отрицателен сигнал. Преобладаващото мнозинство от правените някога изображения нямат такива и почти всяка платформа ги премахва при качване.

Защо работи в браузъра

Моделът е около 40 MB и работи чрез WebAssembly на устройството на самия потребител. Това е съзнателен архитектурен избор с три последици, които си струва да бъдат разбрани.

  • Нищо не се качва, така че няма сървър, който да съхранява чиито и да е изображения, и няма отношение за обработка на данни за документиране.
  • Проверката не струва нищо за обслужване, поради което инструментът може да бъде безплатен без измерване на използването зад него.
  • Първата проверка е по-бавна, тъй като моделът се изтегля веднъж, преди да може да работи. Следващите проверки използват кешираното копие.

Какво съзнателно не прави работният процес

Някои техники, които се срещат в по-старите криминалистични инструменти, липсват, защото те вече не работят върху изображения, които са преминали през съвременни платформи.

  • Анализ на ниво грешки (ELA). Популярен, широко погрешно тълкуван и ненадежден за всяко изображение, което е било записвано повече от веднъж.
  • Откриване на копиране и преместване. Намира дублирани региони в рамката, което улавя клониране в стар стил, а не генериране.
  • Присъди, базирани на метаданни. EXIF се премахва при качване почти навсякъде, така че проверка, която зависи от него, се проваля точно върху изображенията, които хората трябва да верифицират.
  • Специфичен за лица анализ. Полезен за един тесен клас манипулации и сляп за всичко останало.

Въпроси, които хората задават

Детекторът разглежда ли какво има в снимката?
Не. Той няма представа за обекти, лица или сцени. Той измерва статистически взаимоотношения между съседните пиксели, което е причината да работи еднакво добре върху портрет, улична сцена и касова бележка, и защо не може да ви каже дали съдържанието на изображението е истинско.
Защо първата проверка отнема повече време?
Моделът се изтегля веднъж, около 40 MB, преди нещо да може да работи. След това той се кешира и следващите проверки започват незабавно. Това е цената на работата на вашето устройство, вместо на сървър, и тя ви осигурява факта, че нищо не се качва.
Как суровият изход от модела се превръща в оценка?
Калибриране. Моделът връща сурова вероятност, която се мапира към фиксирана скала, така че дадено число винаги означава едно и също нещо. Без тази стъпка оценките биха се променили при всяка промяна на модела и нито една публикувана лента нямаше да остане значима.
Защо припокриващи се плочки, а не обикновена мрежа?
Редакция, която се простира върху границата на плочка, ще бъде разделена между два региона и разредена и в двата. Припокриването на отрязъците означава, че всяка редакция попада изцяло в поне един регион, което е нещото, което предпазва малка вложка от това да бъде усреднена.
Може ли да каже кой генератор е създал изображение?
Само когато файлът го казва. Маркер на генератор или удостоверение може да назове инструмента; пикселният модел не може. Той връща вероятност нещо генеративно да е било включено, което е различен въпрос от идентификацията и много по-лесен за надежден отговор.
Използва ли се същият модел за рамката и за плочките?
Да. Изпълнението на един модел върху различни отрязъци е нещото, което прави двата резултата съпоставими. Отделен регионален модел би имал собствено калибриране и собствени грешки и двете числа вече нямаше да са на една и съща скала.