Какво разглежда моделът
Камерата записва светлина през обектив върху сензор. Този процес оставя специфичен вид шум, специфичен модел на намаляване на рязкостта към краищата и специфично отношение между съседните пиксели, което произтича от сензорната мрежа и последващата обработка.
Дифузионният модел изгражда изображение чрез многократно премахване на шум от случайно поле, докато се появи нещо кохерентно. Този процес също оставя подпис и той е различен. Резултатът може да бъде визуално перфектен и статистически отличим едновременно.
Това е причината откриването да оцелява при екранна снимка, когато метаданните не го правят. Подписът е в самите стойности на пикселите, а не в заглавната част, така че копирането на пикселите копира и доказателството.
Четирите етапа
- 1 Прочетете файла Декодиран в браузъра, никога не качван
- 2 Оценете рамката Vision transformer при 384 пиксела квадрат
- 3 Оценете плочките Същият модел върху припокриващи се региони
- 4 Прочетете идентификационните данни C2PA и маркери на генератора, ако присъстват
Етап първи: декодиране
Файлът се чете от диска от страницата и се декодира в сурови пиксели. HEIC, AVIF, TIFF и останалите се обработват от собствените декодери на браузъра. Нищо не се предава, което е свойство на това къде се извършва работата, а не политика, прилагана на сървър.
Етап втори: оценка на цялата рамка
Изображението се преоразмерява до 384 пиксела квадрат и се прекарва през vision transformer. Моделът връща сурова вероятност кадърът да е синтетичен. След това това число се калибрира, така че да се мапира към публикуваните ленти последователно, вместо да се отклонява с модела.
Преоразмеряването губи детайли, което е първото място, където точността се губи. То е и неизбежно: моделът има фиксиран размер на входните данни и снимка с резолюция 4000 пиксела трябва да бъде намалена, за да се побере.
Етап трети: процесът на разделяне на плочки
Рамката е разделена на припокриващи се региони и всеки от тях се оценява самостоятелно от същия модел. Това е нещото, което отделя напълно генерирано изображение от истинска снимка с добавено нещо, и това е етапът, който едно число не може да замести.
Усредняването на тези резултати дава 21. Изгледът с плочки запазва информацията, която усредняването унищожава.
Плочките се нуждаят от достатъчно пиксели, за да бъдат значими, поради което изображенията под приблизително 576 пиксела от по-кратната страна получават само оценка за цялата рамка. Няма достатъчно детайли в малък отрязък, за да бъде оценен независимо.
Етап четвърти: собственият запис на файла
Отделно от пикселите, файлът се проверява за Content Credentials и за маркери на генератора, оставени от някои инструменти. Този път е криптографски, а не статистически: валидният подпис се проверява спрямо списък с доверени източници, а не се оценява.
Как се комбинират резултатите
Двете пътеки не се усредняват, защото носят различни тегла. Валидно удостоверение, деклариращо заснемане с камера, превишава умерената оценка на пикселите. Удостоверение, деклариращо AI генериране, решава въпроса само по себе си.
| Доказателство | Тип | Тегло |
|---|---|---|
| Валидно удостоверение, деклариращо AI генериране | Криптографско | Решаващо |
| Валидно удостоверение, деклариращо заснемане с камера | Криптографско | Много силно |
| Маркер на генератора във файла | Декларативно | Силно, но подлежащо на премахване |
| Оценка на пикселите за цялата рамка | Статистическо | Умерено |
| Оценки на плочките в регионите | Статистическо | Умерено и по-специфично |
| Няма налично удостоверение | Няма | Няма информация в нито една посока |
Последният ред е този, който хората тълкуват погрешно най-често. Липсващото удостоверение не е отрицателен сигнал. Преобладаващото мнозинство от правените някога изображения нямат такива и почти всяка платформа ги премахва при качване.
Защо работи в браузъра
Моделът е около 40 MB и работи чрез WebAssembly на устройството на самия потребител. Това е съзнателен архитектурен избор с три последици, които си струва да бъдат разбрани.
- Нищо не се качва, така че няма сървър, който да съхранява чиито и да е изображения, и няма отношение за обработка на данни за документиране.
- Проверката не струва нищо за обслужване, поради което инструментът може да бъде безплатен без измерване на използването зад него.
- Първата проверка е по-бавна, тъй като моделът се изтегля веднъж, преди да може да работи. Следващите проверки използват кешираното копие.
Какво съзнателно не прави работният процес
Някои техники, които се срещат в по-старите криминалистични инструменти, липсват, защото те вече не работят върху изображения, които са преминали през съвременни платформи.
- Анализ на ниво грешки (ELA). Популярен, широко погрешно тълкуван и ненадежден за всяко изображение, което е било записвано повече от веднъж.
- Откриване на копиране и преместване. Намира дублирани региони в рамката, което улавя клониране в стар стил, а не генериране.
- Присъди, базирани на метаданни. EXIF се премахва при качване почти навсякъде, така че проверка, която зависи от него, се проваля точно върху изображенията, които хората трябва да верифицират.
- Специфичен за лица анализ. Полезен за един тесен клас манипулации и сляп за всичко останало.