Vad modellen tittar på
En kamera registrerar ljus genom ett objektiv på en sensor. Den processen lämnar en specifik typ av brus, ett visst mönster där skärpan avtar mot kanterna och en särskild relation mellan närliggande pixlar som uppstår ur sensorns färgfilter och den efterföljande interpoleringen (demosaicing).
En diffusionsmodell bygger en bild genom att upprepade gånger ta bort brus från ett slumpmässigt fält tills något sammanhängande framträder. Den processen lämnar också ett spår, och det ser annorlunda ut. Resultatet kan vara visuellt perfekt och samtidigt statistiskt särskiljbart.
Detta är anledningen till att detekteringen fungerar även på en skärmdump när metadata saknas. Signaturen finns i själva pixelvärdena snarare än i filhuvudet, så att kopiera pixlarna innebär att kopiera bevisen.
De fyra stegen
- 1 Läs in filen Avkodas i webbläsaren, laddas aldrig upp
- 2 Bedöm hela bilden Vision transformer i 384 × 384 pixlar
- 3 Bedöm sektionerna Samma modell på överlappande områden
- 4 Läs av metadata C2PA och generatormarkörer, om de finns
Steg ett: avkodning
Filen läses in från disken av sidan och avkodas till råpixlar. HEIC, AVIF, TIFF och övriga format hanteras av webbläsarens egna avkodare. Ingenting överförs, vilket är en följd av var bearbetningen sker snarare än en policy på en server.
Steg två: bedömning av hela bilden
Bilden skalas om till 384 × 384 pixlar och analyseras av en vision transformer. Modellen returnerar en rå sannolikhet för att bilden är syntetisk. Detta värde kalibreras sedan så att det mappas mot de fasta intervallen konsekvent, utan att driva med modellen.
Omskalning gör att detaljer går förlorade, vilket är det första stället där precision tappas. Det är också oundvikligt: modellen har en fast indatastorlek, och ett fotografi på 4000 pixlar måste förminskas för att passa.
Steg tre: sektionsanalys
Bilden delas in i överlappande områden och varje område bedöms separat av samma modell. Det är detta som skiljer en helt genererad bild från ett äkta fotografi där något lagts till, och det är steget som ett enskilt helhetsvärde inte kan ersätta.
Ett genomsnitt av dessa ger 21. Sektionsvyn bevarar informationen som ett medelvärde raderar.
Sektioner kräver tillräckligt med pixlar för att vara meningsfulla. Därför får bilder under cirka 576 pixlar på den kortaste sidan endast en helhetsbedömning. Det finns inte tillräckligt med detaljer i ett litet utsnitt för att bedöma det separat.
Steg fyra: filens egen historik
Separat från pixlarna kontrolleras filen efter Content Credentials och generatormarkörer som vissa verktyg lämnar efter sig. Denna analys är kryptografisk snarare än statistisk: en giltig signatur kontrolleras mot en betrodd lista, inte genom uppskattning.
Hur resultaten kombineras
De två analysvägarna slås inte ihop till ett enkelt genomsnitt, eftersom de väger olika tungt. Ett giltigt certifikat som intygar kamerafångst väger tyngre än ett måttligt pixelresultat. Ett certifikat som anger AI-generering avgör frågan direkt.
| Bevis | Typ | Vikt |
|---|---|---|
| Giltigt certifikat som anger AI-generering | Kryptografisk | Avgörande |
| Giltigt certifikat som anger kamerafångst | Kryptografisk | Mycket stark |
| Generatormarkör i filen | Deklarativ | Stark, men kan tas bort |
| Pixelresultat för hela bilden | Statistisk | Måttlig |
| Sektionsresultat för delområden | Statistisk | Måttlig, och mer specifik |
| Inget certifikat finns | Inget | Ingen information åt något håll |
Den sista raden är den som oftast missförstås. Avsaknad av certifikat är inte en negativ signal. Den överväldigande majoriteten av alla bilder som skapats saknar detta helt, och nästan alla plattformar rensar bort dem vid uppladdning.
Varför verktyget körs i webbläsaren
Modellen är cirka 40 MB och körs via WebAssembly direkt på besökarens enhet. Det är ett medvetet arkitekturval med tre viktiga konsekvenser.
- Ingenting laddas upp, så det finns ingen server som lagrar någons bilder och inget personuppgiftsbiträdesavtal att hantera.
- En analys kostar inget i serverdrift, vilket gör att verktyget kan vara gratis utan begränsningar i användningen.
- Den första analysen tar längre tid, eftersom modellen laddas ner en gång innan den kan köras. Efterföljande körningar återanvänder den sparade kopian.
Vad verktyget medvetet undviker
Flera metoder som förekommer i äldre analysverktyg har valts bort, eftersom de inte längre fungerar på bilder som hanterats av moderna plattformar.
- Felanalys (Error Level Analysis). Populär, ofta feltolkad och opålitlig på bilder som sparats om mer än en gång.
- Kloningsdetektering (Copy-Move). Letar efter duplicerade områden i en bild, vilket fångar klassisk bildmanipulation och inte AI-generering.
- Metadatabaserade bedömningar. EXIF rensas bort vid uppladdning nästan överallt, vilket gör att en kontroll som förlitar sig på detta misslyckas på just de bilder som behöver verifieras.
- Ansiktsspecifik analys. Användbar för en begränsad typ av manipulation, men blind för allt annat.