Model neye bakıyor
Bir kamera, ışığı mercek aracılığıyla bir sensöre kaydeder. Bu süreç, belirli bir tür gürültü, kenarlara doğru azalan belirli bir keskinlik deseni ve sensör ızgarası ile onu takip eden demosaicing işleminden kaynaklanan, bitişik pikseller arasında belirli bir ilişki bırakır.
Bir diffusion modeli, tutarlı bir şey ortaya çıkana kadar rastgele bir alandan gürültüyü defalarca kaldırarak bir görsel oluşturur. Bu süreç de bir imza bırakır ve bu farklıdır. Sonuç hem görsel olarak mükemmel hem de istatistiksel olarak ayırt edilebilir olabilir.
Meta veriler kaybolduğunda bile tespitin ekran görüntüsünde hayatta kalmasının nedeni budur. İmza bir başlıkta değil, piksel değerlerinin kendisindedir; bu nedenle pikselleri kopyalamak kanıtı da kopyalar.
Dört aşama
- 1 Dosyayı oku Tarayıcıda çözülür, asla yüklenmez
- 2 Kareyi puanla 384 piksel karede vision transformer
- 3 Döşemeleri puanla Örtüşen bölgelerde aynı model
- 4 Kimlik bilgilerini oku Varsa C2PA ve oluşturucu işaretleri
Birinci aşama: kod çözme
Dosya, sayfa tarafından diskten okunur ve ham piksellere dönüştürülür. HEIC, AVIF, TIFF ve diğerleri tarayıcının kendi kod çözücüleri tarafından işlenir. Hiçbir şey iletilmez; bu, bir sunucuda uygulanan bir politikadan ziyade çalışmanın gerçekleştiği yerin bir özelliğidir.
İkinci aşama: tüm kare puanı
Görsel 384 piksel kareye yeniden boyutlandırılır ve bir vision transformer üzerinden geçirilir. Model, karenin sentetik olduğuna dair ham bir olasılık döndürür. Bu sayı daha sonra kalibre edilir, böylece modelle birlikte kaymak yerine yayınlanan bantlarla tutarlı bir şekilde eşleşir.
Yeniden boyutlandırma detay kaybına yol açar; bu, doğruluğun azaldığı ilk yerdir. Ayrıca kaçınılmazdır: modelin sabit bir giriş boyutu vardır ve 4000 piksellik bir fotoğrafın buna sığması için küçültülmesi gerekir.
Üçüncü aşama: döşeme geçişi
Kare, örtüşen bölgelere bölünür ve her biri aynı model tarafından ayrı ayrı puanlanır. Tamamen oluşturulmuş bir görseli, üzerinde eklemeler yapılmış gerçek bir fotoğraftan ayıran şey budur ve tek bir sayının yerini tutamayacağı aşama budur.
Bunların ortalaması 21 sonucunu verir. Döşeme görünümü, ortalamanın yok ettiği bilgiyi korur.
Döşemelerin anlamlı olması için yeterli piksele ihtiyacı vardır; bu yüzden daha kısa kenarda yaklaşık 576 pikselin altındaki görseller sadece tüm kare puanı alır. Küçük bir kırpmada, onu bağımsız olarak puanlamaya yetecek kadar detay yoktur.
Dördüncü aşama: dosyanın kendi kaydı
Piksellerden ayrı olarak, dosya Content Credentials ve bazı araçlar tarafından bırakılan oluşturucu işaretleri için kontrol edilir. Bu yol istatistiksel değil, kriptografiktir: geçerli bir imza tahmin edilmez, bir güven listesine karşı kontrol edilir.
Sonuçlar nasıl birleştirilir
İki yol ortalamaya dahil edilmez çünkü farklı ağırlıklara sahiptirler. Kamera çekimi olduğunu belirten geçerli bir kimlik bilgisi, orta düzeydeki bir piksel puanından daha ağır basar. Yapay zeka tarafından oluşturulduğunu belirten bir kimlik bilgisi, soruyu tek başına çözüme kavuşturur.
| Kanıt | Tür | Ağırlık |
|---|---|---|
| Yapay zeka oluşturumunu belirten geçerli kimlik bilgisi | Kriptografik | Belirleyici |
| Kamera çekimi olduğunu belirten geçerli kimlik bilgisi | Kriptografik | Çok güçlü |
| Dosyadaki oluşturucu işareti | Bildirimsel | Güçlü ama çıkarılabilir |
| Tüm kare piksel puanı | İstatistiksel | Orta |
| Bölge döşeme puanları | İstatistiksel | Orta ve daha spesifik |
| Kimlik bilgisi yok | Hiçbir şey | Her iki yönde de bilgi yok |
Son satır, insanların en sık yanlış yorumladığı satırdır. Eksik bir kimlik bilgisi olumsuz bir sinyal değildir. Bugüne kadar üretilen görsellerin büyük çoğunluğu hiçbir şey taşımaz ve neredeyse her platform yükleme sırasında bunları temizler.
Neden tarayıcıda çalışır
Model yaklaşık 40 MB boyutundadır ve ziyaretçinin kendi cihazında WebAssembly aracılığıyla çalışır. Bu, anlaşılması gereken üç sonucu olan bilinçli bir mimari tercihtir.
- Hiçbir şey yüklenmez, bu yüzden kimsenin görsellerini tutan bir sunucu ve belgelenmesi gereken bir veri işleme ilişkisi yoktur.
- Bir kontrolün sunulması hiçbir şeye mal olmaz, bu yüzden araç, arkasında kullanım sayacı olmadan ücretsiz olabilir.
- İlk kontrol daha yavaştır, çünkü model çalışmadan önce bir kez indirilir. Sonraki kontroller önbelleğe alınan kopyayı yeniden kullanır.
İşlem hattının kasıtlı olarak yapmadıkları
Daha eski adli tıp araçlarında görünen birçok teknik, modern platformlardan geçen görseller üzerinde artık çalışmadığı için yoktur.
- Hata düzeyi analizi. Popülerdir, yaygın olarak yanlış okunur ve birden fazla kez kaydedilen herhangi bir görselde güvenilmezdir.
- Kopyala-yapıştır tespiti. Bir kare içindeki çoğaltılmış bölgeleri bulur; bu, eski tarz klonlamayı yakalar, oluşturmayı değil.
- Meta veri tabanlı kararlar. EXIF, neredeyse her yerde yükleme sırasında temizlenir, bu nedenle buna dayanan bir kontrol, insanların doğrulaması gereken görsellerde tam olarak başarısız olur.
- Yüz tabanlı analiz. Dar bir manipülasyon sınıfı için yararlıdır ve diğer her şeye karşı kördür.