← Tüm rehberler Teknik altyapı

Yapay zeka görsel tespiti aslında nasıl çalışır

Bir dosya bırakıp bir puan okuyana kadar geçen sürede neler olur: piksel modeli, döşeme geçişi, dosya kanıtı ve bu üçünün nasıl birleştirildiği.

· 8 dakika okuma · Best AI Image Detector

Bir vision transformer tüm kareyi puanlar, aynı model kareleri döşemeler halinde tekrar puanlar, ayrı bir okuyucu dosyanın kendi kimlik bilgilerini kontrol eder ve bu üç sonuç, kalibre edilmiş tek bir sayıya dönüştürülür.

Model neye bakıyor

Bir kamera, ışığı mercek aracılığıyla bir sensöre kaydeder. Bu süreç, belirli bir tür gürültü, kenarlara doğru azalan belirli bir keskinlik deseni ve sensör ızgarası ile onu takip eden demosaicing işleminden kaynaklanan, bitişik pikseller arasında belirli bir ilişki bırakır.

Bir diffusion modeli, tutarlı bir şey ortaya çıkana kadar rastgele bir alandan gürültüyü defalarca kaldırarak bir görsel oluşturur. Bu süreç de bir imza bırakır ve bu farklıdır. Sonuç hem görsel olarak mükemmel hem de istatistiksel olarak ayırt edilebilir olabilir.

Meta veriler kaybolduğunda bile tespitin ekran görüntüsünde hayatta kalmasının nedeni budur. İmza bir başlıkta değil, piksel değerlerinin kendisindedir; bu nedenle pikselleri kopyalamak kanıtı da kopyalar.

Dört aşama

  1. 1 Dosyayı oku Tarayıcıda çözülür, asla yüklenmez
  2. 2 Kareyi puanla 384 piksel karede vision transformer
  3. 3 Döşemeleri puanla Örtüşen bölgelerde aynı model
  4. 4 Kimlik bilgilerini oku Varsa C2PA ve oluşturucu işaretleri
Birleşen iki bağımsız kanıt yolu. Hiçbirinden cevabı tek başına taşıması istenmez.

Birinci aşama: kod çözme

Dosya, sayfa tarafından diskten okunur ve ham piksellere dönüştürülür. HEIC, AVIF, TIFF ve diğerleri tarayıcının kendi kod çözücüleri tarafından işlenir. Hiçbir şey iletilmez; bu, bir sunucuda uygulanan bir politikadan ziyade çalışmanın gerçekleştiği yerin bir özelliğidir.

İkinci aşama: tüm kare puanı

Görsel 384 piksel kareye yeniden boyutlandırılır ve bir vision transformer üzerinden geçirilir. Model, karenin sentetik olduğuna dair ham bir olasılık döndürür. Bu sayı daha sonra kalibre edilir, böylece modelle birlikte kaymak yerine yayınlanan bantlarla tutarlı bir şekilde eşleşir.

Yeniden boyutlandırma detay kaybına yol açar; bu, doğruluğun azaldığı ilk yerdir. Ayrıca kaçınılmazdır: modelin sabit bir giriş boyutu vardır ve 4000 piksellik bir fotoğrafın buna sığması için küçültülmesi gerekir.

Üçüncü aşama: döşeme geçişi

Kare, örtüşen bölgelere bölünür ve her biri aynı model tarafından ayrı ayrı puanlanır. Tamamen oluşturulmuş bir görseli, üzerinde eklemeler yapılmış gerçek bir fotoğraftan ayıran şey budur ve tek bir sayının yerini tutamayacağı aşama budur.

14 11 16 12 88 13 9 15 10

Bunların ortalaması 21 sonucunu verir. Döşeme görünümü, ortalamanın yok ettiği bilgiyi korur.

Aynı model, örtüşen kırpmalar üzerinde dokuz kez çalıştırıldı. Bu görsel için tüm kare puanı 31 idi.

Döşemelerin anlamlı olması için yeterli piksele ihtiyacı vardır; bu yüzden daha kısa kenarda yaklaşık 576 pikselin altındaki görseller sadece tüm kare puanı alır. Küçük bir kırpmada, onu bağımsız olarak puanlamaya yetecek kadar detay yoktur.

Dördüncü aşama: dosyanın kendi kaydı

Piksellerden ayrı olarak, dosya Content Credentials ve bazı araçlar tarafından bırakılan oluşturucu işaretleri için kontrol edilir. Bu yol istatistiksel değil, kriptografiktir: geçerli bir imza tahmin edilmez, bir güven listesine karşı kontrol edilir.

Sonuçlar nasıl birleştirilir

İki yol ortalamaya dahil edilmez çünkü farklı ağırlıklara sahiptirler. Kamera çekimi olduğunu belirten geçerli bir kimlik bilgisi, orta düzeydeki bir piksel puanından daha ağır basar. Yapay zeka tarafından oluşturulduğunu belirten bir kimlik bilgisi, soruyu tek başına çözüme kavuşturur.

Kanıt nasıl ağırlıklandırılır
KanıtTürAğırlık
Yapay zeka oluşturumunu belirten geçerli kimlik bilgisiKriptografikBelirleyici
Kamera çekimi olduğunu belirten geçerli kimlik bilgisiKriptografikÇok güçlü
Dosyadaki oluşturucu işaretiBildirimselGüçlü ama çıkarılabilir
Tüm kare piksel puanıİstatistikselOrta
Bölge döşeme puanlarıİstatistikselOrta ve daha spesifik
Kimlik bilgisi yokHiçbir şeyHer iki yönde de bilgi yok

Son satır, insanların en sık yanlış yorumladığı satırdır. Eksik bir kimlik bilgisi olumsuz bir sinyal değildir. Bugüne kadar üretilen görsellerin büyük çoğunluğu hiçbir şey taşımaz ve neredeyse her platform yükleme sırasında bunları temizler.

Neden tarayıcıda çalışır

Model yaklaşık 40 MB boyutundadır ve ziyaretçinin kendi cihazında WebAssembly aracılığıyla çalışır. Bu, anlaşılması gereken üç sonucu olan bilinçli bir mimari tercihtir.

  • Hiçbir şey yüklenmez, bu yüzden kimsenin görsellerini tutan bir sunucu ve belgelenmesi gereken bir veri işleme ilişkisi yoktur.
  • Bir kontrolün sunulması hiçbir şeye mal olmaz, bu yüzden araç, arkasında kullanım sayacı olmadan ücretsiz olabilir.
  • İlk kontrol daha yavaştır, çünkü model çalışmadan önce bir kez indirilir. Sonraki kontroller önbelleğe alınan kopyayı yeniden kullanır.

İşlem hattının kasıtlı olarak yapmadıkları

Daha eski adli tıp araçlarında görünen birçok teknik, modern platformlardan geçen görseller üzerinde artık çalışmadığı için yoktur.

  • Hata düzeyi analizi. Popülerdir, yaygın olarak yanlış okunur ve birden fazla kez kaydedilen herhangi bir görselde güvenilmezdir.
  • Kopyala-yapıştır tespiti. Bir kare içindeki çoğaltılmış bölgeleri bulur; bu, eski tarz klonlamayı yakalar, oluşturmayı değil.
  • Meta veri tabanlı kararlar. EXIF, neredeyse her yerde yükleme sırasında temizlenir, bu nedenle buna dayanan bir kontrol, insanların doğrulaması gereken görsellerde tam olarak başarısız olur.
  • Yüz tabanlı analiz. Dar bir manipülasyon sınıfı için yararlıdır ve diğer her şeye karşı kördür.

İnsanların sorduğu sorular

Dedektör resimde ne olduğuna bakar mı?
Hayır. Nesneler, yüzler veya sahneler hakkında hiçbir kavramı yoktur. Komşu pikseller arasındaki istatistiksel ilişkileri ölçer; bu yüzden bir portre, sokak sahnesi ve fiş üzerinde aynı şekilde çalışır ve bir görselin içeriğinin doğru olup olmadığını size söyleyemez.
Neden ilk kontrol daha uzun sürer?
Model, herhangi bir şey çalışmadan önce bir kez (yaklaşık 40 MB) indirilir. Bundan sonra önbelleğe alınır ve sonraki kontroller hemen başlar. Bu, sunucu yerine cihazınızda çalışmanın maliyetidir ve size hiçbir şeyin yüklenmediği gerçeğini kazandırır.
Ham model çıktısı nasıl puana dönüştürülür?
Kalibrasyon. Model, sabit bir ölçeğe eşlenen ham bir olasılık döndürür, böylece belirli bir sayı her zaman aynı anlama gelir. Bu adım olmadan, puanlar model her değiştiğinde kayardı ve hiçbir yayınlanmış bant anlamlı kalmazdı.
Neden basit bir ızgara yerine örtüşen döşemeler?
Bir döşeme sınırını aşan bir düzenleme, iki bölgeye bölünür ve her ikisinde de seyreltilirdi. Kırpmaları örtüştürmek, herhangi bir düzenlemenin en az bir bölgenin tamamen içinde kalması anlamına gelir; küçük bir eklemenin ortalamaya dahil edilip kaybolmasını engelleyen şey budur.
Bir görseli hangi oluşturucunun yaptığını söyleyebilir mi?
Sadece dosya öyle söylüyorsa. Bir oluşturucu işareti veya kimlik bilgisi aracı adlandırabilir; piksel modeli adlandıramaz. Oluşturucu bir şeyin dahil edildiğine dair bir olasılık döndürür; bu, tanımlamadan farklı bir sorudur ve güvenilir bir şekilde cevaplanması çok daha kolaydır.
Kare ve döşemeler için aynı model mi kullanılır?
Evet. Bir modeli farklı kırpmalar üzerinde çalıştırmak, iki sonucun karşılaştırılabilir olmasını sağlar. Ayrı bir bölge modelinin kendi kalibrasyonu ve kendi hataları olurdu, bu durumda iki sayı artık aynı ölçekte yer almazdı.