← Tüm rehberler Doğruluk

Yapay zeka görsel tespit doğruluğu: %91 aslında ne anlama geliyor?

Dengeli doğruluk, karar çizgileri ve bir kıyaslama ile görseliniz arasındaki fark. Başlık numarasının neyi kapsadığı ve neleri sessizce dışarıda bıraktığı.

· 7 dakika okuma · Best AI Image Detector

91.3% dengeli doğruluk, temiz dosyalarda laboratuvar koşulları altında yaklaşık on bir görselden birinin karar çizgisinin yanlış tarafına düştüğü anlamına gelir. Görseliniz laboratuvar koşulu değildir.

Dengeli doğruluk neyi ölçer

Düz doğruluğu şişirmek kolaydır. Bir dedektöre yüzde 90'ı üretilmiş görsellerden oluşan bir test seti verin; her şeye evet diyen bir model yüzde 90 skor yapar ama işe yaramaz olur.

Dengeli doğruluk, gerçek ve üretilmiş görselleri eşit ağırlıklandırarak bunu düzeltir; böylece rakam iki oranın ortalamasıdır: gerçek fotoğrafların ne sıklıkla doğru temizlendiği ve üretilmiş görsellerin ne sıklıkla doğru işaretlendiği. Test karışımını belirtmeden düz doğruluk alıntılayan bir araç size pek bir şey anlatmıyordur.

JPEG kalitesine göre dengeli doğruluk
Temiz orijinaller
91.3 %
JPEG kalitesi 60
87.3 %
JPEG kalitesi 40
84.6 %

Eksen %80'den başlar, böylece eğim okunabilir. Tam bir 0-100 ekseni etkiyi tamamen gizlerdi.

Burada kullanılan model için araştırma kıyaslamasında ölçülen yayınlanmış rakamlar.

Bir dedektörün yanılmasının iki yolu

Tek bir rakam, birbirinden çok farklı iki hatayı gizler ve bunların maliyetleri çok farklıdır.

Yanlış pozitif

  • Çizginin üzerinde skor alan gerçek bir fotoğraf
  • Ölçekleme, rötuş, gece modu, ekran görüntüleri kaynaklı
  • Maliyet: gerçek bir kişiye karşı suçlama
  • Gerçek zarar veren hata

Yanlış negatif

  • Çizginin altında skor alan üretilmiş bir görsel
  • Yeni üreticiler, küçük düzenlemeler, temizlenmiş dosyalar kaynaklı
  • Maliyet: sahte bir şeyin itiraz edilmeden geçmesi
  • İnsanların daha az fark ettiği hata
Tek bir doğruluk rakamı bu ikisinin ortalamasını alır. Bunlar birbirinin yerine geçemez ve çoğu insan bunlardan biriyle çok daha fazla ilgilenir.

Karar çizgisini hareket ettirmek, ikisi arasında bir takas yaratır. Çizgiyi aşağı çekmek daha fazla sahte görseli yakalar ve daha fazla gerçek fotoğrafı işaretler. Çizgiyi yukarı çekmek orijinal görselleri korur ancak daha fazla sahte görselin gözden kaçmasına neden olur. Her iki durumu da iyileştiren bir ayar yoktur; bu nedenle çizgi sessizce ayarlanmak yerine 65 olarak yayınlanmıştır.

Kıyaslama rakamları gerçek performansı neden abartır?

Bir test seti ile birinin size gönderdiği görsel arasındaki fark
Kıyaslama görseliGörselinizPuana etkisi
Orijinal dosya, yeniden kaydedilmemişİki veya üç kez sıkıştırılmışDoğruluk birkaç puan düşer
Tam çözünürlükSohbet uygulaması için kırpılmış veya küçültülmüşOkunacak daha az ayrıntı, daha fazla belirsizlik
Eğitim sırasında bilinen üreticilerGeçen ay yayınlanan bir modelHer dedektörün kalıcı zayıflığı
Temiz fotoğraf veya temiz renderBir yapay zeka düzenlemesi içeren gerçek fotoğrafTüm kare puanı durumu olduğundan düşük gösterir
Düşmanca (adversarial) işlem yokGeçmesi için kasıtlı olarak temizlenmişÖlçümü bozmak için tasarlanmış

Bunların hiçbiri olağandışı vakalar değildir. Görsellerin gerçekte nasıl dolaştığını tarif ederler. İki platformdan ve bir ekran görüntüsünden geçerek size ulaşan bir resim, kıyaslamanın üzerinde ölçüldüğü sinyalin çoğunu zaten kaybetmiştir.

Doğruluk iddiası nasıl okunmalı?

  • Test setini sorun. Adlandırılmış bir kıyaslaması olmayan rakam pazarlamadır. Herkese açık bir kıyaslamadaki rakam başkası tarafından kontrol edilebilir.
  • Dengeli mi yoksa taraflı mı olduğunu sorun. Dengesiz bir test setindeki düz doğruluk, şişirilmesi en kolay rakamdır.
  • Karar çizgisinin nerede olduğunu sorun. Doğruluk, ölçüldüğü eşik değeri bilinmeden anlamsızdır.
  • Hangi üreticilerin dahil edildiğini sorun. Her dedektör, üzerinde eğitildiği modellerde iyi, sonradan yayınlanan modellerde ise daha kötü puan alır.
  • Yanlış pozitif oranını ayrı olarak isteyin. Bu, aracın gerçek insanlar üzerinde kullanılmasının güvenli olup olmadığına karar veren rakamdır.

Doğruluğun size söyleyemeyecekleri

Bir kıyaslama, bir modelin görsel popülasyonu genelinde ne sıklıkta doğru olduğunu ölçer. Sizinkinde doğru olup olmadığı hakkında hiçbir şey söylemez. Tek bir sonuca eklenmiş bir güven aralığı yoktur ve bir dedektör yaptığı hatalardan hangisini yaptığını bilemez.

Bölge haritasının ve dosya kanıtlarının manşet rakamından daha önemli olmasının nedeni budur. Bağımsız sinyaller arasındaki uyum, bunlardan birinden gelen güçlü bir sayıdan daha değerlidir ve uyumsuzluk başlı başına bir bulgudur.

Bir dedektörü kendiniz nasıl test edersiniz?

Kimsenin rakamına güvenmek zorunda değilsiniz. Yararlı bir test bir öğleden sonranızı alır ve size yayınlanmış herhangi bir kıyaslamadan daha fazla bilgi verir, çünkü sizinkine benzeyen görselleri kullanır.

  1. Cevabını zaten bildiğiniz bir set oluşturun

    Kendinizin çektiği yirmi fotoğraf ve oluşturduğunuz yirmi görsel. Orijinallerine dokunmayın. Her birinden yirmi adet olması, bariz şekilde zayıf bir aracı ortaya çıkarmak için yeterlidir.

  2. Zorlayıcı orta durumu dahil edin

    Kendi fotoğraflarınızın ekran görüntülerini, gece modu çekimlerini, yükseltilmiş (upscaled) bir kırpmayı ve yoğun şekilde rötuşlanmış bir portreyi ekleyin. Dedektörlerin başarısız olduğu yer burasıdır ve bu, her satıcı kıyaslamasının dışarıda bıraktığı kısımdır.

  3. Karar değil, puanı ve bandı kaydedin

    Her aracın ne döndürdüğünü not edin. Bantları karşılaştırmak sayıları karşılaştırmaktan daha bilgilendiricidir, çünkü iki araç karar çizgilerini farklı yerlere koyabilir.

  4. İki hata türünü ayrı ayrı sayın

    Gerçek fotoğraflarınızın kaçı işaretlendi ve oluşturduğunuz görsellerin kaçı gözden kaçırıldı. Kendi fotoğraflarınızın üçte birini işaretleyerek hiçbir sahteyi kaçırmayan bir araç, insanlar üzerinde kullanılamaz.

Önemli olan rakam ilkidir: kendi çalışmanızı ne sıklıkla sahte olarak adlandırıyor? Bu, bir maliyeti olan başarısızlıktır ve manşet doğruluk rakamının ortalamasını alarak gizlediği şey budur.

İnsanların sorduğu sorular

Yüzde 91 doğruluk, bir yapay zeka görsel dedektörü için iyi midir?
Temiz bir kıyaslama üzerinde piksel tabanlı bir dedektör için makul bir rakamdır ve tek başına harekete geçmek için yeterince yüksek değildir. Her birinin suçlama olabileceği bir durumda yüz üzerinden dokuz hatalı arama çoktur. Bunu sorunu çözen bir testten ziyade, nereye bakmanız gerektiğini söyleyen bir tarama aracı olarak görün.
Hangi yapay zeka görsel dedektörü en doğrudur?
Dürüst cevap, yayınlanmış rakamların karşılaştırılamaz olduğudur. Farklı araçlar farklı test setleri, farklı karar çizgileri ve farklı doğruluk tanımları kullanır, bu nedenle rakamlar farklı şeyleri ölçer. Bunun yerine bir aracın size ne gösterdiğini karşılaştırın: yayınlanmış bantlar, bir bölge haritası ve belirtilen yanlış pozitif oranı.
Modeller geliştikçe doğruluk artar mı?
Tespit ve üretim birlikte gelişir, bu nedenle aradaki fark kabaca sabit kalır. Her yeni üretici, mevcut her dedektör için görülmemiş veridir ve yeniden eğitim, serbest bırakılmadan önce değil, sonra gerçekleşir. Çözülmüş bir sorundan ziyade kalıcı bir gecikme bekleyin.
Neden aynı araç aynı resim için farklı puanlar verir?
Vermemelidir ve veriyorsa iki dosya birbirinden farklıdır. Yeniden kaydedilmiş, boyutu değiştirilmiş veya bir platformdan geçirilmiş bir kopya, farklı piksellere sahip farklı bir dosyadır. Orijinali bir indirmesiyle değil, orijinaliyle karşılaştırın.