← Semua panduan Ketepatan

Mengapa pengesan AI memberikan keputusan berbeza untuk imej yang sama

Imbas satu gambar melalui empat alat dan anda akan mendapat empat jawapan. Sebab-sebabnya adalah bersifat struktur, dan mengetahuinya membolehkan anda menilai keputusan yang patut dipercayai.

· 7 min bacaan · Best AI Image Detector

Data latihan yang berbeza, garis keputusan yang berbeza dan definisi yang berbeza tentang perkara yang dikira sebagai AI. Dua alat boleh membaca imej dengan cara yang sama tetapi tetap melaporkan keputusan yang bertentangan.

Empat sebab keputusan berbeza

Skor ialah penghujung kepada rangkaian pilihan yang panjang. Ubah mana-mana pautan dan nombor itu akan berubah, walaupun tiada apa-apa pada imej tersebut yang bertukar.

  1. Data latihan berbeza. Pengesan mengecam perkara yang pernah dilihatnya. Alat yang dilatih pada ribuan penjana terbuka mengendalikan model luar biasa dengan baik. Alat yang dilatih pada empat alat komersial terbesar mengendalikan empat alat tersebut dengan lebih baik dan selebihnya dengan lebih lemah.
  2. Garis keputusan berbeza. Satu alat menganggap 60 mencurigakan, alat lain menganggap 75 mencurigakan. Bacaan yang sama melepasi satu ambang tetapi tidak melepasi ambang yang lain, jadi anda mendapat dua keputusan daripada satu ukuran.
  3. Definisi berbeza. Sesetengah alat mengira sebarang penglibatan generatif, termasuk penskalaan naik atau isian generatif. Alat lain hanya menandakan bingkai yang sintetik sepenuhnya. Potret yang telah diretus dianggap AI bagi alat pertama dan tulen bagi alat kedua.
  4. Prapemprosesan berbeza. Alat mengubah saiz, memotong dan mengekod semula sebelum memberikan skor. Pengesan yang membaca petak 224 piksel di bahagian tengah melihat gambar yang berbeza daripada alat yang membaca 384 piksel seluruh bingkai.
Foto yang sama, diskor melalui empat cara
Alat A, garisan pada 50
61
Alat B, garisan pada 65
58
Alat C, seluruh bingkai sahaja
34
Alat D, mengira sebarang suntingan
88

Angka ilustrasi yang menunjukkan taburan lazim bagi foto tulen yang melalui pemprosesan berat.

Satu imej, empat alat. Tiada apa-apa di sini yang pincang tugas: setiap satu melaporkan perkara yang dinyatakan oleh skalanya sendiri.

Alat D tidak lebih sensitif daripada yang lain. Ia menjawab soalan yang lebih luas. Jika kebimbangan anda adalah sama ada foto tersebut direka sepenuhnya oleh penjana, D melaporkan secara berlebihan. Jika kebimbangan anda adalah sama ada sebarang AI telah menyentuh fail itu, D adalah satu-satunya alat yang menjawab anda.

Tanya soalan yang dijawab oleh setiap alat

Tiga soalan yang dimaksudkan orang apabila bertanya "adakah ini AI"
SoalanPerkara yang menandakannyaKegunaan lazim
Adakah bingkai ini dijana daripada tiada apa-apa?Tekstur sintetik seluruh bingkaiBerita, penyenaraian pasaran, profil janji temu
Adakah mana-mana bahagian ini disunting oleh AI?Satu kawasan di atas garisanInsurans, tuntutan, semakan bukti
Adakah sebarang AI menyentuh fail ini langsung?Penskalaan naik, nyahhingar, isian generatifPustaka stok, peraturan pertandingan

Kebanyakan percanggahan antara alat sebenarnya adalah perselisihan tentang soalan mana antara ketiga-tiga ini yang anda tanyakan. Sebelum membandingkan keputusan, tentukan soalan yang penting bagi anda, kemudian nilaikan setiap alat berdasarkan soalan tersebut.

Cara membandingkan dua keputusan dengan betul

  1. Berikan fail yang serupa kepada kedua-dua alat

    Bukan muat turun semula, bukan tangkapan skrin, bukan salinan yang melalui aplikasi sembang. Bait yang berbeza ialah imej yang berbeza dan sewajarnya akan mendapat skor yang berbeza.

  2. Bandingkan jalur, bukan nombor

    Skor 61 pada skala dengan garisan pada 50 dan skor 58 pada skala dengan garisan pada 65 tidak bersetuju tentang keputusan akhir walaupun bersetuju tentang bacaan asas.

  3. Cari ambang yang diterbitkan

    Alat yang enggan menyatakan kedudukan garisannya tidak boleh dibandingkan dengan apa-apa. Anggap nombor itu sebagai tidak boleh ditafsirkan dan bukannya sebagai bukti.

  4. Utamakan alat yang menunjukkan cara kerjanya

    Peta kawasan, jalur yang dinamakan dan penanda aras yang dinyatakan membolehkan anda menyemak hujah di sebaliknya. Label yang yakin tanpa sebarang sokongan tidak membolehkan anda berbuat demikian.

  5. Anggap persetujuan sebagai isyarat yang kukuh

    Dua alat bebas yang mencapai jalur yang sama adalah lebih bernilai daripada mana-mana satu alat secara bersendirian. Dua alat yang bercanggah bermakna tidak pasti, bukan mengambil jalan tengah.

Apabila percanggahan itu sendiri merupakan penemuan

Satu corak yang wajar dipelajari untuk dikenali. Alat yang melaporkan skor seluruh bingkai yang rendah bersama alat yang melaporkan skor tinggi sering kali bermakna imej itu ialah foto sebenar dengan suntingan setempat.

Alat pertama mempuratakan suntingan tersebut merentasi bingkai yang sebahagian besarnya tulen. Alat kedua memberikan wajaran kepada kawasan yang paling kuat. Kedua-duanya betul tentang perkara yang diukur, dan percanggahan itu sendiri telah memberitahu anda lebih banyak perkara daripada mana-mana nombor.

11 14 9 13 89 12 10 8 15

Satu jubin di atas garis keputusan dalam bingkai yang selebihnya sejuk. Tiada nombor tunggal yang dapat merangkum perkara ini.

Paparan kawasan menyelesaikan pertikaian tersebut. Purata seluruh bingkai bagi jubin ini ialah 24, yang dibaca sebagai bersih; peta menunjukkan sebab bacaan itu mengelirukan.

Perkara yang boleh menjadikan pengesan sehaluan

Penanda aras bersama, garis keputusan yang diterbitkan dan definisi yang dipersetujui tentang perkara yang dikira sebagai penglibatan AI akan menghapuskan kebanyakan variasi ini. Tiada satu pun daripadanya wujud setakat ini, dan terdapat sedikit tekanan komersial untuk menghasilkannya, kerana alat yang menerbitkan kelemahannya kelihatan lebih buruk daripada alat yang tidak berbuat demikian.

Sehingga keadaan itu berubah, anggap setiap skor datang daripada skala persendirian. Baca bukti yang ditunjukkan oleh alat dan berikan wajaran yang lebih berat kepada bukti tersebut berbanding keyakinan pada labelnya.

Masalah versi yang tiada sesiapa sebutkan

Pengesan bukanlah entiti yang sama dari masa ke masa. Vendor melatih semula, melaraskan ambang dan menukar model tanpa pengumuman, dan hampir tiada seorang pun daripada mereka meletakkan versi pada output mereka. Skor yang anda dapat pada bulan Mac dan skor yang anda dapat hari ini mungkin datang daripada model berbeza dengan penentukuran yang berbeza di sebaliknya.

Ini penting jika anda merekodkan keputusan. Fail tuntutan, log penyederhanaan atau kes akademik yang memetik skor daripada lapan belas bulan lalu sebenarnya memetik ukuran yang instrumennya tidak lagi wujud. Tiada cara untuk menghasilkannya semula dan tiada cara untuk menyemak maksudnya pada masa itu.

Di mana anda menyimpan keputusan, simpan bukti bersama-sama dengannya: skor wilayah, jalur, garisan keputusan dan tarikh. Perkara ini kekal boleh ditafsirkan selepas model di belakangnya berubah, berbeza dengan peratusan semata-mata.

Soalan yang sering ditanya

Jika dua pengesan tidak bersetuju, yang mana patut saya percayai?
Pengesan yang menunjukkan alasannya. Garisan keputusan yang diterbitkan, jalur yang dinamakan dan peta wilayah membolehkan anda menyemak sama ada bacaan tersebut munasabah untuk imej anda. Peratusan semata-mata daripada alat yang tidak menyatakan maksudnya bukanlah bukti, tidak kira betapa yakin bunyinya.
Adakah menjalankan lebih banyak pengesan memberikan jawapan yang lebih baik?
Hanya jika anda memutuskan terlebih dahulu cara menilainya. Tiga alat yang bersetuju sememangnya lebih kukuh daripada satu. Enam alat dengan dua daripadanya bersetuju dengan anda ialah cara orang meyakinkan diri mereka tentang kesimpulan yang telah mereka buat lebih awal.
Mengapa satu alat memanggil foto saya yang diedit sebagai AI dan satu lagi memanggilnya tulen?
Ia menjawab soalan yang berbeza. Alat yang mengira sebarang penglibatan generatif akan membenderakan isian generatif atau peningkatan skala (upscale). Alat yang hanya mencari bingkai sintetik sepenuhnya tidak akan melakukannya. Tiada yang salah; semak definisi yang digunakan oleh setiap satu.
Bolehkah kedua-dua pengesan betul?
Ya, dan ia perkara biasa. Ambang yang berbeza bermakna pengukuran yang sama menghasilkan keputusan yang berbeza, dan set latihan yang berbeza bermakna bacaan yang benar-benar berbeza terhadap imej yang luar biasa. Persetujuan dalam jalur adalah perkara yang penting, bukan persetujuan dalam angka.