Empat sebab keputusan berbeza
Skor ialah penghujung kepada rangkaian pilihan yang panjang. Ubah mana-mana pautan dan nombor itu akan berubah, walaupun tiada apa-apa pada imej tersebut yang bertukar.
- Data latihan berbeza. Pengesan mengecam perkara yang pernah dilihatnya. Alat yang dilatih pada ribuan penjana terbuka mengendalikan model luar biasa dengan baik. Alat yang dilatih pada empat alat komersial terbesar mengendalikan empat alat tersebut dengan lebih baik dan selebihnya dengan lebih lemah.
- Garis keputusan berbeza. Satu alat menganggap 60 mencurigakan, alat lain menganggap 75 mencurigakan. Bacaan yang sama melepasi satu ambang tetapi tidak melepasi ambang yang lain, jadi anda mendapat dua keputusan daripada satu ukuran.
- Definisi berbeza. Sesetengah alat mengira sebarang penglibatan generatif, termasuk penskalaan naik atau isian generatif. Alat lain hanya menandakan bingkai yang sintetik sepenuhnya. Potret yang telah diretus dianggap AI bagi alat pertama dan tulen bagi alat kedua.
- Prapemprosesan berbeza. Alat mengubah saiz, memotong dan mengekod semula sebelum memberikan skor. Pengesan yang membaca petak 224 piksel di bahagian tengah melihat gambar yang berbeza daripada alat yang membaca 384 piksel seluruh bingkai.
Alat D tidak lebih sensitif daripada yang lain. Ia menjawab soalan yang lebih luas. Jika kebimbangan anda adalah sama ada foto tersebut direka sepenuhnya oleh penjana, D melaporkan secara berlebihan. Jika kebimbangan anda adalah sama ada sebarang AI telah menyentuh fail itu, D adalah satu-satunya alat yang menjawab anda.
Tanya soalan yang dijawab oleh setiap alat
| Soalan | Perkara yang menandakannya | Kegunaan lazim |
|---|---|---|
| Adakah bingkai ini dijana daripada tiada apa-apa? | Tekstur sintetik seluruh bingkai | Berita, penyenaraian pasaran, profil janji temu |
| Adakah mana-mana bahagian ini disunting oleh AI? | Satu kawasan di atas garisan | Insurans, tuntutan, semakan bukti |
| Adakah sebarang AI menyentuh fail ini langsung? | Penskalaan naik, nyahhingar, isian generatif | Pustaka stok, peraturan pertandingan |
Kebanyakan percanggahan antara alat sebenarnya adalah perselisihan tentang soalan mana antara ketiga-tiga ini yang anda tanyakan. Sebelum membandingkan keputusan, tentukan soalan yang penting bagi anda, kemudian nilaikan setiap alat berdasarkan soalan tersebut.
Cara membandingkan dua keputusan dengan betul
-
Berikan fail yang serupa kepada kedua-dua alat
Bukan muat turun semula, bukan tangkapan skrin, bukan salinan yang melalui aplikasi sembang. Bait yang berbeza ialah imej yang berbeza dan sewajarnya akan mendapat skor yang berbeza.
-
Bandingkan jalur, bukan nombor
Skor 61 pada skala dengan garisan pada 50 dan skor 58 pada skala dengan garisan pada 65 tidak bersetuju tentang keputusan akhir walaupun bersetuju tentang bacaan asas.
-
Cari ambang yang diterbitkan
Alat yang enggan menyatakan kedudukan garisannya tidak boleh dibandingkan dengan apa-apa. Anggap nombor itu sebagai tidak boleh ditafsirkan dan bukannya sebagai bukti.
-
Utamakan alat yang menunjukkan cara kerjanya
Peta kawasan, jalur yang dinamakan dan penanda aras yang dinyatakan membolehkan anda menyemak hujah di sebaliknya. Label yang yakin tanpa sebarang sokongan tidak membolehkan anda berbuat demikian.
-
Anggap persetujuan sebagai isyarat yang kukuh
Dua alat bebas yang mencapai jalur yang sama adalah lebih bernilai daripada mana-mana satu alat secara bersendirian. Dua alat yang bercanggah bermakna tidak pasti, bukan mengambil jalan tengah.
Apabila percanggahan itu sendiri merupakan penemuan
Satu corak yang wajar dipelajari untuk dikenali. Alat yang melaporkan skor seluruh bingkai yang rendah bersama alat yang melaporkan skor tinggi sering kali bermakna imej itu ialah foto sebenar dengan suntingan setempat.
Alat pertama mempuratakan suntingan tersebut merentasi bingkai yang sebahagian besarnya tulen. Alat kedua memberikan wajaran kepada kawasan yang paling kuat. Kedua-duanya betul tentang perkara yang diukur, dan percanggahan itu sendiri telah memberitahu anda lebih banyak perkara daripada mana-mana nombor.
Satu jubin di atas garis keputusan dalam bingkai yang selebihnya sejuk. Tiada nombor tunggal yang dapat merangkum perkara ini.
Perkara yang boleh menjadikan pengesan sehaluan
Penanda aras bersama, garis keputusan yang diterbitkan dan definisi yang dipersetujui tentang perkara yang dikira sebagai penglibatan AI akan menghapuskan kebanyakan variasi ini. Tiada satu pun daripadanya wujud setakat ini, dan terdapat sedikit tekanan komersial untuk menghasilkannya, kerana alat yang menerbitkan kelemahannya kelihatan lebih buruk daripada alat yang tidak berbuat demikian.
Sehingga keadaan itu berubah, anggap setiap skor datang daripada skala persendirian. Baca bukti yang ditunjukkan oleh alat dan berikan wajaran yang lebih berat kepada bukti tersebut berbanding keyakinan pada labelnya.
Masalah versi yang tiada sesiapa sebutkan
Pengesan bukanlah entiti yang sama dari masa ke masa. Vendor melatih semula, melaraskan ambang dan menukar model tanpa pengumuman, dan hampir tiada seorang pun daripada mereka meletakkan versi pada output mereka. Skor yang anda dapat pada bulan Mac dan skor yang anda dapat hari ini mungkin datang daripada model berbeza dengan penentukuran yang berbeza di sebaliknya.
Ini penting jika anda merekodkan keputusan. Fail tuntutan, log penyederhanaan atau kes akademik yang memetik skor daripada lapan belas bulan lalu sebenarnya memetik ukuran yang instrumennya tidak lagi wujud. Tiada cara untuk menghasilkannya semula dan tiada cara untuk menyemak maksudnya pada masa itu.
Di mana anda menyimpan keputusan, simpan bukti bersama-sama dengannya: skor wilayah, jalur, garisan keputusan dan tarikh. Perkara ini kekal boleh ditafsirkan selepas model di belakangnya berubah, berbeza dengan peratusan semata-mata.