Empat alasan hasil berbeda
Skor adalah akhir dari rantai panjang pilihan. Ubah tautan mana pun dan angkanya akan bergeser, meskipun tidak ada yang berubah pada gambar tersebut.
- Data pelatihan yang berbeda. Detektor mengenali apa yang telah dilihatnya. Satu yang dilatih pada ribuan generator terbuka menangani model yang tidak biasa dengan baik. Satu yang dilatih pada empat alat komersial terbesar menangani keempatnya dengan lebih baik dan sisanya lebih buruk.
- Garis keputusan yang berbeda. Satu alat menyebut 60 mencurigakan, alat lain menyebut 75 mencurigakan. Pembacaan yang sama melewati satu ambang batas dan bukan yang lain, sehingga Anda mendapatkan dua vonis dari satu pengukuran.
- Definisi yang berbeda. Beberapa alat menghitung keterlibatan generatif apa yang mencakup peningkatan skala atau pengisian generatif. Yang lain hanya menandai bingkai yang sepenuhnya sintetik. Potret yang telah di-retouch adalah AI bagi yang pertama dan asli bagi yang kedua.
- Pra-pemrosesan yang berbeda. Alat mengubah ukuran, memotong, dan mengenkode ulang sebelum memberi skor. Detektor yang membaca kotak berukuran 224 piksel di bagian tengah melihat gambar yang berbeda dari detektor yang membaca 384 piksel dari seluruh bingkai.
Alat D tidak lebih sensitif daripada yang lain. Alat ini menjawab pertanyaan yang lebih luas. Jika kekhawatiran Anda adalah apakah sebuah foto dibuat oleh generator, Alat D melaporkan secara berlebihan. Jika kekhawatiran Anda adalah apakah ada AI yang menyentuh berkas tersebut, Alat D adalah satu-satunya yang menjawab Anda.
Tanyakan pertanyaan apa yang dijawab oleh setiap alat
| Pertanyaan | Hal yang menandainya | Penggunaan umum |
|---|---|---|
| Apakah bingkai ini dihasilkan dari ketiadaan? | Tekstur sintetik seluruh bingkai | Berita, daftar marketplace, profil kencan |
| Apakah ada bagian dari ini yang diedit oleh AI? | Satu wilayah di atas garis | Asuransi, klaim, tinjauan bukti |
| Apakah ada AI yang menyentuh berkas ini sama sekali? | Peningkatan skala, pengurangan derau, pengisian generatif | Pustaka stok, aturan kompetisi |
Sebagian besar perbedaan pendapat antar alat sebenarnya adalah perbedaan pendapat mengenai mana dari ketiga hal tersebut yang Anda tanyakan. Sebelum membandingkan hasil, tentukan pertanyaan mana yang penting bagi Anda, kemudian baca setiap alat berdasarkan pertanyaan tersebut.
Cara membandingkan dua hasil dengan benar
-
Berikan berkas yang persis sama ke kedua alat
Bukan unduhan ulang, bukan tangkapan layar, bukan salinan yang melewati aplikasi obrolan. Bita yang berbeda adalah gambar yang berbeda dan secara sah akan menghasilkan skor yang berbeda.
-
Bandingkan rentang, bukan angka
Skor 61 pada skala dengan garis di 50 dan skor 58 pada skala dengan garis di 65 tidak sependapat mengenai vonis tetapi sepakat mengenai pembacaan.
-
Cari ambang batas yang dipublikasikan
Alat yang tidak mau menyebutkan letak garisnya tidak dapat dibandingkan dengan apa pun. Anggap angka tersebut tidak dapat diartikan alih-alih sebagai bukti.
-
Lebih pilih alat yang menunjukkan cara kerjanya
Peta wilayah, rentang yang disebutkan, dan tolok ukur yang dinyatakan memungkinkan Anda memeriksa alasannya. Label yang meyakinkan tanpa dasar di belakangnya tidak dapat diandalkan.
-
Anggap kesepakatan sebagai sinyal yang kuat
Dua alat independen yang mencapai rentang yang sama lebih berharga daripada salah satu di antaranya saja. Dua alat yang tidak sependapat berarti tidak pasti, bukan mengambil nilai tengah.
Ketika perbedaan pendapat adalah temuannya
Satu pola layak dipelajari untuk dikenali. Alat yang melaporkan skor seluruh bingkai yang rendah berdampingan dengan alat yang melaporkan skor tinggi sering kali berarti gambar tersebut adalah foto asli dengan pengeditan lokal.
Alat pertama meratakan hasil pengeditan pada bingkai yang sebagian besar asli. Alat kedua memberikan bobot lebih pada wilayah terkuat. Keduanya benar mengenai apa yang mereka ukur, dan perbedaan pendapat itu sendiri memberi tahu Anda lebih banyak daripada angka apa pun.
Satu petak di atas garis keputusan di dalam bingkai yang sebenarnya dingin. Tidak ada satu angka pun yang dapat menangkap hal ini.
Apa yang membuat detektor sepakat
Tolok ukur bersama, garis keputusan yang dipublikasikan, dan definisi yang disepakati tentang apa yang dihitung sebagai keterlibatan AI akan menghilangkan sebagian besar perbedaan tersebut. Tidak satupun dari hal itu ada saat ini, dan hanya ada sedikit tekanan komersial untuk menciptakannya, karena alat yang mempublikasikan kelemahannya akan terlihat lebih buruk daripada alat yang tidak melakukannya.
Hingga hal itu berubah, anggap setiap skor berasal dari skala privat. Baca bukti yang ditunjukkan oleh alat kepada Anda dan pertimbangkan hal tersebut lebih serius daripada tingkat keyakinan pada labelnya.
Masalah versi yang tidak pernah dibicarakan oleh siapa pun
Detektor bukanlah satu hal yang tetap seiring waktu. Vendor melatih ulang, menyesuaikan ambang batas, dan menukar model tanpa pengumuman, dan hampir tidak ada dari mereka yang memberikan versi pada keluaran mereka. Skor yang Anda dapatkan pada bulan Maret dan skor yang Anda dapatkan hari ini mungkin berasal dari model yang berbeda dengan kalibrasi yang berbeda di baliknya.
Ini penting jika Anda mencatat hasil. Berkas klaim, catatan moderasi, atau kasus akademik yang mengutip skor dari delapan belas bulan lalu sedang mengutip pengukuran yang instrumennya sudah tidak ada lagi. Tidak ada cara untuk mereproduksinya dan tidak ada cara untuk memeriksa apa artinya pada saat itu.
Saat Anda menyimpan hasil, simpan juga buktinya bersama hasil tersebut: skor wilayah, pita, garis keputusan, dan tanggal. Hal-hal tersebut tetap dapat diinterpretasikan setelah model di baliknya diperbarui, yang tidak dapat dilakukan oleh persentase kosong semata.