← Semua panduan Akurasi

Mengapa detektor AI tidak sependapat pada gambar yang sama

Masukkan satu gambar ke dalam empat alat dan dapatkan empat jawaban. Alasannya bersifat struktural, dan mengetahuinya memberi tahu Anda hasil mana yang harus dipercayai.

· 7 mnt baca · Best AI Image Detector

Data pelatihan yang berbeda, garis keputusan yang berbeda, dan definisi yang berbeda mengenai apa yang dihitung sebagai AI. Dua alat dapat membaca gambar secara identik dan tetap melaporkan vonis yang berlawanan.

Empat alasan hasil berbeda

Skor adalah akhir dari rantai panjang pilihan. Ubah tautan mana pun dan angkanya akan bergeser, meskipun tidak ada yang berubah pada gambar tersebut.

  1. Data pelatihan yang berbeda. Detektor mengenali apa yang telah dilihatnya. Satu yang dilatih pada ribuan generator terbuka menangani model yang tidak biasa dengan baik. Satu yang dilatih pada empat alat komersial terbesar menangani keempatnya dengan lebih baik dan sisanya lebih buruk.
  2. Garis keputusan yang berbeda. Satu alat menyebut 60 mencurigakan, alat lain menyebut 75 mencurigakan. Pembacaan yang sama melewati satu ambang batas dan bukan yang lain, sehingga Anda mendapatkan dua vonis dari satu pengukuran.
  3. Definisi yang berbeda. Beberapa alat menghitung keterlibatan generatif apa yang mencakup peningkatan skala atau pengisian generatif. Yang lain hanya menandai bingkai yang sepenuhnya sintetik. Potret yang telah di-retouch adalah AI bagi yang pertama dan asli bagi yang kedua.
  4. Pra-pemrosesan yang berbeda. Alat mengubah ukuran, memotong, dan mengenkode ulang sebelum memberi skor. Detektor yang membaca kotak berukuran 224 piksel di bagian tengah melihat gambar yang berbeda dari detektor yang membaca 384 piksel dari seluruh bingkai.
Foto yang sama, dinilai dengan empat cara
Alat A, garis pada 50
61
Alat B, garis pada 65
58
Alat C, khusus seluruh bingkai
34
Alat D, menghitung semua pengeditan
88

Angka ilustratif yang menunjukkan penyebaran yang khas dari foto yang diproses secara intensif tetapi asli.

Satu gambar, empat alat. Tidak ada yang salah di sini: masing-masing melaporkan apa yang dikatakan oleh skala mereka sendiri.

Alat D tidak lebih sensitif daripada yang lain. Alat ini menjawab pertanyaan yang lebih luas. Jika kekhawatiran Anda adalah apakah sebuah foto dibuat oleh generator, Alat D melaporkan secara berlebihan. Jika kekhawatiran Anda adalah apakah ada AI yang menyentuh berkas tersebut, Alat D adalah satu-satunya yang menjawab Anda.

Tanyakan pertanyaan apa yang dijawab oleh setiap alat

Tiga pertanyaan yang dimaksud orang dengan "apakah ini AI"
PertanyaanHal yang menandainyaPenggunaan umum
Apakah bingkai ini dihasilkan dari ketiadaan?Tekstur sintetik seluruh bingkaiBerita, daftar marketplace, profil kencan
Apakah ada bagian dari ini yang diedit oleh AI?Satu wilayah di atas garisAsuransi, klaim, tinjauan bukti
Apakah ada AI yang menyentuh berkas ini sama sekali?Peningkatan skala, pengurangan derau, pengisian generatifPustaka stok, aturan kompetisi

Sebagian besar perbedaan pendapat antar alat sebenarnya adalah perbedaan pendapat mengenai mana dari ketiga hal tersebut yang Anda tanyakan. Sebelum membandingkan hasil, tentukan pertanyaan mana yang penting bagi Anda, kemudian baca setiap alat berdasarkan pertanyaan tersebut.

Cara membandingkan dua hasil dengan benar

  1. Berikan berkas yang persis sama ke kedua alat

    Bukan unduhan ulang, bukan tangkapan layar, bukan salinan yang melewati aplikasi obrolan. Bita yang berbeda adalah gambar yang berbeda dan secara sah akan menghasilkan skor yang berbeda.

  2. Bandingkan rentang, bukan angka

    Skor 61 pada skala dengan garis di 50 dan skor 58 pada skala dengan garis di 65 tidak sependapat mengenai vonis tetapi sepakat mengenai pembacaan.

  3. Cari ambang batas yang dipublikasikan

    Alat yang tidak mau menyebutkan letak garisnya tidak dapat dibandingkan dengan apa pun. Anggap angka tersebut tidak dapat diartikan alih-alih sebagai bukti.

  4. Lebih pilih alat yang menunjukkan cara kerjanya

    Peta wilayah, rentang yang disebutkan, dan tolok ukur yang dinyatakan memungkinkan Anda memeriksa alasannya. Label yang meyakinkan tanpa dasar di belakangnya tidak dapat diandalkan.

  5. Anggap kesepakatan sebagai sinyal yang kuat

    Dua alat independen yang mencapai rentang yang sama lebih berharga daripada salah satu di antaranya saja. Dua alat yang tidak sependapat berarti tidak pasti, bukan mengambil nilai tengah.

Ketika perbedaan pendapat adalah temuannya

Satu pola layak dipelajari untuk dikenali. Alat yang melaporkan skor seluruh bingkai yang rendah berdampingan dengan alat yang melaporkan skor tinggi sering kali berarti gambar tersebut adalah foto asli dengan pengeditan lokal.

Alat pertama meratakan hasil pengeditan pada bingkai yang sebagian besar asli. Alat kedua memberikan bobot lebih pada wilayah terkuat. Keduanya benar mengenai apa yang mereka ukur, dan perbedaan pendapat itu sendiri memberi tahu Anda lebih banyak daripada angka apa pun.

11 14 9 13 89 12 10 8 15

Satu petak di atas garis keputusan di dalam bingkai yang sebenarnya dingin. Tidak ada satu angka pun yang dapat menangkap hal ini.

Tampilan wilayah menyelesaikan perdebatan tersebut. Rata-rata seluruh bingkai dari petak-petak ini adalah 24, yang terbaca sebagai bersih; peta tersebut menunjukkan mengapa hal itu menyesatkan.

Apa yang membuat detektor sepakat

Tolok ukur bersama, garis keputusan yang dipublikasikan, dan definisi yang disepakati tentang apa yang dihitung sebagai keterlibatan AI akan menghilangkan sebagian besar perbedaan tersebut. Tidak satupun dari hal itu ada saat ini, dan hanya ada sedikit tekanan komersial untuk menciptakannya, karena alat yang mempublikasikan kelemahannya akan terlihat lebih buruk daripada alat yang tidak melakukannya.

Hingga hal itu berubah, anggap setiap skor berasal dari skala privat. Baca bukti yang ditunjukkan oleh alat kepada Anda dan pertimbangkan hal tersebut lebih serius daripada tingkat keyakinan pada labelnya.

Masalah versi yang tidak pernah dibicarakan oleh siapa pun

Detektor bukanlah satu hal yang tetap seiring waktu. Vendor melatih ulang, menyesuaikan ambang batas, dan menukar model tanpa pengumuman, dan hampir tidak ada dari mereka yang memberikan versi pada keluaran mereka. Skor yang Anda dapatkan pada bulan Maret dan skor yang Anda dapatkan hari ini mungkin berasal dari model yang berbeda dengan kalibrasi yang berbeda di baliknya.

Ini penting jika Anda mencatat hasil. Berkas klaim, catatan moderasi, atau kasus akademik yang mengutip skor dari delapan belas bulan lalu sedang mengutip pengukuran yang instrumennya sudah tidak ada lagi. Tidak ada cara untuk mereproduksinya dan tidak ada cara untuk memeriksa apa artinya pada saat itu.

Saat Anda menyimpan hasil, simpan juga buktinya bersama hasil tersebut: skor wilayah, pita, garis keputusan, dan tanggal. Hal-hal tersebut tetap dapat diinterpretasikan setelah model di baliknya diperbarui, yang tidak dapat dilakukan oleh persentase kosong semata.

Pertanyaan yang diajukan orang

Jika dua detektor tidak sependapat, mana yang harus saya percaya?
Detektor yang menunjukkan penalarannya kepada Anda. Garis keputusan yang dipublikasikan, pita yang diberi nama, dan peta wilayah memungkinkan Anda memeriksa apakah pembacaan tersebut masuk akal untuk gambar Anda. Persentase mentah dari alat yang tidak mau menyebutkan maknanya bukanlah bukti, betapapun meyakinkan kedengarannya.
Apakah menjalankan lebih banyak detektor memberikan jawaban yang lebih baik?
Hanya jika Anda memutuskan terlebih dahulu cara menimbangnya. Tiga alat yang sepakat benar-benar lebih kuat daripada satu. Enam alat dengan dua alat yang sepakat dengan Anda adalah cara orang meyakinkan diri sendiri pada kesimpulan yang telah mereka buat sebelumnya.
Mengapa satu alat menyebut foto suntingan saya sebagai AI dan alat lain menyebutnya asli?
Mereka menjawab pertanyaan yang berbeda. Alat yang menghitung keterlibatan generatif apa pun akan menandai pengisian generatif atau peningkatan skala. Alat yang hanya mencari bingkai yang sepenuhnya sintetik tidak melakukannya. Keduanya tidak salah; periksa definisi mana yang digunakan masing-masing.
Bisakah dua detektor benar semuanya?
Ya, dan itu lumrah. Ambang batas yang berbeda berarti pengukuran yang sama menghasilkan vonis yang berbeda, dan kumpulan pelatihan yang berbeda berarti pembacaan yang benar-benar berbeda dari gambar yang tidak biasa. Kesepakatan dalam pita adalah hal yang penting, bukan kesepakatan dalam digit.