← Semua panduan Di sebalik tabir

Cara pengesanan imej AI sebenarnya berfungsi

Perkara yang berlaku antara memasukkan fail dan membaca skor: model piksel, hantaran jubin, bukti fail, dan cara ketiga-tiganya digabungkan.

· 8 min bacaan · Best AI Image Detector

Vision transformer memberi skor pada keseluruhan bingkai, model yang sama memberikannya skor sekali lagi sebagai jubin, pembaca berasingan menyemak kelayakan fail itu sendiri, dan ketiga-tiga hasil digabungkan menjadi satu nombor yang ditentukur.

Perkara yang dilihat oleh model

Kamera merakam cahaya melalui lensa ke atas sensor. Proses itu meninggalkan jenis hingar tertentu, corak ketajaman khusus yang berkurangan ke arah tepi, dan hubungan khusus antara piksel bersebelahan yang terhasil daripada grid sensor dan proses demosaicing seterusnya.

Model diffusion membina imej dengan mengeluarkan hingar secara berulang kali daripada medan rawak sehingga sesuatu yang koheren muncul. Proses itu juga meninggalkan tandatangan, dan ia berbeza. Hasilnya boleh kelihatan sempurna secara visual dan boleh dibezakan secara statistik pada masa yang sama.

Inilah sebabnya pengesanan kekal berfungsi pada tangkapan skrin sedangkan metadata tidak. Tandatangan tersebut berada dalam nilai piksel itu sendiri dan bukannya dalam pengepala, jadi menyalin piksel bermaksud menyalin bukti.

Empat peringkat

  1. 1 Baca fail Dinyahkod dalam pelayar, tidak pernah dimuat naik
  2. 2 Skor bingkai Vision transformer pada saiz 384 piksel persegi
  3. 3 Skor jubin Model yang sama pada kawasan bertindih
  4. 4 Baca kelayakan C2PA dan penanda penjana, jika ada
Dua laluan bukti bebas yang menumpu. Tiada satu pun diminta untuk memberikan jawapan secara bersendirian.

Peringkat satu: penyahkodan

Fail dibaca daripada cakera oleh halaman dan dinyahkod menjadi piksel mentah. HEIC, AVIF, TIFF dan selebihnya dikendalikan oleh penyahkod pelayar itu sendiri. Tiada apa-apa yang dihantar, yang merupakan ciri lokasi pemprosesan dilakukan dan bukannya dasar yang digunakan pada pelayan.

Peringkat dua: skor keseluruhan bingkai

Imej disaizkan semula kepada 384 piksel persegi dan diproses melalui vision transformer. Model mengembalikan kebarangkalian mentah bahawa bingkai tersebut adalah sintetik. Nombor itu kemudiannya ditentukur supaya dipetakan ke jalur yang diterbitkan secara konsisten dan bukannya berubah-ubah mengikut model.

Pensaizan semula mengurangkan perincian, yang merupakan punca pertama ketepatan terjejas. Ia juga tidak dapat dielakkan: model mempunyai saiz input yang tetap, dan gambar 4000 piksel mesti dikecilkan untuk memuatkannya.

Peringkat tiga: hantaran jubin

Bingkai dibahagikan kepada kawasan bertindih dan setiap satu diskorkan secara berasingan oleh model yang sama. Ini membezakan imej yang dijana sepenuhnya daripada foto sebenar yang ditambahkan sesuatu, dan ia merupakan peringkat yang tidak boleh digantikan oleh satu nombor tunggal.

14 11 16 12 88 13 9 15 10

Purata bagi semua ini ialah 21. Paparan jubin mengekalkan maklumat yang dimusnahkan oleh pemurataan.

Model yang sama, dijalankan sembilan kali pada keratan bertindih. Skor keseluruhan bingkai untuk imej ini ialah 31.

Jubin memerlukan piksel yang mencukupi untuk bermakna, itulah sebabnya imej di bawah kira-kira 576 piksel pada sisi yang lebih pendek hanya mendapat skor keseluruhan bingkai. Perincian tidak mencukupi dalam keratan kecil untuk diskorkan secara bebas.

Peringkat empat: rekod fail itu sendiri

Berasingan daripada piksel, fail disemak untuk Content Credentials dan penanda penjana yang ditinggalkan oleh sesetengah alat. Laluan ini bersifat kriptografi dan bukannya statistik: tandatangan yang sah disemak terhadap senarai amanah, bukan dianggarkan.

Cara hasil digabungkan

Kedua-dua laluan tidak dipuratakan, kerana kedua-duanya membawa pemberat yang berbeza. Kelayakan sah yang mengisytiharkan tangkapan kamera mengatasi skor piksel sederhana. Kelayakan yang mengisytiharkan penjanaan AI menyelesaikan persoalan itu dengan sendirinya.

Cara bukti diberatkan
BuktiJenisPemberat
Kelayakan sah yang mengisytiharkan penjanaan AIKriptografiMuktamad
Kelayakan sah yang mengisytiharkan tangkapan kameraKriptografiSangat kukuh
Penanda penjana dalam failDeklaratifKukuh, tetapi boleh dibuang
Skor piksel keseluruhan bingkaiStatistikSederhana
Skor jubin kawasanStatistikSederhana, dan lebih khusus
Tiada kelayakan wujudTiada apa-apaTiada maklumat bagi kedua-dua kemungkinan

Baris terakhir itulah yang paling kerap disalah tafsir. Ketiadaan kelayakan bukanlah isyarat negatif. Sebahagian besar imej yang pernah dihasilkan tidak membawanya, dan hampir setiap platform membuangnya semasa muat naik.

Sebab ia berjalan dalam pelayar

Model ini bersaiz kira-kira 40 MB dan berjalan melalui WebAssembly pada peranti pelawat sendiri. Itu merupakan pilihan seni bina yang disengajakan dengan tiga akibat yang wajar difahami.

  • Tiada apa-apa yang dimuat naik, jadi tiada pelayan yang memegang imej sesiapa dan tiada hubungan pemprosesan data untuk didokumenkan.
  • Semakan tidak memerlukan kos untuk dihidangkan, itulah sebabnya alat ini boleh percuma tanpa had penggunaan di belakangnya.
  • Semakan pertama lebih perlahan, kerana model dimuat turun sekali sebelum ia boleh dijalankan. Semakan seterusnya menggunakan semula salinan yang dicache.

Perkara yang sengaja tidak dilakukan oleh saluran paip

Beberapa teknik yang terdapat dalam alat forensik terdahulu tiada di sini, kerana ia tidak lagi berfungsi pada imej yang telah melalui platform moden.

  • Error level analysis. Popular, sering disalah tafsir, dan tidak boleh dipercayai pada mana-mana imej yang telah disimpan semula lebih daripada sekali.
  • Copy-move detection. Mencari kawasan pendua dalam bingkai, yang hanya mengesan pengklonan gaya lama dan bukannya penjanaan.
  • Penilaian berasaskan metadata. EXIF dibuang semasa muat naik hampir di mana-mana sahaja, jadi semakan yang bergantung padanya gagal tepat pada imej yang perlu disahkan oleh orang ramai.
  • Analisis khusus wajah. Berguna untuk satu kategori manipulasi yang sempit, dan tidak dapat mengesan perkara lain.

Soalan yang sering ditanya

Adakah pengesan melihat apa yang ada dalam gambar?
Tidak. Ia tidak mempunyai konsep objek, wajah atau pemandangan. Ia mengukur hubungan statistik antara piksel bersebelahan, itulah sebabnya ia berfungsi sama rata pada potret, pemandangan jalanan dan resit, dan sebab ia tidak dapat memberitahu anda sama ada kandungan imej itu benar.
Mengapakah semakan pertama mengambil masa lebih lama?
Model dimuat turun sekali, kira-kira 40 MB, sebelum apa-apa boleh dijalankan. Selepas itu ia dicache dan semakan berikutnya bermula serta-merta. Ini ialah kos operasi pada peranti anda dan bukannya pada pelayan, dan ia menjamin bahawa tiada apa-apa yang dimuat naik.
Bagaimanakah output model mentah ditukar menjadi skor?
Penentukuran. Model mengembalikan kebarangkalian mentah, yang dipetakan pada skala tetap supaya nombor tertentu sentiasa membawa maksud yang sama. Tanpa langkah itu, skor akan berubah setiap kali model bertukar dan tiada jalur yang diterbitkan akan kekal bermakna.
Mengapa menggunakan jubin bertindih dan bukannya grid mudah?
Suntingan yang merentasi sempadan jubin akan terbahagi antara dua kawasan dan cair dalam kedua-duanya. Pertindihan keratan memastikan sebarang suntingan berada sepenuhnya di dalam sekurang-kurangnya satu kawasan, yang menghalang sisipan kecil daripada hilang akibat pemurataan.
Bolehkah ia mengenal pasti penjana yang menghasilkan sesuatu imej?
Hanya jika fail menyatakannya. Penanda penjana atau kelayakan boleh menamakan alat tersebut; model piksel tidak boleh. Ia mengembalikan kemungkinan bahawa sesuatu yang generatif terlibat, yang merupakan persoalan berbeza daripada pengenalpastian dan jauh lebih mudah untuk dijawab secara andal.
Adakah model yang sama digunakan untuk bingkai dan jubin?
Ya. Menjalankan satu model pada keratan yang berbeza membolehkan kedua-dua hasil dibandingkan. Model kawasan yang berasingan akan mempunyai penentukuran dan ralatnya sendiri, dan kedua-dua nombor itu tidak lagi berada pada skala yang sama.