← Semua panduan Di sebalik tabir

Diffusion vs GAN: sebab pengesan mengendalikannya secara berbeza

Dua kaedah menghasilkan imej, dua cap jari yang berbeza. Perkara yang ditinggalkan oleh setiap proses, sebab GAN lebih mudah dikesan, dan implikasinya terhadap perkembangan seterusnya.

· 8 min bacaan · Best AI Image Detector

GAN meninggalkan artifak berulang daripada pensampelan atas yang hampir menyerupai tandatangan digital. Model diffusion tidak berbuat demikian. Sebab itulah pengesanan menjadi lebih sukar pada tahun 2022 dan helah khusus seni bina tidak lagi berkesan.

Cara GAN membina imej

Generative adversarial network bermula daripada vektor kecil dan melakukan pensampelan atas secara berulang, menggandakan resolusi pada setiap lapisan sehingga mencapai saiz penuh. Rangkaian kedua menilai hasilnya, dan kedua-duanya dilatih secara bersaing antara satu sama lain.

Pensampelan atas yang berulang adalah bahagian penting. Setiap langkah penggandaan menghasilkan corak yang sekata, dan corak tersebut terkumpul menjadi struktur berkala yang kelihatan apabila imej ditukar ke domain frekuensi.

Struktur tersebut menyerupai tandatangan digital. Pengesan awal boleh mencari corak papan catur dalam spektrum frekuensi dan mencapai ketepatan tinggi tanpa perlu memahami kandungan gambar. Ia merupakan cap jari seni bina dan bukannya mana-mana model tertentu.

Cara model diffusion membinanya

Diffusion berfungsi secara terbalik. Ia bermula dengan medan hingar tulen pada resolusi sasaran penuh dan membuang sedikit demi sedikit hingar pada setiap langkah, berpandukan perkara yang telah dipelajari oleh model, sehingga imej terhasil.

Tiada tangga pensampelan atas (upsampling), jadi tiada artifak berkala. Outputnya berbeza secara statistik daripada tangkapan kamera, dan perbezaan itu bersifat difus dan bukannya berstruktur. Tiada apa-apa mengenainya yang muncul sebagai corak jelas yang boleh dicari.

GAN

  • Vektor kecil disampel atas berulang kali
  • Artifak berkala daripada setiap penggandaan
  • Boleh dikesan dalam domain frekuensi
  • Seni bina meninggalkan tanda khas tersendiri
  • Dominan sehingga sekitar 2022

Diffusion

  • Hingar disingkirkan langkah demi langkah pada saiz penuh
  • Tiada tangga pensampelan atas, tiada corak berkala
  • Perbezaan bersifat statistik, bukan berstruktur
  • Memerlukan model terlatih untuk dikesan
  • Dominan sejak 2022
Dua proses tersebut dan apa yang ditinggalkan oleh setiap satu. Lajur sebelah kanan adalah sebab pengesanan terpaksa dibina semula.

Mengapa pengesan lama berhenti berfungsi

Alat yang dibina untuk mencari corak papan catur domain frekuensi tidak menemui apa-apa dalam imej diffusion. Ia tidak melaporkan ketidakpastian; ia melaporkan bahawa artifak tersebut tiada, yang terbaca sebagai keputusan bersih.

Itulah sebabnya ketepatan pengesanan merentasi bidang ini kelihatan merosot antara 2021 dan 2023. Alat tersebut tidak merosot. Perkara yang dicari oleh alat itu telah berhenti dihasilkan.

Perkara yang menggantikan pengesanan khusus seni bina

Keluasan. Daripada mencari satu artifak, pengesan semasa dilatih menggunakan output daripada sebanyak mungkin penjana berbeza yang boleh dikumpulkan, supaya model mempelajari persamaan tekstur sintetik dan bukannya apa yang dihasilkan oleh satu keluarga model.

Model yang digunakan di sini dilatih pada berjuta-juta imej daripada ribuan penjana atas sebab ini. Liputan merentasi seni bina membolehkan generalisasi kepada seni bina seterusnya, dan ia merupakan satu-satunya pendekatan yang bertahan melalui perubahan kaedah dominan.

Komprominya ialah ketepatan pada mana-mana satu penjana khusus adalah lebih rendah daripada apa yang dicapai oleh pengesan khusus. Itu adalah kompromi yang wajar, kerana pengesan khusus menjadi tidak berguna sebaik sahaja sesuatu yang baharu muncul.

Apa yang diramalkan oleh perkara ini

Pengajaran daripada peralihan GAN ke diffusion bukan mengenai diffusion. Ia adalah bahawa mana-mana pengesan yang terikat dengan cara imej dihasilkan pada masa ini mempunyai jangka hayat terhad, dan peralihan tersebut tidak akan diumumkan lebih awal.

Bagaimana setiap generasi pengesanan menua
PendekatanBerfungsi padaGagal apabila
Pencarian artifak frekuensiGANDiffusion diperkenalkan
Analisis khusus wajahPertukaran wajah awalPenjanaan keseluruhan pemandangan diperkenalkan
Pemeriksaan metadataFail terus daripada alat penjanaPlatform menyingkirkan metadata
Analisis tahap ralat (Error level analysis)JPEG simpanan tunggalImej mula disebarkan
Latihan pelbagai penjana yang meluasKebanyakan output semasaTidak diketahui, dan lebih lewat daripada yang lain

Adakah perkara ini penting kepada pengguna

Sebahagian besarnya ia menjelaskan dua perkara yang akan anda perhatikan. Pertama, mengapa pengesan biasanya tidak dapat menamakan alat mana yang menghasilkan imej: ia membaca sifat statistik yang dikongsi dan bukannya cap jari khusus setiap model.

Kedua, mengapa penyemak percuma yang lebih lama berprestasi buruk. Beberapa alat yang masih dalam talian dibina berdasarkan artifak GAN dan belum dilatih semula. Alat tersebut mengembalikan keputusan bersih yang yakin pada output semasa, dan tiada apa-apa dalam antara muka yang menjelaskan sebabnya.

Kesan saluran paip hibrid terhadap keputusan

Kebanyakan imej yang sampai kepada anda tidak dihasilkan oleh satu kaedah sahaja. Model diffusion menjana asas, pensampel atas berasaskan GAN membesarkannya, pemulihan wajah membetulkan mata, dan penyunting memangkas serta menyimpan semula hasilnya.

Setiap peringkat menulis semula tekstur, jadi fail tersebut membawa kesan daripada beberapa proses yang bertindih antara satu sama lain. Proses terakhir yang mengubah imej biasanya mendominasi apa yang dibaca oleh pengesan, itulah sebabnya imej diffusion yang disampel atas boleh kelihatan lebih serupa secara statistik dengan pensampel atas berbanding dengan penjana asal.

Ini adalah sebab praktikal mengapa pengenalpastian seni bina tidak berfungsi di luar makmal. Dalam ujian terkawal dengan output bersih satu model, ia adalah masalah yang boleh diselesaikan. Pada imej yang telah melalui saluran paip pengeluaran sebenar, persoalan tersebut tidak dapat ditentukan dengan tepat.

Ia juga menjelaskan hasil yang sering mengelirukan orang ramai: imej yang dijana sepenuhnya yang mendapat skor lebih rendah daripada gambar foto yang telah disampel atas secara agresif. Kedua-duanya telah melalui penulisan semula tekstur oleh perisian, dan pengesan membaca penulisan semula tersebut, bukannya punca asalnya.

Soalan yang sering ditanya

Adakah imej GAN lebih mudah dikesan berbanding imej diffusion?
Sebelum ini ya, dan kini jumlahnya jauh lebih sedikit. Pensampelan atas GAN meninggalkan artifak berkala yang boleh ditemui oleh analisis frekuensi mudah. Diffusion tidak meninggalkan struktur yang setara, jadi pengesanan memerlukan model terlatih yang membaca tekstur statistik dan bukannya carian bersasar untuk satu corak tertentu.
Bolehkah pengesan memberitahu saya sama ada imej berasal daripada model GAN atau diffusion?
Secara umum, bukan daripada piksel. Pengesan berasaskan luas melaporkan kemungkinan penglibatan elemen generatif, bukan keluarga model mana yang menghasilkannya. Pengenalpastian seni bina ialah masalah penyelidikan yang berasingan dan ia jauh kurang boleh dipercayai berbanding pengesanan biasa.
Adakah GAN masih digunakan?
Ya, di tempat tertentu. Ia kekal pantas dan cekap untuk tugasan khusus seperti sintesis wajah dan sesetengah pensampelan atas, di mana diffusion akan menjadi lebih perlahan. Sesetengah alat menggunakan kedua-duanya pada peringkat yang berbeza, bermakna imej boleh membawa kesan daripada mana-mana satu daripadanya.
Adakah seni bina seterusnya akan merosakkan pengesanan sekali lagi?
Ia akan mengurangkan ketepatan dan bukannya merosakkannya sepenuhnya, yang merupakan kelebihan daripada latihan meluas. Model yang mempelajari persamaan tekstur sintetik merentasi ribuan penjana akan merosot secara beransur-ansur terhadap sesuatu yang baharu, berbanding pengesan artifak tunggal yang gagal sepenuhnya.
Mengapa sesetengah alat masih mendakwa ketepatan yang sangat tinggi?
Biasanya kerana ujian dibuat pada set ujian yang dibina daripada penjana yang digunakan semasa latihannya. Angka itu benar tetapi ia tidak menggambarkan prestasi pada model yang dikeluarkan bulan lepas. Tanya penjana mana yang ada dalam penanda aras sebelum membandingkan angka antara alat.
Adakah ini mempengaruhi cara saya membaca skor?
Hanya dalam satu cara. Anggap keputusan bersih pada imej yang anda ragui atas sebab lain sebagai bukti yang lebih lemah berbanding keputusan yang ditandakan, kerana mod kegagalan bagi seni bina yang belum pernah dilihat ialah skor rendah yang yakin, bukannya skor yang tidak pasti.