← Semua panduan Di balik layar

Diffusion vs GAN: mengapa detektor menanganinya secara berbeda

Dua cara untuk membangun gambar, dua sidik jari yang berbeda. Apa yang ditinggalkan oleh masing-masing proses, mengapa GAN lebih mudah ditangkap, dan apa prediksi hal tersebut tentang apa yang akan terjadi selanjutnya.

· 8 mnt baca · Best AI Image Detector

GAN meninggalkan artefak berulang dari upsampling yang hampir seperti tanda tangan. Model diffusion tidak, itulah sebabnya deteksi menjadi lebih sulit pada tahun 2022 dan mengapa trik khusus arsitektur berhenti berfungsi.

Bagaimana GAN membangun sebuah gambar

Generative adversarial network dimulai dari vektor kecil dan berulang kali melakukan upsampling, menggandakan resolusi pada setiap lapisan hingga mencapai ukuran penuh. Jaringan kedua menilai hasilnya, dan keduanya berlatih satu sama lain.

Upsampling berulang adalah bagian penting. Setiap langkah penggandaan memperkenalkan pola beraturan, dan pola tersebut terakumulasi menjadi struktur periodik yang terlihat ketika gambar diubah ke domain frekuensi.

Struktur itu mirip dengan tanda tangan. Detektor awal dapat mencari pola papan catur dalam spektrum frekuensi dan mencapai akurasi tinggi tanpa memahami apa pun tentang gambar. Itu adalah sidik jari arsitektur alih-alih model tertentu.

Bagaimana model diffusion membangunnya

Diffusion bekerja sebaliknya. Ini dimulai dengan bidang noise murni pada resolusi target penuh dan menghilangkannya sedikit demi sedikit pada setiap langkah, dipandu oleh apa yang dipelajari model, hingga gambar muncul.

Tidak ada tangga upsampling, sehingga tidak ada artefak berkala. Output tersebut secara statistik berbeda dari tangkapan kamera, dan perbedaannya bersifat menyebar, bukan struktural. Tidak ada hal di dalamnya yang muncul sebagai pola bersih yang bisa Anda cari.

GAN

  • Vektor kecil di-upsample berulang kali
  • Artefak berkala dari setiap penggandaan
  • Dapat dideteksi dalam domain frekuensi
  • Arsitektur meninggalkan sesuatu yang menyerupai tanda tangan
  • Dominan hingga sekitar tahun 2022

Diffusion

  • Derau dihilangkan selangkah demi selangkah pada ukuran penuh
  • Tidak ada tangga upsampling, tidak ada pola berkala
  • Perbedaannya bersifat statistik, bukan struktural
  • Membutuhkan model terlatih untuk mendeteksi
  • Dominan sejak 2022
Kedua proses dan apa yang ditinggalkan masing-masing. Kolom sebelah kanan adalah alasan deteksi harus dibangun kembali.

Mengapa detektor lama berhenti berfungsi

Alat yang dibangun untuk menemukan checkerboarding domain frekuensi tidak menemukan apa pun dalam gambar diffusion. Alat ini tidak melaporkan ketidakpastian; alat ini melaporkan bahwa artefak tidak ada, yang terbaca sebagai hasil yang bersih.

Itulah sebabnya akurasi deteksi di seluruh bidang ini tampak runtuh antara tahun 2021 dan 2023. Alat-alat tersebut tidak mengalami penurunan kualitas. Hal yang mereka cari telah berhenti diproduksi.

Apa yang menggantikan deteksi khusus arsitektur

Keluasan. Daripada mencari satu artefak, detektor saat ini dilatih pada output dari sebanyak mungkin generator berbeda yang dapat dikumpulkan, sehingga model tersebut mempelajari kesamaan tekstur sintetis, bukan apa yang diproduksi oleh satu keluarga generator.

Model yang digunakan di sini dilatih pada jutaan gambar dari ribuan generator tepat karena alasan ini. Cakupan lintas arsitektur adalah hal yang memberikan generalisasi pada arsitektur berikutnya, dan ini adalah satu-satunya pendekatan yang mampu bertahan dari perubahan metode yang dominan.

Pertukarannya adalah bahwa akurasi pada generator tunggal mana pun yang diketahui lebih rendah daripada yang bisa dicapai oleh detektor spesialis. Itu adalah pertukaran yang tepat, karena spesialis menjadi tidak berguna saat sesuatu yang baru tiba.

Apa yang diprediksi oleh ini

Pelajaran dari transisi GAN ke diffusion bukanlah tentang diffusion. Pelajarannya adalah bahwa setiap detektor yang terikat pada cara gambar dibuat saat ini memiliki umur yang terbatas, dan transisinya tidak akan diumumkan sebelumnya.

Bagaimana setiap generasi deteksi menua
PendekatanBerfungsi padaGagal ketika
Pencarian artefak frekuensiGANDiffusion tiba
Analisis khusus wajahTukar wajah awalPembuatan seluruh adegan tiba
Pemeriksaan metadataFile langsung dari sebuah alatPlatform menghapus metadata
Analisis tingkat kesalahanJPEG penyimpanan tunggalGambar mulai beredar
Pelatihan multi-generator yang luasSebagian besar output saat iniTidak diketahui, dan lebih lambat dari yang lain

Apakah hal ini penting bagi pengguna

Sebagian besar ini menjelaskan dua hal yang akan Anda perhatikan. Pertama, mengapa detektor biasanya tidak dapat menyebutkan alat apa yang menghasilkan sebuah gambar: alat tersebut membaca properti statistik bersama dan bukan sidik jari per model.

Kedua, mengapa alat pemeriksa gratis yang lebih lama bekerja dengan buruk. Beberapa alat yang masih daring dibangun berdasarkan artefak GAN dan belum dilatih ulang. Alat tersebut memberikan hasil bersih dengan tingkat keyakinan tinggi pada output saat ini, dan tidak ada di antarmuka yang menjelaskan alasannya.

Apa yang dilakukan pipeline hibrida terhadap suatu hasil

Sebagian besar gambar yang sampai kepada Anda tidak diproduksi oleh satu metode. Model diffusion menghasilkan dasar, upscaler berbasis GAN memperbesarnya, proses restorasi wajah memperbaiki mata, dan editor memotong serta menyimpan ulang hasilnya.

Setiap tahap menulis ulang tekstur, sehingga file tersebut membawa jejak dari beberapa proses yang berlapis-lapis. Proses terakhir yang menyentuh gambar biasanya mendominasi apa yang dibaca detektor, itulah sebabnya gambar diffusion yang di-upsample dapat terlihat secara statistik lebih mirip upscaler daripada generator.

Ini adalah alasan praktis mengapa identifikasi arsitektur tidak berfungsi di luar laboratorium. Dalam uji terkontrol dengan output model tunggal yang bersih, ini adalah masalah yang bisa diselesaikan. Pada gambar yang telah melalui pipeline produksi nyata, pertanyaannya tidak dirumuskan dengan baik.

Hal ini juga menjelaskan hasil yang dianggap membingungkan oleh orang-orang: gambar yang benar-benar dihasilkan AI yang mendapat skor lebih rendah daripada foto yang diperbesar resolusinya secara signifikan. Keduanya telah mengalami penulisan ulang tekstur oleh perangkat lunak, dan detektor tersebut membaca penulisan ulang tersebut dan bukan asalnya.

Pertanyaan yang diajukan orang

Apakah gambar GAN lebih mudah dideteksi daripada gambar diffusion?
Dahulu iya, dan sekarang jumlahnya jauh lebih sedikit. Upsampling GAN meninggalkan artefak berkala yang dapat ditemukan oleh analisis frekuensi sederhana. Diffusion tidak meninggalkan struktur yang setara, sehingga deteksinya memerlukan model terlatih yang membaca tekstur statistik daripada pencarian yang ditargetkan untuk satu pola.
Dapatkah detektor memberi tahu saya apakah sebuah gambar berasal dari GAN atau model diffusion?
Secara umum tidak dari pikselnya. Detektor yang luas melaporkan seberapa besar kemungkinan adanya unsur generatif yang terlibat, bukan keluarga mana yang menghasilkannya. Identifikasi arsitektur adalah masalah penelitian terpisah dan jauh kurang dapat diandalkan dibandingkan deteksi.
Apakah GAN masih digunakan?
Ya, di tempat-tempat tertentu. Mereka tetap cepat dan efisien untuk tugas-tugas sempit seperti sintesis wajah dan beberapa upscaling, di mana diffusion akan lebih lambat. Beberapa alat menggunakan keduanya pada tahap yang berbeda, yang berarti sebuah gambar dapat membawa jejak salah satunya.
Apakah arsitektur berikutnya akan merusak deteksi lagi?
Itu akan mengurangi akurasi daripada merusaknya, yang mana merupakan peningkatan yang didapat dari pelatihan luas. Model yang mempelajari kesamaan tekstur sintetis di ribuan generator akan menurun secara bertahap terhadap sesuatu yang baru, di mana detektor artefak tunggal akan gagal sama sekali.
Mengapa beberapa alat masih mengklaim akurasi yang sangat tinggi?
Biasanya karena mereka mengukur pada set pengujian yang dibangun dari generator tempat mereka berlatih. Angka tersebut nyata dan tidak menggambarkan performa pada model yang dirilis bulan lalu. Tanyakan generator mana yang ada dalam tolok ukur sebelum membandingkan angka antar alat.
Apakah ini memengaruhi cara saya membaca skor?
Hanya dengan satu cara. Anggap hasil bersih pada gambar yang Anda ragukan karena alasan lain sebagai bukti yang lebih lemah daripada hasil yang ditandai, karena mode kegagalan dari arsitektur yang belum pernah dilihat adalah skor rendah dengan tingkat keyakinan tinggi, dan bukan skor yang tidak pasti.