Bagaimana GAN membangun sebuah gambar
Generative adversarial network dimulai dari vektor kecil dan berulang kali melakukan upsampling, menggandakan resolusi pada setiap lapisan hingga mencapai ukuran penuh. Jaringan kedua menilai hasilnya, dan keduanya berlatih satu sama lain.
Upsampling berulang adalah bagian penting. Setiap langkah penggandaan memperkenalkan pola beraturan, dan pola tersebut terakumulasi menjadi struktur periodik yang terlihat ketika gambar diubah ke domain frekuensi.
Struktur itu mirip dengan tanda tangan. Detektor awal dapat mencari pola papan catur dalam spektrum frekuensi dan mencapai akurasi tinggi tanpa memahami apa pun tentang gambar. Itu adalah sidik jari arsitektur alih-alih model tertentu.
Bagaimana model diffusion membangunnya
Diffusion bekerja sebaliknya. Ini dimulai dengan bidang noise murni pada resolusi target penuh dan menghilangkannya sedikit demi sedikit pada setiap langkah, dipandu oleh apa yang dipelajari model, hingga gambar muncul.
Tidak ada tangga upsampling, sehingga tidak ada artefak berkala. Output tersebut secara statistik berbeda dari tangkapan kamera, dan perbedaannya bersifat menyebar, bukan struktural. Tidak ada hal di dalamnya yang muncul sebagai pola bersih yang bisa Anda cari.
GAN
- Vektor kecil di-upsample berulang kali
- Artefak berkala dari setiap penggandaan
- Dapat dideteksi dalam domain frekuensi
- Arsitektur meninggalkan sesuatu yang menyerupai tanda tangan
- Dominan hingga sekitar tahun 2022
Diffusion
- Derau dihilangkan selangkah demi selangkah pada ukuran penuh
- Tidak ada tangga upsampling, tidak ada pola berkala
- Perbedaannya bersifat statistik, bukan struktural
- Membutuhkan model terlatih untuk mendeteksi
- Dominan sejak 2022
Mengapa detektor lama berhenti berfungsi
Alat yang dibangun untuk menemukan checkerboarding domain frekuensi tidak menemukan apa pun dalam gambar diffusion. Alat ini tidak melaporkan ketidakpastian; alat ini melaporkan bahwa artefak tidak ada, yang terbaca sebagai hasil yang bersih.
Itulah sebabnya akurasi deteksi di seluruh bidang ini tampak runtuh antara tahun 2021 dan 2023. Alat-alat tersebut tidak mengalami penurunan kualitas. Hal yang mereka cari telah berhenti diproduksi.
Apa yang menggantikan deteksi khusus arsitektur
Keluasan. Daripada mencari satu artefak, detektor saat ini dilatih pada output dari sebanyak mungkin generator berbeda yang dapat dikumpulkan, sehingga model tersebut mempelajari kesamaan tekstur sintetis, bukan apa yang diproduksi oleh satu keluarga generator.
Model yang digunakan di sini dilatih pada jutaan gambar dari ribuan generator tepat karena alasan ini. Cakupan lintas arsitektur adalah hal yang memberikan generalisasi pada arsitektur berikutnya, dan ini adalah satu-satunya pendekatan yang mampu bertahan dari perubahan metode yang dominan.
Pertukarannya adalah bahwa akurasi pada generator tunggal mana pun yang diketahui lebih rendah daripada yang bisa dicapai oleh detektor spesialis. Itu adalah pertukaran yang tepat, karena spesialis menjadi tidak berguna saat sesuatu yang baru tiba.
Apa yang diprediksi oleh ini
Pelajaran dari transisi GAN ke diffusion bukanlah tentang diffusion. Pelajarannya adalah bahwa setiap detektor yang terikat pada cara gambar dibuat saat ini memiliki umur yang terbatas, dan transisinya tidak akan diumumkan sebelumnya.
| Pendekatan | Berfungsi pada | Gagal ketika |
|---|---|---|
| Pencarian artefak frekuensi | GAN | Diffusion tiba |
| Analisis khusus wajah | Tukar wajah awal | Pembuatan seluruh adegan tiba |
| Pemeriksaan metadata | File langsung dari sebuah alat | Platform menghapus metadata |
| Analisis tingkat kesalahan | JPEG penyimpanan tunggal | Gambar mulai beredar |
| Pelatihan multi-generator yang luas | Sebagian besar output saat ini | Tidak diketahui, dan lebih lambat dari yang lain |
Apakah hal ini penting bagi pengguna
Sebagian besar ini menjelaskan dua hal yang akan Anda perhatikan. Pertama, mengapa detektor biasanya tidak dapat menyebutkan alat apa yang menghasilkan sebuah gambar: alat tersebut membaca properti statistik bersama dan bukan sidik jari per model.
Kedua, mengapa alat pemeriksa gratis yang lebih lama bekerja dengan buruk. Beberapa alat yang masih daring dibangun berdasarkan artefak GAN dan belum dilatih ulang. Alat tersebut memberikan hasil bersih dengan tingkat keyakinan tinggi pada output saat ini, dan tidak ada di antarmuka yang menjelaskan alasannya.
Apa yang dilakukan pipeline hibrida terhadap suatu hasil
Sebagian besar gambar yang sampai kepada Anda tidak diproduksi oleh satu metode. Model diffusion menghasilkan dasar, upscaler berbasis GAN memperbesarnya, proses restorasi wajah memperbaiki mata, dan editor memotong serta menyimpan ulang hasilnya.
Setiap tahap menulis ulang tekstur, sehingga file tersebut membawa jejak dari beberapa proses yang berlapis-lapis. Proses terakhir yang menyentuh gambar biasanya mendominasi apa yang dibaca detektor, itulah sebabnya gambar diffusion yang di-upsample dapat terlihat secara statistik lebih mirip upscaler daripada generator.
Ini adalah alasan praktis mengapa identifikasi arsitektur tidak berfungsi di luar laboratorium. Dalam uji terkontrol dengan output model tunggal yang bersih, ini adalah masalah yang bisa diselesaikan. Pada gambar yang telah melalui pipeline produksi nyata, pertanyaannya tidak dirumuskan dengan baik.
Hal ini juga menjelaskan hasil yang dianggap membingungkan oleh orang-orang: gambar yang benar-benar dihasilkan AI yang mendapat skor lebih rendah daripada foto yang diperbesar resolusinya secara signifikan. Keduanya telah mengalami penulisan ulang tekstur oleh perangkat lunak, dan detektor tersebut membaca penulisan ulang tersebut dan bukan asalnya.