← Semua panduan Panduan

Cara mengesan wajah janaan AI

Petunjuk visual yang semua orang asyik sebut adalah yang pertama sekali diperbaiki. Berikut ialah apa yang masih membezakan wajah janaan daripada wajah yang diambil gambarnya, dan apa yang sudah tidak membezakannya lagi.

· 9 min bacaan · Best AI Image Detector

Berhenti melihat pada muka. Petunjuk yang boleh dipercayai telah berpindah ke tepi bingkai sejak beberapa tahun lalu: latar belakang, barang kemas, gigi, telinga dan sempadan tempat pertemuan rambut dengan bahagian-bahagian lain. Muka itu sendiri merupakan bahagian pertama yang dibaiki pada setiap model baharu.

Sebab senarai semak lama tidak lagi berfungsi

Setiap senarai petunjuk yang dikongsi meluas mempunyai masalah yang sama: ia menerangkan kelemahan pada model yang wujud semasa ia ditulis. Kelemahan tersebut terbuka, boleh diukur dan memalukan, lantas menjadikannya tepat sebagai perkara yang telah ditala supaya dapat dibaiki pada keluaran yang seterusnya.

Tangan adalah contoh paling jelas. Mengira jari benar-benar berguna selama lebih kurang lapan belas bulan, kemudian ia menjadi cara untuk menunjukkan kesilapan secara yakin dari kedua-dua arah: tangan janaan kini kebiasaannya sudah betul, dan tangan sebenar yang sedang bergerak menjadi kabur menjadi bentuk yang kelihatan salah pada pandangan seseorang yang disuruh mengira.

Perkara yang sama berlaku kepada pantulan mata, ketaksimetrian telinga dan geometri gigi, secara kasar mengikut urutan tersebut. Apa-apa sahaja yang boleh diterangkan dalam siaran tular akan ditanda aras, dan apa-apa sahaja yang ditanda aras akan dibaiki.

  1. 2019
    Latar belakang terlarut Penjana wajah awal menghasilkan wajah yang tajam di atas calitan. Diselesaikan apabila model mempelajari adegan secara keseluruhan.
  2. 2022
    Telinga dan anting-anting tidak sepadan Barang kemas asimetri merupakan isyarat yang kuat sehingga data latihan meliputinya.
  3. 2023
    Tangan dan jari Petunjuk yang paling kerap disebut. Sebahagian besarnya diselesaikan dalam dua kitaran keluaran.
  4. 2024
    Teks dalam bingkai Papan tanda dan label menjadi boleh dibaca, menghapuskan petunjuk yang mudah.
  5. 2026
    Apa yang tinggal adalah statistik Perbezaan yang tinggal adalah pada tekstur dan hingar, di bawah keupayaan penglihatan mata.
Secara kasarnya waktu setiap petunjuk popular tidak lagi boleh dipercayai. Corak inilah intipatinya, bukan tarikh sebenar.

Pandang ke arah lain selain wajah

Usaha penjanaan tertumpu di mana perhatian tertumpu. Model yang dilatih pada potret menjadi sangat mahir pada kawasan yang dilihat orang, dan kekal lemah pada apa-apa sahaja yang dianggap sebagai latar belakang oleh isyarat latihan.

Di situlah terletaknya semakan yang tahan lama. Tanya apa yang tertulis pada tali leher, sama ada corak pada kemeja bersambung dengan betul di belakang lengan, sama ada rantai leher melalui belakang leher dan keluar di tempat yang betul, dan sama ada bilik di belakang bahu adalah tempat yang boleh wujud.

Butiran yang berulang ialah satu lagi kumpulan yang boleh dipercayai. Kertas dinding, kerja bata, dedaun dan wajah orang ramai adalah mahal untuk dijana secara koheren, jadi ia cenderung untuk berulang, beralih atau kehilangan titik lenyapnya dengan cara yang boleh ditangkap oleh mata walaupun potret di hadapannya adalah sempurna.

  • Teks jauh dari tengah. Lencana, papan tanda, tulang buku, pembungkusan. Teks tengah kini biasanya betul; teks persisian masih lagi bahagian yang gagal.
  • Kesinambungan melalui oklusi. Tali, rantai atau jalur yang lalu di belakang sesuatu dan keluar dengan rupa yang salah.
  • Orang ramai dan objek berulang. Barisan kedua dan ketiga orang ramai, atau kerusi keempat dalam satu barisan, mendapat kurang perhatian berbanding yang pertama.
  • Kulit pada pembesaran tinggi. Kulit sebenar mempunyai liang roma, bulu halus dan jeragat asimetri. Kulit yang dijana selalunya licin dengan cara yang tidak dapat dijelaskan oleh pencahayaan.
  • Tempat rambut bertemu segalanya. Sempadan antara rambut dan latar belakang kekal sebagai salah satu kawasan yang paling sukar untuk dirender secara koheren.

Perkara yang dilihat oleh pengesan yang tidak dapat anda lihat

Sebab untuk menjalankan semakan dan tidak bergantung pada pemerhatian adalah kerana perbezaan yang tinggal berada di bawah resolusi penglihatan manusia. Penderia kamera menghasilkan sejenis hingar tertentu; proses penjanaan menghasilkan hingar yang berbeza, dan kedua-duanya tidak kelihatan pada saiz tontonan biasa.

Ini juga sebab pengesan dan mata anda mungkin tidak bersetuju. Gambar dengan ralat visual yang jelas mungkin mendapat skor rendah kerana teksturnya adalah fotografi, dan gambar yang kelihatan sempurna mungkin mendapat skor tinggi kerana teksturnya tidak begitu. Kedua-dua bacaan adalah bermaklumat, dan tidak ada yang membatalkan satu sama lain.

Dua jenis bukti yang berbeza
Pemeriksaan visualAnalisis piksel
Berfungsi padaRalat komposisi dan logikStruktur tekstur dan hingar
Tahan mampatanYaMerosot
Kekal berfungsi pada tangkapan skrinYaMerosot dengan teruk
Menangkap suntingan kecilHanya jika anda menyedarinyaYa, melalui peta kawasan
Bertambah teruk dari semasa ke semasaDengan pantasSecara beransur-ansur

Baris terakhir adalah yang berguna. Petunjuk visual merosot dengan setiap keluaran model; pengesan yang dilatih merentasi banyak penjana merosot dengan lebih perlahan, kerana ia mempelajari perkara yang sama pada tekstur sintetik dan bukannya kesilapan satu produk dalam satu tahun.

Kes yang paling penting: wajah sebenar, diubah

Kepalsuan yang paling memberi kesan selalunya bukanlah potret yang dijana sepenuhnya. Ia adalah gambar orang sebenar dengan satu perkara diubah: wajah berbeza pada badan yang sama, objek ditambah pada tangan, lencana diubah, orang kedua dibuang daripada bingkai.

Skor seluruh bingkai mengendalikan perkara ini dengan teruk mengikut reka bentuk, kerana sembilan puluh peratus daripada imej itu memang gambar dan purata mencerminkannya. Peta kawasan ialah apa yang mendedahkannya, dan membaca peta dan bukannya nombor merupakan satu-satunya tabiat yang paling meningkatkan ketepatan pada wajah.

14 18 11 16 12 15 89 13 17 10 14 19

Sebelas jubin dibaca sebagai fotografi. Satu tidak, dan ia adalah jubin yang meliputi wajah.

Gambar kumpulan tulen dengan satu wajah diganti. Skor seluruh bingkai ialah 31.

Tabiat yang boleh dilaksanakan

Berikan potret itu lima saat pemeriksaan persisian: teks, kesinambungan, corak berulang, sempadan rambut. Kemudian jalankan semakan dan baca peta. Kedua-duanya bersama menangkap lebih banyak daripada salah satu daripadanya sahaja, dan keseluruhannya mengambil masa kurang dari seminit.

Di mana risikonya adalah nyata, tambah langkah yang tidak dapat digantikan oleh sebarang analisis piksel: cari wajah yang sama di tempat lain yang mempunyai sejarah. Profil dengan siaran selama tiga tahun, gambar yang ditanda oleh orang lain dan majikan yang konsisten ialah sejenis bukti yang tidak dihasilkan oleh mana-mana penjana.

Petunjuk yang belum berubah

Dua perkara telah menahan pembaikan selama empat tahun, dan kedua-duanya adalah mengenai koheren merentasi jarak berbanding butiran tempatan. Yang pertama ialah pencahayaan: sama ada setiap permukaan dalam bingkai diterangi oleh sumber yang sama, dari arah yang sama, dengan bayang-bayang dengan kelembutan yang sama.

Potret yang dijana biasanya memaparkan wajah dengan betul dan persekitarannya hampir betul, dan ketidaksepadanan dapat dilihat pada bayang-bayang. Bayang keras di bawah dagu di sebelah bayang lembut pada dinding di belakang menggambarkan dua bilik yang berbeza.

Yang kedua ialah kedalaman. Permukaan pemantulan, kaca, air dan cermin mesti sepadan dengan geometri semua benda lain, dan ia selalunya tidak. Tingkap di belakang subjek yang menunjukkan adegan yang tidak sepatutnya ada adalah jenis ralat yang bertahan dengan peningkatan model, kerana ia memerlukan model dunia dan bukan model wajah.

Kedua-duanya bukanlah ujian yang boleh anda gunakan secara mekanikal, dan kedua-duanya mengambil masa yang lebih lama daripada mengira jari. Itulah tukarannya: semakan yang masih berkesan adalah yang memerlukan pemikiran tentang gambar sebagai sebuah tempat dan bukannya mengimbasnya untuk mencari kecacatan.

Soalan yang sering ditanya

Adakah mengira jari masih berguna?
Jarang sekali, dan ia kini gagal dalam kedua-dua arah. Model semasa merender tangan dengan betul kebanyakan masa, jadi tangan yang betul tidak membuktikan apa-apa, dan tangan sebenar yang ditangkap di tengah-tengah pergerakan menghasilkan bentuk kabur yang orang baca sebagai dijana. Ia adalah heuristik yang baik selama kira-kira lapan belas bulan dan ia bukan satu sekarang.
Bagaimana pula dengan mata? Saya membaca bahawa pantulan tidak sepadan.
Itu benar bagi penjana wajah awal, yang merender setiap mata secara agak bebas. Model moden menghasilkan tangkapan cahaya yang konsisten. Ia masih patut dilihat sekilas kerana ia tidak menelan kos, tetapi sepasang pantulan yang sepadan tidak lagi menjadi bukti apa-apa.
Mengapakah pengesan menandai gambar orang sebenar?
Biasanya pemprosesan dan bukannya manipulasi. Penapis kecantikan, mod potret, mod malam dan pengurangan hingar yang agresif semuanya menulis semula tekstur kulit selepas tangkapan, dan itulah isyarat yang dibaca oleh model. Minta gambar asal yang tidak ditapis sebelum menganggap skor pertengahan sebagai bermakna.
Bolehkah ia memberitahu saya alat mana yang membuat wajah itu?
Bukan daripada piksel. Model berkongsi seni bina dan data latihan, jadi cap jarinya bertindih, dan sebarang pemprosesan pasca mengaburkan sedikit perkara yang memisahkannya. Jika nama muncul dalam keputusan ia datang daripada kelayakan dalam fail dan bukannya daripada gambar, dan keputusannya menyatakan demikian.
Adakah ia berfungsi pada wajah dalam foto kumpulan?
Ya, dan di sinilah peta kawasan menunjukkan nilainya. Satu wajah yang diganti di dalam gambar yang selainnya tulen hampir tidak mengubah skor seluruh bingkai tetapi menyalakan satu jubin. Baca peta dahulu pada sebarang imej yang mengandungi lebih daripada seorang.
Bagaimana pula dengan panggilan video?
Masalah yang berbeza, alatan yang berbeza. Pengesanan imej pegun tidak menangani manipulasi video secara langsung, dan menyemak bingkai individu terlepas ketidakkonsistenan temporal yang mendedahkan pertukaran wajah masa nyata. Anggap ia secara berasingan dan bukannya mengandaikan semakan imej pegun meliputinya.