Dalawang magkaibang bagay na tinatawag ng mga tao na pareho
Ang isang fully generated image ay nagsisimula sa wala. Walang larawan sa ilalim nito, walang sensor reading, walang moment na nangyari. Bawat pixel ay ginawa ng isang model, at ang taong nasa loob nito ay walang pagkakakilanlan na masisira dahil walang tao.
Ang isang deepfake ay nagsisimula sa isang bagay na totoo. May larawan o video sa ilalim nito, isang tunay na kuha ng isang tunay na sandali, at isang model ang pumalit sa isang partikular na bahagi nito, karaniwan ay mukha, gamit ang rendering ng ibang tao.
Ang pagkakaiba ay mahalaga sa legal, editorial, at teknikal na aspeto. Ang isang generated stock photo ng isang hindi nage-exist na doktor ay isang isyu sa paglilisensya. Ang isang larawan ng isang totoong doktor na ang mukha ay ipinadikit sa katawan na hindi naman nila pagmamay-ari ay isang isyu sa paninirang-puri, at posibleng kriminal na kaso.
Bakit mahirap hulihin ang deepfake
Binabasa ng detector ang texture ng estatistika ng isang larawan at iniuulat kung gaano ito kamukha ng isang bagay na gawa ng modelo. Kapag buong frame ang synthetic, naroon ang signal na iyon, at malinaw ang score.
Binabaligtad ng face swap ang problemang ito. Siyamnapung porsyento ng larawan ay isang tunay na litrato, na may tunay na sensor noise at tunay na compression history, at ang average ng buong frame ay sumasalamin doon. Ang isang nakakakumbinsing swap ay maaaring makabuo ng score na nasa tatlumpu sa isang larawang mapanlinlang.
Hindi iyon kabiguan ng modelo kundi kabiguan ng tanong. Ang pagtatanong kung ang larawan ay generated ay may maling anyo kung ang tapat na sagot ay karamihan nito ay hindi, at ang isang mahalagang bahagi nito ay iyon.
Ang averaging na nagbunga ng 33 ay eksaktong nagtatago sa tile na mahalaga.
Ang region map ang sagot sa problemang iyon sa anyo. Ang magkahiwalay na pag-score sa mga magkakapatong na tile ay nangangahulugang ang isang lokalisadong pagpapalit ay sinusukat laban sa sarili nitong kapaligiran sa halip na mahalo sa isang frame na hindi naman ito kasali.
Ang talasalitaan, ayon sa pagkakasunod-sunod
| Termino | Ano ang ibig sabihin nito | Tunay ba ang paksa? |
|---|---|---|
| Deepfake | Ang wangis ng isang tunay na tao na inilagay sa ibang footage | Oo |
| Face swap | Ang karaniwang anyo ng deepfake, sa static na larawan o video | Oo |
| Ginawa ng AI | Ginawa mula sa isang prompt na walang pinagbatayang litrato | Hindi |
| Na-edit ng AI | Isang totoong larawan na may idinagdag o tinanggal | Kadalasan |
| Synthetic media | Terminong sumasaklaw sa lahat ng nasa itaas | Depende |
| Cheapfake | Tunay na media na nilinlang sa pamamagitan ng caption, crop, o lumang petsa | Oo |
Ang huling hanay ay dapat pagtuunan ng pansin, dahil ito ang pinakakaraniwang anyo ng biswal na maling impormasyon at ang hindi natutugunan ng kahit anong detector. Ang isang tunay at hindi na-edit na litrato mula sa ibang bansa tatlong taon na ang nakalilipas, na may caption na balita ngayon, ay magkakaroon ng score bilang tunay na litratong ito.
Ano ang dapat gawin, ayon sa kaso
- Pinaghihinalaan mong gawa-gawa ang buong larawan. Magsagawa ng whole-frame check. Ang mataas na score na may flat na map ay kasinglinaw na nito.
- Pinaghihinalaan mong may taong ipinasok o ipinalit. Basahin muna ang region map. Ipapaliit ng numero ang epekto nito.
- Pinaghihinalaan mong may binagong dokumento. Gaya ng nasa itaas, at asahan ang eksaktong isang mainit na tile sa binagong field.
- Pinaghihinalaan mong nagsisinungaling ang caption. Hindi makakatulong ang detector. Mag-reverse image search, pagkatapos ay tingnan ang petsa at lugar.
- Ito ay video. Iba ang kagamitan para dito. Ang frame-by-frame na pagsusuri ng still ay nakakaligtaan ang mga temporal na artifact na nagbubunyag ng real-time swaps.
Bakit pinoprotektahan ng pagkakaibang ito ang mga tao
Ang pagtrato sa bawat synthetic na larawan bilang parehong seryoso ay nagdudulot ng dalawang kabiguan nang sabay. Nasasayang ang atensyon sa mga hindi nakakapinsalang bagay, tulad ng isang taong gumagamit ng generated na portrait dahil hindi nila afford ang photographer, at hindi nabibigyan ng sapat na timbang ang kaso na tunay na nakakasakit sa isang tao.
Ang pinsala ay wala sa mga artificial na pixel. Ito ay nasa isang tunay at pinangalanang indibidwal na ipinapakita sa paggawa ng isang bagay na hindi naman nila ginawa. Iyon ang bagay na dapat bigyang-pansin, at ito ang kaso kung saan ang katamtamang score ay hindi mapagkakatiwalaan bilang buod.
Ang pagbuo ng panloob na polisiya batay sa pagkakakilanlan kaysa sa teknolohiya ay nakakatulong din para hindi ito maluma. Patuloy na magbabago ang mga paraan; ang tanong kung ang isang partikular na tao ay maling kinakatawan ay hindi.
Paano ginagawa ang isang face swap
Ang pag-unawa sa produksyon ay nakakatulong sa pagpapaliwanag ng detection. Nagsisimula ang isang swap sa isang target na litrato at isang set ng mga larawan ng taong gagamitin ang mukha. Natututo ang isang modelo na i-render ang mukha na iyon sa ilalim ng lighting, anggulo, at ekspresyon na naroroon na sa target.
Ang rendered na mukha ay ikino-composite pabalik sa orihinal na frame, at ang tahi ang mahirap na bahagi. Ang dalawang kalahati ay may magkaibang noise, magkaibang compression history, at kadalasang magkaibang color response, kaya ang blending step ay pinapakinis ang boundary hanggang sa hindi na mapansin ng mata ang dugtong.
Ang pagpapakinis na iyon ang binabasa ng region map. Ang blending ay nag-aalis ng high-frequency texture na ginagawa ng sensor, at ang resultang patch ay istatistikang hindi katulad ng lahat ng nasa paligid nito kahit na hindi nakikita ang dugtong. Ang tahi ay hindi nakikita at nasusukat sa parehong oras.
Ipinaliliwanag din nito kung bakit madaling makalusot ang isang swap sa whole-frame check. Ang manipulated na bahagi ay maliit, sinadyang i-blend sa paligid nito, at napapalibutan ng isang authentic na litrato na nangingibabaw sa anumang average na kinuha sa buong frame.
Ang pagkakamaling paulit-ulit
Ang mga tao ay nagpapatakbo ng pinaghihinalaang deepfake sa isang detector, nakakakita ng score sa tatlumpu, at nagreresulta na ang larawan ay tunay. Maling hinuha iyon mula sa tamang numero: tama ang score at ang tanong na sinasagot nito ay hindi ang tinatanong.
Ang ugali na nag-aayos nito ay maliit. Sa anumang larawan kung saan ang alalahanin ay tungkol sa isang partikular na tao, buksan ang region map bago basahin ang pangunahing figure, at ituring ang pinakamataas na tile sa halip na ang average bilang natuklasan na dapat aksyunan.