← सभी गाइड आंतरिक कार्यप्रणाली

Diffusion बनाम GAN: डिटेक्टर उन्हें अलग तरह से क्यों संभालते हैं

एक इमेज बनाने के दो तरीके, दो अलग फिंगरप्रिंट। प्रत्येक प्रक्रिया अपने पीछे क्या छोड़ती है, GAN को पकड़ना आसान क्यों था, और यह आगे आने वाली तकनीक के बारे में क्या संकेत देता है।

· 8 मिनट का पठन · Best AI Image Detector

GAN अपसैंपलिंग से एक दोहराव वाला आर्टिफ़ैक्ट छोड़ते हैं जो लगभग एक हस्ताक्षर जैसा होता है। Diffusion मॉडल ऐसा नहीं करते, यही वजह है कि 2022 में डिटेक्शन अधिक कठिन हो गया और आर्किटेक्चर-विशिष्ट तरकीबों ने काम करना बंद कर दिया।

एक GAN इमेज कैसे बनाता है

एक जनरेटिव एडवरसैरियल नेटवर्क एक छोटे वेक्टर से शुरू होता है और इसे बार-बार अपसॅम्पल करता है, प्रत्येक परत पर रिज़ॉल्यूशन को दोगुना करता है जब तक कि यह पूरे आकार तक नहीं पहुंच जाता। एक दूसरा नेटवर्क परिणाम का आकलन करता है, और दोनों एक-दूसरे के विपरीत प्रशिक्षित होते हैं।

बार-बार होने वाला अपसैंपलिंग ही महत्वपूर्ण हिस्सा है। प्रत्येक दोगुना करने वाला चरण एक नियमित पैटर्न बनाता है, और वे पैटर्न आवधिक संरचना में जमा हो जाते हैं जो इमेज को फ़्रीक्वेंसी डोमेन में बदलने पर दिखाई देती है।

वह संरचना लगभग एक हस्ताक्षर जैसी थी। शुरुआती डिटेक्टर फ़्रीक्वेंसी स्पेक्ट्रम में चेकरबोर्ड पैटर्न की तलाश कर सकते थे और तस्वीर को समझे बिना भी उच्च सटीकता प्राप्त कर सकते थे। यह किसी विशेष मॉडल के बजाय आर्किटेक्चर का एक फिंगरप्रिंट था।

एक diffusion मॉडल इसे कैसे बनाता है

Diffusion इसके विपरीत तरीके से काम करता है। यह पूर्ण लक्षित रिज़ॉल्यूशन पर शुद्ध नॉइज़ के एक क्षेत्र से शुरू होता है और मॉडल द्वारा सीखे गए आधार पर प्रत्येक चरण में इसमें से थोड़ा नॉइज़ हटाता है, जब तक कि एक इमेज सामने न आ जाए।

कोई अपसैंपलिंग लैडर नहीं है, इसलिए कोई आवधिक आर्टिफ़ैक्ट भी नहीं है। इसका आउटपुट सांख्यिकीय रूप से कैमरा कैप्चर से अलग होता है, और यह अंतर संरचनात्मक होने के बजाय विस्तृत (डिफ़्यूज़) होता है। इसमें ऐसा कुछ भी नहीं है जो एक स्पष्ट पैटर्न के रूप में दिखे जिसे खोजा जा सके।

GAN

  • छोटा वेक्टर बार-बार अपसैंपल किया गया
  • प्रत्येक दोहरीकरण से आवधिक आर्टिफ़ैक्ट
  • फ़्रीक्वेंसी डोमेन में पहचाने जाने योग्य
  • आर्किटेक्चर लगभग एक सिग्नेचर छोड़ता है
  • लगभग 2022 तक प्रमुख

Diffusion

  • पूरे आकार में चरण-दर-चरण नॉइज़ हटाई गई
  • कोई अपसैंपलिंग लैडर नहीं, कोई आवधिक पैटर्न नहीं
  • अंतर सांख्यिकीय है, संरचनात्मक नहीं
  • पहचानने के लिए सीखे हुए मॉडल की आवश्यकता है
  • 2022 से प्रमुख
दोनों प्रक्रियाएं और उनमें से प्रत्येक क्या पीछे छोड़ती है। दायां कॉलम बताता है कि डिटेक्शन को नए सिरे से क्यों बनाना पड़ा।

पुराने डिटेक्टरों ने काम करना क्यों बंद कर दिया

फ़्रीक्वेंसी-डोमेन चेकरबोर्डिंग खोजने के लिए बना टूल diffusion इमेज में कुछ भी नहीं खोज पाता है। यह अनिश्चितता की रिपोर्ट नहीं करता; यह रिपोर्ट करता है कि आर्टिफ़ैक्ट अनुपस्थित है, जो एक क्लीन परिणाम जैसा दिखता है।

यही कारण है कि 2021 और 2023 के बीच पूरे क्षेत्र में डिटेक्शन सटीकता गिरती हुई प्रतीत हुई। टूल्स खराब नहीं हुए थे। वे जिस चीज़ को खोज रहे थे, वह बनना बंद हो गई थी।

आर्किटेक्चर-विशिष्ट डिटेक्शन की जगह किसने ली

विस्तार ने। किसी एक आर्टिफ़ैक्ट को खोजने के बजाय, वर्तमान डिटेक्टरों को अधिक से अधिक विभिन्न जनरेटरों के आउटपुट पर प्रशिक्षित किया जाता है, ताकि मॉडल यह सीखे कि सिंथेटिक टेक्सचर में क्या समानता है, न कि यह कि कोई एक फ़ैमिली क्या बनाती है।

यहाँ उपयोग किए गए मॉडल को इसी कारण से हज़ारों जनरेटरों की लाखों छवियों पर प्रशिक्षित किया गया था। विभिन्न आर्किटेक्चरों का कवरेज ही अगले आर्किटेक्चर के लिए सामान्यीकरण क्षमता प्रदान करता है, और यह एकमात्र दृष्टिकोण है जो प्रमुख तरीकों में बदलाव के बाद भी बना रहा है।

इसका समझौता यह है कि किसी एक ज्ञात जनरेटर पर सटीकता उस स्तर से कम होती है जो एक विशेषज्ञ डिटेक्टर प्राप्त कर सकता है। यह सही समझौता है, क्योंकि कुछ नया आते ही विशेषज्ञ अनुपयोगी हो जाता है।

यह क्या भविष्यवाणी करता है

GAN से diffusion में बदलाव का सबक diffusion के बारे में नहीं है। यह है कि वर्तमान में छवियां कैसे बनाई जाती हैं, इससे जुड़ा कोई भी डिटेक्टर सीमित जीवन रखता है, और यह बदलाव पहले से घोषित नहीं होगा।

डिटेक्शन की प्रत्येक पीढ़ी का प्रभाव कैसे घटा
दृष्टिकोणइस पर काम कियातब विफल हुआ जब
फ़्रीक्वेंसी आर्टिफ़ैक्ट खोजGANsDiffusion आया
चेहरा-विशिष्ट विश्लेषणशुरुआती फ़ेस स्वैपपूरे दृश्य का निर्माण शुरू हुआ
मेटाडेटा निरीक्षणटूल से सीधे निकली फ़ाइलेंप्लेटफ़ॉर्मों ने मेटाडेटा हटा दिया
एरर लेवल एनालिसिसएक बार सेव किए गए JPEGsछवियां प्रसारित होने लगीं
व्यापक बहु-जनरेटर प्रशिक्षणअधिकांश वर्तमान आउटपुटअज्ञात, और दूसरों की तुलना में बाद में

क्या उपयोगकर्ता के लिए इनमें से कोई मायने रखता है

मुख्य रूप से यह दो बातों को स्पष्ट करता है जिन्हें आप नोटिस करेंगे। पहला, डिटेक्टर आमतौर पर यह क्यों नहीं बता पाता कि किस टूल ने इमेज बनाई है: यह प्रति-मॉडल फ़िंगरप्रिंट के बजाय एक साझा सांख्यिकीय विशेषता को पढ़ रहा होता है।

दूसरा, पुराने मुफ़्त चेकर्स खराब प्रदर्शन क्यों करते हैं। अभी भी ऑनलाइन मौजूद कई टूल्स GAN आर्टिफ़ैक्ट्स के आधार पर बनाए गए थे और उन्हें फिर से प्रशिक्षित नहीं किया गया है। वे वर्तमान आउटपुट पर आश्वस्त क्लीन परिणाम देते हैं, और इंटरफ़ेस में कुछ भी यह नहीं बताता कि ऐसा क्यों है।

एक हाइब्रिड पाइपलाइन परिणाम पर क्या प्रभाव डालती है

आप तक पहुँचने वाली अधिकांश छवियां किसी एक तरीके से नहीं बनाई गई होती हैं। एक diffusion मॉडल बेस तैयार करता है, एक GAN-आधारित अपस्केलर इसे बड़ा करता है, एक फ़ेस रेस्टोरेशन प्रक्रिया आँखों को ठीक करती है, और एक एडिटर परिणाम को क्रॉप करके फिर से सेव करता है।

प्रत्येक चरण टेक्सचर को फिर से लिखता है, इसलिए फ़ाइल में एक-दूसरे के ऊपर कई प्रक्रियाओं के निशान होते हैं। जो प्रक्रिया इमेज को सबसे अंत में छूती है, आमतौर पर डिटेक्टर उसी को प्रमुखता से पढ़ता है, यही कारण है कि एक अपस्केल की गई diffusion इमेज सांख्यिकीय रूप से जनरेटर के बजाय अपस्केलर जैसी अधिक दिख सकती है।

यही व्यावहारिक कारण है कि प्रयोगशाला के बाहर आर्किटेक्चर की पहचान काम नहीं करती है। क्लीन सिंगल-मॉडल आउटपुट के साथ नियंत्रित परीक्षण में यह हल करने योग्य समस्या है। वास्तविक प्रोडक्शन पाइपलाइन से गुज़री छवि पर यह सवाल ठीक से लागू नहीं होता।

यह उस परिणाम को भी स्पष्ट करता है जो लोगों को भ्रमित करता है: वास्तव में जनरेट की गई एक इमेज जो अत्यधिक अपस्केल की गई फ़ोटो की तुलना में कम स्कोर करती है। दोनों के टेक्सचर सॉफ़्टवेयर द्वारा फिर से लिखे गए हैं, और डिटेक्टर मूल स्रोत के बजाय उस बदलाव को पढ़ रहा है।

अक्सर पूछे जाने वाले सवाल

क्या GAN छवियों का पता लगाना diffusion छवियों की तुलना में आसान है?
वे आसान थीं, और अब उनकी संख्या बहुत कम है। GAN अपसैंपलिंग ने एक आवधिक आर्टिफ़ैक्ट छोड़ा जिसे एक साधारण फ़्रीक्वेंसी विश्लेषण से खोजा जा सकता था। Diffusion कोई समतुल्य संरचना नहीं छोड़ता है, इसलिए डिटेक्शन के लिए एक पैटर्न की लक्षित खोज के बजाय सांख्यिकीय टेक्सचर को पढ़ने वाले प्रशिक्षित मॉडल की आवश्यकता होती है।
क्या कोई डिटेक्टर मुझे बता सकता है कि छवि GAN से आई है या diffusion मॉडल से?
सामान्य तौर पर पिक्सल देखकर नहीं। एक व्यापक डिटेक्टर यह रिपोर्ट करता है कि किसी जेनेरेटिव प्रक्रिया के शामिल होने की कितनी संभावना है, न कि यह कि इसे किस फ़ैमिली ने बनाया है। आर्किटेक्चर की पहचान एक अलग शोध विषय है और यह डिटेक्शन की तुलना में काफी कम विश्वसनीय है।
क्या GANs का अभी भी उपयोग किया जाता है?
हाँ, कुछ विशिष्ट जगहों पर। वे चेहरे के निर्माण और कुछ अपस्केलिंग जैसे सीमित कार्यों के लिए तेज़ और कुशल बने हुए हैं, जहाँ diffusion धीमा होगा। कुछ टूल्स विभिन्न चरणों में दोनों का उपयोग करते हैं, जिसका अर्थ है कि एक इमेज में दोनों के निशान हो सकते हैं।
क्या अगला आर्किटेक्चर डिटेक्शन को फिर से तोड़ देगा?
यह इसे पूरी तरह तोड़ने के बजाय सटीकता को कम करेगा, जो कि व्यापक प्रशिक्षण से हुआ सुधार है। एक मॉडल जिसने हज़ारों जनरेटरों में सिंथेटिक टेक्सचर की समानता को सीखा है, किसी नई चीज़ के सामने धीरे-धीरे कमज़ोर होता है, जबकि सिंगल-आर्टिफ़ैक्ट डिटेक्टर पूरी तरह विफल हो जाता है।
कुछ टूल्स अभी भी बहुत उच्च सटीकता का दावा क्यों करते हैं?
आमतौर पर इसलिए क्योंकि वे उसी टेस्ट सेट पर माप रहे होते हैं जो उन्हीं जनरेटरों से बना है जिन पर उन्होंने प्रशिक्षण लिया था। वह आंकड़ा वास्तविक है पर वह पिछले महीने जारी किए गए मॉडल पर प्रदर्शन का वर्णन नहीं करता। टूल्स के बीच संख्याओं की तुलना करने से पहले पूछें कि बेंचमार्क में कौन से जनरेटर शामिल थे।
क्या इससे यह प्रभावित होता है कि मुझे स्कोर को कैसे समझना चाहिए?
केवल एक तरह से। जिस छवि पर आपको अन्य कारणों से संदेह हो, उस पर आए क्लीन परिणाम को फ़्लैग किए गए परिणाम की तुलना में कमज़ोर प्रमाण मानें, क्योंकि किसी अनदेखे आर्किटेक्चर की विफलता अनिश्चित स्कोर के बजाय एक आश्वस्त कम स्कोर होती है।

अभी एक छवि की जांच करें

मुफ़्त, कोई खाता नहीं, और फ़ाइल कभी आपके डिवाइस से बाहर नहीं जाती। प्रतिदिन पचास जाँचें।

डिटेक्टर खोलें

आगे पढ़ें