परिणाम अलग होने के चार कारण
एक स्कोर विकल्पों की एक लंबी श्रृंखला का अंतिम सिरा होता है। किसी भी कड़ी को बदलें और संख्या बदल जाती है, भले ही इमेज में कुछ भी न बदला हो।
- अलग-अलग ट्रेनिंग डेटा। एक डिटेक्टर उसी को पहचानता है जो उसने देखा है। हजारों खुले जनरेटरों पर प्रशिक्षित डिटेक्टर असामान्य मॉडलों को अच्छी तरह से संभालता है। चार सबसे बड़े व्यावसायिक टूल पर प्रशिक्षित डिटेक्टर उन चारों को बेहतर ढंग से और बाकी सभी को खराब ढंग से संभालता है।
- अलग-अलग निर्णय सीमाएं। एक टूल 60 को संदिग्ध कहता है, दूसरा 75 को संदिग्ध कहता है। एक ही रीडिंग एक सीमा को पार करती है और दूसरी को नहीं, इसलिए आपको एक माप से दो फैसले मिलते हैं।
- अलग-अलग परिभाषाएं। कुछ टूल किसी भी जनरेटिव भागीदारी को गिनते हैं, जिसमें अपस्केल या जनरेटिव फिल शामिल है। अन्य केवल पूरी तरह से सिंथेटिक फ्रेम को चिह्नित करते हैं। एक रीटच किया गया पोर्ट्रेट पहले के लिए AI है और दूसरे के लिए वास्तविक।
- अलग-अलग प्रीप्रोसेसिंग। स्कोर करने से पहले टूल आकार बदलते हैं, क्रॉप करते हैं और दोबारा एनकोड करते हैं। केंद्र के 224-पिक्सेल वर्ग को पढ़ने वाला डिटेक्टर पूरे फ्रेम के 384 पिक्सेल पढ़ने वाले डिटेक्टर से एक अलग तस्वीर देखता है।
Tool D दूसरों की तुलना में अधिक संवेदनशील नहीं है। यह एक व्यापक प्रश्न का उत्तर देता है। यदि आपकी चिंता यह है कि क्या कोई तस्वीर जनरेटर द्वारा बनाई गई थी, तो D अत्यधिक रिपोर्ट कर रहा है। यदि आपकी चिंता यह है कि क्या किसी AI ने फ़ाइल को छुआ है, तो केवल D ही आपको उत्तर दे रहा है।
पूछें कि प्रत्येक टूल किस प्रश्न का उत्तर देता है
| प्रश्न | इसे क्या चिह्नित करता है | विशिष्ट उपयोग |
|---|---|---|
| क्या यह फ्रेम शून्य से जनरेट किया गया था? | पूरे फ्रेम का सिंथेटिक टेक्सचर | समाचार, बाज़ार लिस्टिंग, डेटिंग प्रोफाइल |
| क्या इसका कोई भाग AI द्वारा संपादित किया गया था? | रेखा के ऊपर एक क्षेत्र | बीमा, दावे, साक्ष्य समीक्षा |
| क्या किसी AI ने इस फ़ाइल को बिल्कुल भी छुआ है? | अपस्केलिंग, डिनॉइज़, जनरेटिव फिल | स्टॉक लाइब्रेरी, प्रतियोगिता नियम |
टूल के बीच अधिकांश असहमति वास्तव में इस बात पर असहमति है कि आपने इन तीनों में से कौन सा पूछा है। परिणामों की तुलना करने से पहले, तय करें कि आपके लिए कौन सा प्रश्न मायने रखता है, फिर उसके आधार पर प्रत्येक टूल को समझें।
दो परिणामों की ठीक से तुलना कैसे करें
-
दोनों टूल में बिल्कुल वही फ़ाइल डालें
दोबारा डाउनलोड की गई नहीं, स्क्रीनशॉट नहीं, चैट ऐप से गुजरी कॉपी नहीं। अलग-अलग बाइट्स एक अलग इमेज हैं और उनका अलग-अलग स्कोर होना स्वाभाविक है।
-
संख्याओं की नहीं, बैंड की तुलना करें
50 की रेखा वाले पैमाने पर 61 और 65 की रेखा वाले पैमाने पर 58 रीडिंग पर सहमत होते हुए भी फैसले पर असहमत हैं।
-
प्रकाशित सीमा (threshold) देखें
जो टूल यह नहीं बताएगा कि उसकी रेखा कहां स्थित है, उसकी तुलना किसी भी चीज़ से नहीं की जा सकती। संख्या को सबूत के बजाय अस्पष्ट समझें।
-
उस टूल को प्राथमिकता दें जो अपनी प्रक्रिया दिखाता है
एक रीजन मैप, एक नामित बैंड और एक घोषित बेंचमार्क आपको तर्क की जांच करने देते हैं। बिना किसी आधार के एक आश्वस्त लेबल ऐसा नहीं करने देता।
-
सहमति को मजबूत संकेत मानें
दो स्वतंत्र टूल का एक ही बैंड तक पहुंचना किसी एक की तुलना में अधिक मूल्यवान है। दो के असहमत होने का मतलब अनिश्चितता है, न कि अंतर को आधा-आधा बांटना।
जब असहमति ही निष्कर्ष हो
एक पैटर्न को पहचानना सीखने योग्य है। एक टूल जो उच्च स्कोर की रिपोर्ट करने वाले टूल के साथ-साथ कम पूर्ण-फ्रेम स्कोर की रिपोर्ट करता है, उसका अक्सर मतलब होता है कि इमेज स्थानीय संपादन वाली एक वास्तविक तस्वीर है।
पहला टूल ज्यादातर वास्तविक फ्रेम में संपादन को औसत कर रहा है। दूसरा सबसे मजबूत क्षेत्र को महत्व दे रहा है। दोनों ने जो मापा है उसके बारे में सही हैं, और असहमति ने खुद आपको किसी भी संख्या से अधिक बताया है।
अन्यथा ठंडे फ्रेम के अंदर निर्णय रेखा के ऊपर एक टाइल। कोई भी अकेली संख्या इसे कैप्चर नहीं कर सकती।
डिटेक्टर किस बात पर सहमत होंगे
एक साझा बेंचमार्क, प्रकाशित निर्णय रेखाएं और AI भागीदारी क्या मानी जाए इस पर एक सहमत परिभाषा अधिकांश फैलाव को दूर कर देगी। इनमें से कोई भी अभी मौजूद नहीं है, और उन्हें बनाने के लिए बहुत कम व्यावसायिक दबाव है, क्योंकि जो टूल अपनी कमजोरियों को प्रकाशित करता है वह उस टूल से बदतर दिखता है जो ऐसा नहीं करता।
जब तक यह नहीं बदलता, प्रत्येक स्कोर को एक निजी पैमाने से आ रहा मानें। कोई टूल आपको जो सबूत दिखाता है उसे पढ़ें और उसके लेबल के आत्मविश्वास से अधिक उसे महत्व दें।
संस्करण की समस्या जिसका कोई उल्लेख नहीं करता
एक डिटेक्टर समय के साथ एक जैसा नहीं रहता। विक्रेता बिना किसी घोषणा के दोबारा प्रशिक्षण देते हैं, सीमाओं को समायोजित करते हैं और मॉडल बदलते हैं, और उनमें से लगभग कोई भी अपने आउटपुट का संस्करण तय नहीं करता है। मार्च में आपको जो स्कोर मिला था और आज जो स्कोर मिलता है, वह अलग-अलग अंशांकन वाले अलग-अलग मॉडलों से आ सकता है।
यदि आप परिणाम रिकॉर्ड करते हैं तो यह मायने रखता है। एक क्लेम फ़ाइल, एक मॉडरेशन लॉग या एक शैक्षणिक मामला जो अठारह महीने पहले के स्कोर का हवाला देता है, वह एक ऐसे माप का हवाला दे रहा है जिसका उपकरण अब मौजूद नहीं है। इसे पुन: प्रस्तुत करने का कोई तरीका नहीं है और उस समय इसका क्या मतलब था यह जांचने का कोई तरीका नहीं है।
जहाँ आप परिणाम रखते हैं, वहाँ उनके साथ साक्ष्य भी रखें: क्षेत्र के स्कोर, बैंड, निर्णय रेखा और तारीख। मॉडल के आगे बढ़ जाने के बाद भी ये समझने योग्य रहते हैं, जबकि केवल एक प्रतिशत ऐसा नहीं रहता।