دو راستے
ایک ڈیٹیکٹر دو آزادانہ جانچیں چلاتا ہے اور وہ مختلف چیزوں کے جواب دیتے ہیں۔ انہیں الگ رکھنا اس صفحہ پر سب سے مفید آئیڈیا ہے۔
پکسل تجزیہ
- اسکرین شاٹس اور کمپریشن کے بعد بھی کام کرتا ہے
- شناخت نہیں، امکان ظاہر کرتا ہے
- ڈیزائن کے لحاظ سے جنریٹر-ایگناسٹک
- ٹول کا نام نہیں بتا سکتا
- نادیدہ آرکیٹیکچرز کے خلاف کارکردگی کم ہو جاتی ہے
فائل کا ثبوت
- ٹول کا نام درست بتا سکتا ہے
- سائن شدہ ہونے پر کرپٹوگرافک
- تقریباً ہر پلیٹ فارم سے ہٹا دیا جاتا ہے
- زیادہ تر تصاویر سے غائب
- جان بوجھ کر آسانی سے ختم کر دیا جاتا ہے
فائل کیا اعلان کر سکتی ہے
جب کوئی تصویر اب بھی اپنا اصلی ڈھانچہ رکھتی ہو، تو کئی قسم کے مارکر موجود ہو سکتے ہیں۔ ہر ایک وہ دعویٰ ہے جو اسے لکھنے والے سافٹ ویئر نے کیا ہے، نہ کہ پکسلز سے ماخوذ کچھ۔
- کونٹینٹ کریڈینشلز۔ ایک سائن شدہ منشور جو ٹول اور اس کے کام کا نام بتاتا ہے۔ کچھ بڑے جنریٹرز اب اپنے آؤٹ پٹ پر دستخط کرتے ہیں، جو اس کی سب سے مضبوط شکل ہے۔
- جنریشن پیرامیٹرز۔ کئی اوپن ٹولز پرامپٹ، سیڈ، سیمپلر اور ماڈل کا نام براہ راست فائل میں ایمبیڈ کرتے ہیں، جو کہ لوگوں کی توقع سے کہیں زیادہ معلومات ہے۔
- سافٹ ویئر شناخت کنندگان۔ میٹا ڈیٹا کا ایک سادہ فیلڈ جو اس ایپلی کیشن کا نام بتاتا ہے جس نے آخری بار تصویر کو محفوظ کیا تھا۔
- اعلان کردہ AI واٹر مارکس۔ ایک فلیگ جو یہ بتاتا ہے کہ ایک پوشیدہ واٹر مارک لگایا گیا تھا، جو کہ خود واٹر مارک کے بجائے ایک اعلان ہے۔
- کیمرہ کیپچر کے دعوے۔ اس کے برعکس دعویٰ، جو ایک سائن کرنے والے کیمرے کی طرف سے کیا جاتا ہے، کہ فائل سینسر سے آئی ہے۔
یہ سب اس لمحے غائب ہو جاتے ہیں جب تصویر کسی بھی پلیٹ فارم پر اپ لوڈ کی جاتی ہے۔ یہی وجہ ہے کہ فائل اسکین چلانے کے لائق ہے لیکن اس پر انحصار کرنا مناسب نہیں: جب یہ کچھ تلاش کرتا ہے تو نتیجہ مضبوط ہوتا ہے، اور یہ زیادہ تر وقت کچھ نہیں تلاش کرتا۔
جنریٹر کا نام بتانا مشکل کیوں ہے
یہ ممکن معلوم ہوتا ہے۔ مختلف ٹولز مختلف جمالیات پیدا کرتے ہیں، اور جو شخص ان کے ساتھ وقت گزارتا ہے وہ اکثر صحیح اندازہ لگا سکتا ہے۔ وہ وجدان تین وجوہات کی بنا پر ڈیٹیکٹر تک منتقل نہیں ہوتا۔
ماڈلز آرکیٹیکچرز اور ٹریننگ ڈیٹا شیئر کرتے ہیں، لہذا ان کے شماریاتی فنگر پرنٹس بہت زیادہ اوورلیپ ہوتے ہیں۔ بہت سے ٹولز ایک ہی بیس کے فائن-ٹونز ہوتے ہیں، جو انہیں بناوٹ کی سطح پر تقریباً ناقابل شناخت بناتے ہیں، چاہے ان کے آؤٹ پٹ دیکھنے والے کو مختلف لگیں۔
آؤٹ پٹس کو بعد میں بھی پروسیس کیا جاتا ہے۔ اپ اسکیلنگ، چہرے کی بحالی اور ایڈیٹنگ سب جنریشن کے بعد ہوتی ہیں اور بالکل وہی ٹیکسچر لکھتی ہیں جس پر شناخت کا انحصار ہوتا ہے۔ جب تک تصویر شائع ہوتی ہے، اس میں جنریٹر سے زیادہ اپ اسکیلر کا حصہ ہو سکتا ہے۔
اور ہدف مسلسل بدلتا رہتا ہے۔ کوئی بھی شناخت کا ماڈل ان چیزوں کا لک اپ ٹیبل ہے جو پہلے سے موجود تھیں، جو اسے تربیت کے بعد جاری ہونے والی ہر چیز کے بارے میں غلط ثابت کرتا ہے، اور یہ غلطی واضح ہونے کے بجائے خاموش ہوتی ہے۔
اچھی کوریج کا اصل مطلب کیا ہے
ڈیٹیکٹر کے بارے میں مفید سوال یہ نہیں ہے کہ وہ کن جنریٹرز کو نام سے پہچانتا ہے۔ یہ ہے کہ ٹریننگ کتنی وسیع تھی، کیونکہ وسعت ہی وہ چیز ہے جو اس ماڈل پر کارکردگی کی پیش گوئی کرتی ہے جو ابھی تک جاری نہیں ہوا ہے۔
| طریقہ کار | طاقت | کمزوری |
|---|---|---|
| کچھ بڑے کمرشل ٹولز پر ٹریننگ | ان ٹولز پر اعلیٰ درستگی | کسی بھی دوسری چیز کے لیے خراب جنرلائزیشن |
| ہزاروں جنریٹرز پر ٹریننگ | نادیدہ ماڈلز پر جنرلائزیشن | کسی ایک پر کم پیک درستگی |
| صرف ایک آرکیٹیکچر کا آرٹفیکٹ تلاش کریں | جب تک یہ برقرار رہے بہت زیادہ | طریقہ بدلنے پر مکمل ناکامی |
| صرف فائل مارکر پڑھیں | موجود ہونے پر درست | زیادہ تر تصاویر پر نابینا |
دوسری قطار وہ طریقہ ہے جو یہاں استعمال ہوتا ہے، اور یہ تجارت جان بوجھ کر ہے۔ ایک ڈیٹیکٹر جو چار پروڈکٹس پر بہترین ہو اور پانچویں پر بیکار ہو، کسی کے بھی بھیجے گئے امیج کو چیک کرنے کے لیے زیادہ مفید نہیں ہے۔
پروڈکٹ کے ناموں پر
سپورٹ شدہ جنریٹرز کی فہرستیں تکنیکی سے زیادہ مارکیٹنگ کا ایک حصہ ہیں۔ پکسل ماڈل کی کوئی فہرست نہیں ہوتی؛ اس کی ٹریننگ ڈسٹری بیوشن ہوتی ہے۔ پروڈکٹس کا نام لینے کا مطلب ہے کہ ایک ایسی فی ٹول صلاحیت جو وسیع ڈیٹیکشن میں نہیں ہوتی اور جس کی ضرورت بھی نہیں ہوتی۔
جہاں یہاں نتیجے میں نام ظاہر ہوتا ہے، وہ پکسلز کے بجائے فائل سے آیا ہے، اور نتیجہ ایسا ہی بتاتا ہے۔ یہ فرق کسی بھی ٹول کے استعمال پر اصرار کرنے کے لائق ہے۔
کوریج کا دعویٰ کیسے پڑھیں
وینڈرز کوریج کو ایسے طریقوں سے بیان کرتے ہیں جو موازنہ کے قابل لگتے ہیں لیکن ہوتے نہیں ہیں۔ تین جملے بار بار سامنے آتے ہیں اور ہر ایک کا مطلب مختلف ہے۔
X، Y اور Z سے تصاویر کا پتہ لگاتا ہے کا مطلب عام طور پر یہ ہوتا ہے کہ بینچ مارک میں وہ تینوں شامل تھے۔ یہ ٹیسٹنگ کے بارے میں ایک بیان ہے، نہ کہ صلاحیت کے بارے میں، اور یہ چوتھے جنریٹر کے بارے میں کچھ نہیں کہتا۔
چالیس سے زیادہ جنریٹرز کو سپورٹ کرتا ہے کا مطلب عام طور پر یہ ہوتا ہے کہ ٹریننگ سیٹ نے اتنے ذرائع سے ڈیٹا لیا ہے۔ یہ زیادہ معنی خیز ہے، کیونکہ ٹریننگ کی وسعت ہی جنرلائزیشن کی پیش گوئی کرتی ہے، اور یہ اب بھی کسی مخصوص ٹول کے بارے میں گارنٹی نہیں ہے۔
ماخذ ماڈل کی شناخت کرنا سب سے مشکل دعویٰ ہے۔ یہ پوچھیں کہ آیا وہ شناخت فائل سے ہے یا پکسلز سے۔ اگر یہ پکسلز سے ہے، تو شناخت کی درستگی کو ڈیٹیکشن کی درستگی سے الگ مانگیں، کیونکہ یہ بہت مختلف اعداد ہیں۔