← تمام گائیڈز پردے کے پیچھے

Diffusion بمقابلہ GAN: ڈیٹیکٹر ان کے ساتھ مختلف سلوک کیوں کرتے ہیں

تصویر بنانے کے دو طریقے، دو مختلف فنگر پرنٹس۔ ہر عمل کیا چھوڑ جاتا ہے، GANs کو پکڑنا آسان کیوں تھا، اور یہ اس بارے میں کیا پیش گوئی کرتا ہے کہ آگے کیا ہونے والا ہے۔

· 8 منٹ کا مطالعہ · Best AI Image Detector

GANs اپسیمپلنگ سے ایک دہرایا جانے والا آرٹفیکٹ چھوڑتے ہیں جو تقریباً ایک دستخط ہے۔ Diffusion ماڈلز ایسا نہیں کرتے، اسی لیے 2022 میں ڈٹیکشن مشکل ہو گئی اور کیوں آرکیٹیکچر کے مخصوص ٹوٹکے کام کرنا بند کر گئے۔

GAN تصویر کیسے بناتا ہے

ایک جنریٹو ایڈورسریل نیٹ ورک ایک چھوٹے ویکٹر سے شروع ہوتا ہے اور اسے بار بار اپسیمپل کرتا ہے، ہر پرت پر ریزولیوشن کو دوگنا کرتا ہے یہاں تک کہ یہ مکمل سائز تک پہنچ جائے۔ ایک دوسرا نیٹ ورک نتیجے کو پرکھتا ہے، اور دونوں ایک دوسرے کے خلاف تربیت حاصل کرتے ہیں۔

بار بار اپسیمپلنگ اہم حصہ ہے۔ ہر دوگنا کرنے والا مرحلہ ایک باقاعدہ پیٹرن متعارف کراتا ہے، اور وہ پیٹرن متواتر ڈھانچے میں جمع ہو جاتے ہیں جو اس وقت دکھائی دیتا ہے جب تصویر کو فریکوئنسی ڈومین میں تبدیل کیا جاتا ہے۔

وہ ڈھانچہ دستخط کے قریب تھا۔ ابتدائی ڈٹیکٹر فریکوئنسی اسپیکٹرم میں چیکر بورڈ پیٹرن تلاش کر سکتے تھے اور تصویر کے بارے میں کچھ سمجھے بغیر اعلیٰ درستگی تک پہنچ سکتے تھے۔ یہ کسی خاص ماڈل کے بجائے آرکیٹیکچر کا فنگر پرنٹ تھا۔

ایک diffusion ماڈل اسے کیسے بناتا ہے

Diffusion الٹا کام کرتا ہے۔ یہ مکمل ٹارگٹ ریزولیوشن پر خالص شور کے میدان سے شروع ہوتا ہے اور ہر مرحلے پر اس میں سے کچھ حصہ ہٹا دیتا ہے، ماڈل کی سیکھی ہوئی باتوں کی رہنمائی میں، یہاں تک کہ ایک تصویر ابھر کر سامنے آ جاتی ہے۔

اس میں کوئی اپ سیمپلنگ لیڈر نہیں ہے، اس لیے اس میں کوئی پیریڈک آرٹیفیکٹ نہیں ہے۔ آؤٹ پٹ شماریاتی طور پر کیمرے کی کیپچر سے مختلف ہے، اور یہ فرق ساختی کے بجائے پھیلا ہوا ہے۔ اس میں ایسی کوئی چیز نہیں جو ایک صاف نمونے کے طور پر سامنے آئے جسے آپ تلاش کر سکیں۔

GAN

  • چھوٹا ویکٹر بار بار اپ سیمپل کیا گیا
  • ہر ڈبلنگ سے پیریڈک آرٹیفیکٹس
  • فریکوئنسی ڈومین میں قابل شناخت
  • آرکیٹیکچر ایک قریب قریب دستخط چھوڑتا ہے
  • تقریباً 2022 تک غالب

ڈیفیوژن

  • مکمل سائز پر شور کو مرحلہ وار ہٹا دیا گیا
  • کوئی اپ سیمپلنگ لیڈر نہیں، کوئی پیریڈک پیٹرن نہیں
  • فرق شماریاتی ہے، ساختی نہیں
  • شناخت کے لیے ایک سیکھے ہوئے ماڈل کی ضرورت ہے
  • 2022 سے غالب
دو عمل اور ہر ایک کیا پیچھے چھوڑتا ہے۔ دائیں ہاتھ کا کالم وہ وجہ ہے جس کی وجہ سے ڈیٹیکشن کو دوبارہ بنانا پڑا۔

پرانے ڈیٹیکٹرز نے کام کرنا کیوں چھوڑ دیا

ایک ٹول جو فریکوئنسی ڈومین چیکر بورڈنگ تلاش کرنے کے لیے بنایا گیا ہے، وہ ڈیفیوژن امیج میں کچھ نہیں ڈھونڈ پاتا۔ یہ غیر یقینی صورتحال کی اطلاع نہیں دیتا؛ یہ بتاتا ہے کہ آرٹیفیکٹ موجود نہیں ہے، جسے ایک صاف نتیجے کے طور پر پڑھا جاتا ہے۔

یہی وجہ ہے کہ 2021 اور 2023 کے درمیان فیلڈ میں ڈیٹیکشن کی درستگی ختم ہوتی دکھائی دی۔ ٹولز خراب نہیں ہوئے تھے۔ وہ چیز جسے وہ تلاش کر رہے تھے، اس کی پیداوار رک گئی تھی۔

آرکیٹیکچر کے لحاظ سے مخصوص ڈیٹیکشن کی جگہ کس نے لی

وسعت۔ ایک آرٹیفیکٹ تلاش کرنے کے بجائے، موجودہ ڈیٹیکٹرز کو زیادہ سے زیادہ مختلف جنریٹرز کے آؤٹ پٹ پر ٹرین کیا جاتا ہے، تاکہ ماڈل یہ سیکھ سکے کہ مصنوعی ٹیکسچر میں کیا مشترک ہے نہ کہ یہ کہ ایک فیملی کیا بناتی ہے۔

یہاں استعمال ہونے والا ماڈل بالکل اسی وجہ سے ہزاروں جنریٹرز کی لاکھوں تصاویر پر ٹرین کیا گیا تھا۔ تمام آرکیٹیکچرز کا احاطہ کرنا ہی اگلی چیز تک جنرلائزیشن کی ضمانت دیتا ہے، اور یہ واحد طریقہ کار ہے جو غالب طریقے کی تبدیلی کے بعد بھی زندہ رہا ہے۔

اس کا نقصان یہ ہے کہ کسی ایک معلوم جنریٹر پر درستگی اس سے کم ہوتی ہے جو ایک ماہر ڈیٹیکٹر حاصل کر سکتا ہے۔ یہ ایک درست سودا ہے، کیونکہ جب کوئی نئی چیز آتی ہے تو ماہر بیکار ہو جاتا ہے۔

یہ کیا پیش گوئی کرتا ہے

GAN سے ڈیفیوژن کے عمل کی تبدیلی سے ملنے والا سبق ڈیفیوژن کے بارے میں نہیں ہے۔ یہ یہ ہے کہ کوئی بھی ڈیٹیکٹر جو اس بات سے جڑا ہو کہ تصاویر فی الحال کیسے بنتی ہیں، اس کی زندگی محدود ہے، اور تبدیلی کا اعلان پہلے سے نہیں کیا جائے گا۔

ڈیٹیکشن کی ہر نسل کی عمر کیسے بڑھی
طریقہ کاراس پر کام کیاتب ناکام ہوا جب
فریکوئنسی آرٹیفیکٹ تلاشGANsڈیفیوژن آیا
چہرے کا مخصوص تجزیہابتدائی فیس سویپسپورے منظر کی جنریشن آئی
میٹا ڈیٹا کا معائنہٹول سے براہ راست فائلیںپلیٹ فارمز نے میٹا ڈیٹا ہٹا دیا
ایرر لیول کا تجزیہسنگل سیو JPEGsتصاویر سفر کرنے لگیں
وسیع ملٹی جنریٹر ٹریننگزیادہ تر موجودہ آؤٹ پٹنامعلوم، اور دوسروں کے بعد

کیا اس میں سے کچھ صارف کے لیے اہم ہے

زیادہ تر یہ ان دو چیزوں کی وضاحت کرتا ہے جن پر آپ غور کریں گے۔ پہلا، ایک ڈیٹیکٹر عام طور پر یہ نام کیوں نہیں بتا سکتا کہ کس ٹول نے تصویر تیار کی ہے: یہ ماڈل کے بجائے ایک مشترکہ شماریاتی خصوصیت کو پڑھ رہا ہے۔

دوسرا، پرانے مفت چیکرز خراب کارکردگی کیوں دکھاتے ہیں۔ آن لائن موجود کئی ٹولز GAN آرٹیفیکٹس کے گرد بنائے گئے تھے اور انہیں دوبارہ ٹرین نہیں کیا گیا ہے۔ وہ موجودہ آؤٹ پٹ پر پراعتماد صاف نتائج دیتے ہیں، اور انٹرفیس میں کچھ بھی اس کی وجہ نہیں بتاتا۔

ایک ہائبرڈ پائپ لائن نتیجے کے ساتھ کیا کرتی ہے

آپ تک پہنچنے والی زیادہ تر تصاویر ایک طریقے سے تیار نہیں کی گئی تھیں۔ ایک ڈیفیوژن ماڈل بیس بناتا ہے، ایک GAN پر مبنی اپ اسکیلر اسے بڑا کرتا ہے، چہرے کی بحالی کا ایک مرحلہ آنکھوں کو ٹھیک کرتا ہے، اور ایک ایڈیٹر رزلٹ کو کراپ اور دوبارہ محفوظ کرتا ہے۔

ہر مرحلہ ٹیکسچر کو دوبارہ لکھتا ہے، اس لیے فائل میں کئی عملوں کے نشانات ایک دوسرے پر تہہ ہوتے ہیں۔ تصویر کو چھونے والا آخری عمل عام طور پر ڈیٹیکٹر کے پڑھے جانے والے نتائج پر غالب رہتا ہے، یہی وجہ ہے کہ ایک اپ اسکیل شدہ ڈیفیوژن امیج شماریاتی طور پر جنریٹر کے مقابلے میں اپ اسکیلر کی طرح زیادہ دکھائی دے سکتی ہے۔

یہ وہ عملی وجہ ہے کہ آرکیٹیکچر کی شناخت لیبارٹری کے باہر کام کیوں نہیں کرتی ہے۔ صاف سنگل ماڈل آؤٹ پٹ کے ساتھ کنٹرول شدہ ٹیسٹ میں یہ ایک حل طلب مسئلہ ہے۔ ایک ایسی تصویر پر جو ایک حقیقی پروڈکشن پائپ لائن سے گزری ہو، سوال صحیح طرح سے نہیں پوچھا گیا۔

یہ ایک ایسا نتیجہ بھی بیان کرتا ہے جو لوگوں کو الجھا دیتا ہے: ایک حقیقی جنریٹڈ تصویر جو بھاری اپ اسکیل شدہ تصویر سے کم اسکور کرتی ہے۔ دونوں کے ٹیکسچر کو سافٹ ویئر نے دوبارہ لکھا ہے، اور ڈیٹیکٹر اصلیت کے بجائے دوبارہ لکھنے کے عمل کو پڑھ رہا ہے۔

لوگوں کے پوچھے گئے سوالات

کیا GAN تصاویر ڈیفیوژن تصاویر سے زیادہ آسانی سے شناخت کی جا سکتی ہیں؟
وہ تھیں، اور اب ان کی تعداد بہت کم ہے۔ GAN اپ سیمپلنگ ایک پیریڈک آرٹیفیکٹ چھوڑتی تھی جسے ایک سادہ فریکوئنسی تجزیہ تلاش کر سکتا تھا۔ ڈیفیوژن کوئی مساوی ڈھانچہ نہیں چھوڑتی، اس لیے ڈیٹیکشن کے لیے ایک ایسے ٹرینڈ ماڈل کی ضرورت ہوتی ہے جو کسی ایک پیٹرن کی ٹارگٹڈ تلاش کے بجائے شماریاتی ٹیکسچر کو پڑھے۔
کیا کوئی ڈیٹیکٹر مجھے بتا سکتا ہے کہ آیا تصویر GAN سے آئی ہے یا ڈیفیوژن ماڈل سے؟
عام طور پر، پکسلز سے نہیں۔ ایک وسیع ڈیٹیکٹر رپورٹ کرتا ہے کہ یہ کتنا ممکن ہے کہ کچھ جنریٹو شامل تھا، نہ کہ یہ کہ کس فیملی نے اسے تیار کیا۔ آرکیٹیکچر کی شناخت ایک الگ تحقیقی مسئلہ ہے اور یہ ڈیٹیکشن کے مقابلے میں کافی کم قابل اعتماد ہے۔
کیا GANs اب بھی استعمال ہوتے ہیں؟
ہاں، مخصوص جگہوں پر۔ وہ چہرے کی ترکیب اور کچھ اپ اسکیلنگ جیسے محدود کاموں کے لیے تیز اور موثر رہتے ہیں، جہاں ڈیفیوژن سست ہوگی۔ کچھ ٹولز مختلف مراحل پر دونوں کا استعمال کرتے ہیں، جس کا مطلب ہے کہ تصویر میں کسی ایک کے نشانات ہو سکتے ہیں۔
کیا اگلا آرکیٹیکچر دوبارہ ڈیٹیکشن کو توڑ دے گا؟
یہ اسے توڑنے کے بجائے درستگی کو کم کر دے گا، جو کہ وسیع ٹریننگ سے ملنے والی بہتری ہے۔ ایک ماڈل جس نے ہزاروں جنریٹرز میں مصنوعی ٹیکسچر کی مشترکہ خصوصیات سیکھ لی ہوں، وہ کسی نئی چیز کے خلاف آہستہ آہستہ خراب ہوتا ہے، جبکہ ایک سنگل آرٹیفیکٹ ڈیٹیکٹر مکمل طور پر ناکام ہو جاتا ہے۔
کچھ ٹولز ابھی بھی بہت زیادہ درستگی کا دعویٰ کیوں کرتے ہیں؟
عام طور پر اس لیے کہ وہ ان جنریٹرز سے بنے ٹیسٹ سیٹ پر پیمائش کر رہے ہیں جن پر انہوں نے ٹریننگ کی تھی۔ وہ اعداد و شمار درست ہیں اور یہ پچھلے مہینے جاری کیے گئے ماڈل پر کارکردگی کو بیان نہیں کرتے۔ ٹولز کے درمیان نمبروں کا موازنہ کرنے سے پہلے پوچھیں کہ بینچ مارک میں کون سے جنریٹرز شامل تھے۔
کیا اس کا اثر اس بات پر پڑتا ہے کہ مجھے اسکور کیسے پڑھنا چاہیے؟
صرف ایک طرح سے۔ کسی ایسی تصویر پر صاف نتیجے کو جس پر آپ کو شک کرنے کی دوسری وجوہات ہوں، فلیگ شدہ نتیجے سے کمزور ثبوت مانیں، کیونکہ ایک نادیدہ آرکیٹیکچر کی ناکامی کا موڈ ایک پراعتماد کم اسکور ہوتا ہے نہ کہ غیر یقینی۔