একটি GAN কীভাবে ছবি তৈরি করে
একটি জেনারেটিভ অ্যাডভারসারিয়াল নেটওয়ার্ক একটি ছোট ভেক্টর থেকে শুরু করে এবং বারবার আপস্যাম্পল করে রেজোলিউশন দ্বিগুণ করতে করতে পূর্ণ আকারে পৌঁছায়। একটি দ্বিতীয় নেটওয়ার্ক ফলাফলটি বিচার করে এবং দুটি নেটওয়ার্ক পরস্পরের বিপরীতে প্রশিক্ষিত হয়।
এই পুনরাবৃত্তিমূলক আপস্যাম্পলিং প্রক্রিয়াটিই সবচেয়ে গুরুত্বপূর্ণ অংশ। রেজোলিউশন দ্বিগুণ করার প্রতিটি ধাপে একটি নিয়মিত প্যাটার্ন তৈরি হয় এবং সেই প্যাটার্নগুলো জমে একটি পর্যায়ক্রমিক কাঠামো তৈরি করে, যা ফ্রিকোয়েন্সি ডোমেইনে রূপান্তর করলে স্পষ্ট দেখা যায়।
সেই কাঠামোটি একটি স্বাক্ষরের মতো কাজ করত। প্রাথমিক ডিটেক্টরগুলো ফ্রিকোয়েন্সি স্পেকট্রামে চেকারবোর্ড প্যাটার্ন খুঁজে পেত এবং ছবির বিষয়বস্তু না বুঝেই উচ্চ নির্ভুলতা অর্জন করতে পারত। এটি কোনো নির্দিষ্ট মডেলের চেয়ে আর্কিটেকচারের নিজস্ব ফিঙ্গারপ্রিন্ট ছিল।
একটি diffusion মডেল কীভাবে ছবি তৈরি করে
Diffusion সম্পূর্ণ বিপরীতভাবে কাজ করে। এটি লক্ষ্য করা রেজোলিউশনে বিশুদ্ধ নয়েজের একটি ক্ষেত্র দিয়ে শুরু করে এবং প্রশিক্ষিত জ্ঞানের ওপর ভিত্তি করে প্রতিটি ধাপে অল্প অল্প করে নয়েজ সরাতে থাকে, যতক্ষণ না একটি ছবি ফুটে ওঠে।
এখানে কোনো আপস্যাম্পলিং ল্যাডার নেই, তাই কোনো পর্যায়বৃত্ত ত্রুটিও (periodic artefact) নেই। আউটপুটটি পরিসংখ্যানগতভাবে ক্যামেরার ছবির চেয়ে আলাদা, এবং এই পার্থক্যটি কাঠামোগত হওয়ার চেয়ে বেশি পরিব্যাপ্ত (diffuse)। এর কোনো কিছুই এমন স্পষ্ট প্যাটার্ন হিসেবে দেখা যায় না যা আপনি সরাসরি খুঁজতে পারেন।
GAN
- ছোট ভেক্টর বারবার আপস্যাম্পল করা হয়েছে
- প্রতিবার দ্বিগুণ করার কারণে পর্যায়বৃত্ত ত্রুটি তৈরি হয়
- ফ্রিকোয়েন্সি ডোমেনে সনাক্তযোগ্য
- আর্কিটেকচারটি প্রায় একটি স্বাক্ষরের মতো চিহ্ন রেখে যায়
- প্রায় 2022 সাল পর্যন্ত প্রধান ছিল
Diffusion
- সম্পূর্ণ আকারে ধাপে ধাপে নয়েজ সরানো হয়েছে
- কোনো আপস্যাম্পলিং ল্যাডার নেই, কোনো পর্যায়বৃত্ত প্যাটার্ন নেই
- পার্থক্যটি পরিসংখ্যানগত, কাঠামোগত নয়
- সনাক্ত করতে একটি প্রশিক্ষিত মডেল প্রয়োজন
- 2022 সাল থেকে প্রধান
পুরোনো ডিটেক্টরগুলো কেন কাজ করা বন্ধ করে দিয়েছে
ফ্রিকোয়েন্সি-ডোমেন চেকারবোর্ডিং খোঁজার জন্য তৈরি একটি টুল diffusion ছবিতে কিছুই খুঁজে পায় না। এটি অনিশ্চয়তা প্রকাশ করে না; বরং জানায় যে ত্রুটিটি অনুপস্থিত, যা একটি নির্দোষ বা আসল ফলাফল হিসেবে প্রতীয়মান হয়।
এ কারণেই 2021 থেকে 2023 সালের মধ্যে এই ক্ষেত্রের সামগ্রিক সনাক্তকরণের নির্ভুলতা হঠাৎ ভেঙে পড়েছে বলে মনে হয়েছিল। টুলগুলোর মান কমেনি। তারা যা খুঁজছিল, তা তৈরি হওয়াই বন্ধ হয়ে গিয়েছিল।
আর্কিটেকচার-নির্দিষ্ট সনাক্তকরণের বিকল্প হিসেবে যা এসেছে
বিস্তৃতি। একটিমাত্র ত্রুটি খোঁজার পরিবর্তে, বর্তমান ডিটেক্টরগুলোকে যত বেশি সম্ভব বিভিন্ন জেনারেটরের আউটপুটের ওপর প্রশিক্ষণ দেওয়া হয়। ফলে মডেলটি নির্দিষ্ট কোনো পরিবারের আউটপুটের বদলে সিন্থেটিক টেক্সচারের সাধারণ বৈশিষ্ট্যগুলো শিখে নেয়।
ঠিক এই কারণেই এখানে ব্যবহৃত মডেলটিকে হাজার হাজার জেনারেটর থেকে আসা লক্ষাধিক ছবির ওপর প্রশিক্ষণ দেওয়া হয়েছে। বিভিন্ন আর্কিটেকচার জুড়ে এই কভারেজ পরবর্তী প্রজন্মের মডেলগুলোতেও কার্যকারিতা নিশ্চিত করে, এবং প্রভাবশালী পদ্ধতির পরিবর্তনের মুখেও এটিই একমাত্র টিকে থাকা পন্থা।
এর একমাত্র আপস হলো, যেকোনো একক জেনারেটরের ক্ষেত্রে এর নির্ভুলতা একটি বিশেষজ্ঞ ডিটেক্টরের চেয়ে কিছুটা কম হতে পারে। তবে এটিই সঠিক সিদ্ধান্ত, কারণ নতুন কিছু এলেই বিশেষজ্ঞ ডিটেক্টর অকেজো হয়ে পড়ে।
এটি থেকে কী বোঝা যায়
GAN থেকে diffusion-এ রূপান্তরের শিক্ষাটি diffusion নিয়ে নয়। মূল শিক্ষা হলো, ছবি কীভাবে তৈরি হচ্ছে তার ওপর নির্ভরশীল যেকোনো ডিটেক্টরের আয়ু সীমিত, এবং এই রূপান্তরগুলো আগে থেকে ঘোষণা দিয়ে আসবে না।
| পদ্ধতি | যেটিতে কার্যকর ছিল | যখন ব্যর্থ হয়েছে |
|---|---|---|
| ফ্রিকোয়েন্সি ত্রুটি অনুসন্ধান | GANs | Diffusion আসার পর |
| মুখ-নির্দিষ্ট বিশ্লেষণ | প্রাথমিক ফেস সোয়াপ | সম্পূর্ণ দৃশ্য তৈরি শুরু হওয়ার পর |
| মেটাডেটা পরিদর্শন | সরাসরি টুল থেকে আসা ফাইল | প্ল্যাটফর্মগুলো মেটাডেটা মুছে ফেলার পর |
| এরর লেভেল অ্যানালাইসিস | একবার সংরক্ষিত JPEG | ছবি বিভিন্ন মাধ্যমে আদান-প্রদান শুরু হওয়ার পর |
| ব্যাপক মাল্টি-জেনারেটর প্রশিক্ষণ | অধিকাংশ বর্তমান আউটপুট | অজানা, এবং অন্যান্য পদ্ধতির চেয়ে পরে |
একজন ব্যবহারকারীর জন্য কি এর কোনো গুরুত্ব আছে
মূলত এটি এমন দুটি বিষয় ব্যাখ্যা করে যা আপনি লক্ষ্য করবেন। প্রথমত, কেন একটি ডিটেক্টর সাধারণত কোন টুল দিয়ে ছবিটি তৈরি হয়েছে তা নির্দিষ্ট করে বলতে পারে না: এটি প্রতি-মডেলের ফিঙ্গারপ্রিন্টের বদলে একটি যৌথ পরিসংখ্যানগত বৈশিষ্ট্য পড়ে।
দ্বিতীয়ত, কেন পুরোনো বিনামূল্যের চেকারগুলো খারাপ ফলাফল দেয়। অনলাইনে থাকা বেশ কিছু টুল GAN ত্রুটির ওপর ভিত্তি করে তৈরি এবং সেগুলো পুনরায় প্রশিক্ষণ দেওয়া হয়নি। এগুলো বর্তমান আউটপুটগুলোতে আত্মবিশ্বাসের সাথে নির্দোষ ফলাফল দেয়, এবং ইন্টারফেসে এর কারণ সম্পর্কে কিছুই বলা থাকে না।
একটি হাইব্রিড পাইপলাইন ফলাফলের ওপর কী প্রভাব ফেলে
আপনার কাছে পৌঁছানো বেশিরভাগ ছবি একক পদ্ধতিতে তৈরি নয়। একটি diffusion মডেল মূল ছবি তৈরি করে, একটি GAN-ভিত্তিক আপস্কেলার তা বড় করে, একটি ফেস রিস্টোরেশন ধাপ চোখ ঠিক করে, এবং একজন সম্পাদক ছবিটি ক্রপ করে পুনরায় সংরক্ষণ করেন।
প্রতিটি ধাপ টেক্সচারকে নতুন করে লিখে, ফলে ফাইলটিতে একাধিক প্রক্রিয়ার ছাপ একের ওপর এক স্তরীভূত থাকে। যে প্রক্রিয়াটি সর্বশেষ ছবিতে প্রয়োগ করা হয়েছে, সাধারণত সেটিই ডিটেক্টরের রিডিংয়ে প্রাধান্য পায়। একারণেই একটি আপস্কেল করা diffusion ছবি পরিসংখ্যানগতভাবে জেনারেটরের চেয়ে আপস্কেলারের মতো বেশি মনে হতে পারে।
ল্যাবরেটরির বাইরে আর্কিটেকচার শনাক্তকরণ কাজ না করার এটিই ব্যবহারিক কারণ। একক মডেলের নিয়ন্ত্রিত আউটপুটে এটি সমাধানযোগ্য সমস্যা হলেও, বাস্তব জীবনের প্রোডাকশন পাইপলাইনের মধ্য দিয়ে যাওয়া একটি ছবির ক্ষেত্রে এই প্রশ্নটি যথাযথ নয়।
এটি এমন একটি ফলাফলও ব্যাখ্যা করে যা মানুষের কাছে বিভ্রান্তিকর মনে হয়: একটি প্রকৃত জেনারেট করা ছবি অতিরিক্ত আপস্কেল করা সাধারণ ছবির চেয়ে কম স্কোর পায়। উভয়ের টেক্সচারই সফটওয়্যার দ্বারা পুনর্লিখিত হয়েছে, এবং ডিটেক্টরটি উৎসের চেয়ে এই পুনর্লিখনকেই বেশি শনাক্ত করছে।