যাচাইয়ের দুটি ধারা
একটি ডিটেক্টর দুটি স্বাধীন যাচাই চালায় এবং তারা ভিন্ন ভিন্ন প্রশ্নের উত্তর দেয়। এদের আলাদা রাখাই এই পেজের সবচেয়ে গুরুত্বপূর্ণ ধারণা।
পিক্সেল বিশ্লেষণ
- স্ক্রিনশট এবং কম্প্রেশনের পরেও কাজ করে
- নির্দিষ্ট পরিচয় নয়, একটি সম্ভাবনা প্রকাশ করে
- জেনারেটর-নিরপেক্ষভাবে কাজ করার জন্য তৈরি
- নির্দিষ্ট টুলের নাম বলতে পারে না
- নতুন ধরনের আর্কিটেকচারের ক্ষেত্রে সক্ষমতা কমে যায়
ফাইলের প্রমাণ
- টুলের সঠিক নাম বলতে পারে
- ডিজিটালি সাইন করা থাকলে ক্রিপ্টোগ্রাফিক সুরক্ষা থাকে
- প্রায় প্রতিটি প্ল্যাটফর্ম এটি মুছে ফেলে
- বেশিরভাগ ছবিতে অনুপস্থিত থাকে
- সহজেই ইচ্ছা করে মুছে ফেলা যায়
একটি ফাইলে কী কী তথ্য থাকতে পারে
যখন একটি ছবিতে তার মূল কাঠামো বজায় থাকে, তখন কয়েক ধরণের চিহ্ন উপস্থিত থাকতে পারে। এর প্রতিটি পিক্সেল থেকে প্রাপ্ত তথ্যের চেয়ে বরং ফাইল প্রস্তুতকারী সফ্টওয়্যারের একটি দাবি।
- Content Credentials. একটি স্বাক্ষরিত ম্যানিফেস্ট যা টুলের নাম এবং এটি কী করেছে তা উল্লেখ করে। কিছু প্রধান জেনারেটর এখন তাদের আউটপুটে স্বাক্ষর করে, যা এই ধরনের তথ্যের সবচেয়ে শক্তিশালী রূপ।
- তৈরির প্যারামিটার। বেশ কয়েকটি উন্মুক্ত টুল প্রম্পট, সীড, স্যাম্পলার এবং মডেলের নাম সরাসরি ফাইলে যুক্ত করে, যা বেশিরভাগ মানুষের ধারণার চেয়েও বেশি তথ্য।
- সফটওয়্যার শনাক্তকারী। একটি সাধারণ মেটাডেটা ফিল্ড যা ছবিটি শেষ সংরক্ষণকারী অ্যাপ্লিকেশনটির নাম উল্লেখ করে।
- ঘোষিত এআই জলছাপ। একটি ফ্ল্যাগ যা উল্লেখ করে যে একটি অদৃশ্য জলছাপ প্রয়োগ করা হয়েছে, যা মূলত জলছাপের উপস্থিতির চেয়ে একটি ঘোষণা মাত্র।
- ক্যামেরা ক্যাপচার নিশ্চিতকরণ। বিপরীত একটি দাবি, যা ক্যামেরা সাইনিংয়ের মাধ্যমে নিশ্চিত করে যে ফাইলটি সরাসরি সেন্সর থেকে এসেছে।
প্রায় যেকোনো প্ল্যাটফর্মে ছবি আপলোড করার সাথে সাথেই এই সবগুলো মুছে যায়। এই কারণেই ফাইল স্ক্যান চালানো সার্থক হলেও এর ওপর নির্ভর করা উচিত নয়: যখন এটি কিছু খুঁজে পায় তখন তথ্যটি নির্ভুল হয়, কিন্তু বেশিরভাগ সময় এটি কিছুই খুঁজে পায় না।
জেনারেটরের নাম বলা কেন কঠিন
মনে হতে পারে এটি করা সম্ভব। বিভিন্ন টুল আলাদা নান্দনিক আউটপুট তৈরি করে এবং যারা এগুলোর পেছনে সময় দেন তারা প্রায়ই সঠিকভাবে অনুমান করতে পারেন। তিনটি কারণে এই অন্তর্দৃষ্টি একটি ডিটেক্টরে কার্যকর হয় না।
মডেলগুলো একই ধরণের আর্কিটেকচার এবং ট্রেনিং ডেটা ভাগ করে নেয়, ফলে তাদের পরিসংখ্যানগত প্যাটার্ন অনেকাংশেই মিলে যায়। অনেক টুল একই বেস মডেলের ফাইন-টিউন সংস্করণ, যার কারণে মানুষের চোখে আউটপুট ভিন্ন মনে হলেও টেক্সচারের দিক থেকে এগুলো প্রায় অভিন্ন থাকে।
এছাড়াও আউটপুটগুলো পরবর্তী প্রসেসিংয়ের মধ্য দিয়ে যায়। আপস্কেলিং, মুখের অবয়ব পুনরুদ্ধার এবং সম্পাদনা সবই তৈরির পরে ঘটে এবং ঠিক সেই টেক্সচার পরিবর্তন করে দেয় যার ওপর ভিত্তি করে শনাক্তকরণ নির্ভর করে। একটি ছবি প্রকাশের সময় এতে জেনারেটরের চেয়ে আপস্কেলারের চিহ্ন বেশি থাকতে পারে।
এবং লক্ষ্য সবসময় পরিবর্তনশীল। যেকোনো শনাক্তকরণ মডেল হলো পূর্বে বিদ্যমান জিনিসগুলোর একটি তালিকা, যার অর্থ এটি ট্রেনিংয়ের পরে প্রকাশিত যেকোনো নতুন টুলের ক্ষেত্রে ভুল করবে, যা স্পষ্ট হওয়ার পরিবর্তে অলক্ষ্যেই থেকে যায়।
প্রকৃতপক্ষে ভালো কভারেজের অর্থ কী
ডিটেক্টরের ক্ষেত্রে দরকারী প্রশ্ন এটি নয় যে এটি কোন কোন জেনারেটরের নাম চেনে। বরং মূল বিষয় হলো এর ট্রেনিং কতটা বিস্তৃত ছিল, কারণ ট্রেনিংয়ের বিস্তারই নির্ধারণ করে এমন মডেলের ক্ষেত্রে এটি কেমন কাজ করবে যা এখনও বাজারে আসেনি।
| পদ্ধতি | শক্তি | দুর্বলতা |
|---|---|---|
| কয়েকটি প্রধান বাণিজ্যিক টুলের ওপর ট্রেনিং | সেই টুলগুলোতে উচ্চ নির্ভুলতা | অন্যান্য ক্ষেত্রে দুর্বল সাধারণীকরণ |
| হাজার হাজার জেনারেটরের ওপর ট্রেনিং | অদেখা মডেলগুলোর ক্ষেত্রেও কার্যকর | যেকোনো একক টুলের ক্ষেত্রে সর্বোচ্চ নির্ভুলতার হার কম |
| একটি নির্দিষ্ট আর্কিটেকচারের ত্রুটি খোঁজা | যতদিন টিকে থাকে ততদিন অত্যন্ত কার্যকর | পদ্ধতি পরিবর্তিত হলে সম্পূর্ণ ব্যর্থ হয় |
| কেবল ফাইলের মার্কার পড়া | উপস্থিত থাকলে একদম নির্ভুল | বেশিরভাগ ছবির ক্ষেত্রে অকার্যকর |
দ্বিতীয় সারিটি এখানে ব্যবহৃত পদ্ধতি, এবং এই বিনিময়টি উদ্দেশ্যমূলক। একটি ডিটেক্টর যা চারটি পণ্যে চমৎকার কিন্তু পঞ্চমটিতে অকেজো, তা কেউ পাঠানো ছবি যাচাই করার জন্য খুব একটা কাজে আসে না।
পণ্যের নাম প্রসঙ্গে
সমর্থিত জেনারেটরের তালিকা প্রযুক্তিগত বিষয়ের চেয়ে বেশি বিপণন কৌশল মাত্র। একটি পিক্সেল মডেলের কোনো তালিকা থাকে না; এর থাকে একটি ট্রেনিং ডিস্ট্রিবিউশন। পণ্যের নাম উল্লেখ করলে প্রতিটি টুলের জন্য আলাদা সক্ষমতার ইঙ্গিত দেয়, যা বিস্তৃত শনাক্তকরণের ক্ষেত্রে থাকে না এবং প্রয়োজনও হয় না।
এখানে ফলাফলে কোনো নাম এলে তা পিক্সেল থেকে নয় বরং ফাইল থেকে এসেছে, এবং ফলাফলে তা উল্লেখ থাকে। আপনার ব্যবহৃত যেকোনো টুল থেকে এই পার্থক্য দাবি করা উচিত।
কভারেজের দাবি কীভাবে মূল্যায়ন করবেন
ভেন্ডররা কভারেজ এমনভাবে বর্ণনা করে যা শুনতে একই রকম মনে হলেও আসলে তা নয়। তিনটি বিবরণ বারবার দেখা যায় এবং প্রতিটির অর্থ আলাদা।
X, Y এবং Z থেকে আসা ছবি শনাক্ত করে—এর অর্থ সাধারণত বেঞ্চমার্কে ওই তিনটি অন্তর্ভুক্ত ছিল। এটি পরীক্ষার বিবরণ মাত্র, সক্ষমতার নয়, এবং এটি চতুর্থ জেনারেটর সম্পর্কে কিছুই বলে না।
চল্লিশটির বেশি জেনারেটর সমর্থন করে—এর অর্থ সাধারণত ট্রেনিং সেটটি ততগুলো উৎস থেকে নেওয়া হয়েছে। এটি আরও অর্থপূর্ণ, কারণ ট্রেনিংয়ের বিস্তার সাধারণীকরণ ক্ষমতার পূর্বাভাস দেয়, তবে এটি কোনো নির্দিষ্ট টুলের নিশ্চয়তা দেয় না।
উৎস মডেল শনাক্ত করার দাবিটিকেই সবচেয়ে কঠোরভাবে যাচাই করা উচিত। প্রশ্ন করুন এই শনাক্তকরণটি ফাইল থেকে এসেছে নাকি পিক্সেল থেকে। যদি এটি পিক্সেল থেকে আসে, তবে শনাক্তকরণের নির্ভুলতার হার এবং ডিটেকশনের নির্ভুলতার হার আলাদাভাবে জানতে চান, কারণ এই দুটি সম্পূর্ণ ভিন্ন সংখ্যা।