ফলাফল ভিন্ন হওয়ার চারটি কারণ
একটি স্কোর হলো দীর্ঘ ধারাবাহিক সিদ্ধান্তের চূড়ান্ত ফল। এর যেকোনো একটি অংশে পরিবর্তন এলে সংখ্যার পরিবর্তন ঘটে, যদিও ছবির কোনো পরিবর্তন হয়নি।
- ভিন্ন ট্রেনিং ডেটা। একটি ডিটেক্টর যা দেখেছে কেবল সেটাই চিনতে পারে। হাজার হাজার ওপেন জেনারেটরে প্রশিক্ষিত টুল অপরিচিত মডেলগুলোকে ভালোভাবে ধরতে পারে। আর চারটি বৃহত্তম বাণিজ্যিক টুলে প্রশিক্ষিত টুল সেই চারটিকে আরও ভালোভাবে এবং বাকিগুলোকে তুলনামূলকভাবে দুর্বলভাবে শনাক্ত করে।
- ভিন্ন সিদ্ধান্তের মাপকাঠি। একটি টুল 60-কে সন্দেহজনক বলে গণ্য করতে পারে, আবার অন্যটি 75-কে সন্দেহজনক বলতে পারে। একই পরিমাপ একটি থ্রেশহোল্ড অতিক্রম করলেও অন্যটি করে না, ফলে একই মান থেকে দুটি ভিন্ন রায় পাওয়া যায়।
- ভিন্ন সংজ্ঞা। কিছু টুল আপস্কেল বা জেনারেটিভ ফিল সহ যেকোনো জেনারেটিভ পরিবর্তনকে অন্তর্ভুক্ত করে। অন্যগুলো কেবল সম্পূর্ণ সিন্থেটিক ফ্রেমকে ফ্ল্যাগ করে। একটি রিটাচ করা পোর্ট্রেট প্রথমটির কাছে AI হলেও দ্বিতীয়টির কাছে আসল বলে গণ্য হয়।
- ভিন্ন প্রি-প্রসেসিং। টুলগুলো স্কোরিংয়ের আগে ছবির আকার পরিবর্তন, ক্রপ এবং পুনরায় এনকোড করে। কেন্দ্রের 224-পিক্সেল বর্গক্ষেত্র বিশ্লেষণকারী একটি ডিটেক্টর পুরো ফ্রেমের 384 পিক্সেল বিশ্লেষণকারী ডিটেক্টরের চেয়ে ভিন্ন ছবি দেখতে পায়।
টুল D অন্যদের চেয়ে বেশি সংবেদনশীল নয়। এটি তুলনামূলকভাবে একটি বিস্তৃত প্রশ্নের উত্তর দেয়। আপনার অনুসন্ধান যদি হয় ছবিটি জেনারেটর দিয়ে তৈরি কি না, তবে D অতিরিক্ত তথ্য রিপোর্ট করছে। আর ফাইলে কোনো প্রকার AI ব্যবহার করা হয়েছে কি না তা জানতে চাইলে কেবল D-ই আপনাকে সঠিক উত্তর দিচ্ছে।
প্রতিটি টুল কোন প্রশ্নের উত্তর দেয় তা যাচাই করুন
| প্রশ্ন | যা এটিকে ফ্ল্যাগ করায় | সাধারণ ব্যবহার |
|---|---|---|
| এই ফ্রেমটি কি সম্পূর্ণ নতুন করে জেনারেট করা হয়েছে? | পুরো ফ্রেম জুড়ে সিন্থেটিক টেক্সচার | সংবাদ, মার্কেটপ্লেস লিস্টিং, ডেটিং প্রোফাইল |
| এর কোনো অংশ কি AI দিয়ে এডিট করা হয়েছে? | লাইনের উপরে থাকা একটি রিজিয়ন | বীমা, দাবি, প্রমাণের পর্যালোচনা |
| এই ফাইলে কি কোনো প্রকার AI ব্যবহার করা হয়েছে? | আপস্কেলিং, ডিনয়েজ, জেনারেটিভ ফিল | স্টক লাইব্রেরি, প্রতিযোগিতার নিয়মাবলী |
টুলগুলোর মধ্যকার বেশিরভাগ অমিল মূলত এই তিনটি প্রশ্নের মধ্যে আপনি কোনটি জানতে চেয়েছেন তা নিয়ে। ফলাফলের তুলনা করার আগে আপনার জন্য কোন প্রশ্নটি গুরুত্বপূর্ণ তা নির্ধারণ করুন, তারপর সেই অনুযায়ী প্রতিটি টুল পর্যালোচনা করুন।
দুটি ফলাফল সঠিকভাবে তুলনা করার নিয়ম
-
উভয় টুলে হুবহু একই ফাইল দিন
পুনরায় ডাউনলোড করা, স্ক্রিনশট নেওয়া বা চ্যাট অ্যাপের মাধ্যমে আসা কোনো কপি নয়। ভিন্ন বাইটের ছবি সম্পূর্ণ ভিন্ন একটি ছবি এবং তার স্কোর ভিন্ন হওয়াই স্বাভাবিক।
-
সংখ্যার নয়, ব্যান্ডের তুলনা করুন
50 লাইনের স্কেলে 61 এবং 65 লাইনের স্কেলে 58 পাওয়া ফলাফলগুলো রিডিংয়ের বিষয়ে একমত হলেও চূড়ান্ত রায়ে ভিন্ন হতে পারে।
-
প্রকাশিত থ্রেশহোল্ড খুঁজুন
যে টুল তার সিদ্ধান্তের লাইন কোথায় তা প্রকাশ করে না, সেটির সাথে অন্য কিছুর তুলনা করা যায় না। এর সংখ্যাটিকে কোনো প্রমাণ হিসেবে না দেখে অনির্ধারিত হিসেবে বিবেচনা করুন।
-
যে টুল তার কার্যপদ্ধতি প্রকাশ করে সেটি বেছে নিন
একটি রিজিয়ন ম্যাপ, নির্দিষ্ট ব্যান্ডের নাম এবং উল্লেখিত বেঞ্চমার্ক আপনাকে পেছনের যুক্তি যাচাই করতে সাহায্য করে। কোনো ভিত্তি ছাড়া নিশ্চিত দাবি করা লেবেল তা করে না।
-
ফলাফলের মিলকে একটি শক্তিশালী সংকেত হিসেবে বিবেচনা করুন
দুটি স্বাধীন টুলের একই ব্যান্ডে পৌঁছানো যেকোনো একটির চেয়ে অনেক বেশি নির্ভরযোগ্য। দুটির মধ্যে অমিল থাকার অর্থ ফলাফল অনিশ্চিত, মাঝামাঝি কিছু ধরে নেওয়া নয়।
যখন মতবিরোধই আসল ফলাফল
একটি প্যাটার্ন চিনে রাখা ভালো। একটি টুলে পুরো ফ্রেমের স্কোর কম আসার পাশাপাশি অন্যটিতে উচ্চ স্কোর আসার অর্থ সাধারণত ছবিটি লোকাল এডিট সহ একটি আসল ছবি।
প্রথম টুলটি প্রায় আসল ফ্রেমের ভেতরে থাকা এডিটটিকে গড়ে নামিয়ে আনে। দ্বিতীয় টুলটি সবচেয়ে জোরালো রিজিয়নটিকে গুরুত্ব দেয়। উভয় টুলই তাদের পরিমাপ অনুযায়ী সঠিক, এবং এই অমিলটি একক সংখ্যার চেয়ে আপনাকে অনেক বেশি তথ্য দেয়।
সাধারণ কোল্ড ফ্রেমের মধ্যে সিদ্ধান্তের লাইনের উপরে থাকা একটি টাইল। কোনো একক সংখ্যা দিয়ে এটি বোঝানো সম্ভব নয়।
যা ডিটেক্টরগুলোর মধ্যে মিল তৈরি করতে পারে
একটি সাধারণ বেঞ্চমার্ক, প্রকাশিত সিদ্ধান্তের লাইন এবং AI হস্তক্ষেপের বিষয়ে একটি সর্বসম্মত সংজ্ঞা থাকলে এই পার্থক্যের বড় অংশ দূর হয়ে যেত। এর কোনোটিই এখনও তৈরি হয়নি এবং তা তৈরির বাণিজ্যিক চাপও কম, কারণ দুর্বলতা প্রকাশকারী টুলকে অন্যদের চেয়ে দুর্বল মনে হয়।
যতক্ষণ না এর পরিবর্তন হচ্ছে, প্রতিটি স্কোরকে নিজস্ব স্কেল থেকে আসা হিসেবে বিবেচনা করুন। টুলের লেবেলের আত্মবিশ্বাসের চেয়ে এটি যে প্রমাণ দেখাচ্ছে তা পর্যালোচনা করুন এবং সেটিকে বেশি গুরুত্ব দিন।
ভার্সন সংক্রান্ত যে সমস্যার কথা কেউ উল্লেখ করে না
সময়ের সাথে সাথে একটি ডিটেক্টর অপরিবর্তিত থাকে না। নির্মাতারা কোনো ঘোষণা ছাড়াই মডেল রি-ট্রেন করেন, থ্রেশহোল্ড সমন্বয় করেন এবং মডেল পরিবর্তন করেন, এবং তাদের প্রায় কেউই আউটপুটের ভার্সন নম্বর রাখে না। আপনি মার্চ মাসে যে স্কোর পেয়েছিলেন এবং আজ যে স্কোর পাচ্ছেন তা ভিন্ন ভিন্ন ক্যালিব্রেশনের সম্পূর্ণ আলাদা মডেল থেকে আসতে পারে।
ফলাফল সংরক্ষণ করার ক্ষেত্রে এটি গুরুত্বপূর্ণ। আঠারো মাস আগের কোনো স্কোরের উল্লেখ থাকা বীমা দাবির ফাইল, মডারেশন লগ বা অ্যাকাডেমিক নথিতে মূলত এমন একটি পরিমাপকে উদ্ধৃত করা হয় যার মূল ব্যবস্থাটিই আর বিদ্যমান নেই। এটি পুনরায় তৈরি করার কোনো উপায় নেই এবং সেই সময়ে এর অর্থ কী ছিল তা যাচাই করারও কোনো সুযোগ নেই।
যেখানে ফলাফল সংরক্ষণ করেন, তার সাথে প্রমাণগুলোও রাখুন: অঞ্চলভিত্তিক স্কোর, ব্যান্ড, সিদ্ধান্ত রেখা এবং তারিখ। পেছনের মডেলটি পরিবর্তিত হয়ে গেলেও এগুলো বোধগম্য থাকে, যা কেবল একটি সংখ্যার শতাংশ দিয়ে সম্ভব নয়।