কেন এই ক্ষেত্রে স্বয়ংক্রিয় প্রয়োগ ব্যর্থ হয়
ল্যাবরেটরি পরিস্থিতিতে 91 শতাংশ সুষম নির্ভুলতা থাকলেও, প্রায় প্রতি এগারোটি সিদ্ধান্তের একটি ভুল হয়। ব্যবহারকারীদের তৈরি করা কন্টেন্টের ক্ষেত্রে, যা স্ক্রিনশট নেওয়া, পুনরায় কম্প্রেস করা এবং ক্রপ করা অবস্থায় আসে, প্রকৃত নির্ভুলতার হার আরও খারাপ হয়।
দিনে এক লক্ষ আইটেমে এটি প্রয়োগ করলে হাজার হাজার ভুল পদক্ষেপ নেওয়া হবে। এর প্রতিটির জন্যই আপিল হবে, এবং প্রতিটি কেসে পর্যালোচনার খরচের চেয়ে আপিলের খরচ বেশি হবে যা অটোমেশনের মাধ্যমে বাঁচানো সম্ভব ছিল। আসল পোস্ট মুছে ফেলার ফলে যে সুনামহানি হয়, তা বিবেচনায় নেওয়ার আগেই এই হিসাব অকার্যকর প্রমাণিত হয়।
মডারেশনের ক্ষেত্রে আরেকটি দ্বিতীয় সমস্যা রয়েছে। প্রয়োগের সিদ্ধান্তগুলো নিরীক্ষিত (audit) হয়। কোনো নিয়ন্ত্রক সংস্থা বা আদালত যখন জানতে চাইবে কেন একটি অ্যাকাউন্ট সরানো হয়েছে, তখন অপ্রকাশিত থ্রেশহোল্ড সম্বলিত কোনো মডেলের আউটপুট যুক্তি হিসেবে গ্রহণ করা হবে না।
পদক্ষেপ নেওয়ার জন্য নয়, সাজানোর জন্য স্কোরিং
কার্যকর পদ্ধতি হলো সারির ক্রম নির্ধারণ। আপনার পর্যালোচকের সংখ্যার চেয়ে আইটেমের সংখ্যা বেশি। একজন মানুষ কোন আইটেমগুলো আগে দেখবে তা স্কোর নির্ধারণ করে, এবং 85 শতাংশ নির্ভুলতাতেও এই কাজটি খুব ভালোভাবে করা যায়, কারণ ভুল হওয়ার অর্থ কেবল কেউ একজন অপ্রয়োজনীয় কিছু দেখছে।
- 1 90-এর উপরে পর্যালোচনা সারির শুরুতে
- 2 65 থেকে 90 স্বাভাবিক সময়ের মধ্যে পর্যালোচিত
- 3 45 থেকে 65 শুধুমাত্র ব্যবহারকারী রিপোর্ট করলেই
- 4 45-এর নিচে কোনো পদক্ষেপ নয়, গুণমান পরীক্ষার জন্য নমুনা হিসেবে রাখা হয়েছে
সর্বনিম্ন ব্যান্ডের নমুনা নেওয়া যতটা সাধারণ মনে হয় তার চেয়ে বেশি গুরুত্বপূর্ণ। আপনার ফলস নেগেটিভ রেট পরিমাপ করার একমাত্র উপায় এটিই, এবং এই সংখ্যাটি ছাড়া সিস্টেমটি কাজ করছে নাকি নীরবে সবকিছু বাদ দিচ্ছে তা বোঝার কোনো উপায় নেই।
আপনার নীতিমালায় যা থাকা প্রয়োজন
অধিকাংশ প্ল্যাটফর্মেই এখন সিন্থেটিক মিডিয়া সংক্রান্ত নিয়ম রয়েছে, এবং সেগুলোর বেশিরভাগই ভুলভাবে লেখা। সাধারণ ভুলটি হলো সামগ্রিকভাবে AI কন্টেন্ট নিষিদ্ধ করা, যা কার্যকর করা অসম্ভব এবং এমন সব বিষয়কে আটকে দেয় যা কেউ বাদ দিতে চায়নি।
| কার্যকরযোগ্য | কার্যকরযোগ্য নয় | কেন |
|---|---|---|
| বাস্তব ব্যক্তির অপ্রকাশিত সিন্থেটিক মিডিয়া | সমস্ত AI-জেনারেটেড ছবি | দ্বিতীয়টি ইলাস্ট্রেশন এবং ডিজাইনের কাজ নিষিদ্ধ করে |
| নথিভুক্ত প্রমাণ হিসেবে উপস্থাপন করা জেনারেটেড ছবি | যেকোনো কিছু যা 65-এর বেশি স্কোর পায় | থ্রেশহোল্ড কোনো নীতিমালা নয় |
| অর্থের জন্য প্রতারণা করতে ব্যবহৃত সিন্থেটিক মিডিয়া | যেসব ছবি দেখতে AI-জেনারেটেড মনে হয় | শুধু দেখা কোনো মানদণ্ড নয় |
| জিজ্ঞাসা করার পরও লেবেল দিতে ব্যর্থ হওয়া | যেকোনো ধরণের অপ্রকাশিত AI | প্রমাণাতীত, এবং ব্যবহারকারীদের পক্ষে মেনে চলা অসম্ভব |
প্রযুক্তির ভিত্তিতে নয়, বরং ক্ষতি এবং প্রকাশের (disclosure) ওপর ভিত্তি করে নিয়ম লিখুন। একটি কাল্পনিক পোস্টে জেনারেট করা ইলাস্ট্রেশন কারও ক্ষতি করে না। একটি পণ্য, ব্যক্তি বা ঘটনার জেনারেট করা ছবি যদি বাস্তব হিসেবে উপস্থাপন করা হয়, তবে সেটাই মূলত আপনার আটকানো উচিত।
অঞ্চলভিত্তিক মানচিত্র যে তিনটি পরিস্থিতি আলাদা করে
সম্পূর্ণ ফ্রেমের সামগ্রিক স্কোর এমন তিনটি পরিস্থিতিকে এক করে ফেলে যাদের ভিন্নভাবে পরিচালনা করা প্রয়োজন। টাইল ভিউ সেগুলোকে আলাদা করে দেখায়, এবং এই পার্থক্যই সাধারণত ফলাফল নির্ধারণ করে।
- প্রতিটি টাইল উচ্চ স্কোর যুক্ত। একটি সম্পূর্ণ জেনারেট করা ছবি। যদি এটি বাস্তব কিছুর ফটোগ্রাফ হিসেবে উপস্থাপন করা হয়, তবে এটি আপনার সবচেয়ে স্পষ্ট কেস।
- একটি টাইল উচ্চ স্কোর যুক্ত। একটি আসল ছবি যাতে কিছু যোগ করা হয়েছে বা সরানো হয়েছে। কোনো মার্কেটপ্লেস বা খবরের ক্ষেত্রে এটি সম্পূর্ণ জেনারেট করা ছবির চেয়েও বেশি মারাত্মক, কারণ এটি বিশ্বাস করানোর উদ্দেশ্যে তৈরি করা হয়।
- সমানভাবে মধ্যম স্কোর, কোনোটিই উচ্চ নয়। অতিরিক্ত প্রসেসিং। সাধারণত ফিল্টার বা আপস্কেলারের মাধ্যমে তৈরি একটি আসল ছবি। এর বিরুদ্ধে পদক্ষেপ নেওয়ার প্রয়োজন প্রায় কখনোই হয় না।
একটি সংযোজিত উপাদান সহ আসল ছবি। কেবল মূল স্কোরের ওপর ভিত্তি করে সারি সাজালে এটি কখনোই সামনে আসত না।
এটি কাজ করছে কিনা তা পরিমাপ করা
-
শীর্ষ ব্যান্ডের যথার্থতা (precision) ট্র্যাক করুন
মডারেটর কর্তৃক উন্মুক্ত 90-এর বেশি স্কোরের আইটেমগুলোর মধ্যে কতগুলোর বিরুদ্ধে পদক্ষেপ নেওয়া হয়েছে? এই সংখ্যাটি কম হলে বুঝতে হবে টুলটি কাজ বাঁচানোর চেয়ে নতুন কাজ তৈরি করছে।
-
প্রতি সপ্তাহে সর্বনিম্ন ব্যান্ডের নমুনা পরীক্ষা করুন
45-এর নিচের স্কোর থেকে এলোমেলোভাবে একশত আইটেম নিন এবং সেগুলো পর্যালোচনা করুন। আপনি কী মিস করছেন তা পরিমাপের একমাত্র উপায় এটিই, এবং সাধারণত দলগুলো এটিই এড়িয়ে যায়।
-
আপিলের হারের ওপর নজর রাখুন
সিন্থেটিক মিডিয়া সিদ্ধান্তের ওপর সফল আপিল বেড়ে যাওয়ার অর্থ হলো থ্রেশহোল্ডের মান সরে গেছে অথবা এমন কোনো নতুন জেনারেটর এসেছে যার স্কোর কম আসছে।
-
প্রতিটি মডেল পরিবর্তনের পর রি-বেসলাইন করুন
ডিটেক্টর আপডেটের ফলে স্কোর পরিবর্তিত হয়। একটি ভিন্ন মডেল সংস্করণের বিপরীতে ছয় মাস আগে সেট করা থ্রেশহোল্ড এখন আর আগের মতো কাজ নাও করতে পারে।
টুলটির দ্বারা তৈরি সারির জন্য কর্মী নিয়োগ
মডারেশন পাইপলাইনে একটি ডিটেক্টর যুক্ত করলে কর্মীর সংখ্যা কমে না, এবং যে দলগুলো কর্মী কমানোর পরিকল্পনা করে তারা ক্ষতির সম্মুখীন হয়। এটি যা পরিবর্তন করে তা হলো কাজের আসার ক্রম, যা আপনার প্রয়োজনীয় লোকবল না কমিয়েই প্রতিটি পর্যালোচক ঘণ্টার মান বাড়িয়ে দেয়।
সাধারণ সারির তুলনায় ফ্ল্যাগ করা সারির আইটেম পর্যালোচনায় বেশি সময় লাগবে ধরে বাজেট করুন। ফ্ল্যাগ করা পোস্ট দেখছেন এমন একজন পর্যালোচক আরও দ্ব্যর্থবোধক উপাদানের ওপর কঠিন সিদ্ধান্ত নিচ্ছেন, এবং এতে তাড়াহুড়ো করলেই ভুল প্রয়োগ ঘটে। আইটেম প্রতি দুই মিনিট বাস্তবসম্মত; ত্রিশ সেকেন্ড নয়।
পর্যালোচকদের স্কোরের পরিবর্তে অঞ্চলভিত্তিক মানচিত্র দিন। একজন মডারেটর যিনি দেখতে পান যে ছবির একটি কোণ চিহ্নিত হয়েছে, তিনি কেবল একটি সংখ্যা পাওয়া ব্যক্তির চেয়ে ভালো সিদ্ধান্ত নেন এবং পরবর্তীতে তারা আপিল দল বা নিয়ন্ত্রকের কাছে সেই সিদ্ধান্তের ব্যাখ্যা দিতে পারেন।
সিন্থেটিক মিডিয়া পর্যালোচনা থেকে কর্মীদের পর্যায়ক্রমে পরিবর্তন (rotate) করুন। এটি অত্যন্ত পুনরাবৃত্তিমূলক এবং এতে অস্পষ্ট কেসের অনুপাত বেশি থাকে, যার ফলে দীর্ঘ শিফটে নির্ভুলতার হার স্পষ্টভাবেই কমে যায়। অন্যান্য বিভাগের ক্ষেত্রেও প্রতিটি মডারেশন বিভাগ ইতিমধ্যে এই একই শিক্ষা পেয়েছে।