← সকল নির্দেশিকা তুলনা

ChatGPT কি বলতে পারে কোনো ছবি AI জেনারেটেড কি না?

এটি আপনাকে এর পেছনে কোনো ভিত্তি ছাড়াই একটি আত্মবিশ্বাসী উত্তর দেবে। কেন ভাষা মডেলগুলো এটি করতে পারে না, তারা আসলে কী করছে এবং পরিবর্তে কী ব্যবহার করা উচিত।

· 7 মিনিট পড়া · Best AI Image Detector

না। ভাষা মডেল বর্ণনা করে যে একটি ছবি দেখতে কেমন এবং শব্দে সে সম্পর্কে যুক্তি দেয়। এর কোনো ক্যালিব্রেটেড থ্রেশহোল্ড নেই, কোনো বেঞ্চমার্ক নেই এবং পিক্সেল পরিসংখ্যানের কোনো অ্যাক্সেস নেই যার ওপর ডিটেকশন নির্ভর করে।

একটি চ্যাটবট আসলে কী করছে

একটি মাল্টিমোডাল ভাষা মডেল একটি ছবিকে সেমান্টিক বর্ণনায় রূপান্তরিত করে এবং তারপর টেক্সটে সেই বর্ণনা সম্পর্কে যুক্তি দেয়। এটি এই প্রশ্নের উত্তর দিচ্ছে যে এই ছবিটিকে আমার ট্রেনিংয়ের সময় পড়া AI ইমেজগুলোর মতো দেখায় কি না।

এটি কন্টেন্ট এবং কম্পোজিটিং সম্পর্কে একটি প্রশ্ন। ডিটেকশন হলো টেক্সট নিয়ে একটি প্রশ্ন: আশেপাশের পিক্সেল ভ্যালুগুলো কীভাবে একে অপরের সাথে সম্পর্কিত, সেমান্টিক বর্ণনা সংরক্ষণ করে এমন কোনো কিছুর চেয়ে অনেক ছোট স্কেলে।

একটি ডিটেক্টর যে তথ্য পড়ে তা ভাষা মডেল চিন্তা শুরু করার আগেই বাতিল করা হয়। এমন নয় যে চ্যাটবটগুলো এতে খারাপ। তারা এমন একটি রিপ্রেজেন্টেশন থেকে কাজ করছে যাতে প্রমাণ নেই।

বাস্তবে এটি কী তৈরি করে

  • কোনো থ্রেশহোল্ড ছাড়া আত্মবিশ্বাসী উত্তর। একটি চ্যাটবট 'সম্ভাব্য AI-জেনারেটেড' বলবে সম্ভাব্যতা শব্দের পেছনে কোনো স্কেল ছাড়াই। এখানে কোনো সংখ্যা, কোনো ব্যান্ড এবং অন্য ছবির সাথে তুলনা করার মতো কিছু নেই।
  • পুরনো টেলস থেকে যুক্তি। মডেলগুলো আঙুল, দাঁত, মোমের মতো ত্বক এবং বাঁকা টেক্সটের কথা বলে, কারণ ট্রেনিং টেক্সট এগুলোই খুঁজতে বলে। এগুলো বছর আগেই ঠিক করা হয়েছিল।
  • আপনার ফ্রেমিংয়ের সাথে চুক্তি। কোনো ছবি নকল কি না তা জিজ্ঞাসা করুন এবং নিরপেক্ষভাবে জিজ্ঞাসা করার চেয়ে আপনার 'হ্যাঁ' শোনার সম্ভাবনা বেশি। এটি ছবির নয়, ইন্টারফেসের একটি বৈশিষ্ট্য।
  • কোনো পুনরুৎপাদনযোগ্যতা নেই। দুবার জিজ্ঞাসা করুন এবং আপনি একই ফাইল সম্পর্কে দুটি ভিন্ন উত্তর পেতে পারেন, প্রতিটির জন্যই সমানভাবে আত্মবিশ্বাসী ব্যাখ্যা সহ।
  • কোনো রিজিওন তথ্য নেই। এটি আপনাকে বলতে পারে না যে একটি ফটোগ্রাফের একটি কোণ বাকি অংশ থেকে আলাদাভাবে আচরণ করে, যা সেই ফাইন্যান্স যা সাধারণত গুরুত্বপূর্ণ।
ক্ষমতা চ্যাটবট পিক্সেল ডিটেক্টর
পিক্সেল-লেভেল টেক্সট পড়ে No Yes
প্রকাশিত ব্যান্ড সহ ক্যালিব্রেটেড স্কোর No Yes
প্রতিবার একই উত্তর No Yes
রিজিওন-লেভেল ব্রেকডাউন No Yes
বেঞ্চমার্কের বিপরীতে পরিমাপ করা হয়েছে No Yes
প্রোজে এর যুক্তি ব্যাখ্যা করে Yes সাবলীলভাবে Partly সিগন্যাল হিসেবে
ছবিতে কী আছে তা বর্ণনা করে Yes No
প্রতিটি দৃষ্টিভঙ্গি আসলে কী তৈরি করতে পারে। মধ্য কলামটি হলো সেই কলাম যাকে লোকেরা ডান কলাম বলে ভুল করে।

শেষের দুটি সারিই কেবল ধরে রাখার মতো। একটি ল্যাঙ্গুয়েজ মডেল ছবির বর্ণনা দিতে এবং কোনো দৃশ্য যুক্তিযুক্ত কি না তা বিশ্লেষণ করতে সত্যিই দক্ষ। এগুলি দরকারি, তবে এগুলি সনাক্তকরণ নয়।

যেখানে একটি চ্যাটবট সত্যিই কার্যকর

টুলটিকে পুরোপুরি বাতিল করা ভুল সিদ্ধান্ত হবে। যা করার জন্য এটি উপযুক্ত, সেই কাজে ব্যবহার করলে এটি একটি ডিটেক্টরকে প্রতিস্থাপনের বদলে তার পরিপূরক হিসেবে কাজ করে।

  1. দৃশ্যটি বিস্তারিতভাবে বর্ণনা করতে বলুন

    একটি সতর্কতামূলক বর্ণনা প্রায়শই এমন বিষয়গুলি সামনে আনে যা আপনি নিজে লক্ষ্য করেননি, যার মধ্যে রয়েছে একসাথে না মানানসই বস্তু বা এমন কোনো সাইনবোর্ড যা আপনি পড়েননি।

  2. দৃশ্যটি বাস্তবসম্মত কি না তা যাচাই করতে বলুন

    ছায়া, প্রতিফলন, অনুপাত এবং পার্সপেক্টিভ হলো যুক্তিভিত্তিক সমস্যা, আর এই মডেলগুলি যুক্তির জন্যই তৈরি। এটি এমন কম্পোজিট ছবি ধরে ফেলে যা পিক্সেল বিশ্লেষণ মিস করতে পারে।

  3. কী এটি নিশ্চিত বা খণ্ডন করবে তা জানতে চান

    সন্দেহ দূর করতে চেক করার একটি তালিকা তৈরি করা ল্যাঙ্গুয়েজ মডেলের একটি ভালো ব্যবহার, এবং এই তালিকাটি সাধারণত আপনার তৈরি করা তালিকার চেয়ে ভালো হয়।

  4. তারপর আসল ডিটেক্টর চালান

    পিক্সেল সম্পর্কিত প্রশ্নের জন্য, বিশেষভাবে তৈরি কোনো টুল ব্যবহার করুন এবং প্রকাশিত স্কেলের সাথে মিলিয়ে স্কোর পড়ুন।

সাবলীল ভাষাই যেখানে আসল বিপদ

কোনো ডিটেক্টর নিশ্চিত না হলে মাঝামাঝি একটি সংখ্যা প্রদান করে, এবং সংখ্যাটি নিজেই তার অনিশ্চয়তা প্রকাশ করে। একটি ল্যাঙ্গুয়েজ মডেল নিশ্চিত না হলে একটি অনুচ্ছেদ লেখে, আর অনুচ্ছেদে কোনো এরর বার বা অনিশ্চয়তার মাত্রা থাকে না।

মডেলটি কোনো বাস্তব বিষয় শনাক্ত করুক বা মনগড়া কিন্তু বিশ্বাসযোগ্য কোনো বিবরণ দিক—উভয় ক্ষেত্রেই একই ধরনের সুগঠিত ব্যাখ্যা দেয়। পাঠকেরা লেখার মানের ওপর ভিত্তি করে বিশ্বাস করেন, অথচ এই ক্ষেত্রেই লেখার মান কোনো নির্ভরযোগ্য তথ্য দেয় না।

এই কারণেই নিজে ছবি দেখার চেয়ে চ্যাটবটকে জিজ্ঞাসা করা খারাপ সূচনা। অন্তত নিজের অনিশ্চয়তাটুকু আপনার কাছে স্পষ্ট থাকে।

অন্যান্য টুলে একই সমস্যা

এটি কেবল একটি পণ্যের বিষয় নয়। যেকোনো সিস্টেম যা কোনো ছবিকে ভাবার্থের ভিত্তিতে বিশ্লেষণ করে, তার একই সীমাবদ্ধতা রয়েছে; আর বর্তমানে ডিটেক্টর হিসেবে দাবি করা বেশ কিছু টুল ভেতরে ভেতরে ঠিক এই কাজটিই করছে।

একটি কার্যকর পরীক্ষা: টুলে কোনো ছবির ছবি, অথবা কোনো স্পষ্ট বিষয়বস্তু ছাড়া একটি ছবি দিলে তা কী দেখায় তা পরখ করুন। একটি পিক্সেল ডিটেক্টর উভয় ক্ষেত্রেই একটি স্কোর দেবে, কারণ বিষয়বস্তু যাই হোক না কেন টেক্সচার বিদ্যমান থাকে। একটি অর্থভিত্তিক সিস্টেমের বিশ্লেষণ করার মতো কিছু থাকে না, ফলে এটি হয় প্রত্যাখ্যান করবে নয়তো কিছু বানিয়ে দেবে।

দ্বিতীয় পরীক্ষা: একই ফাইল দুবার চালান। একটি পিক্সেল মডেল সুনির্দিষ্ট নিয়ম অনুযায়ী চলে এবং প্রতিবার একই সংখ্যা দেয়। একটি ল্যাঙ্গুয়েজ মডেল স্যাম্পল তৈরি করে, তাই দুইবারে ভিন্ন উত্তর আসতে পারে। কোনো টুল যদি একই বাইটের জন্য ভিন্ন উত্তর দেয়, তবে তা কিছুই পরিমাপ করছে না।

কোনো পরীক্ষার জন্যই টুল কীভাবে কাজ করে তা বোঝার প্রয়োজন নেই। উভয়ের জন্যই এক মিনিট সময় লাগে, এবং মার্কেটিংয়ের পাতা পড়ার চেয়ে এগুলি অনেক বেশি নির্ভরযোগ্যভাবে পরিমাপ ও বর্ণনার পার্থক্য স্পষ্ট করে।

মানুষ যেসব প্রশ্ন করে

ChatGPT কি এআই দিয়ে তৈরি ছবি শনাক্ত করতে পারে?
না, পরিমাপযোগ্য কোনো উপায়ে নয়। পিক্সেল কীভাবে তৈরি হয়েছে তার ওপর ভিত্তি না করে ছবিতে কী প্রদর্শিত হয়েছে তার ওপর ভিত্তি করে এটি আত্মবিশ্বাসী শোনানো একটি মূল্যায়ন দেয়। উত্তরের পেছনে কোনো ক্যালিব্রেটেড থ্রেশহোল্ড নেই, কোনো বেঞ্চমার্ক নেই, এবং দুবার জিজ্ঞাসা করলে দুটি ভিন্ন রায় আসতে পারে।
কিন্তু আমার পরীক্ষা করা একটি ছবিতে এটি সঠিক উত্তর দিয়েছিল।
এটি অনেক সময়ই সঠিক হবে, বিশেষ করে স্পষ্ট ক্ষেত্রগুলিতে যেখানে আপনি নিজেও সঠিক হতেন। সমস্যা হলো ভুল হলেও এর ভাষা হুবহু একই রকম আত্মবিশ্বাসী থাকে, ফলে একটি সঠিক উত্তর দেখে পরবর্তী ছবিতে পাওয়া উত্তরটি সঠিক না ভুল তা জানার কোনো উপায় থাকে না।
আমি যদি এটিকে পিক্সেল বিশ্লেষণ করতে বলি?
এটি তা করতে পারে না। মডেলটি বিশ্লেষণ করার আগেই ছবিটি একটি অর্থভিত্তিক উপস্থাপনায় রূপান্তরিত হয়, এবং সনাক্তকরণের জন্য প্রয়োজনীয় সূক্ষ্ম টেক্সচার সেই রূপান্তরের সময়েই বাদ পড়ে যায়। পিক্সেল বিশ্লেষণ করতে বললে এটি মূলত পিক্সেল বিশ্লেষণ দেখতে কেমন হবে তার একটি বিবরণ দেয়।
সনাক্তকরণের জন্য তৈরি কোনো মাল্টিমোডাল মডেল আছে কি?
এই ক্ষেত্রে গবেষণা চলছে এবং সাধারণ অ্যাসিস্ট্যান্টরা এই কাজ করে না। একটি নির্দিষ্ট উদ্দেশ্যে তৈরি ডিটেক্টরকে ক্যালিব্রেটেড আউটপুটসহ আসল ও তৈরি করা ছবির জোড়ার ওপর প্রশিক্ষণ দেওয়া হয়; একটি সাধারণ মডেলকে সব বিষয়ে সহায়ক হওয়ার প্রশিক্ষণ দেওয়া হয়। এই দুটি একে অপরের বিকল্প নয়।
কোনো ছবি যাচাইয়ের সময় আমার কি আদৌ চ্যাটবট ব্যবহার করা উচিত?
হ্যাঁ, বর্ণনা ও যুক্তির জন্য। ফ্রেমে কী আছে, আলোর ব্যবহার সামঞ্জস্যপূর্ণ কি না এবং কী আপনার সন্দেহ নিশ্চিত বা খণ্ডন করতে পারে তা জিজ্ঞাসা করুন। এরপর পিক্সেল সম্পর্কিত প্রশ্নের জন্য একটি ডিটেক্টর ব্যবহার করুন এবং দুটি উত্তরকে আলাদা রাখুন।
এত মানুষ প্রথমেই কেন চ্যাটবটকে জিজ্ঞাসা করে?
কারণ এটি অন্য ট্যাবে খোলাই থাকে এবং সবসময় উত্তর দেয়। যখন ভুল হওয়ার ক্ষতি চোখে দেখা যায় না তখন নির্ভুলতার চেয়ে সুবিধাই প্রাধান্য পায়; আর ছবি যাচাইয়ের ক্ষেত্রে ক্ষতি সাধারণত তখনই চোখে পড়ে যখন কেউ উত্তরের ওপর ভিত্তি করে ব্যবস্থা নিয়ে ফেলে।

এখনই একটি ছবি চেক করুন

বিনামূল্যে, কোনো অ্যাকাউন্ট ছাড়াই এবং ফাইলটি আপনার ডিভাইস ছেড়ে যায় না। দিনে পঞ্চাশটি চেক।

ডিটেক্টর খুলুন

আরও পড়ুন