একটি চ্যাটবট আসলে কী করছে
একটি মাল্টিমোডাল ভাষা মডেল একটি ছবিকে সেমান্টিক বর্ণনায় রূপান্তরিত করে এবং তারপর টেক্সটে সেই বর্ণনা সম্পর্কে যুক্তি দেয়। এটি এই প্রশ্নের উত্তর দিচ্ছে যে এই ছবিটিকে আমার ট্রেনিংয়ের সময় পড়া AI ইমেজগুলোর মতো দেখায় কি না।
এটি কন্টেন্ট এবং কম্পোজিটিং সম্পর্কে একটি প্রশ্ন। ডিটেকশন হলো টেক্সট নিয়ে একটি প্রশ্ন: আশেপাশের পিক্সেল ভ্যালুগুলো কীভাবে একে অপরের সাথে সম্পর্কিত, সেমান্টিক বর্ণনা সংরক্ষণ করে এমন কোনো কিছুর চেয়ে অনেক ছোট স্কেলে।
একটি ডিটেক্টর যে তথ্য পড়ে তা ভাষা মডেল চিন্তা শুরু করার আগেই বাতিল করা হয়। এমন নয় যে চ্যাটবটগুলো এতে খারাপ। তারা এমন একটি রিপ্রেজেন্টেশন থেকে কাজ করছে যাতে প্রমাণ নেই।
বাস্তবে এটি কী তৈরি করে
- কোনো থ্রেশহোল্ড ছাড়া আত্মবিশ্বাসী উত্তর। একটি চ্যাটবট 'সম্ভাব্য AI-জেনারেটেড' বলবে সম্ভাব্যতা শব্দের পেছনে কোনো স্কেল ছাড়াই। এখানে কোনো সংখ্যা, কোনো ব্যান্ড এবং অন্য ছবির সাথে তুলনা করার মতো কিছু নেই।
- পুরনো টেলস থেকে যুক্তি। মডেলগুলো আঙুল, দাঁত, মোমের মতো ত্বক এবং বাঁকা টেক্সটের কথা বলে, কারণ ট্রেনিং টেক্সট এগুলোই খুঁজতে বলে। এগুলো বছর আগেই ঠিক করা হয়েছিল।
- আপনার ফ্রেমিংয়ের সাথে চুক্তি। কোনো ছবি নকল কি না তা জিজ্ঞাসা করুন এবং নিরপেক্ষভাবে জিজ্ঞাসা করার চেয়ে আপনার 'হ্যাঁ' শোনার সম্ভাবনা বেশি। এটি ছবির নয়, ইন্টারফেসের একটি বৈশিষ্ট্য।
- কোনো পুনরুৎপাদনযোগ্যতা নেই। দুবার জিজ্ঞাসা করুন এবং আপনি একই ফাইল সম্পর্কে দুটি ভিন্ন উত্তর পেতে পারেন, প্রতিটির জন্যই সমানভাবে আত্মবিশ্বাসী ব্যাখ্যা সহ।
- কোনো রিজিওন তথ্য নেই। এটি আপনাকে বলতে পারে না যে একটি ফটোগ্রাফের একটি কোণ বাকি অংশ থেকে আলাদাভাবে আচরণ করে, যা সেই ফাইন্যান্স যা সাধারণত গুরুত্বপূর্ণ।
| ক্ষমতা | চ্যাটবট | পিক্সেল ডিটেক্টর |
|---|---|---|
| পিক্সেল-লেভেল টেক্সট পড়ে | No | Yes |
| প্রকাশিত ব্যান্ড সহ ক্যালিব্রেটেড স্কোর | No | Yes |
| প্রতিবার একই উত্তর | No | Yes |
| রিজিওন-লেভেল ব্রেকডাউন | No | Yes |
| বেঞ্চমার্কের বিপরীতে পরিমাপ করা হয়েছে | No | Yes |
| প্রোজে এর যুক্তি ব্যাখ্যা করে | Yes সাবলীলভাবে | Partly সিগন্যাল হিসেবে |
| ছবিতে কী আছে তা বর্ণনা করে | Yes | No |
শেষের দুটি সারিই কেবল ধরে রাখার মতো। একটি ল্যাঙ্গুয়েজ মডেল ছবির বর্ণনা দিতে এবং কোনো দৃশ্য যুক্তিযুক্ত কি না তা বিশ্লেষণ করতে সত্যিই দক্ষ। এগুলি দরকারি, তবে এগুলি সনাক্তকরণ নয়।
যেখানে একটি চ্যাটবট সত্যিই কার্যকর
টুলটিকে পুরোপুরি বাতিল করা ভুল সিদ্ধান্ত হবে। যা করার জন্য এটি উপযুক্ত, সেই কাজে ব্যবহার করলে এটি একটি ডিটেক্টরকে প্রতিস্থাপনের বদলে তার পরিপূরক হিসেবে কাজ করে।
-
দৃশ্যটি বিস্তারিতভাবে বর্ণনা করতে বলুন
একটি সতর্কতামূলক বর্ণনা প্রায়শই এমন বিষয়গুলি সামনে আনে যা আপনি নিজে লক্ষ্য করেননি, যার মধ্যে রয়েছে একসাথে না মানানসই বস্তু বা এমন কোনো সাইনবোর্ড যা আপনি পড়েননি।
-
দৃশ্যটি বাস্তবসম্মত কি না তা যাচাই করতে বলুন
ছায়া, প্রতিফলন, অনুপাত এবং পার্সপেক্টিভ হলো যুক্তিভিত্তিক সমস্যা, আর এই মডেলগুলি যুক্তির জন্যই তৈরি। এটি এমন কম্পোজিট ছবি ধরে ফেলে যা পিক্সেল বিশ্লেষণ মিস করতে পারে।
-
কী এটি নিশ্চিত বা খণ্ডন করবে তা জানতে চান
সন্দেহ দূর করতে চেক করার একটি তালিকা তৈরি করা ল্যাঙ্গুয়েজ মডেলের একটি ভালো ব্যবহার, এবং এই তালিকাটি সাধারণত আপনার তৈরি করা তালিকার চেয়ে ভালো হয়।
-
তারপর আসল ডিটেক্টর চালান
পিক্সেল সম্পর্কিত প্রশ্নের জন্য, বিশেষভাবে তৈরি কোনো টুল ব্যবহার করুন এবং প্রকাশিত স্কেলের সাথে মিলিয়ে স্কোর পড়ুন।
সাবলীল ভাষাই যেখানে আসল বিপদ
কোনো ডিটেক্টর নিশ্চিত না হলে মাঝামাঝি একটি সংখ্যা প্রদান করে, এবং সংখ্যাটি নিজেই তার অনিশ্চয়তা প্রকাশ করে। একটি ল্যাঙ্গুয়েজ মডেল নিশ্চিত না হলে একটি অনুচ্ছেদ লেখে, আর অনুচ্ছেদে কোনো এরর বার বা অনিশ্চয়তার মাত্রা থাকে না।
মডেলটি কোনো বাস্তব বিষয় শনাক্ত করুক বা মনগড়া কিন্তু বিশ্বাসযোগ্য কোনো বিবরণ দিক—উভয় ক্ষেত্রেই একই ধরনের সুগঠিত ব্যাখ্যা দেয়। পাঠকেরা লেখার মানের ওপর ভিত্তি করে বিশ্বাস করেন, অথচ এই ক্ষেত্রেই লেখার মান কোনো নির্ভরযোগ্য তথ্য দেয় না।
এই কারণেই নিজে ছবি দেখার চেয়ে চ্যাটবটকে জিজ্ঞাসা করা খারাপ সূচনা। অন্তত নিজের অনিশ্চয়তাটুকু আপনার কাছে স্পষ্ট থাকে।
অন্যান্য টুলে একই সমস্যা
এটি কেবল একটি পণ্যের বিষয় নয়। যেকোনো সিস্টেম যা কোনো ছবিকে ভাবার্থের ভিত্তিতে বিশ্লেষণ করে, তার একই সীমাবদ্ধতা রয়েছে; আর বর্তমানে ডিটেক্টর হিসেবে দাবি করা বেশ কিছু টুল ভেতরে ভেতরে ঠিক এই কাজটিই করছে।
একটি কার্যকর পরীক্ষা: টুলে কোনো ছবির ছবি, অথবা কোনো স্পষ্ট বিষয়বস্তু ছাড়া একটি ছবি দিলে তা কী দেখায় তা পরখ করুন। একটি পিক্সেল ডিটেক্টর উভয় ক্ষেত্রেই একটি স্কোর দেবে, কারণ বিষয়বস্তু যাই হোক না কেন টেক্সচার বিদ্যমান থাকে। একটি অর্থভিত্তিক সিস্টেমের বিশ্লেষণ করার মতো কিছু থাকে না, ফলে এটি হয় প্রত্যাখ্যান করবে নয়তো কিছু বানিয়ে দেবে।
দ্বিতীয় পরীক্ষা: একই ফাইল দুবার চালান। একটি পিক্সেল মডেল সুনির্দিষ্ট নিয়ম অনুযায়ী চলে এবং প্রতিবার একই সংখ্যা দেয়। একটি ল্যাঙ্গুয়েজ মডেল স্যাম্পল তৈরি করে, তাই দুইবারে ভিন্ন উত্তর আসতে পারে। কোনো টুল যদি একই বাইটের জন্য ভিন্ন উত্তর দেয়, তবে তা কিছুই পরিমাপ করছে না।
কোনো পরীক্ষার জন্যই টুল কীভাবে কাজ করে তা বোঝার প্রয়োজন নেই। উভয়ের জন্যই এক মিনিট সময় লাগে, এবং মার্কেটিংয়ের পাতা পড়ার চেয়ে এগুলি অনেক বেশি নির্ভরযোগ্যভাবে পরিমাপ ও বর্ণনার পার্থক্য স্পষ্ট করে।