ما يفعله روبوت الدردشة فعلياً
يحول النموذج اللغوي متعدد الوسائط الصورة إلى وصف دلالي ثم يستنتج بشأن ذلك الوصف نصياً. إنه يجيب على سؤال: هل تبدو هذه الصورة مثل صور AI التي قرأت عنها أثناء التدريب.
هذا سؤال حول المحتوى والتكوين. الكشف هو سؤال حول النسيج: كيف ترتبط قيم البكسلات المجاورة ببعضها البعض، على مقياس أقل بكثير من أي شيء يحافظ عليه الوصف الدلالي.
المعلومات التي يقرأها الكاشف يتم التخلص منها قبل أن يبدأ النموذج اللغوي في التفكير. ليس الأمر أن روبوتات الدردشة سيئة في هذا. إنها تعمل من تمثيل لا يحتوي على الأدلة.
ما ينتج عن ذلك في الممارسة العملية
- إجابات واثقة دون حد. سيقول روبوت الدردشة من المحتمل أنه مولد بواسطة AI دون أي مقياس خلف كلمة محتمل. لا يوجد رقم، ولا نطاق، ولا شيء للمقارنة به مع صورة أخرى.
- الاستنتاج من مؤشرات قديمة. يستشهد النموذج بالأصابع والأسنان والجلد الشمعي والنص المشوه، لأن هذا ما يقوله نص التدريب للبحث عنه. تم إصلاح تلك المشكلات منذ سنوات.
- الاتفاق مع صياغتك. اسأل عما إذا كانت الصورة مزيفة ومن المرجح أن تسمع نعم أكثر مما لو سألت بشكل محايد. هذه خاصية للواجهة، وليس للصورة.
- عدم قابلية التكرار. اسأل مرتين ويمكنك الحصول على إجابتين مختلفتين حول نفس الملف، مع تفسيرات واثقة بنفس القدر لكل منهما.
- لا توجد معلومات عن المنطقة. لا يمكنه إخبارك بأن ركناً واحداً من الصورة يتصرف بشكل مختلف عن البقية، وهي النتيجة التي تهم عادةً.
| القدرة | روبوت الدردشة | كاشف البكسل |
|---|---|---|
| يقرأ نسيج مستوى البكسل | No | Yes |
| تقييم معاير مع نطاقات منشورة | No | Yes |
| نفس الإجابة في كل مرة | No | Yes |
| تحليل على مستوى المنطقة | No | Yes |
| مقاس مقابل معيار قياسي | No | Yes |
| يشرح استنتاجاته نثراً | Yes بطلاقة | Partly كإشارات |
| يصف ما في الصورة | Yes | No |
الصفان الأخيران هما ما يستحق الاحتفاظ به. إن النموذج اللغوي جيد حقاً في وصف الصورة وفي الاستنتاج حول ما إذا كان المشهد منطقياً. هذه أمور مفيدة ولكنها ليست كشفاً.
أين يكون روبوت الدردشة مفيداً حقاً
تجاهل الأداة تماماً سيكون درساً خاطئاً. عند استخدامها فيما يمكنها فعله، فهي تكمل أداة الكشف بدلاً من استبدالها.
-
اطلب منه وصف المشهد بالتفصيل
غالباً ما يُظهر الوصف الدقيق أشياء لم تلاحظها بوعي، بما في ذلك الأشياء التي لا تنتمي معاً أو اللافتات التي لم تقرأها.
-
اسأل عما إذا كان المشهد متسقاً مادياً
تعد الظلال والانعكاسات والحجم والمنظور مشاكل استنتاجية، والاستنتاج هو ما صُمم النموذج من أجله. هذا يكتشف التركيبات التي قد يفوتها تحليل البكسل.
-
اسأل عما يمكن أن يؤكد ذلك أو يدحضه
إن تحويل الشك إلى قائمة من الفحوصات يعد استخداماً جيداً للنموذج اللغوي، وغالباً ما تكون القائمة أفضل من تلك التي كنت ستكتبها.
-
ثم قم بتشغيل أداة كشف فعلية
بالنسبة لمسألة البكسل، استخدم شيئاً مصمماً لذلك، واقرأ النتيجة مقابل مقياس منشور.
لماذا تعد الطلاقة هي الخطر
أداة الكشف غير المتأكدة تُرجع رقماً متوسطاً، والرقم نفسه ينقل عدم اليقين. أما النموذج اللغوي غير المتأكد فيُرجع فقرة، والفقرات لا تحتوي على أشرطة خطأ.
يظهر نفس التفسير المنظم جيداً سواء كان النموذج قد حدد شيئاً حقيقياً أو أنتج رواية تبدو مقنعة عن لا شيء. يقوم القراء بمعايرة ثقتهم بناءً على جودة الكتابة، وهي بالضبط الإشارة التي لا تحمل أي معلومات هنا.
هذا هو السبب في أن سؤال روبوت الدردشة يعد نقطة انطلاق أسوأ من النظر إلى الصورة بنفسك. فعدم يقينك على الأقل يكون مرئياً لك.
نفس المشكلة في أدوات أخرى
هذا لا يتعلق حقاً بمنتج واحد. أي نظام يستنتج حول صورة دلالياً لديه نفس الفجوة، والعديد من الأدوات التي تُقدم الآن كأدوات كشف تفعل ذلك بالضبط من الداخل.
اختبار مفيد: اسأل عما ستُبلغ عنه الأداة في صورة لصورة، أو في صورة لا تحتوي على موضوع يمكن التعرف عليه على الإطلاق. أداة كشف البكسل تُرجع نتيجة في كلتا الحالتين، لأن النسيج موجود بغض النظر عن المحتوى. أما النظام الدلالي فليس لديه ما يستنتج عنه وإما أن يرفض أو يختلق شيئاً.
اختبار ثانٍ: قم بتشغيل نفس الملف مرتين. نموذج البكسل حتمي ويُرجع نفس الرقم. أما النموذج اللغوي فيأخذ عينات، وقد تختلف النتيجتان. إذا أعطتك أداة إجابات مختلفة لنفس البايتات، فهي لا تقيس شيئاً.
لا يتطلب أي من الاختبارين فهم كيفية عمل الأداة. يستغرق كل منهما دقيقة واحدة، وبينهما يفصلان القياس عن الوصف بشكل أكثر موثوقية من قراءة صفحة تسويقية.