สิ่งที่แชทบอทกำลังทำอยู่จริงๆ
โมเดลภาษาหลายรูปแบบจะแปลงภาพเป็นคำอธิบายเชิงความหมายแล้วใช้เหตุผลเกี่ยวกับคำอธิบายนั้นเป็นข้อความ มันกำลังตอบคำถามว่าภาพนี้ดูเหมือนภาพ AI ที่ฉันเคยอ่านเจอในระหว่างการฝึกฝนหรือไม่
นั่นเป็นคำถามเกี่ยวกับเนื้อหาและองค์ประกอบ การตรวจจับเป็นคำถามเกี่ยวกับพื้นผิวว่าค่าพิกเซลข้างเคียงมีความสัมพันธ์กันอย่างไร ในระดับที่เล็กเกินกว่าที่คำอธิบายเชิงความหมายใดๆ จะรักษาไว้ได้
ข้อมูลที่ตัวตรวจจับอ่านถูกทิ้งไปก่อนที่โมเดลภาษาจะเริ่มคิด ไม่ใช่ว่าแชทบอทไม่เก่งในเรื่องนี้ แต่พวกมันทำงานจากข้อมูลที่ไม่มีหลักฐานเหลืออยู่เลย
สิ่งที่เกิดขึ้นในทางปฏิบัติ
- คำตอบที่มั่นใจโดยไม่มีเกณฑ์ตัดสิน แชทบอทจะบอกว่าน่าจะเป็นภาพจาก AI โดยไม่มีมาตรวัดรองรับคำว่าน่าจะ ไม่มีตัวเลข ไม่มีช่วงคะแนน และไม่มีอะไรให้เปรียบเทียบกับภาพอื่น
- การใช้เหตุผลจากข้อมูลเก่า โมเดลจะยกเรื่องนิ้ว ฟัน ผิวหนังที่ดูเหมือนแว็กซ์ และข้อความที่บิดเบี้ยว มาอ้างอิง เพราะนั่นคือสิ่งที่ข้อมูลที่ใช้ฝึกฝนบอกให้มองหา สิ่งเหล่านั้นได้รับการแก้ไขไปหลายปีแล้ว
- เห็นด้วยกับทิศทางที่คุณถาม หากถามว่าภาพนั้นปลอมหรือไม่ คุณมีแนวโน้มที่จะได้ยินคำว่าใช่ มากกว่าถ้าคุณถามด้วยความเป็นกลาง นั่นเป็นคุณสมบัติของอินเทอร์เฟซ ไม่ใช่คุณสมบัติของภาพ
- ไม่มีความน่าเชื่อถือในการทำซ้ำ ถามสองครั้งคุณอาจได้รับคำตอบที่ต่างกันสำหรับไฟล์เดียวกัน พร้อมคำอธิบายที่มั่นใจพอๆ กันในแต่ละครั้ง
- ไม่มีข้อมูลระดับภูมิภาค มันบอกไม่ได้ว่ามุมหนึ่งของภาพมีพฤติกรรมต่างจากส่วนอื่น ซึ่งนั่นคือสิ่งที่สำคัญจริงๆ
| ความสามารถ | แชทบอท | ตัวตรวจจับพิกเซล |
|---|---|---|
| อ่านพื้นผิวระดับพิกเซล | No | Yes |
| คะแนนที่ปรับเทียบแล้วพร้อมช่วงมาตรฐานที่เผยแพร่ | No | Yes |
| คำตอบเดิมทุกครั้ง | No | Yes |
| การวิเคราะห์ระดับภูมิภาค | No | Yes |
| วัดผลเทียบกับมาตรฐานอ้างอิง | No | Yes |
| อธิบายเหตุผลด้วยร้อยแก้ว | Yes อย่างลื่นไหล | Partly เป็นสัญญาณ |
| อธิบายสิ่งที่อยู่ในภาพ | Yes | No |
ข้อมูลสองบรรทัดสุดท้ายคือส่วนที่ควรเก็บไว้ โมเดลภาษาเก่งจริงในการอธิบายภาพและให้เหตุผลว่าฉากนั้นสมเหตุสมผลหรือไม่ ซึ่งสิ่งเหล่านี้มีประโยชน์แต่ไม่ใช่การตรวจจับ
จุดที่แชทบอทมีประโยชน์อย่างแท้จริง
การเลิกใช้เครื่องมือนี้ไปเลยจะเป็นบทเรียนที่ผิด หากใช้ในสิ่งที่เครื่องมือทำได้ มันจะช่วยเสริมการทำงานของเครื่องมือตรวจจับแทนที่จะมาแทนที่
-
ขอให้มันอธิบายฉากนั้นโดยละเอียด
คำบรรยายที่ละเอียดมักเผยให้เห็นสิ่งที่คุณอาจมองข้ามไป รวมถึงวัตถุที่ไม่ควรอยู่ด้วยกัน หรือป้ายที่คุณยังไม่ได้อ่าน
-
ถามว่าฉากนั้นมีความสมจริงทางกายภาพหรือไม่
เงา การสะท้อน สัดส่วน และมุมมองเป็นปัญหาด้านการให้เหตุผล และการให้เหตุผลคือสิ่งที่โมเดลนี้มีไว้เพื่อการนี้ ซึ่งสิ่งนี้ช่วยตรวจจับภาพตัดต่อที่การวิเคราะห์พิกเซลอาจมองข้ามไปได้
-
ถามว่าสิ่งใดที่จะยืนยันหรือหักล้างข้อสงสัยได้
การเปลี่ยนความสงสัยให้เป็นรายการตรวจสอบคือการใช้โมเดลภาษาที่ดี และรายการที่ได้มักจะดีกว่าสิ่งที่คุณเขียนเอง
-
จากนั้นจึงใช้เครื่องมือตรวจจับจริงๆ
สำหรับคำถามเกี่ยวกับพิกเซล ให้ใช้เครื่องมือที่สร้างมาเพื่อการนี้โดยเฉพาะ และอ่านคะแนนเทียบกับมาตราส่วนที่เผยแพร่ไว้
ทำไมความลื่นไหลของภาษาถึงเป็นอันตราย
เครื่องมือตรวจจับที่ไม่แน่ใจจะให้คะแนนระดับกลาง ซึ่งตัวเลขนั้นสื่อถึงความไม่แน่นอน แต่แชทบอทที่ไม่แน่ใจจะตอบกลับมาเป็นย่อหน้า และย่อหน้าไม่มีค่าความคลาดเคลื่อนให้เห็น
คำอธิบายที่มีโครงสร้างดีแบบเดียวกันจะปรากฏขึ้นไม่ว่าโมเดลจะระบุสิ่งที่เกิดขึ้นจริงได้หรือสร้างคำอธิบายที่ฟังดูสมเหตุสมผลขึ้นมาเอง ผู้อ่านมักตัดสินความน่าเชื่อถือจากคุณภาพการเขียน ซึ่งนั่นคือสัญญาณที่ไม่มีข้อมูลจริงในกรณีนี้
นี่คือเหตุผลว่าทำไมการถามแชทบอทถึงเป็นจุดเริ่มต้นที่แย่กว่าการดูภาพด้วยตัวเอง ความไม่มั่นใจของคุณเองอย่างน้อยคุณก็ยังมองเห็นได้
ปัญหาเดียวกันในเครื่องมืออื่นๆ
นี่ไม่ใช่เรื่องของผลิตภัณฑ์ตัวใดตัวหนึ่ง ระบบใดก็ตามที่ให้เหตุผลเกี่ยวกับภาพในเชิงความหมายย่อมมีช่องว่างแบบเดียวกัน และเครื่องมือหลายตัวที่นำเสนอว่าเป็นเครื่องมือตรวจจับในปัจจุบันก็กำลังทำแบบนั้นอยู่เบื้องหลัง
การทดสอบที่มีประโยชน์: ลองถามว่าเครื่องมือจะรายงานอย่างไรหากเป็นภาพถ่ายของภาพถ่าย หรือภาพที่ไม่มีวัตถุที่จดจำได้เลย เครื่องมือตรวจจับพิกเซลจะให้คะแนนออกมาเสมอเพราะพื้นผิวมีอยู่ไม่ว่าจะเนื้อหาเป็นอย่างไร แต่ระบบเชิงความหมายจะไม่มีอะไรให้ใช้เหตุผลและจะปฏิเสธหรือไม่ก็คิดเรื่องขึ้นมาใหม่
การทดสอบครั้งที่สอง: รันไฟล์เดิมสองครั้ง โมเดลพิกเซลเป็นระบบที่กำหนดแน่นอนและจะให้ตัวเลขเดิม แต่โมเดลภาษาใช้วิธีการสุ่มตัวอย่าง การรันสองครั้งอาจให้ผลต่างกัน หากเครื่องมือให้คำตอบต่างกันสำหรับข้อมูลชุดเดียวกัน แสดงว่ามันไม่ได้วัดค่าอะไรเลย
การทดสอบทั้งสองอย่างไม่จำเป็นต้องเข้าใจกลไกการทำงานของเครื่องมือ ทั้งคู่ใช้เวลาเพียงหนึ่งนาที และช่วยแยกการวัดค่าออกจากคำอธิบายได้น่าเชื่อถือกว่าการอ่านหน้าการตลาด