เหตุผลสี่ประการที่ผลลัพธ์แตกต่างกัน
คะแนนคือผลลัพธ์ปลายทางของตัวเลือกที่ยาวเหยียด เปลี่ยนลิงก์ใดๆ แล้วตัวเลขจะเปลี่ยน แม้ว่าภาพจะไม่มีอะไรเปลี่ยนเลยก็ตาม
- ข้อมูลการฝึกที่ต่างกัน เครื่องตรวจจับจดจำสิ่งที่เคยเห็น เครื่องมือที่ฝึกด้วยเครื่องสร้างภาพแบบเปิดนับพันจะจัดการกับโมเดลที่ไม่คุ้นเคยได้ดี เครื่องมือที่ฝึกด้วยเครื่องมือเชิงพาณิชย์ขนาดใหญ่สี่แห่งจะจัดการกับสี่เครื่องมือนั้นได้ดีกว่าและจัดการอย่างอื่นได้แย่กว่า
- เส้นการตัดสินที่ต่างกัน เครื่องมือหนึ่งให้คะแนน 60 ว่าน่าสงสัย อีกเครื่องให้คะแนน 75 ว่าน่าสงสัย การอ่านค่าเดียวกันข้ามเส้นขอบหนึ่งแต่ไม่ข้ามอีกเส้น คุณจึงได้สองคำตัดสินจากการวัดครั้งเดียว
- นิยามที่ต่างกัน บางเครื่องมือนับการมีส่วนร่วมของการสร้างภาพทุกรูปแบบ รวมถึงการขยายขนาดหรือการเติมด้วย AI อื่นๆ จะระบุเฉพาะเฟรมที่สังเคราะห์ขึ้นทั้งหมดเท่านั้น ภาพถ่ายบุคคลที่รีทัชอาจเป็น AI สำหรับเครื่องมือแรกและเป็นของจริงสำหรับเครื่องมือที่สอง
- การประมวลผลล่วงหน้าที่ต่างกัน เครื่องมือปรับขนาด ครอบตัด และเข้ารหัสใหม่ก่อนให้คะแนน เครื่องตรวจจับที่อ่านช่องสี่เหลี่ยมขนาด 224 พิกเซลตรงกลางจะเห็นภาพที่ต่างจากเครื่องที่อ่าน 384 พิกเซลของทั้งเฟรม
เครื่องมือ D ไม่ได้มีความละเอียดอ่อนมากกว่าเครื่องมืออื่น แต่ตอบคำถามที่กว้างกว่า หากความกังวลของคุณคือภาพถ่ายถูกสร้างขึ้นโดยเครื่องสร้างภาพหรือไม่ D กำลังรายงานเกินจริง หากความกังวลของคุณคือมี AI แตะต้องไฟล์หรือไม่ D คือเครื่องเดียวที่ตอบคำถามคุณ
ถามว่าแต่ละเครื่องมือตอบคำถามอะไร
| คำถาม | สิ่งที่ระบุว่าเป็น AI | การใช้งานทั่วไป |
|---|---|---|
| เฟรมนี้สร้างขึ้นจากความว่างเปล่าหรือไม่? | พื้นผิวสังเคราะห์ทั้งเฟรม | ข่าว, รายการขายสินค้า, โปรไฟล์หาคู่ |
| ส่วนใดส่วนหนึ่งของภาพนี้ถูกแก้ไขโดย AI หรือไม่? | หนึ่งภูมิภาคที่อยู่เหนือเส้นตัดสิน | การประกันภัย, การเคลม, การตรวจสอบหลักฐาน |
| มี AI แตะต้องไฟล์นี้เลยหรือไม่? | การขยายขนาด, การลดสัญญาณรบกวน, การเติมด้วย AI | คลังภาพสต็อก, กฎการแข่งขัน |
ความเห็นต่างส่วนใหญ่ระหว่างเครื่องมือคือความเห็นต่างว่าคุณถามคำถามข้อใดในสามข้อนี้ ก่อนเปรียบเทียบผลลัพธ์ ให้ตัดสินใจว่าคำถามใดสำคัญต่อคุณ แล้วอ่านผลลัพธ์ของแต่ละเครื่องมือเทียบกับคำถามนั้น
วิธีการเปรียบเทียบสองผลลัพธ์อย่างถูกต้อง
-
ป้อนไฟล์เดียวกันให้เครื่องมือทั้งสอง
ไม่ใช่การดาวน์โหลดใหม่ ไม่ใช่ภาพหน้าจอ ไม่ใช่สำเนาที่ผ่านแอปแชท ไบต์ที่ต่างกันคือภาพที่ต่างกันและจะให้คะแนนที่ต่างกันอย่างถูกต้องตามหลักการ
-
เปรียบเทียบแถบระดับ ไม่ใช่ตัวเลข
คะแนน 61 บนมาตรวัดที่มีเส้นที่ 50 และ 58 บนมาตรวัดที่มีเส้นที่ 65 มีความเห็นต่างกันในแง่คำตัดสิน แต่เห็นพ้องกันในการอ่านค่า
-
มองหาเกณฑ์มาตรฐานที่เผยแพร่
เครื่องมือที่ไม่ระบุว่าเส้นตัดสินอยู่ที่ใดไม่สามารถนำไปเปรียบเทียบกับสิ่งใดได้ ให้ถือว่าตัวเลขนั้นไม่สามารถตีความได้แทนที่จะถือว่าเป็นหลักฐาน
-
เลือกใช้เครื่องมือที่แสดงวิธีการทำงาน
แผนที่ภูมิภาค แถบระดับที่ระบุชื่อ และเกณฑ์มาตรฐานที่ระบุไว้ช่วยให้คุณตรวจสอบเหตุผลได้ ป้ายชื่อที่มั่นใจแต่ไม่มีอะไรสนับสนุนนั้นใช้ไม่ได้
-
ถือว่าความเห็นพ้องกันเป็นสัญญาณที่แข็งแกร่ง
สองเครื่องมืออิสระที่ให้ผลในแถบเดียวกันมีค่ายิ่งกว่าเครื่องมือใดเครื่องมือหนึ่งเพียงลำพัง สองเครื่องมือที่เห็นต่างกันหมายถึงความไม่แน่นอน ไม่ใช่การหาค่าเฉลี่ยตรงกลาง
เมื่อความเห็นต่างคือสิ่งที่ค้นพบ
มีรูปแบบหนึ่งที่คุ้มค่าแก่การเรียนรู้ เครื่องมือที่รายงานคะแนนทั้งเฟรมต่ำควบคู่ไปกับเครื่องที่รายงานคะแนนสูง มักหมายความว่าภาพนั้นเป็นภาพถ่ายจริงที่มีการแก้ไขเฉพาะจุด
เครื่องมือแรกกำลังหาค่าเฉลี่ยของการแก้ไขออกไปทั่วทั้งเฟรมที่ค่อนข้างเป็นของจริง เครื่องที่สองกำลังให้น้ำหนักกับภูมิภาคที่รุนแรงที่สุด ทั้งสองถูกต้องในสิ่งที่ตนวัด และความเห็นต่างนั้นได้บอกอะไรคุณมากกว่าตัวเลขใดๆ
หนึ่งไทล์เหนือเส้นตัดสินภายในเฟรมที่เย็น ไม่มีตัวเลขใดที่สามารถสรุปสิ่งนี้ได้
อะไรที่จะทำให้เครื่องตรวจจับเห็นพ้องกัน
เกณฑ์มาตรฐานร่วม เส้นการตัดสินที่เผยแพร่ และนิยามที่ตกลงกันว่าอะไรนับเป็นการมีส่วนร่วมของ AI จะช่วยขจัดความแตกต่างส่วนใหญ่ได้ สิ่งเหล่านั้นยังไม่มีอยู่จริง และมีแรงกดดันทางการค้าเพียงเล็กน้อยที่จะสร้างมันขึ้น เพราะเครื่องมือที่เผยแพร่จุดอ่อนของตนดูแย่กว่าเครื่องมือที่ไม่ทำเช่นนั้น
จนกว่าสิ่งนั้นจะเปลี่ยน ให้ถือว่าคะแนนทุกคะแนนมาจากมาตรวัดส่วนตัว ให้อ่านหลักฐานที่เครื่องมือแสดงให้คุณเห็นและให้น้ำหนักกับสิ่งนั้นมากกว่าความมั่นใจในป้ายชื่อ
ปัญหาเวอร์ชันที่ไม่มีใครกล่าวถึง
เครื่องตรวจจับไม่ใช่สิ่งเดียวที่คงที่ตลอดเวลา ผู้ขายทำการฝึกใหม่ ปรับเกณฑ์ และเปลี่ยนโมเดลโดยไม่มีการประกาศ และแทบไม่มีใครระบุเวอร์ชันของเอาต์พุต คะแนนที่คุณได้รับในเดือนมีนาคมและคะแนนที่คุณได้รับในวันนี้อาจมาจากโมเดลที่ต่างกันพร้อมการปรับเทียบที่ต่างกันเบื้องหลัง
เรื่องนี้สำคัญหากคุณบันทึกผลลัพธ์ ไฟล์การเคลม บันทึกการตรวจสอบ หรือกรณีทางวิชาการที่อ้างอิงคะแนนจากเมื่อสิบแปดเดือนที่แล้ว กำลังอ้างอิงการวัดที่เครื่องมือวัดนั้นไม่มีอยู่แล้ว ไม่มีทางที่จะทำซ้ำได้และไม่มีทางตรวจสอบได้ว่ามันหมายถึงอะไรในขณะนั้น
เมื่อคุณเก็บผลลัพธ์ไว้ ให้เก็บหลักฐานเหล่านี้ไว้ด้วย: คะแนนรายส่วน (region scores), แถบระดับ (band), เส้นเกณฑ์ตัดสิน (decision line) และวันที่ ข้อมูลเหล่านี้ยังคงตีความได้แม้ว่าโมเดลเบื้องหลังจะได้รับการอัปเดตไปแล้ว ซึ่งต่างจากเปอร์เซ็นต์เพียงอย่างเดียวที่ไม่สามารถทำได้