Bốn lý do khiến kết quả khác nhau
Điểm số là kết quả cuối cùng của một chuỗi dài các lựa chọn. Thay đổi bất kỳ mắt xích nào là con số sẽ dịch chuyển, mặc dù không có gì thay đổi về hình ảnh.
- Dữ liệu huấn luyện khác nhau. Trình phát hiện nhận diện những gì nó từng thấy. Một công cụ được huấn luyện trên hàng ngàn trình tạo mở sẽ xử lý tốt các mô hình bất thường. Một công cụ được huấn luyện trên bốn công cụ thương mại lớn nhất sẽ xử lý bốn công cụ đó tốt hơn và xử lý mọi thứ khác kém hơn.
- Ranh giới quyết định khác nhau. Một công cụ gọi 60 là đáng ngờ, công cụ khác gọi 75 là đáng ngờ. Cùng một chỉ số vượt qua ngưỡng này nhưng lại không vượt qua ngưỡng kia, vì vậy bạn nhận được hai kết luận từ một phép đo.
- Định nghĩa khác nhau. Một số công cụ tính bất kỳ sự tham gia nào của việc tạo sinh, bao gồm việc nâng cấp độ phân giải hoặc tạo hình bằng AI. Số khác chỉ gắn cờ các khung hình hoàn toàn tổng hợp. Một bức chân dung đã qua chỉnh sửa là AI đối với bên thứ nhất và là thật đối với bên thứ hai.
- Tiền xử lý khác nhau. Các công cụ thay đổi kích thước, cắt xén và mã hóa lại trước khi chấm điểm. Một trình phát hiện đọc ô vuông 224 pixel ở trung tâm sẽ nhìn thấy bức tranh khác với trình phát hiện đọc 384 pixel của toàn bộ khung hình.
Công cụ D không nhạy hơn các công cụ khác. Nó trả lời một câu hỏi rộng hơn. Nếu mối quan tâm của bạn là liệu một bức ảnh có được dàn dựng bởi trình tạo sinh hay không, công cụ D đang báo cáo quá mức. Nếu mối quan tâm của bạn là liệu có bất kỳ AI nào chạm vào tệp hay không, công cụ D là công cụ duy nhất trả lời bạn.
Hỏi xem mỗi công cụ trả lời câu hỏi nào
| Câu hỏi | Yếu tố gắn cờ | Ứng dụng điển hình |
|---|---|---|
| Khung hình này có được tạo ra từ hư không không? | Kết cấu tổng hợp toàn khung hình | Tin tức, danh sách sàn thương mại, hồ sơ hẹn hò |
| Có bất kỳ phần nào trong này được chỉnh sửa bởi AI không? | Một vùng nằm trên đường ranh giới | Bảo hiểm, khiếu nại, xem xét bằng chứng |
| Có bất kỳ AI nào chạm vào tệp này hay không? | Nâng cấp độ phân giải, khử nhiễu, tạo hình bằng AI | Thư viện ảnh stock, quy tắc cuộc thi |
Hầu hết sự bất đồng giữa các công cụ thực chất là sự bất đồng về việc bạn đang hỏi câu hỏi nào trong ba câu hỏi này. Trước khi so sánh kết quả, hãy xác định câu hỏi nào quan trọng đối với bạn, sau đó đối chiếu kết quả của từng công cụ với câu hỏi đó.
Cách so sánh hai kết quả cho đúng
-
Cung cấp cùng một tệp giống hệt cho cả hai công cụ
Không phải tệp tải lại, không phải ảnh chụp màn hình, không phải bản sao đã đi qua ứng dụng trò chuyện. Các byte khác nhau tạo thành hình ảnh khác nhau và hiển nhiên sẽ có điểm số khác nhau.
-
So sánh các khoảng điểm, không so sánh các con số
Điểm 61 trên thang đo có đường ranh giới ở 50 và điểm 58 trên thang đo có đường ranh giới ở 65 tuy bất đồng về kết luận nhưng lại đồng tình về kết quả đọc.
-
Tìm kiếm ngưỡng đã được công bố
Một công cụ không chịu công bố vị trí đường ranh giới của nó thì không thể mang ra so sánh với bất cứ thứ gì. Hãy coi con số đó là không thể diễn giải thay vì coi là bằng chứng.
-
Ưu tiên công cụ thể hiện rõ quá trình làm việc của nó
Bản đồ vùng, khoảng điểm có tên và tiêu chuẩn được nêu rõ cho phép bạn kiểm tra lập luận. Một nhãn dán khẳng định chắc nịch nhưng không có cơ sở đằng sau thì không thể tin cậy.
-
Cói sự đồng thuận là tín hiệu mạnh
Hai công cụ độc lập cùng đạt đến một khoảng điểm có giá trị hơn nhiều so với việc chỉ dùng một công cụ đơn lẻ. Hai công cụ bất đồng ý kiến nghĩa là không chắc chắn, không phải là lấy điểm trung bình ở giữa.
Khi sự bất đồng chính là phát hiện
Có một mẫu hình rất đáng để học cách nhận biết. Một công cụ báo cáo điểm toàn khung hình thấp đi kèm với một công cụ báo cáo điểm cao thường có nghĩa là hình ảnh đó là một bức ảnh thật nhưng có chỉnh sửa cục bộ.
Công cụ thứ nhất tính trung bình phần chỉnh sửa trên một khung hình đa phần là thật. Công cụ thứ hai tập trung trọng số vào vùng mạnh nhất. Cả hai đều đúng về những gì chúng đo lường, và sự bất đồng đó đã cho bạn biết nhiều điều hơn là chỉ một con số đơn lẻ.
Một ô nằm trên đường ranh giới nằm bên trong một khung hình phần lớn là lạnh. Không có con số đơn lẻ nào nắm bắt được điều này.
Điều gì sẽ khiến các trình phát hiện đồng quan điểm với nhau
Một tiêu chuẩn chung, các đường ranh giới được công bố và một định nghĩa thống nhất về việc thế nào được tính là sự tham gia của AI sẽ loại bỏ phần lớn sự khác biệt. Không có điều nào trong số đó tồn tại vào lúc này, và có rất ít áp lực thương mại để tạo ra chúng, bởi vì một công cụ công bố điểm yếu của mình trông sẽ kém hấp dẫn hơn công cụ không làm điều đó.
Cho đến khi điều đó thay đổi, hãy coi mọi điểm số đều xuất phát từ một thang đo riêng tư. Hãy đọc bằng chứng mà công cụ hiển thị cho bạn và đánh giá bằng chứng đó cao hơn mức độ tự tin của nhãn dán.
Vấn đề phiên bản mà không ai nhắc tới
Một trình phát hiện không phải là một thực thể cố định theo thời gian. Các nhà cung cấp liên tục đào tạo lại, điều chỉnh ngưỡng và thay đổi mô hình mà không cần thông báo, và hầu như không ai trong số họ đánh số phiên bản cho kết quả đầu ra của mình. Điểm số bạn nhận được vào tháng Ba và điểm số bạn nhận được hôm nay có thể đến từ các mô hình khác nhau với mức độ hiệu chuẩn khác nhau ở đằng sau.
Điều này rất quan trọng nếu bạn lưu trữ kết quả. Một hồ sơ khiếu nại, một nhật ký kiểm duyệt hoặc một vụ việc học thuật trích dẫn điểm số từ mười tám tháng trước là đang trích dẫn một phép đo có công cụ đo lường hiện không còn tồn tại. Không có cách nào để tái tạo lại kết quả đó và không có cách nào để kiểm tra ý nghĩa của nó tại thời điểm đó.
Khi lưu giữ kết quả, hãy lưu kèm theo cả bằng chứng: điểm số vùng, nhóm, đường ranh giới quyết định và ngày tháng. Những dữ liệu đó vẫn giữ được tính giải thích ngay cả khi mô hình tạo ra chúng đã lỗi thời, điều mà một con số phần trăm đơn thuần không làm được.