← Tất cả hướng dẫn Độ chính xác

Tại sao các trình phát hiện AI lại đưa ra kết quả trái ngược nhau cho cùng một hình ảnh?

Chạy một bức hình qua bốn công cụ và nhận về bốn câu trả lời. Nguyên nhân mang tính cấu trúc, và việc nắm rõ chúng sẽ cho bạn biết nên tin tưởng kết quả nào.

· 7 phút đọc · Best AI Image Detector

Dữ liệu huấn luyện khác nhau, ranh giới quyết định khác nhau và định nghĩa khác nhau về thế nào là tính bằng AI. Hai công cụ có thể đọc một hình ảnh giống hệt nhau nhưng vẫn đưa ra các kết luận trái ngược.

Bốn lý do khiến kết quả khác nhau

Điểm số là kết quả cuối cùng của một chuỗi dài các lựa chọn. Thay đổi bất kỳ mắt xích nào là con số sẽ dịch chuyển, mặc dù không có gì thay đổi về hình ảnh.

  1. Dữ liệu huấn luyện khác nhau. Trình phát hiện nhận diện những gì nó từng thấy. Một công cụ được huấn luyện trên hàng ngàn trình tạo mở sẽ xử lý tốt các mô hình bất thường. Một công cụ được huấn luyện trên bốn công cụ thương mại lớn nhất sẽ xử lý bốn công cụ đó tốt hơn và xử lý mọi thứ khác kém hơn.
  2. Ranh giới quyết định khác nhau. Một công cụ gọi 60 là đáng ngờ, công cụ khác gọi 75 là đáng ngờ. Cùng một chỉ số vượt qua ngưỡng này nhưng lại không vượt qua ngưỡng kia, vì vậy bạn nhận được hai kết luận từ một phép đo.
  3. Định nghĩa khác nhau. Một số công cụ tính bất kỳ sự tham gia nào của việc tạo sinh, bao gồm việc nâng cấp độ phân giải hoặc tạo hình bằng AI. Số khác chỉ gắn cờ các khung hình hoàn toàn tổng hợp. Một bức chân dung đã qua chỉnh sửa là AI đối với bên thứ nhất và là thật đối với bên thứ hai.
  4. Tiền xử lý khác nhau. Các công cụ thay đổi kích thước, cắt xén và mã hóa lại trước khi chấm điểm. Một trình phát hiện đọc ô vuông 224 pixel ở trung tâm sẽ nhìn thấy bức tranh khác với trình phát hiện đọc 384 pixel của toàn bộ khung hình.
Cùng một bức ảnh, được chấm điểm theo bốn cách
Công cụ A, đường ranh giới ở 50
61
Công cụ B, đường ranh giới ở 65
58
Công cụ C, chỉ xét toàn khung hình
34
Công cụ D, tính mọi chỉnh sửa
88

Các số liệu minh họa cho thấy mức độ phân bố điển hình của một bức ảnh đã qua xử lý nặng nhưng là ảnh thật.

Một hình ảnh, bốn công cụ. Không có gì ở đây là sự cố: mỗi công cụ đang báo cáo theo thang đo của riêng nó.

Công cụ D không nhạy hơn các công cụ khác. Nó trả lời một câu hỏi rộng hơn. Nếu mối quan tâm của bạn là liệu một bức ảnh có được dàn dựng bởi trình tạo sinh hay không, công cụ D đang báo cáo quá mức. Nếu mối quan tâm của bạn là liệu có bất kỳ AI nào chạm vào tệp hay không, công cụ D là công cụ duy nhất trả lời bạn.

Hỏi xem mỗi công cụ trả lời câu hỏi nào

Ba câu hỏi mà mọi người thường ngầm hiểu khi hỏi "đây có phải là AI"
Câu hỏiYếu tố gắn cờỨng dụng điển hình
Khung hình này có được tạo ra từ hư không không?Kết cấu tổng hợp toàn khung hìnhTin tức, danh sách sàn thương mại, hồ sơ hẹn hò
Có bất kỳ phần nào trong này được chỉnh sửa bởi AI không?Một vùng nằm trên đường ranh giớiBảo hiểm, khiếu nại, xem xét bằng chứng
Có bất kỳ AI nào chạm vào tệp này hay không?Nâng cấp độ phân giải, khử nhiễu, tạo hình bằng AIThư viện ảnh stock, quy tắc cuộc thi

Hầu hết sự bất đồng giữa các công cụ thực chất là sự bất đồng về việc bạn đang hỏi câu hỏi nào trong ba câu hỏi này. Trước khi so sánh kết quả, hãy xác định câu hỏi nào quan trọng đối với bạn, sau đó đối chiếu kết quả của từng công cụ với câu hỏi đó.

Cách so sánh hai kết quả cho đúng

  1. Cung cấp cùng một tệp giống hệt cho cả hai công cụ

    Không phải tệp tải lại, không phải ảnh chụp màn hình, không phải bản sao đã đi qua ứng dụng trò chuyện. Các byte khác nhau tạo thành hình ảnh khác nhau và hiển nhiên sẽ có điểm số khác nhau.

  2. So sánh các khoảng điểm, không so sánh các con số

    Điểm 61 trên thang đo có đường ranh giới ở 50 và điểm 58 trên thang đo có đường ranh giới ở 65 tuy bất đồng về kết luận nhưng lại đồng tình về kết quả đọc.

  3. Tìm kiếm ngưỡng đã được công bố

    Một công cụ không chịu công bố vị trí đường ranh giới của nó thì không thể mang ra so sánh với bất cứ thứ gì. Hãy coi con số đó là không thể diễn giải thay vì coi là bằng chứng.

  4. Ưu tiên công cụ thể hiện rõ quá trình làm việc của nó

    Bản đồ vùng, khoảng điểm có tên và tiêu chuẩn được nêu rõ cho phép bạn kiểm tra lập luận. Một nhãn dán khẳng định chắc nịch nhưng không có cơ sở đằng sau thì không thể tin cậy.

  5. Cói sự đồng thuận là tín hiệu mạnh

    Hai công cụ độc lập cùng đạt đến một khoảng điểm có giá trị hơn nhiều so với việc chỉ dùng một công cụ đơn lẻ. Hai công cụ bất đồng ý kiến nghĩa là không chắc chắn, không phải là lấy điểm trung bình ở giữa.

Khi sự bất đồng chính là phát hiện

Có một mẫu hình rất đáng để học cách nhận biết. Một công cụ báo cáo điểm toàn khung hình thấp đi kèm với một công cụ báo cáo điểm cao thường có nghĩa là hình ảnh đó là một bức ảnh thật nhưng có chỉnh sửa cục bộ.

Công cụ thứ nhất tính trung bình phần chỉnh sửa trên một khung hình đa phần là thật. Công cụ thứ hai tập trung trọng số vào vùng mạnh nhất. Cả hai đều đúng về những gì chúng đo lường, và sự bất đồng đó đã cho bạn biết nhiều điều hơn là chỉ một con số đơn lẻ.

11 14 9 13 89 12 10 8 15

Một ô nằm trên đường ranh giới nằm bên trong một khung hình phần lớn là lạnh. Không có con số đơn lẻ nào nắm bắt được điều này.

Chế độ xem theo vùng giúp giải quyết tranh cãi. Điểm trung bình toàn khung hình của các ô này là 24, cho thấy đây là ảnh sạch; bản đồ sẽ cho thấy lý do tại sao nhận định đó lại đánh lạc hướng.

Điều gì sẽ khiến các trình phát hiện đồng quan điểm với nhau

Một tiêu chuẩn chung, các đường ranh giới được công bố và một định nghĩa thống nhất về việc thế nào được tính là sự tham gia của AI sẽ loại bỏ phần lớn sự khác biệt. Không có điều nào trong số đó tồn tại vào lúc này, và có rất ít áp lực thương mại để tạo ra chúng, bởi vì một công cụ công bố điểm yếu của mình trông sẽ kém hấp dẫn hơn công cụ không làm điều đó.

Cho đến khi điều đó thay đổi, hãy coi mọi điểm số đều xuất phát từ một thang đo riêng tư. Hãy đọc bằng chứng mà công cụ hiển thị cho bạn và đánh giá bằng chứng đó cao hơn mức độ tự tin của nhãn dán.

Vấn đề phiên bản mà không ai nhắc tới

Một trình phát hiện không phải là một thực thể cố định theo thời gian. Các nhà cung cấp liên tục đào tạo lại, điều chỉnh ngưỡng và thay đổi mô hình mà không cần thông báo, và hầu như không ai trong số họ đánh số phiên bản cho kết quả đầu ra của mình. Điểm số bạn nhận được vào tháng Ba và điểm số bạn nhận được hôm nay có thể đến từ các mô hình khác nhau với mức độ hiệu chuẩn khác nhau ở đằng sau.

Điều này rất quan trọng nếu bạn lưu trữ kết quả. Một hồ sơ khiếu nại, một nhật ký kiểm duyệt hoặc một vụ việc học thuật trích dẫn điểm số từ mười tám tháng trước là đang trích dẫn một phép đo có công cụ đo lường hiện không còn tồn tại. Không có cách nào để tái tạo lại kết quả đó và không có cách nào để kiểm tra ý nghĩa của nó tại thời điểm đó.

Khi lưu giữ kết quả, hãy lưu kèm theo cả bằng chứng: điểm số vùng, nhóm, đường ranh giới quyết định và ngày tháng. Những dữ liệu đó vẫn giữ được tính giải thích ngay cả khi mô hình tạo ra chúng đã lỗi thời, điều mà một con số phần trăm đơn thuần không làm được.

Các câu hỏi mọi người thường đặt ra

Nếu hai bộ phát hiện đưa ra kết quả trái ngược nhau, tôi nên tin bên nào?
Bên cho bạn thấy lý luận của họ. Đường ranh giới quyết định đã được công bố, một nhóm có tên và bản đồ vùng cho phép bạn kiểm tra xem kết quả đọc được có hợp lý đối với hình ảnh của mình hay không. Một con số phần trăm đơn thuần từ một công cụ không chịu giải thích ý nghĩa của nó thì không phải là bằng chứng, dù cho nó có vẻ chắc chắn đến đâu.
Việc chạy nhiều bộ phát hiện hơn có mang lại câu trả lời tốt hơn không?
Chỉ khi bạn quyết định trước cách cân nhắc chúng. Ba công cụ đồng thuận thực sự mạnh mẽ hơn một. Sáu công cụ với hai công cụ đồng tình với bạn là cách mọi người tự thuyết phục bản thân đi đến một kết luận mà họ đã đạt được từ trước.
Tại sao một công cụ gọi bức ảnh đã chỉnh sửa của tôi là AI trong khi công cụ khác lại gọi nó là thật?
Chúng đang trả lời các câu hỏi khác nhau. Một công cụ đếm bất kỳ sự can thiệp tạo sinh nào sẽ gắn cờ cho thao tác tô màu tạo sinh (generative fill) hoặc nâng cấp độ phân giải. Một công cụ chỉ tìm kiếm các khung hình hoàn toàn tổng hợp thì không. Không bên nào sai; hãy kiểm tra xem mỗi bên đang sử dụng định nghĩa nào.
Liệu hai bộ phát hiện có thể đều đúng không?
Có, và điều đó rất phổ biến. Các ngưỡng khác nhau đồng nghĩa với việc cùng một phép đo tạo ra các kết quả khác nhau, và các tập dữ liệu huấn luyện khác nhau đồng nghĩa với việc các kết quả đọc thực sự khác nhau đối với một hình ảnh bất thường. Sự đồng thuận trong nhóm mới là điều quan trọng, chứ không phải sự đồng thuận trong các con số.