← Tất cả hướng dẫn So sánh

ChatGPT có thể phân biệt hình ảnh do AI tạo ra hay không?

Nó sẽ đưa ra cho bạn một câu trả lời đầy tự tin mà không có cơ sở nào đằng sau cả. Lý do tại sao các mô hình ngôn ngữ không thể làm được điều này, những gì chúng thực sự đang làm, và nên sử dụng cái gì thay thế.

· 7 phút đọc · Best AI Image Detector

Không. Mô hình ngôn ngữ mô tả hình ảnh trông như thế nào và lập luận về nó bằng từ ngữ. Nó không có ngưỡng được hiệu chuẩn, không có điểm chuẩn và không có quyền truy cập vào các thống kê pixel mà quá trình phát hiện phụ thuộc vào.

Những gì một chatbot thực sự đang làm

Một mô hình ngôn ngữ đa phương thức chuyển đổi hình ảnh thành mô tả ngữ nghĩa và sau đó lập luận về mô tả đó bằng văn bản. Nó đang trả lời câu hỏi liệu bức ảnh này có giống với những hình ảnh AI mà tôi đã đọc trong quá trình huấn luyện hay không.

Đó là câu hỏi về nội dung và bố cục. Quá trình phát hiện là câu hỏi về kết cấu: các giá trị pixel lân cận có mối liên hệ như thế nào với nhau, ở tỷ lệ nhỏ hơn rất nhiều so với bất kỳ thứ gì mà mô tả ngữ nghĩa bảo tồn.

Thông tin mà bộ phát hiện đọc được sẽ bị loại bỏ trước khi mô hình ngôn ngữ bắt đầu suy luận. Không phải là các chatbot kém trong việc này. Chúng đang làm việc dựa trên một bản thể không chứa bằng chứng.

Điều đó tạo ra những gì trong thực tế

  • Các câu trả lời tự tin nhưng không có ngưỡng xác định. Chatbot sẽ nói có khả năng do AI tạo ra mà không có bất kỳ thang đo nào đằng sau từ có khả năng. Không có con số, không có dải điểm và không có gì để so sánh với một hình ảnh khác.
  • Lập luận từ các dấu hiệu cũ. Các mô hình viện dẫn ngón tay, răng, làn da bóng nhựa và văn bản bị biến dạng, bởi vì đó là những gì văn bản huấn luyện bảo phải tìm kiếm. Những điều đó đã được khắc phục từ nhiều năm trước.
  • Sự đồng tình với cách đặt vấn đề của bạn. Hãy hỏi xem một hình ảnh có phải là ảnh giả hay không và bạn sẽ có nhiều khả năng nghe thấy câu trả lời là có hơn là khi bạn hỏi một cách trung lập. Đó là đặc tính của giao diện, chứ không phải của bức ảnh.
  • Không thể tái tạo lại kết quả. Hãy hỏi hai lần và bạn có thể nhận được hai câu trả lời khác nhau về cùng một tệp, với những lời giải thích tự tin không kém cho mỗi lần.
  • Không có thông tin về vùng. Nó không thể cho bạn biết rằng một góc của bức ảnh có hành vi khác với phần còn lại, đó là phát hiện thường có ý nghĩa quan trọng.
Khả năng Chatbot Bộ phát hiện pixel
Đọc kết cấu cấp độ pixel No Yes
Điểm số được hiệu chuẩn với các dải đã công bố No Yes
Cùng một câu trả lời mọi lúc No Yes
Phân tích chi tiết theo cấp độ vùng No Yes
Được đo lường dựa trên điểm chuẩn No Yes
Giải thích lập luận của nó bằng văn bản Yes một cách trôi chảy Partly dưới dạng các tín hiệu
Mô tả nội dung có trong bức ảnh Yes No
Những gì mỗi cách tiếp cận thực sự có thể tạo ra. Cột ở giữa là cột mà mọi người nhầm lẫn là cột bên phải.

Hai hàng cuối cùng là những hàng đáng giữ lại. Một mô hình ngôn ngữ thực sự giỏi trong việc mô tả một hình ảnh và suy luận xem một khung cảnh có hợp lý hay không. Những điều đó rất hữu ích và chúng không phải là việc phát hiện.

Nơi chatbot thực sự hữu ích

Việc loại bỏ hoàn toàn công cụ này sẽ là một bài học sai lầm. Được sử dụng đúng với khả năng của nó, nó bổ sung cho trình phát hiện hơn là thay thế nó.

  1. Yêu cầu mô tả chi tiết khung cảnh

    Một mô tả cẩn thận thường làm nổi bật những điều bạn không ý thức được, bao gồm các đối tượng không thuộc về nhau hoặc các biển báo mà bạn chưa đọc.

  2. Hỏi xem khung cảnh có tính nhất quán về mặt vật lý hay không

    Bóng đổ, phản chiếu, tỷ lệ và phối cảnh là những vấn đề suy luận, và suy luận chính là mục đích của mô hình. Điều này bắt được các bức ảnh ghép mà phân tích điểm ảnh có thể bỏ sót.

  3. Hỏi điều gì sẽ xác nhận hoặc bác bỏ nó

    Biến một sự nghi ngờ thành một danh sách các điểm cần kiểm tra là một cách sử dụng tốt của mô hình ngôn ngữ, và danh sách này thường tốt hơn danh sách bạn tự viết.

  4. Sau đó chạy một trình phát hiện thực tế

    Đối với câu hỏi về điểm ảnh, hãy sử dụng thứ gì đó được xây dựng riêng cho nó và đọc điểm số so với thang đo đã công bố.

Lý do sự trôi chảy là mối nguy hiểm

Một trình phát hiện không chắc chắn sẽ trả về một con số ở mức trung bình, và bản thân con số đó truyền đạt sự không chắc chắn. Một mô hình ngôn ngữ không chắc chắn sẽ trả về một đoạn văn, và các đoạn văn thì không có thanh sai số.

Cùng một lời giải thích có cấu trúc tốt xuất hiện bất kể mô hình đã xác định được điều gì thực sự hay tạo ra một lời tường thuật nghe có vẻ hợp lý về hư không. Người đọc hiệu chuẩn niềm tin của họ dựa trên chất lượng của bài viết, chính xác là tín hiệu không mang thông tin nào ở đây.

Đây là lý do tại sao việc hỏi một chatbot là một điểm khởi đầu tồi tệ hơn so với việc tự mình nhìn vào bức ảnh. Sự không chắc chắn của chính bạn ít nhất vẫn hiển thị đối với bạn.

Vấn đề tương tự ở các công cụ khác

Điều này không thực sự chỉ về một sản phẩm. Bất kỳ hệ thống nào suy luận về một hình ảnh theo ngữ nghĩa đều có khoảng trống tương tự, và một số công cụ hiện nay được giới thiệu là trình phát hiện thực sự đang làm chính điều đó ở bên dưới.

Một thử nghiệm hữu ích: hỏi xem công cụ này sẽ báo cáo gì về một bức ảnh chụp lại một bức ảnh, hoặc về một hình ảnh không có chủ thể dễ nhận biết nào cả. Một trình phát hiện điểm ảnh trả về điểm số trong mọi trường hợp, bởi vì kết cấu tồn tại bất kể nội dung. Một hệ thống ngữ nghĩa không có gì để suy luận và sẽ từ chối hoặc bịa ra thứ gì đó.

Một thử nghiệm thứ hai: chạy cùng một tệp hai lần. Một mô hình điểm ảnh mang tính tất định và trả về cùng một con số. Một mô hình ngôn ngữ lấy mẫu, và hai lần chạy có thể không khớp nhau. Nếu một công cụ cung cấp cho bạn các câu trả lời khác nhau cho cùng một chuỗi byte, nó không đo lường bất cứ điều gì.

Không thử nghiệm nào yêu cầu phải hiểu cách công cụ hoạt động. Cả hai đều mất một phút, và chúng tách biệt việc đo lường khỏi mô tả một cách đáng tin cậy hơn là đọc một trang tiếp thị.

Các câu hỏi mọi người thường đặt ra

ChatGPT có thể phát hiện hình ảnh do AI tạo ra không?
Không, không theo bất kỳ nghĩa có thể đo lường nào. Nó tạo ra một đánh giá nghe có vẻ tự tin dựa trên những gì hình ảnh mô tả hơn là cách các điểm ảnh được tạo ra. Không có ngưỡng được hiệu chuẩn đằng sau câu trả lời, không có điểm chuẩn và việc hỏi hai lần có thể tạo ra hai kết quả khác nhau.
Nhưng nó đã đúng về một hình ảnh tôi đã kiểm tra.
Nó sẽ đúng thường xuyên, đặc biệt là trong các trường hợp rõ ràng mà bạn cũng sẽ đúng. Vấn đề là nó nghe giống hệt nhau khi nó sai, vì vậy một câu trả lời đúng không cho bạn cách nào để biết bạn đã nhận được loại nào ở hình ảnh tiếp theo.
Điều gì sẽ xảy ra nếu tôi yêu cầu nó phân tích các điểm ảnh?
Nó không thể. Hình ảnh được chuyển đổi thành một biểu diễn ngữ nghĩa trước khi mô hình suy luận về nó, và việc phát hiện kết cấu tinh tế phụ thuộc vào việc bị loại bỏ trong quá trình chuyển đổi đó. Yêu cầu phân tích điểm ảnh tạo ra một mô tả về việc phân tích điểm ảnh sẽ trông như thế nào.
Có các mô hình đa phương thức được xây dựng để phát hiện không?
Có nghiên cứu trong lĩnh vực này và nó không giống những gì một trợ lý chung làm. Một trình phát hiện được xây dựng có mục đích được đào tạo trên các cặp hình ảnh thật và hình ảnh do AI tạo ra với đầu ra được hiệu chuẩn; một mô hình chung được đào tạo để hữu ích trên mọi thứ. Cả hai không phải là sự thay thế gần gũi.
Tôi có nên sử dụng chatbot khi kiểm tra hình ảnh không?
Có, để mô tả và suy luận. Hãy hỏi nó cái gì có trong khung hình, ánh sáng có nhất quán hay không, và điều gì sẽ xác nhận hoặc bác bỏ sự nghi ngờ của bạn. Sau đó, sử dụng trình phát hiện cho câu hỏi về điểm ảnh, và giữ hai câu trả lời đó tách biệt trong tâm trí bạn.
Tại sao rất nhiều người hỏi chatbot trước?
Vì nó đang mở ở một thẻ khác và nó luôn trả lời. Sự tiện lợi đánh bại độ chính xác khi cái giá của việc sai lầm là vô hình, và với việc xác minh hình ảnh, cái giá đó thường là vô hình cho đến khi ai đó đã hành động theo câu trả lời.