Những gì một chatbot thực sự đang làm
Một mô hình ngôn ngữ đa phương thức chuyển đổi hình ảnh thành mô tả ngữ nghĩa và sau đó lập luận về mô tả đó bằng văn bản. Nó đang trả lời câu hỏi liệu bức ảnh này có giống với những hình ảnh AI mà tôi đã đọc trong quá trình huấn luyện hay không.
Đó là câu hỏi về nội dung và bố cục. Quá trình phát hiện là câu hỏi về kết cấu: các giá trị pixel lân cận có mối liên hệ như thế nào với nhau, ở tỷ lệ nhỏ hơn rất nhiều so với bất kỳ thứ gì mà mô tả ngữ nghĩa bảo tồn.
Thông tin mà bộ phát hiện đọc được sẽ bị loại bỏ trước khi mô hình ngôn ngữ bắt đầu suy luận. Không phải là các chatbot kém trong việc này. Chúng đang làm việc dựa trên một bản thể không chứa bằng chứng.
Điều đó tạo ra những gì trong thực tế
- Các câu trả lời tự tin nhưng không có ngưỡng xác định. Chatbot sẽ nói có khả năng do AI tạo ra mà không có bất kỳ thang đo nào đằng sau từ có khả năng. Không có con số, không có dải điểm và không có gì để so sánh với một hình ảnh khác.
- Lập luận từ các dấu hiệu cũ. Các mô hình viện dẫn ngón tay, răng, làn da bóng nhựa và văn bản bị biến dạng, bởi vì đó là những gì văn bản huấn luyện bảo phải tìm kiếm. Những điều đó đã được khắc phục từ nhiều năm trước.
- Sự đồng tình với cách đặt vấn đề của bạn. Hãy hỏi xem một hình ảnh có phải là ảnh giả hay không và bạn sẽ có nhiều khả năng nghe thấy câu trả lời là có hơn là khi bạn hỏi một cách trung lập. Đó là đặc tính của giao diện, chứ không phải của bức ảnh.
- Không thể tái tạo lại kết quả. Hãy hỏi hai lần và bạn có thể nhận được hai câu trả lời khác nhau về cùng một tệp, với những lời giải thích tự tin không kém cho mỗi lần.
- Không có thông tin về vùng. Nó không thể cho bạn biết rằng một góc của bức ảnh có hành vi khác với phần còn lại, đó là phát hiện thường có ý nghĩa quan trọng.
| Khả năng | Chatbot | Bộ phát hiện pixel |
|---|---|---|
| Đọc kết cấu cấp độ pixel | No | Yes |
| Điểm số được hiệu chuẩn với các dải đã công bố | No | Yes |
| Cùng một câu trả lời mọi lúc | No | Yes |
| Phân tích chi tiết theo cấp độ vùng | No | Yes |
| Được đo lường dựa trên điểm chuẩn | No | Yes |
| Giải thích lập luận của nó bằng văn bản | Yes một cách trôi chảy | Partly dưới dạng các tín hiệu |
| Mô tả nội dung có trong bức ảnh | Yes | No |
Hai hàng cuối cùng là những hàng đáng giữ lại. Một mô hình ngôn ngữ thực sự giỏi trong việc mô tả một hình ảnh và suy luận xem một khung cảnh có hợp lý hay không. Những điều đó rất hữu ích và chúng không phải là việc phát hiện.
Nơi chatbot thực sự hữu ích
Việc loại bỏ hoàn toàn công cụ này sẽ là một bài học sai lầm. Được sử dụng đúng với khả năng của nó, nó bổ sung cho trình phát hiện hơn là thay thế nó.
-
Yêu cầu mô tả chi tiết khung cảnh
Một mô tả cẩn thận thường làm nổi bật những điều bạn không ý thức được, bao gồm các đối tượng không thuộc về nhau hoặc các biển báo mà bạn chưa đọc.
-
Hỏi xem khung cảnh có tính nhất quán về mặt vật lý hay không
Bóng đổ, phản chiếu, tỷ lệ và phối cảnh là những vấn đề suy luận, và suy luận chính là mục đích của mô hình. Điều này bắt được các bức ảnh ghép mà phân tích điểm ảnh có thể bỏ sót.
-
Hỏi điều gì sẽ xác nhận hoặc bác bỏ nó
Biến một sự nghi ngờ thành một danh sách các điểm cần kiểm tra là một cách sử dụng tốt của mô hình ngôn ngữ, và danh sách này thường tốt hơn danh sách bạn tự viết.
-
Sau đó chạy một trình phát hiện thực tế
Đối với câu hỏi về điểm ảnh, hãy sử dụng thứ gì đó được xây dựng riêng cho nó và đọc điểm số so với thang đo đã công bố.
Lý do sự trôi chảy là mối nguy hiểm
Một trình phát hiện không chắc chắn sẽ trả về một con số ở mức trung bình, và bản thân con số đó truyền đạt sự không chắc chắn. Một mô hình ngôn ngữ không chắc chắn sẽ trả về một đoạn văn, và các đoạn văn thì không có thanh sai số.
Cùng một lời giải thích có cấu trúc tốt xuất hiện bất kể mô hình đã xác định được điều gì thực sự hay tạo ra một lời tường thuật nghe có vẻ hợp lý về hư không. Người đọc hiệu chuẩn niềm tin của họ dựa trên chất lượng của bài viết, chính xác là tín hiệu không mang thông tin nào ở đây.
Đây là lý do tại sao việc hỏi một chatbot là một điểm khởi đầu tồi tệ hơn so với việc tự mình nhìn vào bức ảnh. Sự không chắc chắn của chính bạn ít nhất vẫn hiển thị đối với bạn.
Vấn đề tương tự ở các công cụ khác
Điều này không thực sự chỉ về một sản phẩm. Bất kỳ hệ thống nào suy luận về một hình ảnh theo ngữ nghĩa đều có khoảng trống tương tự, và một số công cụ hiện nay được giới thiệu là trình phát hiện thực sự đang làm chính điều đó ở bên dưới.
Một thử nghiệm hữu ích: hỏi xem công cụ này sẽ báo cáo gì về một bức ảnh chụp lại một bức ảnh, hoặc về một hình ảnh không có chủ thể dễ nhận biết nào cả. Một trình phát hiện điểm ảnh trả về điểm số trong mọi trường hợp, bởi vì kết cấu tồn tại bất kể nội dung. Một hệ thống ngữ nghĩa không có gì để suy luận và sẽ từ chối hoặc bịa ra thứ gì đó.
Một thử nghiệm thứ hai: chạy cùng một tệp hai lần. Một mô hình điểm ảnh mang tính tất định và trả về cùng một con số. Một mô hình ngôn ngữ lấy mẫu, và hai lần chạy có thể không khớp nhau. Nếu một công cụ cung cấp cho bạn các câu trả lời khác nhau cho cùng một chuỗi byte, nó không đo lường bất cứ điều gì.
Không thử nghiệm nào yêu cầu phải hiểu cách công cụ hoạt động. Cả hai đều mất một phút, và chúng tách biệt việc đo lường khỏi mô tả một cách đáng tin cậy hơn là đọc một trang tiếp thị.