Tại sao việc thực thi tự động lại thất bại trong trường hợp này
Với độ chính xác cân bằng 91 phần trăm trong điều kiện phòng thí nghiệm, cứ khoảng mười một trường hợp thì có một trường hợp sai. Trên nội dung do người dùng tạo, vốn đến nơi ở trạng thái đã chụp màn hình, nén lại và cắt xén, tỷ lệ thực tế còn tệ hơn thế.
Nếu áp dụng cho một trăm nghìn mục mỗi ngày, đó sẽ là hàng nghìn hành động sai lầm. Mỗi hành động đều dẫn đến một đơn khiếu nại, và chi phí xử lý khiếu nại cho mỗi trường hợp còn cao hơn cả quá trình đánh giá mà hệ thống tự động đã thay thế. Bài toán kinh tế không khả thi ngay cả trước khi bạn tính đến chi phí tổn hại uy tín do gỡ bỏ các bài đăng chính hãng.
Có một vấn đề thứ hai cụ thể đối với công tác kiểm duyệt. Các quyết định thực thi sẽ phải chịu sự kiểm toán. Cơ quan quản lý hoặc tòa án khi hỏi lý do tại sao một tài khoản bị gỡ bỏ sẽ không chấp nhận kết quả đầu ra của mô hình với một ngưỡng chưa được công bố làm lý do.
Chấm điểm để sắp xếp, không phải để hành động
Khung tư duy hữu ích là sắp xếp hàng đợi. Bạn có nhiều mục hơn số lượng người đánh giá. Điểm số quyết định mục nào được con người xem trước, và đó là công việc mà nó có thể làm tốt ngay cả ở độ chính xác 85 phần trăm, bởi vì việc nhận định sai chỉ có nghĩa là ai đó nhìn vào thứ gì đó không cần thiết.
- 1 Trên 90 Đầu hàng đợi đánh giá
- 2 65 đến 90 Được đánh giá trong thời gian bình thường
- 3 45 đến 65 Chỉ khi được người dùng báo cáo
- 4 Dưới 45 Không có hành động nào, được lấy mẫu để kiểm tra chất lượng
Việc lấy mẫu dải điểm thấp nhất quan trọng hơn vẻ bề ngoài của nó. Đây là cách duy nhất để đo lường tỷ lệ âm tính giả của bạn, và nếu không có con số đó, bạn không thể biết hệ thống có đang hoạt động hay đã âm thầm ngừng phát hiện bất kỳ thứ gì.
Chính sách của bạn cần nêu rõ những gì
Hầu hết các nền tảng hiện nay đều có quy định về nội dung tổng hợp, và phần lớn trong số đó được viết một cách tồi tệ. Lỗi phổ biến là cấm chung chung nội dung AI, điều này không thể thực thi và bắt nhầm những thứ mà không ai muốn bắt.
| Có thể thực thi | Không thể thực thi | Lý do |
|---|---|---|
| Nội dung tổng hợp chưa được tiết lộ của một người thật | Tất cả hình ảnh do AI tạo ra | Quy định thứ hai cấm cả tác phẩm minh họa và thiết kế |
| Hình ảnh được tạo ra được trình bày như bằng chứng tài liệu | Bất cứ thứ gì có điểm số trên 65 | Ngưỡng điểm không phải là một chính sách |
| Nội dung tổng hợp dùng để đánh lừa nhằm trục lợi | Hình ảnh trông có vẻ do AI tạo ra | Việc nhìn bằng mắt thường không phải là một tiêu chuẩn |
| Không chịu dán nhãn khi được yêu cầu | Nội dung AI không được tiết lộ dưới bất kỳ hình thức nào | Không thể chứng minh và người dùng không thể tuân thủ |
Hãy soạn thảo quy định xoay quanh yếu tố gây hại và việc tiết lộ thay vì xoay quanh kỹ thuật. Một hình minh họa do AI tạo ra trong bài đăng giả tưởng không làm hại ai cả. Một bức ảnh do AI tạo ra về một sản phẩm, một con người hoặc một sự kiện được trình bày như thật mới là thứ bạn thực sự muốn ngăn chặn.
Ba trường hợp mà bản đồ vùng tách biệt
Điểm số của toàn bộ khung hình sẽ gộp chung ba tình huống vốn cần cách xử lý khác nhau. Chế độ xem dạng ô giúp phân biệt chúng, và sự khác biệt đó thường quyết định kết quả.
- Mọi ô đều có điểm cao. Một hình ảnh hoàn toàn do AI tạo ra. Nếu nó được trình bày như bức ảnh chụp một sự việc có thật, đó là trường hợp rõ ràng nhất của bạn.
- Một ô có điểm cao. Một bức ảnh thật có thêm hoặc bớt chi tiết. Trong bối cảnh thương mại điện tử hoặc tin tức, điều này thường nghiêm trọng hơn việc tạo ra toàn bộ bức ảnh, bởi vì nó được thiết kế để tạo lòng tin.
- Ấm đều, không ô nào cao. Đã qua xử lý nặng. Thường là một bức ảnh chính hãng qua bộ lọc hoặc công cụ nâng cấp độ phân giải. Hầu như không bao giờ đáng để xử lý.
Một bức ảnh thật có chèn thêm một phần tử vào. Việc sắp xếp hàng đợi chỉ dựa trên điểm số tiêu đề sẽ không bao giờ phát hiện ra nó.
Đo lường xem nó có hoạt động không
-
Theo dõi độ chính xác ở dải điểm trên cùng
Trong số các mục được chấm điểm trên 90 mà người kiểm duyệt đã mở, có bao nhiêu mục bị xử lý? Nếu con số đó thấp, công cụ đang tạo thêm việc thay vì tiết kiệm nó.
-
Lấy mẫu dải điểm thấp nhất hàng tuần
Chọn ngẫu nhiên một trăm mục có điểm dưới 45 và đánh giá chúng. Đây là phép đo duy nhất về những gì bạn đang bỏ sót, và đó cũng là việc mà các nhóm thường bỏ qua.
-
Theo dõi tỷ lệ khiếu nại
Sự gia tăng về số lượng đơn khiếu nại thành công đối với các quyết định về nội dung tổng hợp có nghĩa là ngưỡng điểm đã bị lệch hoặc một trình tạo mới có điểm số thấp đã xuất hiện.
-
Thiết lập lại mốc cơ sở sau mỗi lần thay đổi mô hình
Các bản cập nhật của công cụ phát hiện làm thay đổi điểm số. Ngưỡng điểm được tinh chỉnh từ sáu tháng trước đối với một phiên bản mô hình khác không còn là ngưỡng điểm mà bạn nghĩ nữa.
Bố trí nhân sự cho hàng đợi mà công cụ tạo ra
Việc thêm công cụ phát hiện vào quy trình kiểm duyệt không làm giảm số lượng nhân sự, và các nhóm lên kế hoạch để đạt được điều đó sẽ càng gặp khó khăn hơn. Thứ mà nó thay đổi là thứ tự tiếp nhận công việc, từ đó nâng cao giá trị của mỗi giờ làm việc của người đánh giá mà không làm giảm số lượng nhân sự bạn cần.
Hãy dự trù ngân sách để hàng đợi bị gắn cờ có thời gian xử lý mỗi mục chậm hơn hàng đợi thông thường. Người đánh giá khi xem xét một bài đăng bị gắn cờ sẽ phải đưa ra quyết định khó khăn hơn đối với tài liệu mơ hồ hơn, và việc làm vội vàng chính là nguyên nhân dẫn đến việc thực thi sai lầm. Hai phút cho mỗi mục là hợp lý; ba mươi giây thì không.
Cung cấp cho người kiểm duyệt bản đồ vùng thay vì điểm số. Một người kiểm duyệt có thể nhìn thấy một góc của hình ảnh có dấu hiệu bất thường sẽ đưa ra quyết định tốt hơn so với người chỉ được giao một con số, và họ có thể giải thích quyết định đó sau đó cho đội ngũ khiếu nại hoặc cơ quan quản lý.
Luân chuyển nhân sự khỏi mảng đánh giá nội dung tổng hợp. Đây là công việc lặp đi lặp lại với tỷ lệ các trường hợp mơ hồ cao, và độ chính xác sẽ giảm rõ rệt trong một ca làm việc kéo dài. Đây là bài học tương tự mà mọi bộ phận kiểm duyệt đã rút ra đối với các danh mục khác.