← Tất cả hướng dẫn Bên dưới lớp vỏ

Deepfake với hình ảnh do AI tạo ra: không phải là cùng một vấn đề

Một bên bịa ra một người không tồn tại. Bên kia đặt một người thật vào nơi họ chưa bao giờ đến. Chúng cần các cách kiểm tra khác nhau, và việc nhầm lẫn chúng gây ra những sai lầm thực sự.

· 9 phút đọc · Best AI Image Detector

Một hình ảnh được tạo ra sẽ bịa ra chủ thể của nó. Một deepfake giữ lại danh tính của một người thật và thay đổi những gì họ dường như đang làm. Loại thứ hai là loại gây hại cho một người cụ thể, và nó khó phát hiện hơn trong hai loại vì hầu hết khung hình là thật.

Hai thứ khác nhau mà mọi người gọi bằng cùng một tên

Một hình ảnh được tạo ra hoàn toàn bắt đầu từ con số không. Không có bức ảnh nào bên dưới nó, không có lần đọc cảm biến nào, không có khoảnh khắc nào đã xảy ra. Mọi điểm ảnh đều được tạo ra bởi một mô hình, và người trong đó không có danh tính nào để bị phỉ báng vì không có người nào cả.

Một deepfake bắt đầu từ một thứ gì đó có thật. Có một bức ảnh hoặc video bên dưới, một lần chụp thực sự của một khoảnh khắc thực sự, và một mô hình đã thay thế một khu vực cụ thể của nó, thường là khuôn mặt, bằng hình ảnh của một người khác.

Sự khác biệt này quan trọng về mặt pháp lý, biên tập và kỹ thuật. Một bức ảnh có sẵn được tạo ra về một bác sĩ không tồn tại là một vấn đề cấp phép. Một bức ảnh của một bác sĩ thật với khuôn mặt của họ được dán lên một cơ thể mà họ chưa bao giờ gắn liền với là một vấn đề phỉ báng, và có thể là vấn đề hình sự.

Ảnh có sẵn được tạo ra Ảnh chụp cận mặt của bản thân do AI tạo ra Người nổi tiếng giả được tạo Ảnh ghép mặt Tài liệu bị chỉnh sửa
Bao nhiêu phần của khung hình là thật → ↑ Tác hại đối với một người cụ thể
Các vị trí chỉ mang tính minh họa. Các trục mới là điều quan trọng: tác hại theo dõi danh tính, chứ không phải mức độ tổng hợp của các điểm ảnh.
Vị trí của mỗi loại. Góc phần tư phía dưới bên phải là nơi tập trung tác hại nghiêm trọng.

Tại sao deepfake lại khó phát hiện hơn

Một công cụ phát hiện đọc kết cấu thống kê của một hình ảnh và báo cáo xem bao nhiêu phần của nó giống với thứ do một mô hình tạo ra. Khi toàn bộ khung hình là tổng hợp, tín hiệu đó có mặt ở khắp nơi và điểm số là rõ ràng.

Ghép mặt đảo ngược vấn đề này. Chín mươi phần trăm bức ảnh là ảnh thật, với nhiễu cảm biến thật và lịch sử nén thật, và mức trung bình của toàn bộ khung hình phản ánh điều đó. Một bản ghép thuyết phục có thể cho ra điểm số ở mức 30 đối với một hình ảnh thực sự mang tính lừa đảo.

Đó không hẳn là lỗi của mô hình mà là lỗi của câu hỏi. Việc hỏi xem hình ảnh có phải được tạo ra hay không là không phù hợp khi câu trả lời thực tế là phần lớn thì không, nhưng một phần quan trọng của nó thì có.

16 12 19 14 11 91 17 13 15 18 12 16

Việc lấy trung bình cho ra 33 chính xác là thứ che giấu đi một ô duy nhất quan trọng.

Một bức ảnh thật bị thay thế một khuôn mặt. Điểm số toàn khung hình là 33 và gần như không cho bạn biết điều gì.

Bản đồ khu vực là câu trả lời cho vấn đề đó. Việc chấm điểm riêng biệt cho các ô chồng chéo có nghĩa là một sự thay thế cục bộ được đo lường so với các vùng lân cận của chính nó thay vì bị pha loãng trên một khung hình mà nó không thuộc về.

Từ vựng, theo thứ tự xuất hiện

Các thuật ngữ mọi người dùng và những gì chúng thực sự mô tả
Thuật ngữÝ nghĩaChủ thể có thật không?
DeepfakeDiện mạo của một người thật được ghép vào cảnh quay khác
Ghép mặtDạng phổ biến của deepfake, trên ảnh tĩnh hoặc video
Được tạo ra bởi AIĐược tạo ra từ câu lệnh mà không có ảnh gốcKhông
Được chỉnh sửa bằng AIMột bức ảnh thật có thứ gì đó được thêm vào hoặc xóa điThường là
Phương tiện tổng hợpThuật ngữ bao trùm tất cả các khái niệm trênTùy thuộc
CheapfakePhương tiện thật bị làm sai lệch bởi chú thích, cắt xén hoặc ngày cũ

Hàng cuối cùng đáng để suy ngẫm, vì đây là hình thức thông tin sai lệch về hình ảnh phổ biến nhất và không công cụ phát hiện nào xử lý được. Một bức ảnh thật, chưa chỉnh sửa từ một quốc gia khác ba năm trước, được chú thích là tin tức của ngày hôm nay, sẽ có điểm số của một bức ảnh thật.

Những việc thực tế cần làm, theo từng trường hợp

  1. Bạn nghi ngờ toàn bộ bức ảnh được thêu dệt. Chạy kiểm tra toàn bộ khung hình. Một điểm số cao với một bản đồ phẳng là dấu hiệu rõ ràng nhất.
  2. Bạn nghi ngờ một người đã được chèn vào hoặc bị thay thế. Hãy đọc bản đồ khu vực trước. Con số tổng thể sẽ không phản ánh đúng mức độ.
  3. Bạn nghi ngờ một tài liệu đã bị thay đổi. Giống như trên, và bạn sẽ thấy chính xác một ô nóng phía trên trường thông tin bị thay đổi.
  4. Bạn nghi ngờ chú thích là nói dối. Một công cụ phát hiện không thể giúp gì. Hãy tìm kiếm hình ảnh đảo ngược, sau đó kiểm tra ngày và địa điểm.
  5. Đây là video. Cần bộ công cụ hoàn toàn khác. Việc phân tích ảnh tĩnh theo từng khung hình sẽ bỏ sót các dị thường về mặt thời gian vốn làm lộ các bản ghép mặt theo thời gian thực.

Tại sao sự phân biệt này bảo vệ mọi người

Việc coi mọi hình ảnh tổng hợp đều nghiêm trọng như nhau gây ra hai sai lầm cùng lúc. Nó làm lãng phí sự chú ý vào những thứ vô hại, chẳng hạn như ai đó sử dụng ảnh chân dung được tạo ra vì họ không đủ tiền thuê nhiếp ảnh gia, và nó đánh giá thấp trường hợp thực sự gây tổn hại cho một con người.

Tác hại không nằm ở chỗ các pixel là nhân tạo. Nó nằm ở việc một cá nhân có thật, có tên tuổi bị cho là đang làm điều gì đó mà họ không hề làm. Đó mới là vấn đề đáng để báo cáo, và đây là trường hợp mà một điểm số trung bình là bản tóm tắt kém tin cậy nhất.

Xây dựng chính sách nội bộ xoay quanh danh tính thay vì xoay quanh công nghệ cũng giúp nó bền vững hơn với thời gian. Các phương pháp sẽ liên tục thay đổi; nhưng câu hỏi về việc một người cụ thể có bị xuyên tạc hay không thì không.

Ghép mặt thực sự được thực hiện như thế nào

Hiểu được quá trình tạo ra giúp giải thích quá trình phát hiện. Một thao tác ghép mặt bắt đầu với một bức ảnh mục tiêu và một bộ hình ảnh của người sẽ được sử dụng khuôn mặt. Một mô hình sẽ học cách kết xuất khuôn mặt đó dưới ánh sáng, góc độ và biểu cảm đã có sẵn trong ảnh mục tiêu.

Khuôn mặt được kết xuất sau đó được ghép trở lại vào khung hình ban đầu, và đường viền là phần khó nhất. Hai nửa có nhiễu khác nhau, lịch sử nén khác nhau và thường có độ phản hồi màu hơi khác nhau, do đó bước trộn ảnh sẽ làm mịn ranh giới cho đến khi mắt người không còn chú ý đến mối ghép nữa.

Quá trình làm mịn đó là những gì bản đồ khu vực đọc được. Việc trộn ảnh loại bỏ đi kết cấu tần số cao mà cảm biến tạo ra, và vùng ảnh kết quả sẽ khác biệt về mặt thống kê với mọi thứ xung quanh nó ngay cả khi mắt thường không nhìn thấy mối ghép. Đường viền vừa vô hình vừa có thể đo lường được cùng lúc.

Điều đó cũng giải thích tại sao một bản ghép lại dễ dàng vượt qua bài kiểm tra toàn khung hình. Khu vực bị thao túng có kích thước nhỏ, được cố tình trộn lẫn vào môi trường xung quanh và được bao quanh bởi một bức ảnh thật vốn lấn át mọi mức trung bình trên toàn bộ khung hình.

Sai lầm liên tục lặp lại

Mọi người đưa một nghi ngờ deepfake qua một công cụ phát hiện, thấy điểm số ở mức khoảng 30 và kết luận rằng hình ảnh đó là thật. Đó là một suy luận sai từ một con số đúng: điểm số là chính xác nhưng câu hỏi mà nó trả lời lại không phải là câu hỏi đang được đặt ra.

Thói quen để khắc phục điều này rất nhỏ. Trên bất kỳ hình ảnh nào mà mối quan tâm là về một người cụ thể, hãy mở bản đồ khu vực trước khi đọc con số chính, và coi ô cao nhất chứ không phải mức trung bình là phát hiện đáng để xử lý.

Các câu hỏi mọi người thường đặt ra

Có phải mọi hình ảnh AI đều là deepfake không?
Không, và điểm khác biệt nằm ở chủ thể. Deepfake sử dụng diện mạo của một người thật mà không có sự tham gia của họ, đó là điều khiến nó có hại và thường là bất hợp pháp. Hình ảnh được tạo ra của một người không tồn tại sẽ không có nạn nhân, và việc coi hai điều đó như nhau sẽ làm lãng phí sự chú ý vào trường hợp vô hại.
Công cụ này có phát hiện được deepfake không?
Trên một ảnh tĩnh, thường là có, thông qua bản đồ khu vực chứ không phải là điểm số. Việc ghép mặt là sự thay thế cục bộ bên trong một bức ảnh thật, vì vậy nó hiển thị dưới dạng một ô nóng trong một lưới nguội xung quanh, trong khi con số toàn khung hình vẫn ở mức thấp. Hãy đọc bản đồ trước đối với bất kỳ hình ảnh nào của một người.
Còn video deepfake thì sao?
Việc này cần các công cụ khác. Việc thao túng video để lại các dị thường về thời gian, những sự không nhất quán giữa các khung hình liên tiếp, điều mà một mô hình ảnh tĩnh không tìm kiếm. Việc kiểm tra từng khung hình đơn lẻ sẽ phát hiện được một số trường hợp và bỏ sót những trường hợp được thiết kế đặc biệt để vượt qua bài kiểm tra đó.
Tại sao một deepfake đã biết lại có điểm số thấp?
Vì phần lớn trong đó là một bức ảnh thật. Điểm số toàn khung hình tính trung bình trên toàn bộ hình ảnh và một khuôn mặt chiếm một phần tám khung hình sẽ làm thay đổi mức trung bình đó rất ít. Đây là cách phổ biến nhất khiến mọi người đọc sai kết quả trên một bức ảnh ghép mặt.
Cheapfake có thể bị phát hiện không?
Không phải bởi một công cụ phát hiện, vì không có gì là tổng hợp để phát hiện cả. Một bức ảnh thật có chú thích sai là một vấn đề về nguồn gốc: hãy tìm kiếm hình ảnh đảo ngược để tìm các bản sao trước đó, sau đó kiểm tra xem ngày tháng và địa điểm có khớp với thông tin được đưa ra hay không.
Luật pháp có xử lý chúng khác nhau không?
Ngày càng có, vâng. Một số khu vực pháp lý đã đưa ra các tội danh đặc biệt liên quan đến việc mô tả tổng hợp không có sự đồng thuận về những người thật, đặc biệt là hình ảnh nhạy cảm, trong khi hình ảnh được tạo ra về những người không cụ thể được xử lý theo các quy định thông thường. Hãy hỏi đội ngũ pháp lý của riêng bạn thay vì dựa vào trang này.