Cách một GAN xây dựng một hình ảnh
Mạng đối kháng sinh bắt đầu từ một véc-tơ nhỏ và liên tục tăng độ phân giải của nó, gấp đôi độ phân giải ở mỗi lớp cho đến khi đạt kích thước đầy đủ. Mạng thứ hai đánh giá kết quả, và hai mạng huấn luyện chống lại nhau.
Việc tăng độ phân giải lặp đi lặp lại là phần quan trọng. Mỗi bước nhân đôi giới thiệu một mẫu thông thường, và các mẫu đó tích tụ thành cấu trúc định kỳ có thể nhìn thấy được khi hình ảnh được biến đổi sang miền tần số.
Cấu trúc đó gần giống như một chữ ký. Các trình phát hiện sớm có thể tìm kiếm một mẫu bàn cờ trong phổ tần số và đạt độ chính xác cao mà không cần hiểu bất cứ điều gì về bức ảnh. Đó là dấu vân tay của kiến trúc chứ không phải của bất kỳ mô hình cụ thể nào.
Cách một mô hình diffusion xây dựng hình ảnh
Diffusion hoạt động theo hướng ngược lại. Nó bắt đầu với một trường nhiễu thuần túy ở độ phân giải mục tiêu đầy đủ và loại bỏ một ít ở mỗi bước, được hướng dẫn bởi những gì mô hình đã học, cho đến khi một hình ảnh xuất hiện.
Không có thang bậc lấy mẫu nội suy (upsampling ladder), do đó không có hiện tượng tạo giả tuần hoàn (periodic artefact). Kết quả đầu ra khác biệt về mặt thống kê so với ảnh chụp bằng máy ảnh, và sự khác biệt này mang tính phân tán hơn là mang tính cấu trúc. Không có điểm nào trong đó xuất hiện dưới dạng một mẫu sạch rõ ràng mà bạn có thể tìm kiếm.
GAN
- Vector nhỏ được nội suy nội suy liên tục
- Hiện tượng tạo giả tuần hoàn từ mỗi lần nhân đôi
- Có thể phát hiện trong miền tần số
- Kiến trúc để lại gần như một chữ ký
- Chủ đạo cho đến khoảng năm 2022
Diffusion
- Nhiễu được loại bỏ từng bước ở kích thước đầy đủ
- Không có thang bậc lấy mẫu nội suy, không có mẫu tuần hoàn
- Sự khác biệt mang tính thống kê, không phải cấu trúc
- Cần có một mô hình đã học để phát hiện
- Chủ đạo từ năm 2022
Lý do các bộ phát hiện cũ ngừng hoạt động
Một công cụ được chế tạo để tìm kiếm dạng bàn cờ trong miền tần số sẽ không tìm thấy gì ở một hình ảnh diffusion. Nó không báo cáo mức độ không chắc chắn; nó báo cáo rằng hiện tượng tạo giả không có mặt, điều này được đọc là một kết quả sạch.
Đó là lý do tại sao độ chính xác của việc phát hiện trên toàn lĩnh vực dường như sụt giảm trong khoảng thời gian từ năm 2021 đến năm 2023. Các công cụ không hề suy giảm chất lượng. Thứ mà chúng tìm kiếm đã ngừng xuất hiện.
Thứ đã thay thế việc phát hiện theo kiến trúc cụ thể
Độ bao quát. Thay vì tìm kiếm một hiện tượng tạo giả duy nhất, các bộ phát hiện hiện tại được huấn luyện trên dữ liệu đầu ra từ càng nhiều trình tạo khác nhau càng tốt, để mô hình học được những điểm chung của kết quả tổng hợp thay vì điểm chung của một họ duy nhất.
Mô hình được sử dụng ở đây được huấn luyện trên hàng triệu hình ảnh từ hàng nghìn trình tạo chính vì lý do này. Độ bao phủ trên các kiến trúc là thứ mang lại khả năng tổng quát hóa cho kiến trúc tiếp theo, và đây là cách tiếp cận duy nhất sống sót sau sự thay đổi về phương pháp chủ đạo.
Sự đánh đổi là độ chính xác trên bất kỳ trình tạo đơn lẻ nào đã biết sẽ thấp hơn so với mức mà một bộ phát hiện chuyên biệt có thể đạt được. Đó là sự đánh đổi chính xác, bởi vì một chuyên gia sẽ trở nên vô dụng vào ngày mà một thứ gì đó mới xuất hiện.
Điều này dự đoán điều gì
Bài học từ sự chuyển đổi từ GAN sang diffusion không phải về diffusion. Mà là bất kỳ bộ phát hiện nào gắn liền với cách hình ảnh đang được tạo ra đều có thời hạn sử dụng hữu hạn, và sự chuyển đổi đó sẽ không được thông báo trước.
| Cách tiếp cận | Đã hoạt động trên | Thất bại khi |
|---|---|---|
| Tìm kiếm hiện tượng tạo giả tần số | GANs | Diffusion xuất hiện |
| Phân tích cụ thể về khuôn mặt | Hoán đổi khuôn mặt thời kỳ đầu | Việc tạo ra toàn bộ cảnh xuất hiện |
| Kiểm tra metadata | Tệp lấy thẳng từ một công cụ | Các nền tảng đã tước bỏ metadata |
| Phân tích mức độ lỗi (Error level analysis) | JPEG lưu một lần | Hình ảnh bắt đầu được di chuyển |
| Huấn luyện đa trình tạo trên diện rộng | Hầu hết dữ liệu đầu ra hiện tại | Không rõ, và muộn hơn những cái khác |
Điều này có quan trọng đối với người dùng không
Hầu hết nó giải thích hai điều bạn sẽ nhận thấy. Đầu tiên, lý do tại sao một bộ phát hiện thường không thể nêu tên công cụ nào đã tạo ra hình ảnh: nó đang đọc một thuộc tính thống kê được chia sẻ thay vì một dấu vân tay của từng mô hình.
Thứ hai, lý do tại sao các trình kiểm tra miễn phí cũ hoạt động kém. Một số công cụ vẫn còn trực tuyến được xây dựng xung quanh các hiện tượng tạo giả của GAN và chưa được huấn luyện lại. Chúng trả về các kết quả sạch đầy tự tin về dữ liệu đầu ra hiện tại, và không có gì trong giao diện nói lên lý do tại sao.
Đường ống lai (hybrid pipeline) làm gì đối với một kết quả
Hầu hết các hình ảnh tiếp cận bạn không được sản xuất bằng một phương pháp duy nhất. Mô hình diffusion tạo ra một nền tảng, bộ nâng cấp độ phân giải dựa trên GAN làm lớn nó lên, một bước khôi phục khuôn mặt sửa chữa đôi mắt, và một trình chỉnh sửa cắt xén rồi lưu lại kết quả.
Mỗi giai đoạn viết lại kết quả xử lý bề mặt (texture), vì vậy tệp mang dấu vết của một số quy trình được xếp chồng lên nhau. Quy trình cuối cùng chạm vào hình ảnh thường chi phối những gì bộ phát hiện đọc được, đó là lý do tại sao một hình ảnh diffusion được nâng cấp độ phân giải có thể trông giống bộ nâng cấp độ phân giải về mặt thống kê hơn là giống trình tạo.
Đây là lý do thực tế tại sao việc nhận dạng kiến trúc không hoạt động bên ngoài phòng thí nghiệm. Trong một thử nghiệm có kiểm soát với dữ liệu đầu ra từ một mô hình duy nhất và sạch sẽ, đó là một vấn đề có thể giải quyết được. Trên một hình ảnh đã trải qua một đường ống sản xuất thực tế, câu hỏi không được đặt ra rõ ràng.
Nó cũng giải thích một kết quả mà mọi người thấy khó hiểu: một hình ảnh được tạo ra thực sự lại có điểm số thấp hơn một bức ảnh được nâng cấp độ phân giải nặng. Cả hai đều đã có bề mặt bị phần mềm viết lại, và bộ phát hiện đang đọc việc viết lại đó thay vì nguồn gốc.