GAN이 이미지를 생성하는 방식
생성적 적대 신경망(GAN)은 작은 벡터에서 시작하여 전체 해상도에 도달할 때까지 각 레이어에서 해상도를 두 배로 높이며 업샘플링을 반복합니다. 두 번째 네트워크가 결과를 평가하며, 이 두 네트워크가 서로 경쟁하며 학습합니다.
반복적인 업샘플링은 중요한 부분입니다. 각 해상도 배가 단계마다 규칙적인 패턴이 도입되며, 이러한 패턴들이 누적되어 주기적 구조를 형성하고, 이는 이미지가 주파수 도메인으로 변환되었을 때 가시화됩니다.
이러한 구조는 서명에 가까웠습니다. 초기 탐지기는 사진에 대한 이해 없이도 주파수 스펙트럼에서 체스판 패턴을 찾아내어 높은 정확도를 달성할 수 있었습니다. 이는 특정 모델의 지문이라기보다는 아키텍처의 지문이었습니다.
diffusion 모델이 이미지를 생성하는 방식
Diffusion은 반대 방식으로 작동합니다. 목표 해상도의 순수한 노이즈 필드에서 시작하여, 모델이 학습한 바에 따라 안내되며 매 단계마다 노이즈를 조금씩 제거하여 이미지를 완성합니다.
업샘플링 래더가 없으므로 주기적 아티팩트도 없습니다. 출력 결과는 카메라 촬영본과 통계적으로 다르며, 그 차이는 구조적이기보다는 확산되어 나타납니다. 그 어떤 부분도 찾아볼 수 있는 깔끔한 패턴으로 나타나지 않습니다.
GAN
- 반복적으로 업샘플링된 작은 벡터
- 각각의 2배 확장에서 비롯된 주기적 아티팩트
- 주파수 영역에서 탐지 가능
- 아키텍처가 남기는 거의 서명에 가까운 흔적
- 대략 2022년까지 주를 이룸
확산
- 원래 크기에서 단계별로 제거된 노이즈
- 업샘플링 래더 없음, 주기적 패턴 없음
- 구조적이 아닌 통계적인 차이
- 탐지를 위해 학습된 모델 필요
- 2022년 이후 주를 이룸
기존 탐지기들이 작동을 멈춘 이유
주파수 영역의 체커보딩을 찾도록 만들어진 도구는 diffusion 이미지에서 아무것도 찾아내지 못합니다. 불확실성을 보고하는 것이 아니라 아티팩트가 없다고 보고하며, 이는 깔끔한 결과로 읽힙니다.
이것이 바로 2021년과 2023년 사이에 분야 전반의 탐지 정확도가 무너진 것처럼 보인 이유입니다. 도구들이 저하된 것이 아니었습니다. 도구들이 찾고 있던 대상이 더 이상 생성되지 않게 되었기 때문입니다.
아키텍처 중심 탐지를 대체한 것
범용성. 단 하나의 아티팩트를 찾는 대신, 현재의 탐지기는 수집 가능한 최대한 많은 다양한 생성기의 출력으로 학습되므로, 모델은 하나의 패밀리가 무엇을 만들어내는지 대신 합성 텍스처가 공통으로 가지는 특징을 학습합니다.
여기에 사용된 모델은 정확히 이러한 이유로 수천 개의 생성기에서 나온 수백만 장의 이미지로 학습되었습니다. 아키텍처 전반을 아우르는 커버리지는 다음 아키텍처에 대한 일반화 능력을 가져다주며, 이는 지배적인 방식의 변화에서 살아남은 유일한 접근 방식입니다.
상쇄되는 부분은 단일 알려진 생성기에 대한 정확도가 전문가용 탐지기가 달성할 수 있는 것보다 낮다는 점입니다. 새로운 무언가가 도착했을 때 전문가용 도구는 무용지물이 되므로, 이는 올바른 절충안입니다.
이것이 예측하는 것
GAN에서 diffusion으로의 전환에서 얻는 교훈은 diffusion에 관한 것이 아닙니다. 이미지가 현재 만들어지는 방식에 묶여 있는 모든 탐지기는 수명이 제한되어 있으며, 전환은 사전에 예고되지 않는다는 점입니다.
| 접근 방식 | 작동 대상 | 실패 시점 |
|---|---|---|
| 주파수 아티팩트 검색 | GAN | Diffusion 등장 |
| 얼굴 전용 분석 | 초기 페이스 스왑 | 전체 장면 생성 등장 |
| 메타데이터 검사 | 도구에서 바로 나온 파일 | 플랫폼의 메타데이터 제거 |
| 오차 수준 분석 | 단일 저장 JPEG | 이미지의 이동 시작 |
| 광범위한 다중 생성기 학습 | 대다수의 현재 출력물 | 알 수 없음, 다른 것들보다 나중 |
이 중 사용자에게 중요한 것이 있을까요?
대체로 이는 여러분이 알아차릴 두 가지 현상을 설명해 줍니다. 첫째, 탐지기가 대개 어떤 도구가 이미지를 생성했는지 명시할 수 없는 이유입니다. 탐지기는 모델별 지문보다는 공유되는 통계적 속성을 읽고 있기 때문입니다.
둘째, 구형 무료 체커들의 성능이 나쁜 이유입니다. 온라인에 남아 있는 여러 도구들은 GAN 아티팩트를 중심으로 제작되었으며 재학습되지 않았습니다. 이들은 현재의 출력물에 대해 자신 있게 깨끗한 결과를 반환하며, 인터페이스의 그 무엇도 그 이유를 설명해주지 않습니다.
하이브리드 파이프라인이 결과에 미치는 영향
여러분에게 도달하는 대부분의 이미지는 단일 방식으로 생성되지 않았습니다. diffusion 모델이 베이스를 생성하고, GAN 기반 업스케일러가 이를 확대하며, 얼굴 복원 패스가 눈을 수정하고, 편집기가 결과를 잘라내어 다시 저장합니다.
각 단계는 텍스처를 다시 쓰기 때문에, 파일은 서로 겹쳐진 여러 프로세스의 흔적을 지니게 됩니다. 이미지에 마지막으로 손을 댄 프로세스가 대개 탐지기가 읽어들이는 내용을 지배하며, 이것이 업스케일된 diffusion 이미지가 생성기보다 업스케일러와 통계적으로 더 유사해 보일 수 있는 이유입니다.
이것이 아키텍처 식별이 실험실 외부에서 작동하지 않는 현실적인 이유입니다. 깨끗한 단일 모델 출력물을 사용한 통제된 테스트에서는 해결 가능한 문제입니다. 실제 제작 파이프라인을 거친 이미지에서는 해당 질문이 제대로 성립하지 않습니다.
이는 또한 사람들이 혼란스러워하는 결과를 설명해 줍니다. 실제로 생성된 이미지임에도 심하게 업스케일된 사진보다 더 낮은 점수를 받는 경우입니다. 둘 다 소프트웨어에 의해 텍스처가 다시 쓰여졌으며, 탐지기는 원본이 아닌 다시 쓰여진 텍스처를 읽고 있습니다.