두 가지 갈래
탐지기는 서로 다른 두 가지 검사를 독립적으로 실행하며 각각 다른 것에 답변합니다. 이 둘을 분리해 두는 것이 이 페이지에서 가장 유용한 아이디어입니다.
픽셀 분석
- 스크린샷 및 압축 후에도 작동함
- 신원이 아닌 확률을 반환함
- 설계상 생성기 독립적임
- 도구 이름을 지정할 수 없음
- 알 수 없는 아키텍처에 대해 성능이 저하됨
파일 증거
- 도구 이름을 정확히 지정할 수 있음
- 서명된 경우 암호화됨
- 거의 모든 플랫폼에서 제거됨
- 대부분의 이미지에 존재하지 않음
- 고의로 쉽게 제거됨
파일이 선언할 수 있는 것
이미지가 여전히 원래 구조를 유지하고 있는 경우, 여러 종류의 마커가 존재할 수 있습니다. 각각은 픽셀에서 파생된 것이 아니라 해당 파일을 작성한 소프트웨어가 내세우는 주장입니다.
- Content Credentials. 도구와 수행 작업을 명시하는 서명된 매니페스트. 일부 주요 생성기는 이제 출력물에 서명하며, 이는 가장 강력한 형태의 증거입니다.
- 생성 매개변수. 여러 오픈 소스 도구는 프롬프트, 시드, 샘플러, 모델 이름을 파일에 직접 내장하는데, 이는 대부분의 사람들이 찾을 것으로 기대하는 것보다 더 많은 정보입니다.
- 소프트웨어 식별자. 이미지를 마지막으로 저장한 애플리케이션을 명시하는 일반 메타데이터 필드.
- 선언된 AI 워터마크. 워터마크 그 자체라기보다는 보이지 않는 워터마크가 적용되었다는 선언을 담은 플래그.
- 카메라 캡처 단언. 파일이 센서에서 나왔다는 서명 카메라의 반대되는 주장.
이 모든 것들은 이미지가 거의 모든 플랫폼에 업로드되는 순간 사라집니다. 이것이 바로 파일 검사를 실행할 가치는 있지만 결코 전적으로 의존할 수는 없는 이유입니다. 무언가를 발견했을 때 그 발견은 강력하지만, 대부분의 경우 아무것도 찾지 못합니다.
생성기 이름을 지정하는 것이 어려운 이유
당연히 가능해야 할 것처럼 들립니다. 도구마다 서로 다른 미학을 보여주며, 오랜 시간 다뤄본 사람은 종종 올바르게 추측할 수 있습니다. 하지만 그러한 직관은 세 가지 이유로 탐지기에 전이되지 않습니다.
모델들은 아키텍처와 학습 데이터를 공유하므로 통계적 지문이 크게 겹칩니다. 많은 도구가 동일한 베이스 모델을 미세 조정(fine-tune)한 것이어서, 사람의 눈에는 출력물이 달라 보여도 텍스처 수준에서는 거의 구별할 수 없습니다.
출력물은 후처리도 거칩니다. 업스케일링, 얼굴 복원, 편집은 모두 생성 후에 발생하며 식별의 기반이 되는 텍스처를 완전히 재작성합니다. 이미지가 게시될 시점에는 생성기의 흔적보다 업스케일링의 흔적을 더 많이 담고 있을 수 있습니다.
그리고 타겟은 끊임없이 움직입니다. 식별 모델은 이미 존재했던 것들의 조회 테이블에 불과하므로, 출시된 지 얼마 안 된 모델에 대해서는 명백하게 틀리기보다는 조용히 틀리게 됩니다.
좋은 적용 범위가 실제로 의미하는 것
탐지기와 관련해 유용한 질문은 이름으로 인식하는 생성기가 무엇인지가 아닙니다. 학습의 폭이 얼마나 넓은가 하는 점인데, 폭이야말로 아직 출시되지 않은 모델에 대한 성능을 예측해주기 때문입니다.
| 접근 방식 | 강점 | 약점 |
|---|---|---|
| 소수의 주요 상용 도구로 학습 | 해당 도구에 대한 높은 정확도 | 다른 모든 대상에 대한 낮은 일반화 성능 |
| 수천 개의 생성기에 걸쳐 학습 | 알 수 없는 모델에 대한 일반화 | 개별 도구에 대한 더 낮은 최고 정확도 |
| 단일 아키텍처의 아티팩트 찾기 | 유지되는 동안 매우 높음 | 방식이 변경되면 완전히 실패함 |
| 파일 마커만 읽기 | 존재할 경우 정확함 | 대다수의 이미지에 대해 맹목적임 |
두 번째 행은 여기서 사용하는 접근 방식이며, 절충안은 의도적인 것입니다. 4개의 제품에서는 탁월하지만 5번째 제품에는 쓸모없는 탐지기는 누군가 보낸 이미지를 검사하는 데 큰 도움이 되지 않습니다.
제품 이름에 대하여
지원되는 생성기 목록은 기술적인 것보다 마케팅적인 아티팩트에 가깝습니다. 픽셀 모델에는 목록이 없으며 학습 분포가 있을 뿐입니다. 제품 이름을 지정하는 것은 광범위한 탐지 기능이 갖추지 못했고 갖출 필요도 없는 도구별 기능을 암시합니다.
여기서 결과에 이름이 나타나는 경우, 그것은 픽셀이 아니라 파일에서 나온 것이며 결과에도 그렇게 명시되어 있습니다. 이러한 구별은 사용하는 모든 도구에 요구할 가치가 있습니다.
적용 범위 주장을 읽는 방법
벤더들은 비교 가능해 보이지만 그렇지 않은 방식으로 적용 범위를 설명합니다. 세 가지 표현이 반복해서 등장하며 각각 다른 의미를 지닙니다.
X, Y, Z의 이미지를 감지한다는 것은 대개 벤치마크에 그 세 가지가 포함되어 있었다는 뜻입니다. 이는 역량이 아니라 테스트에 대한 진술이며, 네 번째 생성기에 대해서는 아무것도 말해주지 않습니다.
40개가 넘는 생성기를 지원한다는 것은 대개 학습 세트가 그만큼의 소스에서 가져왔음을 의미합니다. 학습의 폭이 일반화를 예측해주기 때문에 이는 더 의미가 있지만, 여전히 특정 도구에 대한 보장을 의미하지는 않습니다.
생성 모델을 식별하는 것은 가장 까다로운 주장입니다. 그러한 식별이 파일에서 비롯되었는지 픽셀에서 비롯되었는지 질문하십시오. 픽셀에서 비롯된 경우, 식별 정확도는 감지 정확도와는 매우 다른 수치이므로 각각 따로 정확도를 요구하십시오.