균형 정확도가 측정하는 것
단순 정확도는 부풀리기 쉽습니다. 생성된 이미지가 90%인 테스트 세트와 모든 것에 '예'라고 답하는 모델에 입력하면, 아무 쓸모가 없으면서도 90%의 점수를 얻게 됩니다.
균형 정확도는 실제 이미지와 생성된 이미지에 동일한 가중치를 부여하여 이를 해결합니다. 따라서 이 수치는 실제 사진이 올바르게 통과된 비율과 생성된 이미지가 올바르게 플래그 지정된 비율의 평균입니다. 테스트 구성 비율을 밝히지 않고 단순 정확도만 인용하는 도구는 많은 것을 말해주지 않는 것입니다.
탐지기가 틀리는 두 가지 방식
하나의 숫자는 완전히 다른 두 가지 오류를 숨기며, 비용도 매우 다릅니다.
위양성
- 실제 사진이 선 위에 점수가 매겨짐
- 업스케일링, 리터칭, 야간 모드, 스크린샷으로 인해 발생
- 비용: 실제 사람에 대한 비난
- 실제 피해를 입히는 실패
위음성
- 생성된 이미지가 선 아래에 점수가 매겨짐
- 새로운 생성기, 작은 편집, 세탁된 파일로 인해 발생
- 비용: 가짜가 이의 제기 없이 통과됨
- 사람들이 덜 알아차리는 실패
결정선을 이동하는 것은 둘 중 하나를 양보하는 것입니다. 기준을 낮추면 더 많은 가짜를 잡아내는 동시에 더 많은 실제 사진도 오탐지합니다. 기준을 높이면 진짜 이미지를 보호하고 더 많은 가짜가 통과되도록 허용합니다. 둘 다 개선하는 설정은 존재하지 않으며, 이것이 바로 기준선을 조용히 조정하지 않고 65로 공개하는 이유입니다.
벤치마크 수치가 실제 성능을 과장하는 이유
| 벤치마크 이미지 | 내 이미지 | 점수에 미치는 영향 |
|---|---|---|
| 원본 파일, 재저장된 적 없음 | 2~3회 압축됨 | 정확도가 몇 포인트 하락함 |
| 전체 해상도 | 채팅 앱을 위해 자르거나 다운스케일됨 | 읽을 수 있는 디테일이 줄어들고 불확실성이 커짐 |
| 학습 시점에 알려진 생성기 | 지난달에 출시된 모델 | 모든 탐지기가 가진 고질적인 약점 |
| 깨끗한 사진 또는 깨끗한 렌더링 | AI 편집이 1회 포함된 실제 사진 | 전체 프레임 점수는 이를 과소평가함 |
| 적대적 처리 없음 | 우회를 위해 의도적으로 변조됨 | 측정을 무력화하도록 설계됨 |
이 중 어느 것도 예외적인 사례가 아닙니다. 이미지가 실제로 유통되는 방식을 설명합니다. 두 개의 플랫폼과 스크린샷을 거쳐 도달한 사진은 이미 벤치마크가 측정되었던 신호의 대부분을 잃어버린 상태입니다.
정확도 주장을 읽는 방법
- 어떤 테스트셋인지 물어보세요. 이름이 명시된 벤치마크가 없는 수치는 마케팅 용어일 뿐입니다. 공개된 벤치마크의 수치는 다른 사람이 검증할 수 있습니다.
- 균형 잡힌 세트인지 단순 세트인지 물어보세요. 한쪽으로 치우친 테스트셋에서의 단순 정확도는 가장 부풀리기 쉬운 수치입니다.
- 결정선이 어디에 위치하는지 물어보세요. 측정된 임계값을 모르면 정확도는 의미가 없습니다.
- 어떤 생성기가 포함되었는지 물어보세요. 모든 탐지기는 자신이 학습한 모델에서는 높은 점수를 내고, 그 이후에 출시된 모델에서는 낮은 점수를 냅니다.
- 오탐지율을 별도로 문의하세요. 이는 실제 사람에게 해당 도구를 사용하는 것이 안전한지 여부를 결정하는 수치입니다.
정확도가 말해주지 않는 것
벤치마크는 이미지 집단 전체에서 모델이 얼마나 자주 정답을 맞히는지 측정합니다. 이는 귀하의 이미지에서도 정답을 맞힐 것인지에 대해 아무것도 말해주지 않습니다. 단일 결과에는 신뢰 구간이 첨부되지 않으며, 탐지기는 자신이 범하고 있는 오류 중 어떤 오류를 범했는지 알 수 없습니다.
이것이 바로 영역 맵과 파일 증거가 헤드라인 수치보다 더 중요한 이유입니다. 독립적인 신호 간의 일치는 그중 하나에서 나온 강력한 수치보다 더 가치 있으며, 불일치 그 자체로 하나의 발견입니다.
탐지기를 직접 테스트하는 방법
누군가의 수치를 맹신할 필요는 없습니다. 유용한 테스트는 오후 반나절이면 충분하며, 귀하의 이미지와 유사한 이미지를 사용하기 때문에 어떤 공개된 벤치마크보다 해당 도구에 대해 더 많은 것을 알려줍니다.
-
이미 결과를 알고 있는 테스트셋 구축하기
직접 촬영한 사진 20장과 생성된 이미지 20장을 준비하세요. 원본은 그대로 유지하세요. 각각 20장이면 명백히 성능이 떨어지는 도구를 노출하기에 충분합니다.
-
어색한 중간 단계 포함하기
자신의 사진 스크린샷, 야간 모드 촬영 샷, 업스케일된 크롭 이미지, 그리고 심하게 보정된 인물 사진을 추가하세요. 이곳이 탐지기가 실패하는 지점이며, 모든 공급 업체의 벤치마크가 누락하는 부분입니다.
-
판정이 아닌 점수와 구간 기록하기
각 도구가 반환한 값을 적어두세요. 두 도구는 결정선을 서로 다른 곳에 둘 수 있으므로, 숫자를 비교하는 것보다 구간을 비교하는 것이 더 유익합니다.
-
두 가지 오류 유형을 별도로 집계하기
실제 사진 중 몇 개가 오탐지되었고, 생성된 이미지 중 몇 개를 놓쳤는지 확인하세요. 자신의 사진 중 3분의 1을 가짜로 판정하여 가짜를 하나도 놓치지 않는 도구는 사람에게 사용할 수 없습니다.
중요한 수치는 첫 번째 수치입니다. 즉, 자신의 작업을 얼마나 자주 가짜로 판정하느냐 하는 것입니다. 그것이 비용이 수반되는 실패이며, 헤드라인 정확도 수치가 평균화하여 숨기는 부분입니다.