결과가 달라지는 4가지 이유
점수는 길고 복잡한 선택의 사슬 끝에 도달한 결과물입니다. 이미지는 전혀 변하지 않았더라도 어떤 연결고리든 바꾸면 숫자는 움직입니다.
- 서로 다른 훈련 데이터. 탐지기는 자신이 본 것을 인식합니다. 수많은 오픈소스 생성기로 훈련된 모델은 특이한 모델을 잘 처리합니다. 상용 도구 상위 4개로 훈련된 모델은 그 4개는 더 잘 처리하지만 나머지는 못합니다.
- 서로 다른 판정 선. 한 도구는 60점을 의심스럽다고 하고, 다른 도구는 75점을 의심스럽다고 합니다. 동일한 수치가 한쪽 임계값은 넘고 다른쪽은 넘지 않기 때문에, 하나의 측정값에서 두 가지 판정이 나옵니다.
- 서로 다른 정의. 일부 도구는 업스케일이나 생성형 채우기를 포함하여 생성 과정이 조금이라도 개입되면 전부 감지합니다. 반면 완전히 합성된 프레임만 표시하는 도구도 있습니다. 리터칭된 인물 사진은 첫 번째 도구에는 AI이지만 두 번째 도구에는 실제 사진입니다.
- 서로 다른 전처리. 도구들은 점수를 매기기 전에 크기를 조정하고, 자르고, 다시 인코딩합니다. 중앙의 224픽셀 정사각형을 읽는 탐지기는 전체 프레임의 384픽셀을 읽는 탐지기와는 다른 그림을 보게 됩니다.
도구 D가 다른 도구들보다 더 민감한 것은 아닙니다. 더 광범위한 질문에 답하고 있을 뿐입니다. 사진이 생성기로 연출되었는지 여부가 관심사라면 도구 D는 과도하게 탐지하는 것입니다. 파일에 AI가 조금이라도 관여했는지 여부가 관심사라면 도구 D만이 그 질문에 답하고 있는 유일한 도구입니다.
각 도구가 어떤 질문에 답하는지 확인하기
| 질문 | 탐지 요인 | 일반적인 용도 |
|---|---|---|
| 이 프레임은 무에서 생성되었나요? | 전체 프레임의 합성 질감 | 뉴스, 장터 매물, 데이팅 프로필 |
| 이 중 일부가 AI로 편집되었나요? | 기준선 위에 있는 하나의 영역 | 보험, 청구, 증거 검토 |
| 이 파일에 AI가 조금이라도 닿았나요? | 업스케일링, 노이즈 제거, 생성형 채우기 | 스톡 이미지 라이브러리, 공모전 규칙 |
도구 간의 대부분의 의견 불일치는 실제로 이 세 가지 중 어떤 것에 대해 물었는지에 대한 시각 차이입니다. 결과를 비교하기 전에 어떤 질문이 중요한지 결정한 다음, 각 도구의 결과를 그에 맞춰 읽어보세요.
두 결과를 올바르게 비교하는 방법
-
두 도구에 완전히 동일한 파일 입력하기
재다운로드가 아니며, 스크린샷도 아니고, 채팅 앱을 거친 사본도 아닙니다. 바이트가 다르면 다른 이미지이므로 당연히 점수도 다르게 나옵니다.
-
숫자가 아닌 대역 비교하기
기준선이 50인 척도의 61점과 기준선이 65인 척도의 58점은 판정에 대해서는 의견이 갈리지만 측정값에 대해서는 동의하는 것입니다.
-
공개된 임계값 확인하기
기준선이 어디에 있는지 알려주지 않는 도구는 무엇과도 비교할 수 없습니다. 그 숫자는 증거가 아니라 해석할 수 없는 값으로 취급해야 합니다.
-
작동 방식을 보여주는 도구 선택하기
영역 맵, 명명된 대역, 명시된 벤치마크가 있으면 추론 과정을 확인할 수 있습니다. 아무런 근거 없는 자신감 넘치는 라벨은 그렇지 못합니다.
-
일치하는 결과를 강력한 신호로 받아들이기
두 개의 독립된 도구가 동일한 대역에 도달했다면 어느 한쪽만 사용하는 것보다 더 가치가 있습니다. 두 도구의 결과가 일치하지 않는 것은 중간값으로 절사해야 한다는 뜻이 아니라 불확실하다는 의미입니다.
의견 불일치 자체가 결과인 경우
익혀두면 유용한 하나의 패턴이 있습니다. 전체 프레임 점수는 낮게 나오면서 동시에 높은 점수를 보고하는 도구가 있다면, 이는 대개 해당 이미지가 부분 편집이 포함된 실제 사진임을 의미합니다.
첫 번째 도구는 대개 진본인 프레임 전체에 걸쳐 편집된 부분을 평균화하여 계산합니다. 두 번째 도구는 가장 강력한 영역에 가중치를 둡니다. 두 도구 모두 자신이 측정한 것에 대해서는 정확하며, 의견 불일치 그 자체가 어떤 숫자보다도 더 많은 사실을 알려줍니다.
차가운 프레임 속에서 판정 선 위에 있는 하나의 타일. 이 현상은 단일 숫자로 포착할 수 없습니다.
탐지기들이 일치된 결과를 내놓으려면
공유된 벤치마크, 공개된 판정 선, 그리고 AI 참여로 간주하는 것에 대한 합의된 정의가 있으면 대부분의 편차가 사라질 것입니다. 하지만 아직 그 어떤 것도 존재하지 않으며, 약점을 공개하는 도구가 그렇지 않은 도구보다 나빠 보이기 때문에 이를 만들어야 할 상업적 압박도 거의 없습니다.
그 전까지는 모든 점수가 비공개 척도에서 나온 것으로 취급하세요. 도구가 보여주는 증거를 읽고 라벨의 확신보다 그 증거에 더 큰 무게를 두어야 합니다.
아무도 언급하지 않는 버전 문제
탐지기는 시간에 따라 고정된 무언가가 아닙니다. 공급업체들은 예고 없이 모델을 재훈련하고, 임계값을 조정하며, 모델을 교체하지만, 거의 모든 업체가 결과물에 버전을 매기지 않습니다. 3월에 얻은 점수와 오늘 얻은 점수는 그 뒤에 서로 다른 보정이 적용된 다른 모델에서 나온 것일 수 있습니다.
결과를 기록으로 남기는 경우 이는 중요합니다. 18개월 전의 점수를 인용하는 청구 파일, 중재 로그 또는 학술 사례는 이제 존재하지 않는 측정 기기의 수치를 인용하는 것입니다. 이를 재현할 방법도 없고 당시 그것이 무슨 의미였는지 확인할 방법도 없습니다.
결과를 보관할 때는 증거도 함께 남기십시오. 영역 점수, 밴드, 판정선, 날짜가 그것입니다. 단순한 백분율 수치와 달리, 이러한 데이터는 그 배후의 모델이 바뀐 이후에도 계속해서 해석 가능성을 유지합니다.