← 모든 가이드 정확도

AI 이미지 detector 정확도: 91%의 진정한 의미

균형 정확도, 결정선, 벤치마크와 내 이미지의 차이. 헤드라인 숫자가 다루는 내용과 조용히 누락하는 내용.

· 7 분 읽기 · Best AI Image Detector

91.3%의 균형 정확도는 실험실 조건의 깨끗한 파일 환경에서 대략 11장의 이미지 중 1장이 잘못된 결정선에 도달함을 의미합니다. 귀하의 이미지는 실험실 조건이 아닙니다.

균형 정확도가 측정하는 것

단순 정확도는 부풀리기 쉽습니다. 생성된 이미지가 90%인 테스트 세트와 모든 것에 '예'라고 답하는 모델에 입력하면, 아무 쓸모가 없으면서도 90%의 점수를 얻게 됩니다.

균형 정확도는 실제 이미지와 생성된 이미지에 동일한 가중치를 부여하여 이를 해결합니다. 따라서 이 수치는 실제 사진이 올바르게 통과된 비율과 생성된 이미지가 올바르게 플래그 지정된 비율의 평균입니다. 테스트 구성 비율을 밝히지 않고 단순 정확도만 인용하는 도구는 많은 것을 말해주지 않는 것입니다.

JPEG 품질별 균형 정확도
깨끗한 원본
91.3 %
JPEG 품질 60
87.3 %
JPEG 품질 40
84.6 %

기울기를 쉽게 읽을 수 있도록 축이 80%에서 시작합니다. 전체 0-100 축은 효과를 완전히 숨깁니다.

연구 벤치마크에서 측정된, 여기에 사용된 모델에 대한 공표된 수치.

탐지기가 틀리는 두 가지 방식

하나의 숫자는 완전히 다른 두 가지 오류를 숨기며, 비용도 매우 다릅니다.

위양성

  • 실제 사진이 선 위에 점수가 매겨짐
  • 업스케일링, 리터칭, 야간 모드, 스크린샷으로 인해 발생
  • 비용: 실제 사람에 대한 비난
  • 실제 피해를 입히는 실패

위음성

  • 생성된 이미지가 선 아래에 점수가 매겨짐
  • 새로운 생성기, 작은 편집, 세탁된 파일로 인해 발생
  • 비용: 가짜가 이의 제기 없이 통과됨
  • 사람들이 덜 알아차리는 실패
단일 정확도 수치는 이 둘을 평균화합니다. 이 둘은 상호 교환할 수 없으며, 대부분의 사람들은 그중 하나에 훨씬 더 신경을 씁니다.

결정선을 이동하는 것은 둘 중 하나를 양보하는 것입니다. 기준을 낮추면 더 많은 가짜를 잡아내는 동시에 더 많은 실제 사진도 오탐지합니다. 기준을 높이면 진짜 이미지를 보호하고 더 많은 가짜가 통과되도록 허용합니다. 둘 다 개선하는 설정은 존재하지 않으며, 이것이 바로 기준선을 조용히 조정하지 않고 65로 공개하는 이유입니다.

벤치마크 수치가 실제 성능을 과장하는 이유

테스트셋과 누군가 나에게 보낸 이미지 사이의 간격
벤치마크 이미지내 이미지점수에 미치는 영향
원본 파일, 재저장된 적 없음2~3회 압축됨정확도가 몇 포인트 하락함
전체 해상도채팅 앱을 위해 자르거나 다운스케일됨읽을 수 있는 디테일이 줄어들고 불확실성이 커짐
학습 시점에 알려진 생성기지난달에 출시된 모델모든 탐지기가 가진 고질적인 약점
깨끗한 사진 또는 깨끗한 렌더링AI 편집이 1회 포함된 실제 사진전체 프레임 점수는 이를 과소평가함
적대적 처리 없음우회를 위해 의도적으로 변조됨측정을 무력화하도록 설계됨

이 중 어느 것도 예외적인 사례가 아닙니다. 이미지가 실제로 유통되는 방식을 설명합니다. 두 개의 플랫폼과 스크린샷을 거쳐 도달한 사진은 이미 벤치마크가 측정되었던 신호의 대부분을 잃어버린 상태입니다.

정확도 주장을 읽는 방법

  • 어떤 테스트셋인지 물어보세요. 이름이 명시된 벤치마크가 없는 수치는 마케팅 용어일 뿐입니다. 공개된 벤치마크의 수치는 다른 사람이 검증할 수 있습니다.
  • 균형 잡힌 세트인지 단순 세트인지 물어보세요. 한쪽으로 치우친 테스트셋에서의 단순 정확도는 가장 부풀리기 쉬운 수치입니다.
  • 결정선이 어디에 위치하는지 물어보세요. 측정된 임계값을 모르면 정확도는 의미가 없습니다.
  • 어떤 생성기가 포함되었는지 물어보세요. 모든 탐지기는 자신이 학습한 모델에서는 높은 점수를 내고, 그 이후에 출시된 모델에서는 낮은 점수를 냅니다.
  • 오탐지율을 별도로 문의하세요. 이는 실제 사람에게 해당 도구를 사용하는 것이 안전한지 여부를 결정하는 수치입니다.

정확도가 말해주지 않는 것

벤치마크는 이미지 집단 전체에서 모델이 얼마나 자주 정답을 맞히는지 측정합니다. 이는 귀하의 이미지에서도 정답을 맞힐 것인지에 대해 아무것도 말해주지 않습니다. 단일 결과에는 신뢰 구간이 첨부되지 않으며, 탐지기는 자신이 범하고 있는 오류 중 어떤 오류를 범했는지 알 수 없습니다.

이것이 바로 영역 맵과 파일 증거가 헤드라인 수치보다 더 중요한 이유입니다. 독립적인 신호 간의 일치는 그중 하나에서 나온 강력한 수치보다 더 가치 있으며, 불일치 그 자체로 하나의 발견입니다.

탐지기를 직접 테스트하는 방법

누군가의 수치를 맹신할 필요는 없습니다. 유용한 테스트는 오후 반나절이면 충분하며, 귀하의 이미지와 유사한 이미지를 사용하기 때문에 어떤 공개된 벤치마크보다 해당 도구에 대해 더 많은 것을 알려줍니다.

  1. 이미 결과를 알고 있는 테스트셋 구축하기

    직접 촬영한 사진 20장과 생성된 이미지 20장을 준비하세요. 원본은 그대로 유지하세요. 각각 20장이면 명백히 성능이 떨어지는 도구를 노출하기에 충분합니다.

  2. 어색한 중간 단계 포함하기

    자신의 사진 스크린샷, 야간 모드 촬영 샷, 업스케일된 크롭 이미지, 그리고 심하게 보정된 인물 사진을 추가하세요. 이곳이 탐지기가 실패하는 지점이며, 모든 공급 업체의 벤치마크가 누락하는 부분입니다.

  3. 판정이 아닌 점수와 구간 기록하기

    각 도구가 반환한 값을 적어두세요. 두 도구는 결정선을 서로 다른 곳에 둘 수 있으므로, 숫자를 비교하는 것보다 구간을 비교하는 것이 더 유익합니다.

  4. 두 가지 오류 유형을 별도로 집계하기

    실제 사진 중 몇 개가 오탐지되었고, 생성된 이미지 중 몇 개를 놓쳤는지 확인하세요. 자신의 사진 중 3분의 1을 가짜로 판정하여 가짜를 하나도 놓치지 않는 도구는 사람에게 사용할 수 없습니다.

중요한 수치는 첫 번째 수치입니다. 즉, 자신의 작업을 얼마나 자주 가짜로 판정하느냐 하는 것입니다. 그것이 비용이 수반되는 실패이며, 헤드라인 정확도 수치가 평균화하여 숨기는 부분입니다.

자주 묻는 질문

AI 이미지 탐지기의 정확도가 91%라면 좋은 수준인가요?
이는 깨끗한 벤치마크 상에서 픽셀 기반 탐지기로서는 합리적인 수치이지만, 단독으로 조치를 취하기에는 충분히 높지 않습니다. 각각의 오판이 비난이 될 수 있는 상황에서 백 장 중 아홉 장의 오판은 적지 않은 수입니다. 문제를 해결하는 최종 테스트가 아니라 어디를 살펴봐야 할지 알려주는 스크리닝 도구로 취급하세요.
어떤 AI 이미지 탐지기가 가장 정확한가요?
정직한 답변은 공개된 수치들이 서로 비교될 수 없다는 것입니다. 서로 다른 도구는 서로 다른 테스트셋, 서로 다른 결정선, 서로 다른 정확도 정의를 사용하므로 해당 수치들은 서로 다른 것을 측정합니다. 대신 도구가 보여주는 것, 즉 공개된 구간, 영역 맵, 명시된 오탐지율을 비교하세요.
모델이 발전함에 따라 정확도도 향상되나요?
탐지와 생성은 함께 발전하므로 격차는 대략 일정하게 유지됩니다. 모든 새로운 생성기는 기존의 모든 탐지기에게 미지의 데이터이며, 재학습은 출시보다 선행되지 않고 뒤따릅니다. 문제가 해결되는 것을 기대하기보다는 영구적인 지연이 있음을 예상하세요.
왜 동일한 도구가 동일한 사진에 대해 서로 다른 점수를 부여하나요?
그럴 리가 없으며, 만약 그렇다면 두 파일은 서로 다릅니다. 다시 저장되거나 크기가 조정되었거나 플랫폼을 거쳐간 사본은 서로 다른 픽셀을 가진 다른 파일입니다. 다운로드된 파일과 원본을 비교하지 말고 원본과 원본을 비교하세요.