← 모든 가이드 신뢰 및 안전

대규모 AI 생성 이미지 모더레이션

트리아지 임계값, 일괄 작업 흐름, 그리고 점수에 따른 자동 차단이 잘못된 정책인 이유. 신뢰 및 안전 팀을 위한 실무 가이드.

· 7 분 읽기 · Best AI Image Detector

검토 대기열을 정렬하는 용도로만 점수를 사용하고, 계정 조치에는 절대 사용하지 마세요. 감지기에는 오인율이 존재하므로 자동 제재는 불공정하며, 이의 제기 비용이 트리아지로 절감되는 비용보다 더 큽니다.

자동 제재가 여기서 실패하는 이유

실험실 조건 하에서 91퍼센트의 균형 잡힌 정확도를 보일 때, 대략 11건 중 1건은 오판입니다. 스크린샷으로 찍히고, 재압축되며, 잘려나간 상태로 유입되는 사용자 생성 콘텐츠의 경우 실제 오인율은 더 높습니다.

하루에 10만 개의 항목에 적용하면 수천 건의 잘못된 조치가 발생합니다. 각 조치는 이의 제기로 이어지며, 이의 제기 비용은 자동화가 대체한 검토 비용보다 건당 더 큽니다. 실제 게시물을 삭제함으로써 발생하는 평판 비용을 고려하기 전에도 수학적 수지타산이 맞지 않습니다.

모더레이션에 특화된 두 번째 문제가 있습니다. 제재 결정은 감사를 받습니다. 계정이 삭제된 이유를 묻는 규제 기관이나 법원에 공개되지 않은 임계값을 가진 모델 출력을 이유로 제시할 수 없습니다.

조치가 아닌 정렬을 위한 점수

유용한 프레임워크는 대기열 정렬입니다. 검토자보다 처리할 항목이 더 많습니다. 점수는 사람이 먼저 볼 항목을 결정하며, 정확도가 85퍼센트일 때도 이 작업은 잘 수행할 수 있습니다. 틀리더라도 누군가 불필요한 것을 한 번 더 살펴보는 것을 의미할 뿐이기 때문입니다.

  1. 1 90 초과 검토 대기열의 최우선 순위
  2. 2 65에서 90 사이 일반적인 기간 내 검토
  3. 3 45에서 65 사이 사용자가 신고한 경우에만
  4. 4 45 미만 조치 없음, 품질 검사를 위해 샘플링
구간은 결과가 아니라 대기열 경로에 매핑됩니다. 이 다이어그램의 어떤 내용도 콘텐츠를 단독으로 삭제하지 않습니다.

하위 구간 샘플링은 보기보다 훨씬 중요합니다. 이는 위음성률을 측정하는 유일한 방법이며, 이 수치가 없으면 시스템이 정상 작동 중인지 아니면 아무것도 잡지 못하고 멈춰 있는지 알 수 없습니다.

정책에 명시해야 하는 내용

대부분의 플랫폼에는 이제 합성 미디어 규칙이 있지만, 대부분 잘못 작성되어 있습니다. 흔한 실패 사례는 AI 콘텐츠를 전면 금지하는 것으로, 이는 집행 불가능하며 아무도 의도하지 않은 콘텐츠까지 잡아내게 됩니다.

규칙을 적용할 수 있는 경우와 없는 경우
집행 가능집행 불가이유
실제 인물의 공개되지 않은 합성 미디어모든 AI 생성 이미지두 번째는 일러스트레이션과 디자인 작업까지 금지합니다.
보도 증거로 제시된 생성 이미지65를 초과하는 모든 것임계값은 정책이 아닙니다
금전을 목적으로 기만하기 위해 사용된 합성 미디어AI 생성으로 보이는 이미지보는 것만으로는 기준이 될 수 없습니다
요청받았을 때 라벨링하지 않은 경우어떤 형태든 공개되지 않은 AI증명할 수 없으며 사용자가 준수할 수 없음

기법보다는 피해와 공개 여부를 중심으로 규칙을 작성하세요. 픽션 게시물에 사용된 생성 일러스트레이션은 누구에게도 해를 끼치지 않습니다. 제품, 사람 또는 행사의 생성된 사진을 실제인 것처럼 제시하는 것이 바로 실제로 막고자 하는 대상입니다.

영역 맵이 분리하는 세 가지 경우

전체 프레임 점수는 서로 다른 처리가 필요한 세 가지 상황을 하나로 묶어버립니다. 타일 뷰는 이를 구분해 주며, 이 구분이 대개 결과를 결정합니다.

  • 모든 타일이 높음. 완전히 생성된 이미지입니다. 실제의 사진으로 제시된 경우, 가장 명확한 조치 대상입니다.
  • 하나의 타일만 높음. 무언가가 추가되거나 제거된 실제 사진입니다. 마켓플레이스나 뉴스 맥락에서는 이것이 완전한 생성보다 더 심각한 경우가 많은데, 믿도록 유도하기 위해 설계되었기 때문입니다.
  • 전반적으로 따뜻하지만 높은 곳은 없음. 과도한 프로세싱입니다. 대개 필터나 업스케일러를 거친 실제 사진입니다. 조치할 가치가 거의 없습니다.
13 17 11 15 91 14 12 16 10

삽입된 요소가 있는 실제 사진입니다. 헤드라인 점수만을 기준으로 대기열을 정렬했다면 절대 표면에 드러나지 않을 것입니다.

중간 사례. 33점의 전체 프레임 점수라면 이 항목을 통과시켰을 것입니다.

작동 여부 측정

  1. 최상위 구간의 정밀도 추적

    모더레이터가 연 90점 이상의 항목 중 실제로 조치된 것은 몇 개인가요? 이 숫자가 낮다면, 도구가 업무를 절감하는 것이 아니라 오히려 일을 만들고 있는 것입니다.

  2. 매주 하위 구간 샘플링

    45 미만에서 무작위로 100개를 추출하여 검토하세요. 이는 놓치고 있는 부분을 측정하는 유일한 방법이지만, 팀들이 가장 건너뛰는 부분이기도 합니다.

  3. 이의 제기율 모니터링

    합성 미디어 결정에 대한 성공적인 이의 제기의 표면화는 임계값이 틀어졌거나 낮은 점수를 받는 새로운 생성기가 등장했음을 의미합니다.

  4. 모델이 변경될 때마다 기준 재설정

    감지기 업데이트는 점수를 변화시킵니다. 다른 모델 버전을 대상으로 6개월 전에 조정된 임계값은 더 이상 기대했던 임계값이 아닙니다.

도구가 생성하는 대기열의 인력 배치

모더레이션 파이프라인에 감지기를 추가한다고 해서 인력이 줄어들지는 않으며, 이를 기대했던 팀들은 오히려 더 나쁜 상황에 직면하게 됩니다. 변화하는 것은 작업이 유입되는 순서이며, 이는 필요한 인원수를 줄이지 않으면서도 검토자 1인당 시간의 가치를 높여줍니다.

플래그가 지정된 대기열은 일반 대기열보다 항목당 처리 시간이 더 오래 걸릴 수 있도록 예산을 책정하세요. 플래그가 지정된 게시물을 살펴보는 검토자는 더 모호한 자료에 대해 더 어려운 결정을 내리고 있으며, 이를 서두르는 것이 잘못된 제재로 이어지는 원인입니다. 항목당 2분은 현실적이지만 30초는 아닙니다.

점수 대신 검토자에게 영역 맵을 제공하세요. 이미지의 한쪽 구석이 의심스럽다는 것을 볼 수 있는 모더레이터가 단순히 숫자 하나만 전달받은 사람보다 더 나은 결정을 내리며, 나중에 이의 제기 팀이나 규제 기관에 그 결정을 설명할 수 있습니다.

합성 미디어 검토 업무에서 인력을 순환시키세요. 이는 모호한 사례의 비중이 높은 반복적인 작업이며, 교대 근무가 길어질수록 정확도가 눈에 띄게 떨어집니다. 이는 다른 카테고리에 대해 모든 모더레이션 조직이 이미 배운 교훈과 같습니다.

자주 묻는 질문

점수 임계값을 초과하는 콘텐츠를 자동으로 삭제할 수 있나요?
기술적으로는 가능하지만, 해서는 안 됩니다. 현실적인 정확도 수준에서는 대규모로 수천 건의 잘못된 삭제가 발생하며, 각 건은 이의 제기로 이어지고 그중 일부는 규제 문제로 번집니다. 점수를 사용하여 사람이 검토하는 대기열을 정렬하세요. 우수한 정렬을 통해 절약되는 검토자의 시간은 자동화가 절약해 주는 시간보다 더 큽니다.
검토를 위해 어떤 임계값을 설정해야 하나요?
공개된 결정 선 위의 모든 항목을 라우팅하고 그 아래를 샘플링하는 것으로 시작한 다음, 벤더의 권장 사항이 아닌 자체 정밀도 수치에 맞춰 조정하세요. 콘텐츠 구성에 따라 올바른 임계값이 결정되며, 일러스트레이션이 가득한 플랫폼은 뉴스 사진이 가득한 플랫폼과 다른 기준선이 필요합니다.
이의 제기는 어떻게 처리하나요?
원본 파일을 요청하세요. 대부분의 성공적인 이의 제기는 업로드 과정에서 실제 사진이 재압축된 사용자로부터 발생하며, 소스를 다시 확인하면 대개 한 단계로 해결됩니다. 이의 제기 데이터는 임계값이 틀어졌음을 알려주는 가장 빠른 신호이므로 결과를 기록해 두세요.
사용자에게 이미지가 감지기에 의해 플래그 지정되었다고 알려야 하나요?
검사가 수행되었다고 알리는 것은 공정하며 점점 더 기대되는 바입니다. 정확한 임계값을 공개하는 것은 테스트를 자처하는 누구에게나 회피 목표를 넘겨주는 것이므로 바람직하지 않습니다. 자동화된 신호가 검토에 참고되며 모든 결정은 사람이 내린다고 명시하세요.
비디오에도 이 방법이 작동하나요?
정지 이미지 감지기로는 작동하지 않습니다. 비디오를 프레임별로 확인하면 엄청난 볼륨이 생성되는 반면, 조작된 비디오에서 가장 강력한 신호인 시간적 아티팩트는 놓치게 됩니다. 비디오는 별도의 도구가 필요한 별개의 문제로 다루어야 합니다.
사용자가 합법적으로 생성한 이미지의 경우는 어떻게 하나요?
삭제보다는 라벨링을 선택하세요. 업로드 시 공개 필드를 제공하고, 검토를 위해 미공개 사례에 플래그를 지정하는 검사 과정을 뒷받침하면 실효성 있는 규칙을 마련할 수 있습니다. 라벨링 요건을 준수하는 사용자는 제재를 받지 않아야 하며, 이것이 바로 정책을 정당화하는 요인입니다.