자동 제재가 여기서 실패하는 이유
실험실 조건 하에서 91퍼센트의 균형 잡힌 정확도를 보일 때, 대략 11건 중 1건은 오판입니다. 스크린샷으로 찍히고, 재압축되며, 잘려나간 상태로 유입되는 사용자 생성 콘텐츠의 경우 실제 오인율은 더 높습니다.
하루에 10만 개의 항목에 적용하면 수천 건의 잘못된 조치가 발생합니다. 각 조치는 이의 제기로 이어지며, 이의 제기 비용은 자동화가 대체한 검토 비용보다 건당 더 큽니다. 실제 게시물을 삭제함으로써 발생하는 평판 비용을 고려하기 전에도 수학적 수지타산이 맞지 않습니다.
모더레이션에 특화된 두 번째 문제가 있습니다. 제재 결정은 감사를 받습니다. 계정이 삭제된 이유를 묻는 규제 기관이나 법원에 공개되지 않은 임계값을 가진 모델 출력을 이유로 제시할 수 없습니다.
조치가 아닌 정렬을 위한 점수
유용한 프레임워크는 대기열 정렬입니다. 검토자보다 처리할 항목이 더 많습니다. 점수는 사람이 먼저 볼 항목을 결정하며, 정확도가 85퍼센트일 때도 이 작업은 잘 수행할 수 있습니다. 틀리더라도 누군가 불필요한 것을 한 번 더 살펴보는 것을 의미할 뿐이기 때문입니다.
- 1 90 초과 검토 대기열의 최우선 순위
- 2 65에서 90 사이 일반적인 기간 내 검토
- 3 45에서 65 사이 사용자가 신고한 경우에만
- 4 45 미만 조치 없음, 품질 검사를 위해 샘플링
하위 구간 샘플링은 보기보다 훨씬 중요합니다. 이는 위음성률을 측정하는 유일한 방법이며, 이 수치가 없으면 시스템이 정상 작동 중인지 아니면 아무것도 잡지 못하고 멈춰 있는지 알 수 없습니다.
정책에 명시해야 하는 내용
대부분의 플랫폼에는 이제 합성 미디어 규칙이 있지만, 대부분 잘못 작성되어 있습니다. 흔한 실패 사례는 AI 콘텐츠를 전면 금지하는 것으로, 이는 집행 불가능하며 아무도 의도하지 않은 콘텐츠까지 잡아내게 됩니다.
| 집행 가능 | 집행 불가 | 이유 |
|---|---|---|
| 실제 인물의 공개되지 않은 합성 미디어 | 모든 AI 생성 이미지 | 두 번째는 일러스트레이션과 디자인 작업까지 금지합니다. |
| 보도 증거로 제시된 생성 이미지 | 65를 초과하는 모든 것 | 임계값은 정책이 아닙니다 |
| 금전을 목적으로 기만하기 위해 사용된 합성 미디어 | AI 생성으로 보이는 이미지 | 보는 것만으로는 기준이 될 수 없습니다 |
| 요청받았을 때 라벨링하지 않은 경우 | 어떤 형태든 공개되지 않은 AI | 증명할 수 없으며 사용자가 준수할 수 없음 |
기법보다는 피해와 공개 여부를 중심으로 규칙을 작성하세요. 픽션 게시물에 사용된 생성 일러스트레이션은 누구에게도 해를 끼치지 않습니다. 제품, 사람 또는 행사의 생성된 사진을 실제인 것처럼 제시하는 것이 바로 실제로 막고자 하는 대상입니다.
영역 맵이 분리하는 세 가지 경우
전체 프레임 점수는 서로 다른 처리가 필요한 세 가지 상황을 하나로 묶어버립니다. 타일 뷰는 이를 구분해 주며, 이 구분이 대개 결과를 결정합니다.
- 모든 타일이 높음. 완전히 생성된 이미지입니다. 실제의 사진으로 제시된 경우, 가장 명확한 조치 대상입니다.
- 하나의 타일만 높음. 무언가가 추가되거나 제거된 실제 사진입니다. 마켓플레이스나 뉴스 맥락에서는 이것이 완전한 생성보다 더 심각한 경우가 많은데, 믿도록 유도하기 위해 설계되었기 때문입니다.
- 전반적으로 따뜻하지만 높은 곳은 없음. 과도한 프로세싱입니다. 대개 필터나 업스케일러를 거친 실제 사진입니다. 조치할 가치가 거의 없습니다.
삽입된 요소가 있는 실제 사진입니다. 헤드라인 점수만을 기준으로 대기열을 정렬했다면 절대 표면에 드러나지 않을 것입니다.
작동 여부 측정
-
최상위 구간의 정밀도 추적
모더레이터가 연 90점 이상의 항목 중 실제로 조치된 것은 몇 개인가요? 이 숫자가 낮다면, 도구가 업무를 절감하는 것이 아니라 오히려 일을 만들고 있는 것입니다.
-
매주 하위 구간 샘플링
45 미만에서 무작위로 100개를 추출하여 검토하세요. 이는 놓치고 있는 부분을 측정하는 유일한 방법이지만, 팀들이 가장 건너뛰는 부분이기도 합니다.
-
이의 제기율 모니터링
합성 미디어 결정에 대한 성공적인 이의 제기의 표면화는 임계값이 틀어졌거나 낮은 점수를 받는 새로운 생성기가 등장했음을 의미합니다.
-
모델이 변경될 때마다 기준 재설정
감지기 업데이트는 점수를 변화시킵니다. 다른 모델 버전을 대상으로 6개월 전에 조정된 임계값은 더 이상 기대했던 임계값이 아닙니다.
도구가 생성하는 대기열의 인력 배치
모더레이션 파이프라인에 감지기를 추가한다고 해서 인력이 줄어들지는 않으며, 이를 기대했던 팀들은 오히려 더 나쁜 상황에 직면하게 됩니다. 변화하는 것은 작업이 유입되는 순서이며, 이는 필요한 인원수를 줄이지 않으면서도 검토자 1인당 시간의 가치를 높여줍니다.
플래그가 지정된 대기열은 일반 대기열보다 항목당 처리 시간이 더 오래 걸릴 수 있도록 예산을 책정하세요. 플래그가 지정된 게시물을 살펴보는 검토자는 더 모호한 자료에 대해 더 어려운 결정을 내리고 있으며, 이를 서두르는 것이 잘못된 제재로 이어지는 원인입니다. 항목당 2분은 현실적이지만 30초는 아닙니다.
점수 대신 검토자에게 영역 맵을 제공하세요. 이미지의 한쪽 구석이 의심스럽다는 것을 볼 수 있는 모더레이터가 단순히 숫자 하나만 전달받은 사람보다 더 나은 결정을 내리며, 나중에 이의 제기 팀이나 규제 기관에 그 결정을 설명할 수 있습니다.
합성 미디어 검토 업무에서 인력을 순환시키세요. 이는 모호한 사례의 비중이 높은 반복적인 작업이며, 교대 근무가 길어질수록 정확도가 눈에 띄게 떨어집니다. 이는 다른 카테고리에 대해 모든 모더레이션 조직이 이미 배운 교훈과 같습니다.