챗봇이 실제로 하고 있는 일
멀티모달 언어 모델은 이미지를 의미적 설명으로 변환한 다음 텍스트로 해당 설명을 추론합니다. 이는 이 사진이 훈련 중에 읽은 AI 이미지처럼 보이는가라는 질문에 답하는 것입니다.
그것은 콘텐츠와 구성에 관한 질문입니다. 탐지는 텍스처에 관한 질문입니다. 의미적 설명이 보존하는 것보다 훨씬 작은 규모에서 인접 픽셀 값이 서로 어떻게 관련되어 있는지 다룹니다.
탐지가 읽어내는 정보는 언어 모델이 사고를 시작하기 전에 폐기됩니다. 챗봇이 이 작업을 잘 못한다는 뜻이 아닙니다. 챗봇은 증거를 포함하지 않는 표현 방식을 기반으로 작동하고 있습니다.
그것이 실제로 만들어내는 결과
- 임계값이 없는 자신 있는 답변. 챗봇은 '가능성이 높다'라는 단어 뒤에 어떠한 규모도 없이 'AI 생성 가능성이 높다'고 말할 것입니다. 숫자도, 대역도, 다른 이미지와 비교할 기준도 없습니다.
- 낡은 티에 기반한 추론. 모델들은 손가락, 치아, 왁스 같은 피부, 왜곡된 텍스트를 언급하는데, 훈련 텍스트가 그렇게 찾으라고 지시하기 때문입니다. 그것들은 몇 년 전에 해결된 문제입니다.
- 여러분의 프레이밍에 대한 동조. 이미지가 가짜인지 물어보면 중립적으로 물어봤을 때보다 '그렇다'라는 답변을 들을 가능성이 더 높습니다. 그것은 사진의 속성이 아니라 인터페이스의 속성입니다.
- 재현성 없음. 두 번 물어보면 동일한 파일에 대해 각각 똑같이 자신 있는 설명과 함께 두 가지 다른 답변을 얻을 수 있습니다.
- 영역 정보 없음. 사진의 한 구석이 나머지 부분과 다르게 작동한다고 알려주지 못하며, 이는 대개 중요한 핵심 결과입니다.
| 기능 | 챗봇 | 픽셀 탐지기 |
|---|---|---|
| 픽셀 수준의 텍스트 읽기 | No | Yes |
| 공개된 대역이 있는 보정된 점수 | No | Yes |
| 매번 동일한 답변 | No | Yes |
| 영역별 세부 분석 | No | Yes |
| 벤치마크와 비교됨 | No | Yes |
| 산문으로 추론 과정 설명 | Yes 유창하게 | Partly 신호로서 |
| 사진에 무엇이 있는지 설명합니다 | Yes | No |
마지막 두 행이 유지할 가치가 있는 부분입니다. 언어 모델은 이미지의 내용을 설명하고 장면에 개연성이 있는지 추론하는 데 진정으로 능숙합니다. 이러한 기능은 유용하지만 탐지는 아닙니다.
챗봇이 진정으로 유용한 경우
도구를 전적으로 일축하는 것은 잘못된 교훈입니다. 도구가 할 수 있는 용도로 사용하면, 탐지기를 대체하기보다 보완하는 역할을 합니다.
-
장면을 자세히 설명해 달라고 요청합니다
주의 깊은 설명은 어울리지 않는 객체나 미처 읽지 못한 간판을 포함하여, 의식적으로 알아차리지 못했던 것들을 드러내는 경우가 많습니다.
-
장면이 물리적으로 일관성이 있는지 묻습니다
그림자, 반사, 비율 및 원근법은 추론의 문제이며, 추론은 모델의 존재 이유입니다. 이를 통해 픽셀 분석으로는 놓칠 수 있는 합성 이미지를 잡아냅니다.
-
확인하거나 반박할 수 있는 근거가 무엇인지 묻습니다
의심을 확인 항목 목록으로 바꾸는 것은 언어 모델의 좋은 활용법이며, 그 목록은 직접 작성했을 것보다 더 나은 경우가 많습니다.
-
그런 다음 실제 탐지기를 실행합니다
픽셀에 관한 문제라면 그 용도로 제작된 도구를 사용하고, 공개된 척도와 대조하여 점수를 읽어보세요.
유창함이 위험인 이유
확신이 없는 탐지기는 중간 정도의 숫자를 반환하며, 그 숫자 자체로 불확실성이 전달됩니다. 확신이 없는 언어 모델은 문단을 반환하며, 문단에는 오차 한계가 없습니다.
모델이 실제 무언가를 식별했든 아니면 그럴듯하게 들리는 아무런 내용 없는 설명을 생성했든 상관없이 동일하게 잘 구조화된 설명이 나타납니다. 독자들은 글의 품질을 바탕으로 신뢰도를 조정하는데, 이는 정확히 여기 어떠한 정보도 전달하지 않는 신호입니다.
이것이 바로 챗봇에게 묻는 것이 사진을 직접 보는 것보다 더 나쁜 시작점인 이유입니다. 여러분 자신의 불확실성은 적어도 여러분 눈에 보입니다.
다른 도구들에서도 나타나는 동일한 문제
이는 단일 제품만의 문제가 아닙니다. 이미지에 대해 의미론적으로 추론하는 모든 시스템은 동일한 한계를 가지며, 현재 탐지기로 소개되는 여러 도구들이 실제로 그 이면에서 정확히 그 작업을 수행하고 있습니다.
유용한 테스트: 사진의 사진이나 인식 가능한 피사체가 전혀 없는 이미지에 대해 도구가 무엇을 보고할지 물어보세요. 픽셀 탐지기는 콘텐츠와 관계없이 텍스처가 존재하므로 어떤 방식이든 점수를 반환합니다. 의미론적 시스템은 추론할 대상이 없으므로 거부하거나 무언가를 지어내게 됩니다.
두 번째 테스트: 동일한 파일을 두 번 실행해 보세요. 픽셀 모델은 결정론적이므로 동일한 숫자를 반환합니다. 언어 모델은 샘플링을 거치므로 두 번의 실행 결과가 다를 수 있습니다. 동일한 바이트에 대해 도구가 서로 다른 답변을 제공한다면, 그것은 무언가를 측정하고 있는 것이 아닙니다.
두 테스트 모두 도구의 작동 방식을 이해할 필요가 없습니다. 둘 다 1분이면 충분하며, 마케팅 페이지를 읽는 것보다 더 신뢰할 수 있게 측정과 설명을 구분해 줍니다.