← 모든 가이드 비교

ChatGPT가 이미지가 AI 생성인지 판별할 수 있나요?

근거 없이 자신 있는 답변을 내놓을 것입니다. 언어 모델이 왜 이를 수행할 수 없는지, 실제로 무엇을 하고 있는지, 대신 무엇을 사용해야 하는지 설명합니다.

· 7 분 읽기 · Best AI Image Detector

아니요. 언어 모델은 이미지의 외형을 설명하고 그것을 언어로 추론할 뿐입니다. 보정된 임계값도, 벤치마크도 없으며 탐지가 의존하는 픽셀 통계에 접근할 수도 없습니다.

챗봇이 실제로 하고 있는 일

멀티모달 언어 모델은 이미지를 의미적 설명으로 변환한 다음 텍스트로 해당 설명을 추론합니다. 이는 이 사진이 훈련 중에 읽은 AI 이미지처럼 보이는가라는 질문에 답하는 것입니다.

그것은 콘텐츠와 구성에 관한 질문입니다. 탐지는 텍스처에 관한 질문입니다. 의미적 설명이 보존하는 것보다 훨씬 작은 규모에서 인접 픽셀 값이 서로 어떻게 관련되어 있는지 다룹니다.

탐지가 읽어내는 정보는 언어 모델이 사고를 시작하기 전에 폐기됩니다. 챗봇이 이 작업을 잘 못한다는 뜻이 아닙니다. 챗봇은 증거를 포함하지 않는 표현 방식을 기반으로 작동하고 있습니다.

그것이 실제로 만들어내는 결과

  • 임계값이 없는 자신 있는 답변. 챗봇은 '가능성이 높다'라는 단어 뒤에 어떠한 규모도 없이 'AI 생성 가능성이 높다'고 말할 것입니다. 숫자도, 대역도, 다른 이미지와 비교할 기준도 없습니다.
  • 낡은 티에 기반한 추론. 모델들은 손가락, 치아, 왁스 같은 피부, 왜곡된 텍스트를 언급하는데, 훈련 텍스트가 그렇게 찾으라고 지시하기 때문입니다. 그것들은 몇 년 전에 해결된 문제입니다.
  • 여러분의 프레이밍에 대한 동조. 이미지가 가짜인지 물어보면 중립적으로 물어봤을 때보다 '그렇다'라는 답변을 들을 가능성이 더 높습니다. 그것은 사진의 속성이 아니라 인터페이스의 속성입니다.
  • 재현성 없음. 두 번 물어보면 동일한 파일에 대해 각각 똑같이 자신 있는 설명과 함께 두 가지 다른 답변을 얻을 수 있습니다.
  • 영역 정보 없음. 사진의 한 구석이 나머지 부분과 다르게 작동한다고 알려주지 못하며, 이는 대개 중요한 핵심 결과입니다.
기능 챗봇 픽셀 탐지기
픽셀 수준의 텍스트 읽기 No Yes
공개된 대역이 있는 보정된 점수 No Yes
매번 동일한 답변 No Yes
영역별 세부 분석 No Yes
벤치마크와 비교됨 No Yes
산문으로 추론 과정 설명 Yes 유창하게 Partly 신호로서
사진에 무엇이 있는지 설명합니다 Yes No
각 접근 방식이 실제로 생성할 수 있는 것. 가운데 열은 사람들이 오른쪽 열로 오인하는 열입니다.

마지막 두 행이 유지할 가치가 있는 부분입니다. 언어 모델은 이미지의 내용을 설명하고 장면에 개연성이 있는지 추론하는 데 진정으로 능숙합니다. 이러한 기능은 유용하지만 탐지는 아닙니다.

챗봇이 진정으로 유용한 경우

도구를 전적으로 일축하는 것은 잘못된 교훈입니다. 도구가 할 수 있는 용도로 사용하면, 탐지기를 대체하기보다 보완하는 역할을 합니다.

  1. 장면을 자세히 설명해 달라고 요청합니다

    주의 깊은 설명은 어울리지 않는 객체나 미처 읽지 못한 간판을 포함하여, 의식적으로 알아차리지 못했던 것들을 드러내는 경우가 많습니다.

  2. 장면이 물리적으로 일관성이 있는지 묻습니다

    그림자, 반사, 비율 및 원근법은 추론의 문제이며, 추론은 모델의 존재 이유입니다. 이를 통해 픽셀 분석으로는 놓칠 수 있는 합성 이미지를 잡아냅니다.

  3. 확인하거나 반박할 수 있는 근거가 무엇인지 묻습니다

    의심을 확인 항목 목록으로 바꾸는 것은 언어 모델의 좋은 활용법이며, 그 목록은 직접 작성했을 것보다 더 나은 경우가 많습니다.

  4. 그런 다음 실제 탐지기를 실행합니다

    픽셀에 관한 문제라면 그 용도로 제작된 도구를 사용하고, 공개된 척도와 대조하여 점수를 읽어보세요.

유창함이 위험인 이유

확신이 없는 탐지기는 중간 정도의 숫자를 반환하며, 그 숫자 자체로 불확실성이 전달됩니다. 확신이 없는 언어 모델은 문단을 반환하며, 문단에는 오차 한계가 없습니다.

모델이 실제 무언가를 식별했든 아니면 그럴듯하게 들리는 아무런 내용 없는 설명을 생성했든 상관없이 동일하게 잘 구조화된 설명이 나타납니다. 독자들은 글의 품질을 바탕으로 신뢰도를 조정하는데, 이는 정확히 여기 어떠한 정보도 전달하지 않는 신호입니다.

이것이 바로 챗봇에게 묻는 것이 사진을 직접 보는 것보다 더 나쁜 시작점인 이유입니다. 여러분 자신의 불확실성은 적어도 여러분 눈에 보입니다.

다른 도구들에서도 나타나는 동일한 문제

이는 단일 제품만의 문제가 아닙니다. 이미지에 대해 의미론적으로 추론하는 모든 시스템은 동일한 한계를 가지며, 현재 탐지기로 소개되는 여러 도구들이 실제로 그 이면에서 정확히 그 작업을 수행하고 있습니다.

유용한 테스트: 사진의 사진이나 인식 가능한 피사체가 전혀 없는 이미지에 대해 도구가 무엇을 보고할지 물어보세요. 픽셀 탐지기는 콘텐츠와 관계없이 텍스처가 존재하므로 어떤 방식이든 점수를 반환합니다. 의미론적 시스템은 추론할 대상이 없으므로 거부하거나 무언가를 지어내게 됩니다.

두 번째 테스트: 동일한 파일을 두 번 실행해 보세요. 픽셀 모델은 결정론적이므로 동일한 숫자를 반환합니다. 언어 모델은 샘플링을 거치므로 두 번의 실행 결과가 다를 수 있습니다. 동일한 바이트에 대해 도구가 서로 다른 답변을 제공한다면, 그것은 무언가를 측정하고 있는 것이 아닙니다.

두 테스트 모두 도구의 작동 방식을 이해할 필요가 없습니다. 둘 다 1분이면 충분하며, 마케팅 페이지를 읽는 것보다 더 신뢰할 수 있게 측정과 설명을 구분해 줍니다.

자주 묻는 질문

ChatGPT가 AI 생성 이미지를 탐지할 수 있습니까?
아니요, 측정 가능한 의미에서는 아닙니다. 픽셀이 어떻게 만들어졌는지가 아니라 이미지가 무엇을 묘사하는지에 기반하여 자신감 있어 보이는 평가를 생성할 뿐입니다. 답변 뒤에는 보정된 임계값도, 벤치마크도 없으며, 두 번 질문하면 서로 다른 판정이 나올 수 있습니다.
하지만 제가 테스트한 이미지에 대해서는 맞췄습니다.
특히 여러분도 맞혔을 뻔한 명백한 사례들에서 정답을 맞히는 경우가 많을 것입니다. 문제는 틀렸을 때와 똑같이 자신 있게 들리기 때문에, 정답을 얻더라도 다음 이미지에서 받은 답변이 어떤 종류인지 알 수 있는 방법이 없다는 점입니다.
픽셀을 분석해 달라고 요청하면 어떻게 되나요?
그럴 수 없습니다. 이미지가 의미론적 표현으로 변환된 후에야 모델이 추론을 수행하며, 미세 텍스처 탐지가 의존하는 정보는 그 변환 과정에서 폐기됩니다. 픽셀 분석을 요청하면 픽셀 분석이 어떤 모습일지에 대한 설명이 생성됩니다.
탐지를 위해 제작된 멀티모달 모델이 있나요?
해당 분야에 대한 연구가 존재하지만 일반적인 어시스턴트가 하는 일과는 다릅니다. 용도에 맞게 제작된 탐지기는 보정된 출력과 함께 실제 이미지와 생성된 이미지 쌍으로 학습되며, 일반 모델은 모든 면에서 도움이 되도록 학습됩니다. 이 둘은 긴밀한 대체제가 될 수 없습니다.
이미지를 확인할 때 챗봇을 전혀 사용하지 말아야 하나요?
아니요, 설명과 추론 용도로는 사용하십시오. 프레임에 무엇이 있는지, 조명이 일관성 있는지, 그리고 여러분의 의심을 확인하거나 반박할 근거가 무엇인지 물어보세요. 그런 다음 픽셀 문제에 대해서는 탐지기를 사용하고, 두 가지 답변을 머릿속에서 별도로 유지하십시오.
왜 많은 사람들이 챗봇에게 먼저 물어볼까요?
다른 탭에 열려 있고 항상 답변을 해주기 때문입니다. 틀렸을 때의 대가가 눈에 보이지 않을 때는 정확성보다 편리함이 우선시되며, 이미지 검증의 경우 누군가 이미 그 답변에 따라 행동하기 전까지는 대가가 보이지 않는 경우가 많습니다.