← 모든 가이드 가이드

AI로 생성된 얼굴을 구별하는 방법

사람들이 흔히 말하는 시각적 구별 징후들은 가장 먼저 수정된 결점들입니다. 생성된 얼굴과 실제 촬영된 얼굴을 여전히 구별 짓는 요소와, 더 이상 유효하지 않은 요소를 설명합니다.

· 9 분 읽기 · Best AI Image Detector

얼굴 중심부만 보지 마세요. 신뢰할 만한 구별 단서들은 수년 전 이미 프레임 외곽으로 이동했습니다. 배경, 장신구, 치아, 귀, 머리카락이 다른 부분과 맞닿는 경계선 등을 살펴야 합니다. 얼굴 자체는 새로운 모델이 나올 때마다 가장 먼저 개선되는 부분입니다.

기존 체크리스트가 더 이상 통하지 않는 이유

널리 공유된 구별법 목록들은 모두 동일한 문제를 안고 있습니다. 작성 당시 존재하던 모델의 약점만을 다루고 있다는 점입니다. 이러한 결점들은 공개적이고 측정이 가능하며 부끄러운 부분이기 때문에, 다음 버전이 나올 때 정확히 집중 개선 대상이 됩니다.

손이 가장 대표적인 예입니다. 손가락 개수를 세는 방법은 약 18개월 동안만 유용했을 뿐, 지금은 두 방향 모두에서 잘못된 확신을 주는 원인이 되었습니다. 생성된 손은 이제 대부분 형태가 정확하며, 반대로 움직임으로 인해 흔들린 실제 손이 개수를 세려는 사람의 눈에는 비정상적으로 보일 수 있습니다.

눈동자의 반사광, 귀의 비대칭, 치아의 배열도 대략 이와 같은 순서로 개선되었습니다. 온라인에서 화제가 되는 결점은 모두 벤치마크 지표가 되고, 지표화된 항목은 반드시 수정됩니다.

  1. 2019
    배경 뭉개짐 초기 얼굴 생성 모델은 뭉개진 배경 위에 선명한 얼굴만 만들어냈습니다. 모델이 전체 장면을 학습하면서 해결되었습니다.
  2. 2022
    서로 맞지 않는 귀와 귀걸이 비대칭 장신구는 학습 데이터가 이를 다루기 전까지 강력한 단서였습니다.
  3. 2023
    손과 손가락 가장 자주 언급되던 허점이었습니다. 두 번의 출시 주기 만에 대부분 해결되었습니다.
  4. 2024
    장면 속 텍스트 간판과 라벨이 읽을 수 있게 렌더링되면서 쉽게 구분할 수 있는 특징이 사라졌습니다.
  5. 2026
    남은 것은 통계적 특징뿐입니다 남은 차이점은 사람의 눈으로 분간하기 어려운 질감과 노이즈 수준에 있습니다.
널리 알려진 각 구별 단서의 신뢰성이 사라진 대략적인 시기입니다. 정확한 날짜보다는 변화의 흐름에 주목하세요.

얼굴 바깥을 살펴보세요

생성 연산은 시선이 집중되는 곳에 집중됩니다. 인물 사진으로 훈련된 모델은 사람이 주로 보는 영역은 매우 잘 생성하지만, 학습 과정에서 배경으로 취급된 나머지 영역은 상대적으로 미흡합니다.

지속적으로 유효한 단서는 바로 여기에 있습니다. 목걸이 줄에 무엇이 적혀 있는지, 셔츠의 패턴이 팔 뒤로 자연스럽게 이어지는지, 목걸이 체인이 목 뒤를 지나 알맞은 위치로 나오는지, 어깨 뒤편의 공간이 실제로 존재할 수 있는 구조인지 확인해 보세요.

반복되는 세부 묘사 또한 신뢰할 수 있는 단서입니다. 벽지, 벽돌, 나뭇잎, 군중의 얼굴은 일관되게 생성하는 데 비용이 많이 들기 때문에, 앞쪽의 인물이 완벽하더라도 눈으로 포착할 수 있을 만큼 패턴이 반복되거나 흐트러지거나 소실점을 잃기 쉽습니다.

  • 중심에서 벗어난 텍스트. 배지, 간판, 책등, 포장지 등. 중앙 텍스트는 이제 대부분 정확하지만, 주변부 텍스트는 여전히 깨지기 쉽습니다.
  • 가려짐에 따른 연속성. 끈, 체인, 줄무늬 등이 무언가 뒤로 들어갔다가 잘못된 형태로 나오는 현상입니다.
  • 군중과 반복되는 객체. 군중의 두 번째나 세 번째 줄, 혹은 일렬로 놓인 네 번째 의자 등은 첫 번째보다 덜 정밀하게 처리됩니다.
  • 고배율에서의 피부 질감. 실제 피부에는 모공, 잔머리, 비대칭적인 잡티가 있습니다. 생성된 피부는 어떤 조명으로도 설명하기 어려울 만큼 매끄러운 경우가 많습니다.
  • 머리카락의 경계면. 머리카락과 배경이 맞닿는 경계는 여전히 일관되게 렌더링하기 가장 어려운 영역 중 하나입니다.

탐지기가 포착하지만 인간은 볼 수 없는 것

육안 검사에만 의존하지 않고 분석을 실행해야 하는 이유는, 남은 차이점들이 사람 시각의 해상도를 벗어난 영역에 있기 때문입니다. 카메라 센서는 특유의 노이즈를 만들고, 생성 과정은 또 다른 형태의 노이즈를 만들어내며, 둘 다 일반적인 화면 크기에서는 보이지 않습니다.

이것이 탐지기와 사람의 눈이 서로 다른 판단을 내릴 수 있는 이유이기도 합니다. 명백한 시각적 오류가 있는 사진이라도 질감이 실제 사진과 같다면 점수가 낮을 수 있고, 완벽해 보이는 사진이라도 질감이 그렇지 않다면 점수가 높을 수 있습니다. 두 결과 모두 유의미하며, 어느 한쪽이 다른 쪽을 전적으로 부정하지 않습니다.

두 가지 서로 다른 유형의 증거
육안 검사픽셀 분석
작동 대상구도 및 논리적 오류질감 및 노이즈 구조
압축 환경에서의 유지저하됨
스크린샷에서도 생존함심하게 저하됨
미세한 수정 감지직접 알아차렸을 때만 가능가능(영역 맵 활용)
시간이 지남에 따른 성능 저하빠르게 저하점진적 저하

마지막 행이 핵심입니다. 시각적 단서는 모델이 새로 출시될 때마다 사라지지만, 수많은 생성기를 대상으로 학습된 탐지기는 특정 제품의 일시적인 결함이 아닌 합성 질감의 공통점을 학습했기 때문에 훨씬 더 천천히 효력을 잃습니다.

가장 중요한 사례: 변조된 실제 얼굴

가장 파급력이 큰 위조 사진은 완전히 생성된 인물 사진이 아닙니다. 실제 인물의 사진에서 한 가지만 바꾼 것입니다. 같은 몸에 다른 얼굴을 넣거나, 손에 물건을 추가하거나, 배지를 바꾸거나, 프레임에서 다른 사람을 지우는 방식입니다.

이미지의 90%가 실제 사진이고 평균값도 이를 반영하기 때문에, 전체 프레임 점수로는 구조상 이를 제대로 잡아내기 어렵습니다. 이를 드러내는 것이 영역 맵이며, 수치 대신 맵을 확인하는 것이 얼굴 사진의 정확도를 높이는 가장 중요한 습관입니다.

14 18 11 16 12 15 89 13 17 10 14 19

11개 타일은 실제 사진으로 판독됩니다. 얼굴을 덮고 있는 단 하나의 타일만 그렇지 않습니다.

얼굴 하나만 교체된 실제 단체 사진입니다. 전체 프레임 점수는 31점이었습니다.

실용적인 접근 습관

인물 사진의 주변부를 5초 동안 살펴보세요: 텍스트, 연속성, 반복 패턴, 머리카락 경계선. 그런 다음 분석을 실행하고 맵을 확인하세요. 두 방식을 함께 사용하면 단독으로 볼 때보다 훨씬 더 많은 것을 잡아낼 수 있으며, 전체 과정은 1분도 채 걸리지 않습니다.

중대한 사안인 경우 어떤 픽셀 분석으로도 대체할 수 없는 단계를 추가하세요: 이전 기록이 있는 곳에서 같은 얼굴을 찾아보는 것입니다. 3년치 게시물, 다른 사람이 태그한 사진, 일관된 직장 정보가 있는 프로필은 어떤 생성 모델도 만들어낼 수 없는 증거입니다.

여전히 유효한 단서들

지난 4년간의 발전에도 여전히 남아 있는 두 가지 문제가 있으며, 둘 다 국소적인 세부 묘사보다는 공간 전반의 일관성과 관련이 있습니다. 첫 번째는 조명입니다. 프레임 안의 모든 표면이 같은 광원에서, 같은 방향으로 비추어지며, 그림자의 부드러움이 일치하는지 여부입니다.

생성된 인물 사진은 대개 얼굴은 정확하게, 주변은 대략적으로 표현하므로 그림자에서 불일치가 드러납니다. 턱 아래의 짙은 그림자 바로 옆 배경 벽면에 부드러운 그림자가 있다면 서로 다른 두 공간을 묘사하고 있는 것입니다.

두 번째는 원근과 깊이입니다. 반사 표면, 유리, 물, 거울은 주변 모든 것의 기하학적 구조와 일치해야 하지만 그렇지 못한 경우가 많습니다. 인물 뒤편의 창문에 실제로는 존재할 수 없는 풍경이 비치는 것은, 얼굴 모델이 아닌 세계 전체를 이해하는 모델이 필요하기 때문에 모델 업그레이드 후에도 여전히 남아 있는 오류입니다.

두 가지 모두 기계적으로 적용할 수 있는 테스트가 아니며, 손가락 수를 세는 것보다 시간이 더 걸립니다. 이것이 상충 관계입니다. 여전히 유효한 검사법은 결함을 단순히 훑어보는 것이 아니라 사진을 하나의 공간으로 생각해야 하는 방법들입니다.

자주 묻는 질문

손가락 개수를 세는 것은 여전히 유용한가요?
거의 유용하지 않으며, 이제는 양방향 모두에서 오류가 발생합니다. 최신 모델은 손을 대부분 정확하게 렌더링하므로 올바른 손 형태가 아무것도 증명하지 못하며, 움직이는 중에 찍힌 실제 손의 흐려진 형태를 생성된 것으로 오인하기도 합니다. 약 18개월 동안은 좋은 판별 기준이었으나 지금은 아닙니다.
눈은 어떤가요? 반사된 빛이 서로 맞지 않는다고 들었습니다.
양쪽 눈을 다소 독립적으로 렌더링하던 초기 얼굴 생성기에서는 사실이었습니다. 최신 모델은 일관된 반사광(캐치라이트)을 만들어냅니다. 확인하는 데 비용이 들지 않으므로 한 번 훑어볼 가치는 있지만, 양쪽 반사가 일치한다고 해서 어떤 증거가 되지는 않습니다.
탐지기가 실제 사람의 사진을 지적하는 이유는 무엇인가요?
대부분 변조보다는 후처리 때문입니다. 뷰티 필터, 인물 사진 모드, 야간 모드, 과도한 노이즈 감소는 촬영 후 피부 질감을 다시 쓰며, 이는 모델이 판독하는 신호와 정확히 일치합니다. 중간 정도의 점수를 의미 있게 받아들이기 전에 필터가 적용되지 않은 원본을 요청하세요.
얼굴을 만든 도구가 무엇인지 알 수 있나요?
픽셀만으로는 알 수 없습니다. 모델들은 아키텍처와 학습 데이터를 공유하므로 특징이 겹치며, 어떤 후처리든 모델 간의 미세한 차이를 흐리게 만듭니다. 결과에 도구 이름이 표시된다면 이는 이미지가 아닌 파일 내 자격 증명(크리덴셜)에서 가져온 것이며, 결과에 해당 내용이 명시됩니다.
단체 사진 속 한 사람의 얼굴에도 작동하나요?
네, 바로 이 지점에서 영역 맵의 가치가 드러납니다. 실제 사진 속에서 얼굴 하나만 교체된 경우 전체 프레임 점수는 거의 변하지 않지만 해당 타일 하나가 감지됩니다. 두 사람 이상이 포함된 이미지라면 항상 맵부터 확인하세요.
화상 통화는 어떤가요?
다른 문제이며 다른 도구가 필요합니다. 정지 이미지 탐지는 실시간 영상 조작을 다루지 못하며, 개별 프레임을 검사하는 방식은 실시간 얼굴 교체(페이스 스왑)를 잡아내는 시간적 불일치를 놓칩니다. 정지 이미지 검사로 해결된다고 가정하지 말고 별도로 다루어야 합니다.